跳到正文

全部动态

今日 563 条
今天10月1日周四
  1. TechCrunch:AI(RSS)50

    OpenAI 推出 Decisions API,对标 TypeSafe AI 的 Jev 决策模型

    OpenAI 在 Dev Day 上发布 Decisions API,可为 Luna 模型预设选项并输出概率,功能类似 TypeSafe AI 本月初推出的软件自动化模型 Jev。该 API 目前为限量预览,OpenAI 称其能保持图像理解、多语言支持和安全防护的同时实现极快速度。有开发者用 Jev 监控 AI 智能体行为,每次动作监控成本仅 2.94 美元,而前沿 LLM 需 372 美元。

  2. METR:Blog(网页)70

    METR 主席 Chris Painter 就 OpenAI / Hugging Face 智能体事件向美国参议院作证

    2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全委员会小组听证会上就 OpenAI / Hugging Face 事件作证。

    推荐理由:这是当事机构负责人在参议院听证会的完整证词,以第一手视角拆解了 OpenAI / Hugging Face 事件的三要素框架,并给出行业共性观察。

  3. Noam Brown46

    5 年前我在一个会议的 poster session 上遇到了 @ssokota。他的讲解让我印象深刻,于是我给了他一个实习机会。我们持续合作,他现在和我一起在 @OpenAI 工作。后来他告诉我,整场 session 里我是唯一一个在他 poster 前停下来的人。

    引用Samuel Sokota@ssokota

    In our Nature paper, we introduce the first superhuman Stratego AI, which we built using general techniques that we developed for RL & test-time compute under imperfect information. 1/N

  4. lauren47

    Grok Bot 现可把编码任务交给 Cursor 云智能体,用户只需在 Slack 中 @ 机器人即可派活,还能创建 Projects 把多个相关智能体归入同一对话。这些云智能体支持 Cursor 上任意模型,且各自拥有独立计算机,使 Bot 更像管理者而非亲自写代码。Bot 还能通过 GitHub 和 Origin 插件管理 PR,并分享构建过程的视频演示。

    引用Grok Bot@bot

    Grok Bot is now more powerful for building software. Bots can hand off coding tasks to Cursor, manage your PRs with GitHub and Origin plugins, and share video demos of what they build.

  5. Rohan Paul49

    AI 热潮正在抬高自身的资本成本。 物理瓶颈正转变为融资瓶颈。 超大规模厂商的债券发行洪流,使其债务相对其他顶级评级公司变得更贵。 The information 发表了一篇文章 “投资者持有超大规模厂商债务所要求的额外收益率,今年已上升约 0.25 个百分点” 美联储主席 Kevin Warsh 表示,AI 驱动的融资是推高美国国债收益率的部分原因。

  6. Rohan Paul54

    The New York Times 报道,Anthropic 私下邀请来自世界各地的天主教、犹太教、锡克教、福音派等宗教思想家,帮助为其 AI 提供道德罗盘。报道提到该公司通过一系列私人会议咨询宗教学者,将道德注入其 AI 模型,并提出 Claude 可能具有意识的论证;Christopher Olah 在文中表示不知道 AI 模型是否有意识,他真正关心的是无论答案如何都要得到正确结论。

  7. NVIDIA Technical Blog:Agentic AI / Generative AI41

    NVIDIA 扩展 xio-sig 加入 cuObject,并发布 SCADA Server SDK

    NVIDIA 将 cuObject 纳入 xio-sig,与 cuFile 并列,并宣布 cuObject 客户端与服务器库正式可用,开发者可基于其 API 和 RDMA 线协议构建加速对象存储应用。新的 SCADA Server SDK 让存储厂商构建响应 GPU 发起请求的 SCADA 服务器,IBM 已用集成 SCADA 与 IBM Storage Scale 的原型验证互操作性。

  8. OpenAI:官网动态(RSS · 排除企业/客户案例)77

    OpenAI 披露并阻断一起有组织的对抗性模型蒸馏攻击

    OpenAI 披露已识别并阻断一起试图提取其模型 protected reasoning 的有组织攻击,最早活动出现在 7 月第一周。攻击者通过跨会话复制加密推理内容并请求解密转写等方式操纵模型交互,未入侵加密或数据库。

    推荐理由:OpenAI 官方复盘了一次模型蒸馏攻击的细节、归因和应对措施,读者可以借此了解针对 protected reasoning 的新型攻击手法。

  9. Claude Code:GitHub Releases(RSS)40

    Claude Code v2.1.286 发布

    Claude Code 发布 v2.1.286,为堆叠的权限请求加上"2 of 5"计数,并支持在全屏列表中点击"N more"行跳转。该版本修复了 claude --resume 和 --continue 在并行工具调用后丢失全部轮次、工具或 hook 返回对象/数字/布尔值时触发 API 400 错误,以及云会话因容器在 transcript 加载中被停止而无法唤醒等问题。

  10. Google AI:DEV 作者专属(RSS)59

    Ornith-1.0-9B vs Qwen3.5 vs Gemma4:CPU 本地实测对比

    作者在纯 CPU、32GB 内存的普通笔记本上,用 Ollama 以相同 Q4_K_M 量化对比 Ornith-1.0-9B、其基座模型 Qwen3.5-9B 和 Gemma4-12B,五个任务显示 Ornith 在 JSON 输出上最紧凑(16 token),但 bug 修复在未见过用例上出错,shell 命令与基座同样在含空格文件名上失败。

  11. Google AI:DEV 作者专属(RSS)39

    Sentinel-IR:AI 智能体运营省下数百万成本的非技术指南

    Sentinel-IR 是一种确定性数据压缩层,把代码、API 载荷和文档压缩成超紧凑的中间表示再喂给 LLM,充当上下文窗口的 ZIP 压缩。在 1,366 行的 12-billing-platform 测试文件上,原始 11,635 tokens 被压到 1,332 tokens,节省 88.6%;但 303 tokens(约 34 行)以下的微文件因压缩开销反而更贵。

  12. Google AI:DEV 作者专属(RSS)40

    我无法为代码辩护:i.c.stars 第四周的四份文档与产品规则设计

    i.c.stars 第四周产出四份非代码文档:缺陷日志、同行评审、三份 runbook 和一份 run of show,核心都是让工作能经受交接。作者在同行评审中复现对方八项发现中的六项,指出"擅长找 bug、弱于记录 bug"是常态。其产品贡献是主张检索系统只允许两种行为:附文档、章节和生效日期作答,或停止并转交人工,拒绝不是兜底而是同等功能。

  13. Google AI:DEV 作者专属(RSS)37

    图像质量评测:内容感知裁剪与居中裁剪的三种配方场景对比

    针对菜谱站点头像与菜品卡片,内容感知裁剪应作为默认方案,它能保留居中裁剪经常切掉的主体,但需存储裁剪框并提供人工调整路径。居中裁剪仅适用于拍摄时强制居中构图的流程,其确定性几何在异构上传中会稳定地切掉偏离中心的人脸或餐盘。Cloudinary、Imgix、ImageKit 等托管方案在运营边界上各有取舍,智能裁剪输出仍需审核与覆盖。

  14. Databricks:Blog(RSS)40

    Lakebase Postgres 成本优化实用指南

    Databricks 的 Lakebase Postgres 通过存储与计算分离架构实现成本优化:分支共享底层存储、自动扩缩容支持 scale to zero(数百毫秒恢复),关闭后按基线容量 25% 折扣计费。同步 Lakehouse 数据时建议只同步应用所需的活跃子集(如 60 天滚动窗口),并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式。

  15. Google AI:DEV 作者专属(RSS)75

    一次 Agent 重构事故复盘:二十个正确改动如何掩盖了错误的假设

    作者复盘充电站地图去重任务的事故:一个由 Agent 编写、重构后测试全部通过的去重任务,因测试数据自造而未取自真实数据(9269 对重复记录中运营商名称仅 1 对匹配),导致约三分之一注册表站点在 100 米内存在重复显示,重构 78 分钟后被无审阅合并。

    推荐理由:作者以真实去重事故为底,给出从审代码转向审概念与真实数据的可迁移复核清单。

  16. Google AI:DEV 作者专属(RSS)23

    Portal 跨链流动性协议智能合约漏洞面分析:TVL 18.1 亿美元下的 10 类攻击向量

    针对 TVL 约 18.1 亿美元的跨链流动性路由协议 Portal 的智能合约漏洞面分析列出 10 类攻击向量,整体风险评级 7/10(高)。其中代理管理员可无时间锁升级、跨链桥回调重入、预言机操纵被列为 Critical 或 High 严重度,报告建议引入至少 48 小时时间锁升级机制并为桥接回调添加重入锁。

  17. Google AI:DEV 作者专属(RSS)47

    仅用 61 条数据构建气旋影响预测器:Cyclone Impact Forecaster 如何预测印度东海岸受灾人口

    Cyclone Impact Forecaster 用 61 条 EM-DAT 历史气旋记录训练出一个 2 参数对数线性模型,为北印度洋气旋影响半径内的每个地区输出受灾人口排名及 10-90% 预测区间,并叠加 XGBoost 的 6 小时风速强度预测,在 MapLibre GL 3D 卫星地球上可视化。

  18. MiniMax (official)48

    @HeyGen 发布 HeyGen Video,令人印象深刻!✨ 基于 MiniMax H3 构建,由 HeyGen 后训练,以更可及的成本为企业带来制作级视频。 很自豪能为这项工作提供基础,期待看到 HeyGen 团队将它带向多远。

    引用HeyGen@HeyGen

    We're releasing HeyGen Video, built for businesses that need production-quality video without production-level costs. Pricing starts at $0.01/s through October (50% off) Built on @Minimax_AI H3, post-trained by HeyGen. Learn more: https://developers.heygen.com/heygen-video-1.0-catalog

  19. eric zakariasson53

    作者邀请试用 xAI 的 Grok Bot 市场工程类机器人,链接为 https://x.ai/bot/marketplace/engineering。其引用的 Grok Bot 官方内容称,Grok Bot 现在更适合软件开发,机器人可以把编码任务交给 Cursor、通过 GitHub 和 Origin 插件管理 PR,并分享构建内容的视频演示。截图显示工程分类下有多个可选机器人,包括 SWE by Cursor 等。

    引用Grok Bot@bot

    Grok Bot is now more powerful for building software. Bots can hand off coding tasks to Cursor, manage your PRs with GitHub and Origin plugins, and share video demos of what they build.

  20. Aravind Srinivas69

    Perplexity CEO Aravind Srinivas 宣布向所有人开放 Computer 的邮箱任务功能,无需 Perplexity 账号,限时免费执行所有通过邮箱委派的任务。用户将邮件发送、转发或抄送到 computer@perplexity.com,智能体会在后台完成任务并保留邮件上下文;每个任务以正常会话形式运行,可在网页和移动端查看,审计记录与应用内任务一致。

    引用Perplexity@perplexity_ai

    Computer now works in email. Send, forward, or cc computer@perplexity.com on any thread. Every email task runs as a normal session in Computer, viewable on web and mobile, with the same audit trail as any task in the app.

    推荐理由:Perplexity 开放无需账号的邮箱入口并限时免费,读者可以据此评估把任务转给 Computer 智能体执行的可行性。