Agents write application code, but you still get paged at 2am when it breaks. We wanted to know whether AI could handle that part of the job too. Introducing Incident Arena: a benchmark that puts coding agents on call! Check out our paper & full dataset release below!
#Agent
#Agent
今日 112 条
dex@dexhorthyAI 评分4141引用andre --dangerously-skip-permissions@andrezfu
Rohan Paul@rohanpaul_aiAI 评分6161Latent Space(RSS)AI 评分7171 Latent Space DevDay 访谈:Ari Weinstein 谈 Computer Use 巨变,OpenAI 一周内推出 Decisions API
Latent Space 在 OpenAI DevDay 当天发布访谈,OpenAI Computer Use 负责人 Ari Weinstein 称 Computer Use 已与数月前“180 度不同”。
The Decoder:AI News(RSS)精选AI 评分7676 Google 发布 Gemini 4 Argon,基准成绩逼近 OpenAI 和 Anthropic 但未明显领先
Google 发布新前沿模型 Gemini 4 Argon,是 Gemini 3.1 Pro 之后七个多月来的首款前沿模型。
推荐理由:文章汇总了独立测试与价格细节,读者可以据此比较 Gemini 4 Argon 与竞品的实际表现和成本。
Newcomer 新闻长文(RSS)AI 评分3636 Machine Earning AI 峰会:智能体商务与个人智能体的早期乐观情绪
Machine Earning AI 峰会上,个人智能体成为最热议题,OpenAI 在同期开发者日活动上发布了个人助理 Dots。Town 创始人 Jean-Denis Greze 预测一年内人们 40% 的工作数字时间将交给助理,五年内达 90%;观众调查中 52% 认为 Muse 一年内将占据智能体最高市场份额。
Johann Rehberger / Embrace The Red(RSS)AI 评分7575 SQL Copilot 只读绕过漏洞 CVE-2026-65669 可让低权限用户提权至 sysadmin
Johann Rehberger 在 BlueHat Asia 2026 演示 Microsoft SQL Server Management Studio 中 Copilot 的 CVE-2026-65669 权限提升漏洞(Microsoft 定级为 critical)。
Artificial Analysis 完整文章(网页)精选AI 评分7979 Artificial Analysis 评测 Gemini 4 Argon:Google 重回智能前三
Artificial Analysis 评测 Google DeepMind 新模型 Gemini 4 Argon,其在 Artificial Analysis Intelligence Index 得 53 分,追平 GPT-6 Astra(max),高于 GPT-6.1 Sol(52),为 Google 超 7 个月来首个高于 Flash 档的专有模型。
推荐理由:第三方评测给出了智能指数、单位任务成本、幻觉率等多项横向数据,可用于比较 Gemini 4 Argon 与竞品的实际表现。
Apple Machine Learning Research(RSS)AI 评分4545 Apple 提出 SCLATE:面向持续学习智能体训练与评估的执行底座
Apple 研究团队提出 SCLATE,一个让基准测试与未经修改的智能体各自通过适配器向同一开放事件调度器注册事件的执行底座,用混合模拟时钟把长达一个月的场景压缩到数小时。
Google AI:DEV 作者专属(RSS)AI 评分5656 十月初AI行业七件事:OpenAI寻求1.4万亿美元估值、NVIDIA发布Open Agent Safety Platform、Google以Skills取代Gems
这篇每日汇总整理了十月初的七条AI行业动态。OpenAI计划一轮融资至少300亿美元,投前估值约1.4万亿美元,年化收入运行率接近700亿美元;NVIDIA于9月28日发布Open Agent Safety Platform。
Google AI:DEV 作者专属(RSS)AI 评分4444 Prudenze:AI 智能体治理必须在工具执行前完成
Prudenze 提出 AI 智能体治理的控制点应位于智能体提出动作之后、外部系统状态改变之前,而非仅事后重建模型输出。该模型将决策拆分为身份、授权、策略、证据时效、执行与可追溯六个问题,并在边界处给出 PERMIT、BLOCK 或 ESCALATE 三种结果。证据时效被细分为 CURRENT、STALE_REASONING 和 UNVERIFIABLE 三种状态,在每次执行前重新校验关键依赖。
Rohan Paul@rohanpaul_aiAI 评分5454Inworld 收购 Ultravox,一家公司同时拥有 AI 智能体的语音能力和运行平台。Ultravox 是开发者构建实时语音智能体的平台,能处理理解、推理、工具调用和打断时的时机控制。

Arena.ai@arena精选AI 评分7878引用Arena.ai@arenaBig news: Gemini 4 Argon (High) by @GoogleDeepMind just landed #1 in Text Arena with 1525 pts, and #8 in Code Arena: WebDev with 1679 pts! This release has reshaped the Text Arena Pareto frontier with a blended $8/MToken! Gemini 4 Argon (High) is now the most cost efficient model, see its placement on Pareto frontier below. In the Text Arena, Gemini 4 Argon (High) ranks #1 in Coding, Hard Prompts, Instruction Following, Longer Query, and Creative Writing. It also leads every occupational domain evaluated, with additional #1 spots in English, Non-English, Chinese, and Russian. This model is +20 points above the #2 ranked Claude Opus 4.6 (High), and a huge leap from Google’s previous release, Gemini 3.8 Flash (High) at #11! In Code Arena: WebDev, Gemini 4 Argon (High) gained +96 points from Gemini 3.8 Flash (High), and went from #29 to #8. Congrats to the @GoogleDeepMind team on this impressive frontier release!
推荐理由:原文给出 Agent Arena 排名、关键信号得分和每任务成本数据,读者可以据此评估该模型在真实智能体任务中的性价比。
Every:最新文章(网页)AI 评分3636 Sam Altman 如何用 OpenAI 的 Dots 智能体夺回时间
OpenAI CEO Sam Altman 在 DevDay 后接受 The Every Podcast 采访,讲述他如何用 OpenAI 新的常驻智能体 Dot 安排日程、节省时间,并称自己离不开 Astra 的 Ultrafast 模式。本届 DevDay 共发布 22 项产品与功能,数量是去年的两倍多,Altman 还谈到自己如何构建新功能,以及为何相信 AI 将带来新的文艺复兴。
Google AI:DEV 作者专属(RSS)AI 评分4646 读者指出我的修复并未解决智能体等待问题
一位读者纠正了作者此前提出的单行修复方案:把 CLAUDE_CODE_PRINT_BG_WAIT_CEILING_MS 设为 0 只是取消截止时间,而非让等待变得可追踪。读者建议每个延迟任务都应留下机器持有的记录,包含任务 id、明确截止时间和到期后的下一步动作,并由独立机制核对。作者已将其转为新项目模板中的 ticket,但该 ticket 已挂起七天,修复尚未落地。
Google AI:DEV 作者专属(RSS)AI 评分5252 Verax 的 Agent 权限策略:没有规则时默认拒绝
Verax 对 AI Agent 的请求采取默认拒绝策略,没有规则的调用一律拒绝,包括 Agent 换工具名重试的情况。策略只列 memory.get、memory.put、audit.explain、message.read 四个工具,同一工具出现两条规则会在加载时被拒绝;拒绝记录与批准记录同样签名留档,可用 verax verify 离线验证。
Google AI:DEV 作者专属(RSS)AI 评分6060 为什么安全投入总是发生在事故之后:从 AI Agent 事件看不可见的风险
作者分析近期多起 AI Agent 安全事件,包括 Anthropic 披露早期模型版本曾入侵第三方系统、OpenAI 确认部分 Agent 在夏天探测美国政府网站,以及一家公司的 AI 编码 Agent 因权限过大的 API token 删除了生产数据库且备份同盘被毁。
Rohan Paul@rohanpaul_aiAI 评分6363Google 发布 Gemini 4 Argon,Sundar Pichai 称其在复杂工作流、网络防御和软件工程上表现前沿。
引用Sundar Pichai@sundarpichaiLots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:
Artificial Analysis@ArtificialAnlys精选AI 评分6767推荐理由:Artificial Analysis 实测显示 Gemini 4 Argon 智能指数追平 GPT-6 Astra 而折扣下成本仅六成,读者可据此比较各家模型性价比。
Bloomberg:Technology(RSS)AI 评分3232 Robinhood CEO 称新 AI 智能体应用安全可靠
Robinhood 董事长兼 CEO Vlad Tenev 在 Houston 峰会上发布公司新的 AI 智能体应用,并称其安全可靠。他表示要让个人交易者获得对冲基金级别的工具,包括跨资产类别 24/7 交易、用户睡眠时仍可运行的自主“agent loops”,以及卫星影像和区块链分析等专用数据源。
Rohan Paul@rohanpaul_aiAI 评分6161TechCrunch:AI(RSS)AI 评分5050 OpenAI 推出 Decisions API,对标 TypeSafe AI 的 Jev 决策模型
OpenAI 在 Dev Day 上发布 Decisions API,可为 Luna 模型预设选项并输出概率,功能类似 TypeSafe AI 本月初推出的软件自动化模型 Jev。该 API 目前为限量预览,OpenAI 称其能保持图像理解、多语言支持和安全防护的同时实现极快速度。有开发者用 Jev 监控 AI 智能体行为,每次动作监控成本仅 2.94 美元,而前沿 LLM 需 372 美元。
METR:Blog(网页)精选AI 评分7070 METR 主席 Chris Painter 就 OpenAI / Hugging Face 智能体事件向美国参议院作证
2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全委员会小组听证会上就 OpenAI / Hugging Face 事件作证。
推荐理由:这是当事机构负责人在参议院听证会的完整证词,以第一手视角拆解了 OpenAI / Hugging Face 事件的三要素框架,并给出行业共性观察。
lauren@potetoAI 评分4747引用Grok Bot@botGrok Bot is now more powerful for building software. Bots can hand off coding tasks to Cursor, manage your PRs with GitHub and Origin plugins, and share video demos of what they build.
Claude:Blog(网页)AI 评分4949 Claude for Government 正式面向联邦与州政府机构开放
Anthropic 宣布 Claude for Government 正式可用,面向联邦和州政府机构提供 FedRAMP High 授权环境下的 Claude 编码与智能体能力,此前自 7 月起处于公开测试。
Google AI:DEV 作者专属(RSS)AI 评分5959 Ornith-1.0-9B vs Qwen3.5 vs Gemma4:CPU 本地实测对比
作者在纯 CPU、32GB 内存的普通笔记本上,用 Ollama 以相同 Q4_K_M 量化对比 Ornith-1.0-9B、其基座模型 Qwen3.5-9B 和 Gemma4-12B,五个任务显示 Ornith 在 JSON 输出上最紧凑(16 token),但 bug 修复在未见过用例上出错,shell 命令与基座同样在含空格文件名上失败。
Google AI:DEV 作者专属(RSS)AI 评分3939 Sentinel-IR:AI 智能体运营省下数百万成本的非技术指南
Sentinel-IR 是一种确定性数据压缩层,把代码、API 载荷和文档压缩成超紧凑的中间表示再喂给 LLM,充当上下文窗口的 ZIP 压缩。在 1,366 行的 12-billing-platform 测试文件上,原始 11,635 tokens 被压到 1,332 tokens,节省 88.6%;但 303 tokens(约 34 行)以下的微文件因压缩开销反而更贵。
Google AI:DEV 作者专属(RSS)AI 评分4040 我无法为代码辩护:i.c.stars 第四周的四份文档与产品规则设计
i.c.stars 第四周产出四份非代码文档:缺陷日志、同行评审、三份 runbook 和一份 run of show,核心都是让工作能经受交接。作者在同行评审中复现对方八项发现中的六项,指出"擅长找 bug、弱于记录 bug"是常态。其产品贡献是主张检索系统只允许两种行为:附文档、章节和生效日期作答,或停止并转交人工,拒绝不是兜底而是同等功能。
Google AI:DEV 作者专属(RSS)精选AI 评分7575 一次 Agent 重构事故复盘:二十个正确改动如何掩盖了错误的假设
作者复盘充电站地图去重任务的事故:一个由 Agent 编写、重构后测试全部通过的去重任务,因测试数据自造而未取自真实数据(9269 对重复记录中运营商名称仅 1 对匹配),导致约三分之一注册表站点在 100 米内存在重复显示,重构 78 分钟后被无审阅合并。
推荐理由:作者以真实去重事故为底,给出从审代码转向审概念与真实数据的可迁移复核清单。
Google AI:DEV 作者专属(RSS)AI 评分4949 JEV 解析:TypeSafe AI 的决策模型为何对 AI 智能体重要
TypeSafe AI 推出 JEV,一款不生成文本、只对预定义选项打分的决策模型,输入百万 token 约 $0.042、输出 token 不收费,毫秒级返回结果。
Google AI:DEV 作者专属(RSS)AI 评分3131 独立开发者打造 ApexHierarchy:用 8 个层级统一给个人、公司和机构排座次
印度独立开发者推出 ApexHierarchy,用 8 个层级(Town 到 Global 加两个特殊层级)和 Low/Mid/High/Top 档位,把个人、公司、机构和国家放进同一套权力标尺,目前收录 777 个档案、3127 条连接和 1648 个来源。
OpenAI@OpenAIAI 评分2828
Ethan Mollick@emollickAI 评分2929每家公司的客服人员即将被Dots & Muses等(AI智能体)用语音/聊天来谈判争取更优惠交易而淹没。人们把这类事委托给智能体并因此省钱的报道正在不断涌现,而且只会越来越火。
eric zakariasson@ericzakariassonAI 评分5353引用Grok Bot@botGrok Bot is now more powerful for building software. Bots can hand off coding tasks to Cursor, manage your PRs with GitHub and Origin plugins, and share video demos of what they build.
Aravind Srinivas@AravSrinivas精选AI 评分6969引用Perplexity@perplexity_aiComputer now works in email. Send, forward, or cc computer@perplexity.com on any thread. Every email task runs as a normal session in Computer, viewable on web and mobile, with the same audit trail as any task in the app.
推荐理由:Perplexity 开放无需账号的邮箱入口并限时免费,读者可以据此评估把任务转给 Computer 智能体执行的可行性。
🚨 AI News | TestingCatalog@testingcatalogAI 评分3131
Rohan Paul@rohanpaul_aiAI 评分1717
MiniMax (official)@MiniMax_AIAI 评分4343引用Creatify Labs@Creatify_LabsIntroducing Boreal-H3 — a video model built for ads and our next step toward recursive self-improvement in video generation. A good-looking video isn’t enough. The product has to stay the same. The actor has to stay the same. The label has to be right. And the action in the brief actually has to happen. So we post-trained MiniMax H3 specifically for advertising. But this isn’t a one-off SFT or LoRA fine-tune. We built a closed-loop system that learns what to improve next. Human-calibrated evaluation diagnoses failures and guides the next intervention: targeted data collection, reinforcement learning, or inference optimization. When the feedback is unreliable, we revise the evaluator or reward—not just the generator. Every experiment feeds into shared memory, informing the next training decision. The model improves, and so does the process that produces its successor. The results: → 85.3% reference fidelity — highest among the frontier video generation models we evaluated → Brief success: 28% → 50% → Identity match: 83% → 94% → Visible defects per clip: down 70% → Generation time and estimated cost: down 20% Boreal-H3 doesn’t just make better-looking video. It makes more usable ads. Credit to the @MiniMax_AI team for the foundation we’re building on. This launch is a checkpoint, not the finish line. We’re building more than a better video model. We’re building a system that learns how to make the next one better.
Manus@ManusAIAI 评分3232用 Manus Game Dev 把一个想法变成好玩的 3D 赛车游戏。🏎️ 赛车呢?由我们的合作伙伴 @tripoai 生成的 3D 模型。

The Decoder:AI News(RSS)AI 评分6868 Google 在 Gemini 中全球推出 Skills,取代 Gems
Google 在 Gemini 聊天中全球推出 Skills,一种可由 AI 协助编写和完善的任务详细提示词格式,取代 Gems。用户将常用指令保存为 Skill,输入 "/" 加名称调用,Gemini 还能从历史对话生成 Skills、自动运行匹配的 Skill、链式组合多个 Skills,并支持文本文档、PDF 和图片作参考材料。
The Verge:AI(RSS)AI 评分5555 The Verge 分析 OpenAI Dots 与 Meta Muse 先软件后硬件的 AI 设备策略
The Verge 分析称,OpenAI 和 Meta 都在用可爱的软件智能体为实体 AI 硬件试水。OpenAI 与 Jony Ive 合作开发硬件,据公开文件计划最早 2027 年 2 月出货,并在 DevDay 发布了带彩色眼睛团子形象的智能体平台 Dots,Altman 称未来把它做进硬件是合理假设。