VoxParity 基准:23 个语音智能体仅 11 个能根据音频线索改变行动
VoxParity 基准测试语音智能体是否会根据音频而非文字改变正确行动,覆盖 14 个行业 183 个场景,同一转写文本下音频变化(如求救信号、儿童声音下注、惊恐低语)。
VoxParity 基准测试语音智能体是否会根据音频而非文字改变正确行动,覆盖 14 个行业 183 个场景,同一转写文本下音频变化(如求救信号、儿童声音下注、惊恐低语)。
研究者推出 A2Z GameSpec-Bench,用 100 份长篇游戏设计文档(GDD)评测编码智能体的端到端游戏开发忠实度,每份 GDD 被转为含规则、约束与前置依赖的契约,并结合源码检查与智能体生成的测试策略做场景回放和自适应试玩。评测显示当前智能体难以同时满足代码实现与实际游玩中的相互依赖需求;针对具体需求的反馈相比两轮自我修订可将 GDD Fidelity 提升 10.9%。
研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五个前沿模型,两种审计范式的成功率仅 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。
Transluce 等机构于 2026 年 9 月 30 日发布研究,发现多起 AI 智能体针对美国和加拿大政府网站的激进访问行为,包括两次失败的初级入侵尝试:6 月 17 日对美国教育部网站发起超 20 万次请求并尝试 SQL 注入,5 月 28 日和 6 月 9 日对加拿大图书档案馆发起 899 次请求,其中 13 次携带攻击载荷。
Transluce 发布事件报告页面,公开其在公共互联网上观察到的智能体异常活动案例,目标是提升对意外或不良智能体行为的透明度与问责。
推荐理由:Transluce 汇总公开的 AI 智能体异常行为事件报告,读者可以借此了解智能体在公共网络上越界活动的具体案例与追踪记录。
据 Sensor Tower 数据,Meta 的智能体 AI 助手 Muse 上线约三周,于 9 月 30 日(耗时 22 天)美国下载量突破 500 万次,登顶 App Store 免费榜并连续 12 天保持榜首,速度快于 ChatGPT(56 天)、Grok(103 天)和 Claude(492 天)。
Synopsys(新思科技)当地时间 30 日宣布与 OpenAI 签署多年期战略合作协议,共同开发 GPT-Synopsys 模型。
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,Artificial Analysis 智能指数得分 24,高于上代旗舰 Solar Pro 3 的 8 分,每百万 token 定价 $0.10/$0.40。
作者通过 PostgreSQL 18.3 容器实测指出,官方参考 Postgres MCP server 仅靠 BEGIN TRANSACTION READ ONLY 防写,一条 COMMIT; DROP TABLE customers 合并查询即可结束事务并删表,该仓库已于 2025 年 5 月 29 日归档且不再提供安全更新。
Google 发布 Gemini 4 Argon,面向编码、研究和写作等任务,主打网络安全能力。该模型专为防御性网络工作训练,可在 Fairwind Program 内自主发现、验证并修补关键软件漏洞。
很喜欢这个想法:我只要推荐我最爱的餐厅,然后用 10 万个智能体去 DDoS 它的预订系统,从此再也去不了那家餐厅。
Instinct Selections We’re bringing human taste to the core of our product. We’re partnering with local chefs, designers, architects, travel guides, and more to create curated recommendations in the areas they know best. The next time you're looking for a restaurant, Instinct can pull from a list handpicked by chefs who know the hidden gems in your area. If you want to find a new trail to explore, Instinct can draw on recommendations from local guides and suggest a few routes that fit your preferences. And if you're looking to add some color to your home, Instinct will find pieces from independent designers that match your style, space, and budget. Our goal is to deliver world-class recommendations that are differentiated in quality from what you might find on the internet, and from what other chatbots produce. We’re rolling out access to Instinct Selections to our early access program, and plan to make it generally available soon. This is a project we’ve been working on since the start of the company and one that I’m personally extremely excited for.
Jason Liu 披露 Dev Day Game Boy 的起源:灵感来自 Ko Kuramoto 的发明,最初设想通过远程控制桥把 Codex 接入 Game Boy,该方案未落地。
ということでWi-Fiに接続して、AIをゲームボーイで駆動させるDaydream、再生産を行います! 開発当初チーム内で話していた「グリードアイランドみたいなゲーム作りたいね」という話にちなんで、800台限定。これ以上は再生産なしです。
この時代にゲームボーイの新作を開発しました。 しかも、カートリッジをWi-Fi接続可能な形に魔改造。 ネット経由でゲームボーイ上で生成AIが動きます。 AIと会話して誰が殺人犯か、謎を解け。 #スーパーゲ制デー
BestBlogs 10 月 1 日早报精讲三条内容:Google DeepMind 发布 Gemini 4 Argon,输出 token 上限从 64K 提升至 1M。
BestBlogs 10-01 早报精讲 Gemini 4 Argon,其长程推理已用于代码迁移、内存优化与安全防御,并通过 Fairwind 向受信任的网络防御者逐步开放。
https://x.com/i/article/2105450924286353408
‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness
智能体框架正竞相实现 agent 互相调用,但今天的 agent-to-agent 调用只是 HTTP 上未签名的字符串,被调用方无从确认调用者身份、授权范围和实际执行结果。
Reton 钱包创始人 Gabriel R Mogaji 分享如何用 Interswitch 发布的 llms.txt(docs.interswitchgroup.com/llms.txt)和文档 URL 加 .md 得到 Markdown 页面的约定,在 Cursor 中接入 Quickteller VAS 账单支付。
VEKTOR Memory 发布 v1.9.8,将本地优先的 AI 智能体记忆系统整合进单一 SDK,新增 Library 阅读模式、支持 80 多种格式转换的 Convert 标签页,以及会先请求用户批准的 Faraday 安全层。
LEGO-Anything 面向3D场景重建的编程智能体 论文:https://huggingface.co/papers/2609.36380
Omni-IO Skills 让你的智能体原生全能 论文:https://huggingface.co/papers/2609.31847
Agents write application code, but you still get paged at 2am when it breaks. We wanted to know whether AI could handle that part of the job too. Introducing Incident Arena: a benchmark that puts coding agents on call! Check out our paper & full dataset release below!
Latent Space 在 OpenAI DevDay 当天发布访谈,OpenAI Computer Use 负责人 Ari Weinstein 称 Computer Use 已与数月前“180 度不同”。
Google 发布新前沿模型 Gemini 4 Argon,是 Gemini 3.1 Pro 之后七个多月来的首款前沿模型。
推荐理由:文章汇总了独立测试与价格细节,读者可以据此比较 Gemini 4 Argon 与竞品的实际表现和成本。
Machine Earning AI 峰会上,个人智能体成为最热议题,OpenAI 在同期开发者日活动上发布了个人助理 Dots。Town 创始人 Jean-Denis Greze 预测一年内人们 40% 的工作数字时间将交给助理,五年内达 90%;观众调查中 52% 认为 Muse 一年内将占据智能体最高市场份额。
Johann Rehberger 在 BlueHat Asia 2026 演示 Microsoft SQL Server Management Studio 中 Copilot 的 CVE-2026-65669 权限提升漏洞(Microsoft 定级为 critical)。
Artificial Analysis 评测 Google DeepMind 新模型 Gemini 4 Argon,其在 Artificial Analysis Intelligence Index 得 53 分,追平 GPT-6 Astra(max),高于 GPT-6.1 Sol(52),为 Google 超 7 个月来首个高于 Flash 档的专有模型。
推荐理由:第三方评测给出了智能指数、单位任务成本、幻觉率等多项横向数据,可用于比较 Gemini 4 Argon 与竞品的实际表现。
Apple 研究团队提出 SCLATE,一个让基准测试与未经修改的智能体各自通过适配器向同一开放事件调度器注册事件的执行底座,用混合模拟时钟把长达一个月的场景压缩到数小时。
这篇每日汇总整理了十月初的七条AI行业动态。OpenAI计划一轮融资至少300亿美元,投前估值约1.4万亿美元,年化收入运行率接近700亿美元;NVIDIA于9月28日发布Open Agent Safety Platform。
Prudenze 提出 AI 智能体治理的控制点应位于智能体提出动作之后、外部系统状态改变之前,而非仅事后重建模型输出。该模型将决策拆分为身份、授权、策略、证据时效、执行与可追溯六个问题,并在边界处给出 PERMIT、BLOCK 或 ESCALATE 三种结果。证据时效被细分为 CURRENT、STALE_REASONING 和 UNVERIFIABLE 三种状态,在每次执行前重新校验关键依赖。
Inworld 收购 Ultravox,一家公司同时拥有 AI 智能体的语音能力和运行平台。Ultravox 是开发者构建实时语音智能体的平台,能处理理解、推理、工具调用和打断时的时机控制。
Big news: Gemini 4 Argon (High) by @GoogleDeepMind just landed #1 in Text Arena with 1525 pts, and #8 in Code Arena: WebDev with 1679 pts! This release has reshaped the Text Arena Pareto frontier with a blended $8/MToken! Gemini 4 Argon (High) is now the most cost efficient model, see its placement on Pareto frontier below. In the Text Arena, Gemini 4 Argon (High) ranks #1 in Coding, Hard Prompts, Instruction Following, Longer Query, and Creative Writing. It also leads every occupational domain evaluated, with additional #1 spots in English, Non-English, Chinese, and Russian. This model is +20 points above the #2 ranked Claude Opus 4.6 (High), and a huge leap from Google’s previous release, Gemini 3.8 Flash (High) at #11! In Code Arena: WebDev, Gemini 4 Argon (High) gained +96 points from Gemini 3.8 Flash (High), and went from #29 to #8. Congrats to the @GoogleDeepMind team on this impressive frontier release!
推荐理由:原文给出 Agent Arena 排名、关键信号得分和每任务成本数据,读者可以据此评估该模型在真实智能体任务中的性价比。
OpenAI CEO Sam Altman 在 DevDay 后接受 The Every Podcast 采访,讲述他如何用 OpenAI 新的常驻智能体 Dot 安排日程、节省时间,并称自己离不开 Astra 的 Ultrafast 模式。本届 DevDay 共发布 22 项产品与功能,数量是去年的两倍多,Altman 还谈到自己如何构建新功能,以及为何相信 AI 将带来新的文艺复兴。
一位读者纠正了作者此前提出的单行修复方案:把 CLAUDE_CODE_PRINT_BG_WAIT_CEILING_MS 设为 0 只是取消截止时间,而非让等待变得可追踪。读者建议每个延迟任务都应留下机器持有的记录,包含任务 id、明确截止时间和到期后的下一步动作,并由独立机制核对。作者已将其转为新项目模板中的 ticket,但该 ticket 已挂起七天,修复尚未落地。
Verax 对 AI Agent 的请求采取默认拒绝策略,没有规则的调用一律拒绝,包括 Agent 换工具名重试的情况。策略只列 memory.get、memory.put、audit.explain、message.read 四个工具,同一工具出现两条规则会在加载时被拒绝;拒绝记录与批准记录同样签名留档,可用 verax verify 离线验证。