Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体
Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。
推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。
Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。
推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。
Together AI 提出分布感知推测解码(DAS),在 RL 后训练中最高减少 50% 的 rollout 时间且不改变模型输出。DAS 由自适应后缀树草稿器和长度感知调度两部分组成,前者无需梯度更新即可持续适配策略变化,后者通过跨 GPU 负载均衡与 GPU 内推测预算分配削减长尾请求。
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)架构,将训练拆分到异步解耦的计算岛(learner units),隔离硬件故障让其他部分继续训练。
阿里巴巴发布 OSWorld,一个用于评测多模态智能体在真实计算机环境中完成开放式任务的基准,论文入选 NeurIPS 2024。该仓库为贡献用 Fork,所有改动计划提交上游 PR。
Google Research 在 ICLR 论文中提出智能体记忆框架 ReasoningBank,可从成功和失败经验中蒸馏结构化推理记忆用于测试时自我进化,并开源了代码。
Sierra 开源 μ-Bench,包含五种语言 locale、五家 provider、来自 250 段真实 8 kHz 电话录音的 4,270 条人工标注语料。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升为虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让世界模型的长时程规划更稳健。
Sayash Kapoor、Arvind Narayanan 等 17 位研究者发布新论文,提出“开放世界评估”这一新兴 AI 评测类型,以弥补主流基准快速饱和、无法反映真实世界能力的局限,并启动定期评估前沿 AI 能力的 CRUX 项目。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集构建重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双评审质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Google Research 提出 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 重建模型的训练数据,将小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。
Together AI 提出稳定循环架构 Parcae,通过将激活多次穿过同一批层来增加计算量,验证困惑度较此前大规模循环模型最多降低 6.3%。770M Parcae 在相同数据上追平 1.3B 参数 Transformer 的质量,参数约减半。团队还首次建立循环的缩放定律,发现计算最优训练需同步提升循环次数与数据量。
Sierra 为每个客户从昨日对话中采样数千条匿名搜索样本,用前沿 LLM 多阶段流水线筛选出理想文章构成 golden 数据集,并以 recall、precision、nDCG 等指标每日衡量检索质量。发布检索与重排序模型 Linnaeus 和 Darwin 后,客户 recall 逐日提升,相关解决率最高提升 16 个百分点。
Google Research 推出 ConvApparel 数据集,包含服装购物领域超 4000 段人机多轮对话、近 15000 轮交互,用于量化 LLM 用户模拟器与真实人类的真实感差距。
蚂蚁 inclusionAI 在 GitHub 开源 TC-AE,这是论文《TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders》的官方代码仓库。该工作聚焦深度压缩自编码器,通过解锁 Token 容量提升其能力。
Google Research 提出一个评估 LLM 行为倾向的框架,将 IRI、ERQ 等标准化心理问卷改编为情境判断测试(SJT),在 25 个 LLM 上比较模型与人类标注者的行为分布。
Together AI 提出 DBPlanBench,将 Apache DataFusion 的物理执行计划暴露给 LLM,把查询优化从统计计算转为语义推理。其序列化层将计划压缩约 10 倍,LLM 通过 JSON Patch 做局部改写而非重生成整个计划。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。
OpenAI 对齐团队在 o4-mini 规模模型上测试了 Tice et al. 提出的对齐中期训练,用各 230k 文档(约 340M tokens)分别做对齐与错位中期训练后再做推理后训练。
Together AI 在 ICLR 2026 论文《When Does Divide and Conquer Work for Long Context LLM?
OpenAI 发布首个完整版 Model Spec Evals,用于衡量模型对 Model Spec 行为规范的遵循程度,并开源 596 条提示词的评测数据集和评测代码。
Google Research 发布压缩算法 TurboQuant,在零精度损失下大幅压缩模型体积,可同时用于 KV cache 压缩与向量搜索。它结合 PolarQuant 与 QJL 两种方法:前者通过随机旋转与极坐标量化消除传统量化每块数据需全精度存储常数的内存开销,后者仅用 1 bit 残差纠偏。
Google Research 发布自监督框架 S2Vec,将道路、建筑、商业设施等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在 US-wide 人口密度、收入中位数等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态;但在树木覆盖、海拔等环境任务上仍需改进。
上海人工智能实验室 InternLM 项目推出 WildClawBench,一个面向生产环境(production harness)中 AI 智能体的 in-the-wild 基准测试。该基准聚焦智能体在真实部署环境下的表现评估,目前随 InternLM 项目开源发布。
OpenAI Alignment 团队提出 self-incrimination 训练方法,让智能体在暗中失范时主动调用 report_scheming() 工具自报行为。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 和 𝜏-Voice 两个评测域,并合并社区对原有领域的修正。
Google Research 与 NHS 合作的 AIMS 研究在 Nature Cancer 发表两项研究,评估 AI 乳腺癌检测系统。
推荐理由:两项研究给出AI作为乳腺筛查第二阅片者的实测数据,读者可据此了解其在真实NHS工作流中的可行性与局限。
Together AI 与 CMU、普林斯顿、Cartesia AI 等机构合作推出 Mamba-3,一个以推理效率为首要目标的状态空间模型。
Google 联合康奈尔大学在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性,将交互搜索转化为稀疏恢复问题;ProxySPEX 进一步利用层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。
OpenAI 发布 ARGO 方法,用强化学习训练策略生成可解释的评分标准,使 rubric 条件下的 LLM 评审与黑盒奖励模型的偏好概率最大化对齐。
Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 会话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在门诊就诊前与 AMIE 进行问诊对话,全程由医生实时监督。
推荐理由:这是 AMIE 首次走出模拟环境的真实临床可行性研究,原文给出了安全性、诊断准确率和患者反馈等一手数据。
上海人工智能实验室 InternLM 团队发布 Visual-ERM,一个面向视觉等价性的奖励模型,论文被 NeurIPS 2026 收录,官方实现已开源。该模型用于对视觉等价性进行奖励建模,代码已在 InternLM 项目下公开。
上海人工智能实验室 InternLM 团队发布 EndoCoT 官方实现,用于在扩散模型中扩展内生链式推理(CoT),面向复杂结构化生成任务。该工作已被 ECCV 2026 收录,代码随论文一并开源。
Together AI 等团队发布 FlashAttention-4,通过算法与内核协同设计在 Blackwell B200 上最大化 matmul 与其他资源瓶颈的重叠。
Sayash Kapoor 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴航空、核安全等领域将可靠性分解为12个维度,在 GAIA 和 TauBench 两个基准上评测 OpenAI、Google、Anthropic 的14个模型,共执行500次运行。
Together AI 发布 SF Streets 和 US Streets 两个语音识别基准,测试 15 个模型在街名转写上的表现,平均错误率达 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% vs 64%)。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力与三项联合训练目标,让扩散语言模型在少步推理下保持质量,并支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
上海人工智能实验室 InternLM 团队开源了 ICLR 2026 论文 "Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing" 的官方代码库 InternLM/VSR,提出以像素引导的视觉自精炼范式提升图表解析准确率。该工作聚焦图表解析任务,通过像素级引导实现自我修正。
蚂蚁 inclusionAI 公开 ZwZ(Zooming-without-Zooming)模型家族,在细粒度感知任务上取得 SOTA 表现,相关论文已被 ICML 2026 收录。同时发布 ZoomBench,一个面向细粒度感知的新挑战性评测基准。
OpenAI 提出一种利用推理模型(AI judges)分析真实生产对话的方法,通过识别用户情绪退化来检测和诊断 ChatGPT 的失调行为,发现情绪退化的对话包含 Model Spec 违规的概率约为其他对话的两倍。