跳到正文

全部动态

今日 176 条
5月2日周六
  1. Sierra:Blog(RSS)67

    Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体

    Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。

    推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。

4月24日周五
  1. Together AI 研究与产品博客(RSS)45

    Together AI 用分布感知推测解码将 RL rollout 加速最高 50%

    Together AI 提出分布感知推测解码(DAS),在 RL 后训练中最高减少 50% 的 rollout 时间且不改变模型输出。DAS 由自适应后缀树草稿器和长度感知调度两部分组成,前者无需梯度更新即可持续适配策略变化,后者通过跨 GPU 负载均衡与 GPU 内推测预算分配削减长尾请求。

4月22日周三
4月21日周二
4月20日周一
4月17日周五
4月16日周四
4月15日周三
  1. Together AI 研究与产品博客(RSS)48

    Together AI 推出 Parcae:稳定循环架构用一半参数追平 1.3B Transformer

    Together AI 提出稳定循环架构 Parcae,通过将激活多次穿过同一批层来增加计算量,验证困惑度较此前大规模循环模型最多降低 6.3%。770M Parcae 在相同数据上追平 1.3B 参数 Transformer 的质量,参数约减半。团队还首次建立循环的缩放定律,发现计算最优训练需同步提升循环次数与数据量。

4月9日周四
4月7日周二
4月3日周五
4月1日周三
3月28日周六
3月26日周四
3月25日周三
  1. Google Research40

    Google Research 推出 S2Vec:用自监督嵌入学习城市建成环境

    Google Research 发布自监督框架 S2Vec,将道路、建筑、商业设施等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在 US-wide 人口密度、收入中位数等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态;但在树木覆盖、海拔等环境任务上仍需改进。

3月23日周一
3月22日周日
3月19日周四
3月18日周三
3月17日周二
3月13日周五
  1. BAIR:Berkeley AI Research Blog34

    伯克利提出 SPEX 与 ProxySPEX:大规模识别 LLM 特征交互

    伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性,将交互搜索转化为稀疏恢复问题;ProxySPEX 进一步利用层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。

3月12日周四
  1. Google Research68

    Google AMIE 与 BIDMC 开展会话式诊断 AI 真实门诊可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 会话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在门诊就诊前与 AMIE 进行问诊对话,全程由医生实时监督。

    推荐理由:这是 AMIE 首次走出模拟环境的真实临床可行性研究,原文给出了安全性、诊断准确率和患者反馈等一手数据。

3月9日周一
3月6日周五
3月5日周四
2月24日周二
2月23日周一
2月19日周四
  1. Together AI 研究与产品博客(RSS)48

    Together AI 的 CDLM 让扩散语言模型推理最高提速 14 倍且不牺牲质量

    Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力与三项联合训练目标,让扩散语言模型在少步推理下保持质量,并支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。

2月16日周一
  1. 上海人工智能实验室 InternLM:原创项目29

    InternLM/VSR:上海人工智能实验室开源像素引导图表解析框架 Visual Self-Refine

    上海人工智能实验室 InternLM 团队开源了 ICLR 2026 论文 "Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing" 的官方代码库 InternLM/VSR,提出以像素引导的视觉自精炼范式提升图表解析准确率。该工作聚焦图表解析任务,通过像素级引导实现自我修正。

2月12日周四
2月7日周六