FireRedTeam 发布 ReMatch:面向多模态检索的匹配增强表征方法
FireRedTeam 开源了论文《ReMatch: Boosting Representation through Matching for Multimodal Retrieval》的官方实现,该工作已被 CVPR 2026 收录。ReMatch 通过匹配机制增强多模态检索的表征能力。
FireRedTeam 开源了论文《ReMatch: Boosting Representation through Matching for Multimodal Retrieval》的官方实现,该工作已被 CVPR 2026 收录。ReMatch 通过匹配机制增强多模态检索的表征能力。
Stanford 医学院遗传学家 Gary Peltz 团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药物。
蚂蚁 inclusionAI 在 GitHub 发布 ARGenSeg,将自回归图像生成模型用于图像分割,论文已被 NeurIPS 2025 收录。该工作把分割任务建模为图像生成过程,具体参数规模与 benchmark 分数原文未披露。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论和进化假设来加速复杂科学问题研究,并将在未来几周通过 labs.google/science 向个人研究者开放。
推荐理由:原文给出多智能体架构、想法锦标赛机制和多个实验室应用结果,读者可了解它如何辅助科学假设生成与验证。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。
推荐理由:OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。
Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。
推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下辅助患者照护的 AI 智能体。在 98 个真实初级保健问题的盲评中,该系统在 97 例中零关键错误,优于两种医生广泛使用的 AI 系统;在 OpenFDA RxQA 开放式用药问答上超越其他前沿模型。
推荐理由:原文给出盲评与模拟问诊的测试结果和局限,读者可以了解医疗 AI 在辅助医生与患者场景中的实际表现边界。
Google Research 介绍了科学家及学术合作者使用 Empirical Research Assistance(ERA)开展研究的四个方向。公共卫生方面,团队将 COVID-19 住院预测扩展到流感和 RSV,并每周实时向 CDC 相关项目提交预报,在流感与 COVID-19 公开排行榜上处于或接近榜首。
Together AI 提出分布感知推测解码(DAS),在 RL 后训练中最高减少 50% 的 rollout 时间且不改变模型输出。DAS 由自适应后缀树草稿器和长度感知调度两部分组成,前者无需梯度更新即可持续适配策略变化,后者通过跨 GPU 负载均衡与 GPU 内推测预算分配削减长尾请求。
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)架构,将训练拆分到异步解耦的计算岛(learner units),隔离硬件故障让其他部分继续训练。
阿里巴巴发布 OSWorld,一个用于评测多模态智能体在真实计算机环境中完成开放式任务的基准,论文入选 NeurIPS 2024。该仓库为贡献用 Fork,所有改动计划提交上游 PR。
Google Research 在 ICLR 论文中提出智能体记忆框架 ReasoningBank,可从成功和失败经验中蒸馏结构化推理记忆用于测试时自我进化,并开源了代码。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升为虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让世界模型的长时程规划更稳健。
Sayash Kapoor、Arvind Narayanan 等 17 位研究者发布新论文,提出“开放世界评估”这一新兴 AI 评测类型,以弥补主流基准快速饱和、无法反映真实世界能力的局限,并启动定期评估前沿 AI 能力的 CRUX 项目。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集构建重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双评审质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Google Research 提出 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 重建模型的训练数据,将小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。
Together AI 提出稳定循环架构 Parcae,通过将激活多次穿过同一批层来增加计算量,验证困惑度较此前大规模循环模型最多降低 6.3%。770M Parcae 在相同数据上追平 1.3B 参数 Transformer 的质量,参数约减半。团队还首次建立循环的缩放定律,发现计算最优训练需同步提升循环次数与数据量。
Sierra 为每个客户从昨日对话中采样数千条匿名搜索样本,用前沿 LLM 多阶段流水线筛选出理想文章构成 golden 数据集,并以 recall、precision、nDCG 等指标每日衡量检索质量。发布检索与重排序模型 Linnaeus 和 Darwin 后,客户 recall 逐日提升,相关解决率最高提升 16 个百分点。
Google Research 推出 ConvApparel 数据集,包含服装购物领域超 4000 段人机多轮对话、近 15000 轮交互,用于量化 LLM 用户模拟器与真实人类的真实感差距。
蚂蚁 inclusionAI 在 GitHub 开源 TC-AE,这是论文《TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders》的官方代码仓库。该工作聚焦深度压缩自编码器,通过解锁 Token 容量提升其能力。
Google Research 提出一个评估 LLM 行为倾向的框架,将 IRI、ERQ 等标准化心理问卷改编为情境判断测试(SJT),在 25 个 LLM 上比较模型与人类标注者的行为分布。
Together AI 提出 DBPlanBench,将 Apache DataFusion 的物理执行计划暴露给 LLM,把查询优化从统计计算转为语义推理。其序列化层将计划压缩约 10 倍,LLM 通过 JSON Patch 做局部改写而非重生成整个计划。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。
Together AI 在 ICLR 2026 论文《When Does Divide and Conquer Work for Long Context LLM?
Google Research 发布压缩算法 TurboQuant,在零精度损失下大幅压缩模型体积,可同时用于 KV cache 压缩与向量搜索。它结合 PolarQuant 与 QJL 两种方法:前者通过随机旋转与极坐标量化消除传统量化每块数据需全精度存储常数的内存开销,后者仅用 1 bit 残差纠偏。
Google Research 发布自监督框架 S2Vec,将道路、建筑、商业设施等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在 US-wide 人口密度、收入中位数等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态;但在树木覆盖、海拔等环境任务上仍需改进。
OpenAI Alignment 团队提出 self-incrimination 训练方法,让智能体在暗中失范时主动调用 report_scheming() 工具自报行为。
Google Research 与 NHS 合作的 AIMS 研究在 Nature Cancer 发表两项研究,评估 AI 乳腺癌检测系统。
推荐理由:两项研究给出AI作为乳腺筛查第二阅片者的实测数据,读者可据此了解其在真实NHS工作流中的可行性与局限。
Together AI 与 CMU、普林斯顿、Cartesia AI 等机构合作推出 Mamba-3,一个以推理效率为首要目标的状态空间模型。
Google 联合康奈尔大学在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性,将交互搜索转化为稀疏恢复问题;ProxySPEX 进一步利用层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。
OpenAI 发布 ARGO 方法,用强化学习训练策略生成可解释的评分标准,使 rubric 条件下的 LLM 评审与黑盒奖励模型的偏好概率最大化对齐。
Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 会话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在门诊就诊前与 AMIE 进行问诊对话,全程由医生实时监督。
推荐理由:这是 AMIE 首次走出模拟环境的真实临床可行性研究,原文给出了安全性、诊断准确率和患者反馈等一手数据。
上海人工智能实验室 InternLM 团队发布 Visual-ERM,一个面向视觉等价性的奖励模型,论文被 NeurIPS 2026 收录,官方实现已开源。该模型用于对视觉等价性进行奖励建模,代码已在 InternLM 项目下公开。
上海人工智能实验室 InternLM 团队发布 EndoCoT 官方实现,用于在扩散模型中扩展内生链式推理(CoT),面向复杂结构化生成任务。该工作已被 ECCV 2026 收录,代码随论文一并开源。
Together AI 等团队发布 FlashAttention-4,通过算法与内核协同设计在 Blackwell B200 上最大化 matmul 与其他资源瓶颈的重叠。
Sayash Kapoor 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴航空、核安全等领域将可靠性分解为12个维度,在 GAIA 和 TauBench 两个基准上评测 OpenAI、Google、Anthropic 的14个模型,共执行500次运行。
Together AI 发布 SF Streets 和 US Streets 两个语音识别基准,测试 15 个模型在街名转写上的表现,平均错误率达 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% vs 64%)。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力与三项联合训练目标,让扩散语言模型在少步推理下保持质量,并支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。