LumberChunker:面向长篇叙事文档的分段方法
CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。
CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。
CMU 团队提出 CowCorpus 数据集,包含 400 段真实人机协作网页会话和 4200+ 交错动作,用于训练智能体预测人类介入时机。基于该数据将介入预测建模为逐步二分类任务,用大型多模态模型监督微调,并聚类出 Takeover、Hands-on、Hands-off、Collaborative 四类用户交互模式。
CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。
Datadog 发布 ARFBench,一个基于其内部真实故障遥测数据构建的时间序列问答(TSQA)基准,包含 750 个 QA 对、142 条时间序列和 63 起故障事件。
CMU 研究者发布 CHAI,一个基于批判式人机监督的视频描述管线,与 100+ 专业视频创作者合作一年构建,对应 CVPR 2026 论文(Highlight,Top 3%)。
CMU 提出 V-pretraining,在持续预训练中把固定的自监督任务构造规则换成可学习的任务设计器,下游样本只用于训练设计器,学习者仍只接收自监督梯度。
CMU 研究指出医疗 LLM 基准的评估与部署存在 61 个百分点差距,根源是评估协议中隐含的任务与结果两类假设在真实场景中不成立。研究将差距拆解为查询分布 12 点、交互类型 19 点、决策中介 30 点,并提出 BenchmarkCards 框架显式化这些假设,配合分阶段评估判断基准结果能否迁移到部署。
CMU 博客解读 Forking-Sequences 训练范式:不再逐窗口编码,而是在单次前向传播中编码解码整条序列的所有预测创建日期,无需新增参数。该范式在 MLP、RNN、LSTM、CNN、Transformer 和 State Space 六种编码器上验证,LSTM 编码器的 sCRPS 最高提升 49.3%,梯度方差线性下降。
Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。
Anthropic Frontier Red Team 发布新评测,测量 AI 模型在战术情报定位(如凭碎片信息定位人员)和常规武器开发(如编写无人机制导软件)上的能力,发现部分任务上模型已能做到历史上只有稀缺高度训练专家才能完成的工作。
推荐理由:Anthropic 用自建评测给出各模型在情报定位和武器开发任务上的具体成绩,读者可据此了解滥用风险的能力梯度。
Anthropic 发布研究,Claude 在不到四周内优化了超过 30 个用于结构预测、蛋白质设计、基因组学和蛋白质语言模型的开源模型,平均加速约 4 倍、输出完全一致时约 2 倍,并开源了全部优化代码。
推荐理由:原文给出具体加速倍数、低内存模式和开源入口,读者可评估这些优化对自身生物分子建模工作流的实际收益。
Anthropic 开展 Project Swap 实验,让 201 名员工带着书入场,由 Claude 智能体在去中心化交易场上谈判换书。仅凭 5 分钟 intake 聊天,Claude 构建的排序与本人自评在 61% 的书对上一致(随机为 50%)。
推荐理由:实验把市场失灵主要归因于偏好理解而非谈判能力,并给出模型比指令影响更大的量化结果。
Anthropic 宣布成立生命科学研究组与实验室,并分享早期成果:约 950 个 Claude 智能体用 21 小时和 210 million tokens 搜索 DNA 数据库后,自主发现一种与 DNA 重复序列相关的新型酶系统,命名为 array-associated reverse transcriptases(ART),模式类似 CRISPR。
推荐理由:Anthropic 以当事方身份完整披露 Claude 自主发现 ART 酶系统的流程、规模和实验验证方式,读者可以借此了解 AI 智能体驱动生物学研究的具体做法。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。
MIT 研究人员系统评估了算法单一化的主要反对意见,认为系统性排斥等论点并不成立,并用数学证明单一化主要造成信息回声室、阻碍探索。在招聘场景中,将多个招聘算法组合成单一“ensemble”可克服这一局限,有时表现不逊于甚至优于多算法并存的 polyculture。研究发表于 Philosophical Perspectives。
Apple 研究者提出往返协议,测试语言模型将树结构算术表达式序列化为自然语言后能保留多少信息。评估 16 个模型的所有两两组合发现,通道有损且不对称:交换生成与提取模型可使准确率相差最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本可将所有开源权重模型提升至未训练 Gemini-3.1-Pro 之上。
MIT 研究团队借助可在小数据集上工作的机器学习算法,调整 mRNA 疫苗脂质纳米颗粒(LNP)中的辅料配方,使疫苗在室温下可稳定保存一年,在约 100 华氏度下保存两个月。
Apple 研究者针对联邦随机变分不等式(VI)提出改进收敛速率:先证明经典 Local Extra SGD 在光滑单调 VI 下可获更紧保证,再指出其客户端漂移过大问题,并提出新算法 LIPPAX,在有界 Hessian、有界算子和低方差等场景下缓解漂移并改善收敛保证,结果进一步扩展到联邦复合变分不等式。
MIT McGovern 研究所的 Satra Ghosh 和 Daniel Low 团队开发了一个语言处理工具,用包含 49 个自杀风险因素、每个因素约 60 个词或短语的词表分析文本,准确预测危机对话中的自杀风险,论文发表于 Journal of Psychopathology and Clinical Science。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频,并原生继承 SynthID 水印等安全机制。
推荐理由:Google 把长视频生成拆成四个可组合的智能体框架,并给出三套自建基准与量化结果,便于对照现有方案。
很高兴介绍 X-Planner:面向具身智能的事件结构化任务规划——一个将语义事件作为规划单元的前端,通过 Staircase Decoding 暴露离散+隐式接口,在真实机器人上超越基线。
To address long-horizon robotic manipulation tasks, we propose X-Planner, an embodied long-horizon task planner: It decomposes high-level natural language instructions into event-level subtasks, and can also output continuous implicit Chain-of-Thought (CoT). It directly interfaces with downstream VLA or WAM models to operate robots. GitHub: https://github.com/X-Square-Robot/Xplanner Checkpoint: https://huggingface.co/x-square-robot/X-Planner-9B-0916 Benchmark: https://huggingface.co/datasets/x-square-robot/xplanner-benchmark
Apple 研究团队提出半监督联邦 ASR 训练方案,通过在线伪标签教师与服务器端标注数据锚定更新两条耦合设计轴缩小与全监督联邦学习的差距。该方案在 11 组对比中 9 组优于最强先前方法,域内平均提升 20.8%、跨域提升 10.0%。服务器必须在轮次间持续用标注数据训练,这一交错更新比种子模型更决定收敛,且稳定化需求取决于种子数据分散度及其与客户端数据的重叠程度。
Apple 提出一种潜空间蒸馏方法压缩流式神经音频编码器:不监督离散 token 或输出分布,而是让学生编码器回归教师模型每帧的量化前潜表示,并用单层仿射层吸收师生宽度差异。在 2.8× 压缩下,六组师生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。该方案同时适用于单独预训练和与语言模型联合训练的 tokenizer。
AI 能看出你把宜家家具装错了吗?我们的新基准——家具组装基准(FAB)——给模型提供说明书和一张半成品家具的照片,让它们找出错误。 最高分在短短 10 个月内从 28% 提升到了 80%。
微软研究院对移动机器人操作负载做系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现与电池续航。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出了卸载到边缘或云端 GPU 在任务成功率与续航上的量化差异。
Apple 研究团队提出 probe guidance,利用已有扩散模型冻结的内部状态构建引导信号,无需在推理时增加额外前向计算,即可让弱模型与强模型保持相近动态。该方法在连续扩散语言模型的无条件生成上刷新 SOTA,应用于 1.7B 扩散语言模型时持续提升多项选择题基准表现。研究还发现,传统 autoguidence 中的弱模型必须来自训练的低熵区域。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式集成策略融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的排序预测。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 开放。
Introducing VC-Attention: fast and accurate low-bit attention without retraining. On MiniMax-H3, VC-Attention speeds up attention by 1.6× on B200 and 1.5× on B300 over FlashAttention-4, with better fidelity than SageAttention2. It also works with existing sparse attention methods. Two key innovations: • V-Smooth reduces value quantization error. • ExpCast-FP8 speeds up softmax. Nunchux Attention, our proprietary extension, pushes the speedup to 1.9× on B200 and 1.8× on B300. Blog: http://www.nunchux.ai/blog/attention-is-the-video-bottleneck Technical Report: http://arxiv.org/pdf/2609.15810 Joint work by researchers at MIT, CMU, UC Berkeley, Stanford, and NVIDIA.
Apple 研究团队提出 Dynamically Scaled Activation Steering(DSAS),一种与具体方法无关的激活引导框架,将"何时引导"与"如何引导"解耦,按层和输入自适应调节现有引导变换的强度,仅在检测到不良行为时强力干预。
Google Research 公布一项研究实验,让教师借助生成式 UI(GenUI)创建贴合课程目标的互动学习模拟,并同步开放 30 多个面向初高中 STEM 的英文学习互动样例库,均由 AI 生成、教师审核。
研究者提出 REVERSAL-BENCH,通过连续参数 ρ∈[0,1] 控制环境可逆性,并提供重置 Oracle 在五种物理引擎的八种操作场景中验证状态可恢复性。
这是一份很不错的报告,探讨了最重要的问题之一:AI 可能如何影响科学与创新?它如今已经在产生什么影响? 干得漂亮,Mihai 和团队。
I've had the most wonderful time working on this project for the last few months. This was (equally) co-led w/ @JMateosGarcia , @alexolegimas and a fantastic team.
MIT 及合作机构的团队在 Nature 发表 xvr(X-ray volume registration),可自动将术中 X 光片与患者术前 3D 扫描配准,达到亚毫米精度,比现有 AI 方法高出一个数量级。该方法基于物理仿真生成合成 X 光影像训练基础模型,约五分钟即可适配新患者,团队已在来自五家医院、覆盖成人和儿童的最大公开 2D/3D 配准数据集上完成验证,正与手术机器人公司合作推进落地。