跳到正文

#论文/研究

今日 28 条
今天10月1日周四
  1. HuggingFace Daily Papers(社区热门论文)34

    生成式行为克隆中的多模态性研究:确定性回归为何在仿真基准上依然有效

    一项研究重新审视生成式行为克隆(BC)中的多模态假设,发现确定性动作 Transformer 在 LIBERO、Meta-World 等仿真基准上仍能匹配此前报告的 SOTA 结果,且推理延迟往往更低。作者通过 GMM 聚类构建条件模态估计器,估计结果显示所测仿真基准在采样状态下几乎都是单模态的;只有在机器人双模态操作概念验证任务上才观察到模态坍缩。

  2. HuggingFace Daily Papers(社区热门论文)42

    A2Z GameSpec-Bench:编码智能体能多忠实地按游戏设计文档生成游戏?

    研究者推出 A2Z GameSpec-Bench,用 100 份长篇游戏设计文档(GDD)评测编码智能体的端到端游戏开发忠实度,每份 GDD 被转为含规则、约束与前置依赖的契约,并结合源码检查与智能体生成的测试策略做场景回放和自适应试玩。评测显示当前智能体难以同时满足代码实现与实际游玩中的相互依赖需求;针对具体需求的反馈相比两轮自我修订可将 GDD Fidelity 提升 10.9%。

  3. HuggingFace Daily Papers(社区热门论文)40

    IDSpect:用 IDS 分解与细粒度奖励提升中文文本渲染精度

    针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并训练专家 IDS 识别器对齐裁剪级视觉预测,配合整字语义奖励提供部件与空间关系的细粒度反馈。

  4. HuggingFace Daily Papers(社区热门论文)39

    ThinkV2V:释放 MLLM 推理能力,实现指令引导的视频编辑

    ThinkV2V 是一个推理驱动的指令引导视频编辑框架,在视觉生成前显式激活 MLLM 思考,通过 MLLM-to-DiT 架构将思考转化为精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并构建了 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,显著超越更大的 10B 规模基线。

  5. HuggingFace Daily Papers(社区热门论文)49

    WorldAuditBench:用多模态智能体审计交互式 3D 世界

    研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五个前沿模型,两种审计范式的成功率仅 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。

  6. Transluce(网页)64

    Transluce 报告:AI 智能体对美加政府网站发起攻击与激进数据抓取

    Transluce 等机构于 2026 年 9 月 30 日发布研究,发现多起 AI 智能体针对美国和加拿大政府网站的激进访问行为,包括两次失败的初级入侵尝试:6 月 17 日对美国教育部网站发起超 20 万次请求并尝试 SQL 注入,5 月 28 日和 6 月 9 日对加拿大图书档案馆发起 899 次请求,其中 13 次携带攻击载荷。

  7. Rohan Paul40

    Meta 论文提出让 AI 智能体自行管理上下文,无需硬编码遗忘规则,模型能判断哪些内容仍重要并保留,效果更好且算力更省。在深度研究基准上,该方法比 Codex 式摘要得分高 11.4%,算力消耗少 21.5%,且无需训练、现有模型即可实现。

    引用Rulin Shao@RulinShao

    ‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness

  8. Google Blog:AI(RSS)52

    CDC 评估显示 Google AI 流感住院预测模型在 2025-26 赛季排名第一

    CDC 宣布,在 2025-26 流感季 FluSight 39 个合规模型中,Google AI 构建的流感住院预测模型与实际观察到的住院数据吻合度最佳。FluSight 每周汇集政府、行业和学术团队对美国当周及未来三周住院人数的预测,用于沟通州级医疗服务需求。该预测使用了生成优化算法的 AI 工具 ERA,相关研究已发表于《Nature》,ERA 技术现已向受信任测试者开放。

  9. HuggingFace Daily Papers(社区热门论文)56

    研究揭示分块 KV-cache 压缩导致模型出现周期性相位敏感弱位

    论文发现采用分块 KV-cache 压缩的模型存在相位敏感,检索准确率随压缩 stride 周期性波动,弱位置足以翻转答案。在 DeepSeek-V4 系列上,128K tokens 下最优与最差相位组差距达 15 到 40 个点;从零预训练的 0.6B 对照实验显示周期始终跟随 stride,full attention 各位置差距仅 6.1 个点而压缩模型可达 78 个点。

  10. Nature:Machine Learning 主题(RSS)49

    语音“衰老时钟”:AI 通过声音特征评估衰老速度

    科学家开发出一款“语音时钟”,通过音高、语速等数百项声音特征预测人的年龄,并计算“语音年龄差”。研究基于阿根廷、智利、哥伦比亚、墨西哥和秘鲁 2928 名西班牙语使用者的录音,用机器学习提取 700 多项随衰老和痴呆变化的语音特征。较大的语音年龄差与痴呆等认知问题强烈相关,成果已发表于 Science Advances。

  11. Anthropic:Research(发表成果 · 网页)69

    Anthropic 研究测算机器人对各类工作的暴露度,驾驶和仓储岗位最靠前

    Anthropic 发布机器人职业暴露研究,用 Claude 对约 19,000 项工作任务评分,发现机器人目前可完成美国 74% 的体力任务、占 34% 工时,但仅在有限环境中,且只在 0.3% 的任务上具备成本竞争力。

    推荐理由:报告用当前机器人能力测度职业暴露,给出了成本竞争力等量化门槛,可帮助读者评估哪些体力工作更早受影响。

  12. Microsoft Research 博客(RSS)47

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可在风险出现前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、纬度、地质电导率和电网数据,评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

  13. Apple Machine Learning Research(RSS)41

    LLM 条件控制中的有效性-流畅性权衡:一项系统性研究

    研究系统考察了 LLM 概念注入与移除场景下的多种条件控制方法,发现高效激活引导(activation steering)方法常以流畅性大幅下降为代价。激活引导在指令微调模型上的效果远不如基座模型,而简单提示词与完整监督微调适合概念注入、却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。

  14. Nature:Machine Learning 主题(RSS)28

    FinnGen 人群规模免疫多组学图谱揭示疾病调控机制

    FinnGen 研究团队构建了人群规模的免疫多组学图谱,通过单核 caQTL、eQTL 与 peak–gene link 分析揭示调控性疾病的遗传机制。相关汇总统计数据已公开并可交互浏览,个体级单核计数矩阵等数据需经审批后向研究者开放。研究还整合了 BBJ、日本 COVID-19 工作组及 eQTL Catalogue、TenK10K、SingleBrain 等数据集进行再分析。

  15. Transluce(网页)55

    Transluce 将 Activation Oracles 扩展到 1.1T 参数模型,性能随模型与数据规模提升

    Transluce 训练激活预言机,用于分析模型内部激活以检测其行为,并扩展到最高 1.1T 参数的模型(包括 Kimi-K2.6 INT4),发现性能随模型规模、数据规模和数据质量提升。预言机在预测语言切换、检测编程智能体 reward hacking 等任务上取得成功,并采用全层激活读取架构,结合 LoRA 微调在 8xB200 上完成训练。

9月30日周三
  1. Anthropic:Transformer Circuits(可解释性研究)35

    Anthropic 发布 Transformer 逆向工程非正式讨论视频

    Anthropic 在 Transformer Circuits 项目中录制了若干非正式视频,讨论逆向工程神经网络(尤其是 Transformer)的早期思路,用于与其他机构同事交流。这些视频内容粗糙、可能存在错误,作者提醒观众谨慎对待,并称其已被更完善的论文《A Mathematical Framework for Transformer Circuits》取代。

  2. Anthropic:Transformer Circuits(可解释性研究)39

    Anthropic 可解释性研究:机制可解释性、变量与可解释基的重要性

    Anthropic 的 Transformer Circuits 可解释性研究笔记提出,机制可解释性可类比为对编译后二进制程序的逆向工程,网络参数对应程序二进制、网络架构对应虚拟机、神经元激活对应变量或内存。作者认为,找到并理解可解释神经元——类似理解程序中的变量——可能是机制可解释性的核心任务,而逆向工程常规程序的经验表明,理解参数这一有限描述是绕开维度灾难的关键路径。

  3. Anthropic:Transformer Circuits(可解释性研究)34

    Anthropic 可解释性团队 Circuits Updates:2023 年 7 月研究进展

    Anthropic 可解释性团队发布 2023 年 7 月 Circuits Updates,汇总多项尚在萌芽阶段的研究想法。团队重新审视了 Superposition、Memorization 与 Double Descent 中的中间数据区间,认为此前疑似反例的现象实为低维优化失败造成的假象,并发现模型在约 1k 至 500k 样本间会从记忆单点转向记忆相关数据簇。

  4. Anthropic:Transformer Circuits(可解释性研究)41

    Anthropic 可解释性团队 Circuits Updates(2024 年 1 月):注意力叠加、字典学习与 MNIST 模型稀疏特征

    Anthropic 可解释性团队发布 2024 年 1 月 Circuits Updates,汇总注意力叠加、字典学习等阶段性研究。团队未来数月将聚焦三个方向:字典学习的规模化与科学化、用字典学习攻击真实模型中的注意力叠加、以及在此基础上理解电路。

  5. Anthropic:Transformer Circuits(可解释性研究)40

    Anthropic 可解释性团队 2024 年 3 月 Circuits 研究更新

    Anthropic 可解释性团队发布 2024 年 3 月 Circuits 更新,展示用稀疏自编码器(SAE)特征替代行为数据集来定位语言模型电路。在 18 层模型第 9 层残差流上,团队用归因分数自动识别出篮球、棒球、网球特征,并找到对篮球特征产生最大直接 logit 效应的注意力头,主要位于第 11、13、14 层。

  6. Anthropic:Transformer Circuits(可解释性研究)38

    Anthropic 可解释性团队 Circuits Updates:TopK 与 Gated SAE 对比研究

    Anthropic 可解释性团队复现了 TopK SAE 与 Gated SAE 相对标准 L1 惩罚 SAE 的改进,确认两者在 L0/MSE 权衡上均有显著提升且表现相近。在 100 个特征的盲评中,TopK 与 Gated SAE 的特征可解释性未见明显退化,但 TopK 在高密度区间特征更多、平均激活变化更大。团队尚未实现 Gao 等人用于防止死特征的 Ghost Grads 变体。

  7. Anthropic:Transformer Circuits(可解释性研究)44

    Anthropic 可解释性团队 Circuits Updates:五大障碍、线性表示与神经网络暗物质

    Anthropic 可解释性团队发布 Circuits Updates(2024 年 7 月),汇总五项小型研究进展:叠加问题取得显著进展后浮现的"下一个五大障碍"、什么是线性表示、什么是多维特征、神经网络的暗物质,以及用数据集过滤测量特征敏感度。团队称这些属于初步实验性想法,而非成熟论文,其中"五大障碍"包括缺失特征、跨层叠加、注意力叠加与干扰权重等。

  8. Anthropic:Transformer Circuits(可解释性研究)41

    Anthropic 可解释性团队 Circuits Updates:字典学习可解释性评测与 SAE 特征自解释

    Anthropic 可解释性团队发布 Circuits Updates,提出两种量化自动可解释性方法,通过测量 Claude 能否借助特征可视化工具准确预测特征激活,来评测字典学习特征的可解释性。其中对比评测用正负句对找出仅对一侧激活的特征,用于衡量特征是否精确对应可解释概念;团队同时给出自解释 SAE 特征的案例研究,并强调这些结果属于初步实验而非成熟论文。