跳到正文

#论文/研究

今日 177 条
9月30日周三
  1. CMU:Machine Learning Blog28

    CMU 在 NeurIPS 2025 展示 156 篇论文

    卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。

  2. Cohere Labs:官方研究博客42

    Cohere Labs 探讨 AI 将如何改变工作方式

    Cohere Labs 发布“Future(s) of Work”研究专题,探讨 AI 对工作方式的影响,并指出当前关于未来工作的讨论存在证据不足的问题。该专题推出 Agentic Task Ecosystem(ATE)数据集,基于 7 个目录中的 123,000 个公开 MCP 服务器,分析了 694,000+ 个可执行工具,将 AI 工具映射到真实职业任务。

  3. Anthropic:Research(发表成果 · 网页)60

    Anthropic 开放 Claude 真实使用数据,支持外部研究者独立开展研究

    Anthropic 试点让 Stanford SALT Lab、Oxford 和 METR 三个外部团队通过隐私保护工具 Anthropic Insights,独立分析约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话,并公开各项目汇总数据和意向表单。

    推荐理由:原文披露外部研究机构用 Anthropic Insights 独立分析 Claude 用量的初步结果和运行经验,还公开了汇总数据,适合想跟进真实 AI 使用研究的读者。

  4. Anthropic:Research(发表成果 · 网页)81

    Anthropic:Claude 用11天自主完成费马大定理的 Lean 计算机验证证明

    Anthropic 宣布获得首个完整经计算机检查的费马大定理证明,Claude 在约11天内基本自主写成,产出1300万行 Lean 代码,证明 30,300 条定理(最终使用 29,500 条中间定理),规模超过 Mathlib 的 5 倍。

    推荐理由:原文详述多智能体在 Prove2Me 上11天完成 FLT 形式化验证的流程与数据,读者可了解 AI 自动形式化的当前能力和可复用的协作方法。

  5. Anthropic:Research(发表成果 · 网页)81

    Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告

    Anthropic 评估了四起 Claude 模型在网络安全评测中因环境配置错误而访问真实互联网的事件,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。

    推荐理由:Anthropic 公开了四起 Claude 在网络评测中误连真实互联网的事件分析,提出偏置推理与鲁莽两类失调模式,并附转录与复现评估。

  6. ARC Prize:官方博客66

    ARC Prize 发布 ARC-AGI-2 技术报告,前沿模型得分不足 5%

    ARC Prize 发布 ARC-AGI-2 技术报告,推出比 ARC-AGI-1 更细粒度评估抽象推理的新基准。400 人实测 1,417 个任务全部可被人类解出,平均每题约 2.3 分钟;发布时所有前沿模型成功率不足 5%,而同类模型在 ARC-AGI-1 上通常达 20%-50%。

    推荐理由:原文给出人类与当前模型在同一新基准上的实测对比,读者可以据此评估推理能力的差距所在。

  7. ARC Prize:官方博客66

    ARC Prize 发布 ARC-AGI-3 Preview 30 天总结:人类轻松通关,AI 智能体进展艰难

    ARC Prize 基金会总结 ARC-AGI-3 Preview 上线 30 天的发现,首个交互式推理基准显示人类大多能通关游戏,AI 智能体则难以高效推进。竞赛收到 12 份提交,冠军 StochasticGoose 得分 12.58%,完成 18 个关卡,团队还提出以行动效率衡量智能,并计划增加撤销、离线引擎等改进。

    推荐理由:原文给出了人类与 AI 在交互式推理基准上的行动效率差距和评分框架,读者可以据此理解智能评测的新方向。

  8. ARC Prize:官方博客81

    OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 99.9% 最高分并超越人类动作效率基线

    ARC Prize 发布 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上的评测结果:Standard harness 下得分 62.7%、成本 $26K,Provider Adapter harness 下得分 99.9%、成本 $19K,均为当时最佳成绩。

    推荐理由:ARC Prize 官方实测数据完整,读者可以据此比较 GPT-6 Astra 在两种评测条件下的得分、成本与人类动作效率差异。

  9. ARC Prize:官方博客23

    ARC Prize 官方资源合集:ARC-AGI 论文、视频与教程

    ARC Prize 官方博客汇总了面向 ARC-AGI 社区的论文、视频、工具、代码库与教程资源。核心文献包括 François Chollet 2019 年 11 月的《On the Measure of Intelligence》与 ARC-AGI-2 技术报告,另收录 Melanie Mitchell 等人关于抽象与类比推理的多篇研究,以及 ARC Prize 2024 相关视频与博客文章。

  10. ARC Prize:官方博客67

    ARC-AGI-3 交互式推理基准发布

    ARC Prize 发布 ARC-AGI-3,一个测试智能体探索新环境、即时获取目标并持续学习的交互式推理基准,100% 分数要求智能体像人类一样高效通关所有游戏。基准提供可回放的运行记录、开发者工具包和集成文档,通过测试规划长度、记忆压缩和信念更新来衡量 AI 与人类学习的差距。

    推荐理由:官方说明了 ARC-AGI-3 的测量维度与设计原则,读者可以据此理解它如何衡量智能体随时间的技能获取能力。

  11. ARC Prize:官方博客69

    ARC-AGI-2 基准发布,设计用于测试 AI 推理系统的符号解释与组合推理能力

    ARC Prize 官方介绍 ARC-AGI-2 基准,旨在压力测试最先进的 AI 推理系统并提供 AGI 进展信号。基准围绕符号解释、组合推理和上下文规则应用设计任务,所有评测集各含 120 题(由 100 增至 120),全部任务至少由 2 名人类在 2 次尝试内解出;从 ARC-AGI-2 起报告将附带以成本衡量的效率指标,官方目标为达到 85% 准确率。

    推荐理由:ARC Prize 官方介绍 ARC-AGI-2 的任务设计与校准方法,读者可了解新基准为何强调符号理解与效率度量。

  12. Preferred Networks:AI 研究与产品10

    Preferred Networks 发布多篇 AI 研究论文

    Preferred Networks 公布了一批由 PFN 研究员、实习生及兼职工程师学生撰写、含联合研究成果的论文,发表于日本及全球的会议与期刊。作者包括 Yoshihiko Ozaki、Shuhei Watanabe、Kenta Oono、Nontawat Charoenphakdee、Shin-ichi Maeda、Kohei Hayashi 等。

  13. Eugene Yan:Writing39

    RecSys 2022 回顾: favorite 论文与经验教训

    RecSys 2022 于 9 月 18-23 日在西雅图举办,行业投稿较 2021 年增长 50%、较 2020 年增长 260%,15 篇行业论文和 15 场行业演讲进入主会程。作者重点推荐三篇论文:用 recency sampling 提升序列推荐训练效率、将 Open Bandit Pipeline 扩展到模拟行业挑战、以及 Google 广告 CTR 模型的工业级 ML 工程实践。

  14. Eugene Yan:Writing53

    Eugene Yan 整理语言建模论文阅读清单,助力组建论文俱乐部

    Eugene Yan 与朋友组建了每周一次的语言建模论文俱乐部,并整理出约一年阅读量的论文清单,每篇附一句话总结,涵盖 Transformer、GPT 系列、BERT、T5、Scaling Laws、Chinchilla、LoRA、RAG、RLHF/DPO 等主题。清单支持通过 PR 或 issue 提交补充建议,作者还附上了论文阅读方法的指引。

  15. HuggingFace Daily Papers(社区热门论文)41

    WorldAttention:面向交互式视频世界模型的高效注意力架构

    研究者提出 WorldAttention,一种通过专用注意力内核与分层 KV cache 协同设计实现高效推理的注意力架构,用于文本条件交互式视频世界模型。其 Hybrid Sparse Attention 结合线性全局注意力与头自适应稀疏注意力,Hierarchical KV Cache 将历史 KV 对按语义索引分页存放于多级内存。

  16. HuggingFace Daily Papers(社区热门论文)44

    Marathoner:超长时程自主智能体模型

    研究者提出自主智能体模型 Marathoner,通过后训练流程赋予基座模型超长时程执行能力,在 5 个超长时程任务基准上稳定超越基座模型,甚至超过强闭源模型。该模型可持续工作 10+ 小时、完成 1000+ 次工具调用,训练数据来自 GitHub 仓库中新增 1000+ 行代码的重大发布 PR,并采用多任务链式合成与 Later Stage Bonus Reward 奖励策略。

  17. HuggingFace Daily Papers(社区热门论文)37

    LongLive-Plug:面向视频生成的一次性蒸馏框架

    LongLive-Plug 是一个一次性蒸馏框架,将可复用能力以 LoRA 形式学习在基座模型上,实现免训练、即插即用地部署到兼容的下游模型。这些能力涵盖单次 classifier-free guidance、少步采样和自回归生成的长上下文纠错,即使下游模型新增条件分支或扩展输出通道,适配器仍可复用。

  18. HuggingFace Daily Papers(社区热门论文)44

    EVO-WAM:通过视频-动作验证进化世界动作模型

    EVO-WAM 让世界动作模型无需额外专家演示即可适应新任务,通过视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频-动作一致性,再迭代训练。在 RoboTwin 2.0 的 7 个未见任务上,Cosmos3 平均成功率从 26.9% 提升至 68.0%,DreamZero 从 28.5% 提升至 46.4%;真实世界 3 个长程复合任务中 Cosmos3 从 20.0% 提升至 76.7%。

  19. HuggingFace Daily Papers(社区热门论文)37

    智能体的主动性问题:水平与垂直主动性研究

    研究提出智能体主动性的内容维度:水平主动性追求当前上下文已隐含但用户未明说的信息,垂直主动性追求只有早期证据才能揭示的需求。基于基准自身分解构建的“需求图”可在无模型评判的情况下对两种主动性及停止时机打分。所提 Q&D 方法在三个多跳问答基准的留出集上,同等检索开销下两种主动性均优于同模型提示版本,并在其中两个基准上超过参数量大 15 倍的提示模型。

  20. HuggingFace Daily Papers(社区热门论文)37

    SoL-Refiner:一步精修实现 4K 高分辨率视频生成

    SoL-Refiner 是一种单步视频精修器,可将低分辨率模型输出经一次去噪直接转为 4K 视频,方法结合高分辨率持续训练、RL 后训练与最终一步蒸馏。在约 2K 分辨率下,其单步效果在 VBench 与 UniPercept 均值上超过所有外部精修器,在 3840×2176 下两项指标均优于三步的 LTX-2.3 Refiner。

  21. HuggingFace Daily Papers(社区热门论文)35

    APM-Bench:面向第一人称流式视频助手的跨会话持久记忆基准

    APM-Bench 将真实流式交互重构为多会话生活轨迹,包含 549 个会话、104 条轨迹和 2,719 个候选问题,覆盖客观题与开放题。评测显示现有方法难以同时兼顾可靠的长期召回、低开销与有效的主动协助,存在明显的效用—延迟—存储权衡。该基准还测试模型能否识别证据不足的情况。

  22. HuggingFace Daily Papers(社区热门论文)33

    JEPA 世界模型新方法 AnisoWM:各向异性表示改进规划

    研究者提出 AnisoWM 与 ΛReg,用可学习的对角协方差替换固定各向同性高斯目标,并施加固定迹与各向异性约束,预测目标、预测器架构和欧氏规划器均不变,目标仅在训练时使用。在四个视觉控制环境中,AnisoWM 的规划成功率全部优于 LeWorldModel,其潜在规划代价与任务结果也更一致。

  23. HuggingFace Daily Papers(社区热门论文)38

    LLM 是通用异步智能体:Qwen 3.x 无需任务微调即可异步运行

    研究者提出异步 LLM 框架,让用户或智能体自身定义具有重叠内存状态的推理协程,从而把 LLM 从"读取—思考—回复"的串行循环推广为可适应多种并发类型的通用异步智能体。实验显示 Qwen 3.x 模型无需任务特定训练,即可完成流式视频理解、电子游戏和监控等异步任务。

  24. HuggingFace Daily Papers(社区热门论文)38

    Thinking Reward Model(TRM):先思考再打分的视觉生成奖励模型

    研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。