跳到正文

全部动态

今日 176 条
9月30日周三
  1. ARC Prize:官方博客67

    ARC-AGI-3 交互式推理基准发布

    ARC Prize 发布 ARC-AGI-3,一个测试智能体探索新环境、即时获取目标并持续学习的交互式推理基准,100% 分数要求智能体像人类一样高效通关所有游戏。基准提供可回放的运行记录、开发者工具包和集成文档,通过测试规划长度、记忆压缩和信念更新来衡量 AI 与人类学习的差距。

    推荐理由:官方说明了 ARC-AGI-3 的测量维度与设计原则,读者可以据此理解它如何衡量智能体随时间的技能获取能力。

  2. ARC Prize:官方博客69

    ARC-AGI-2 基准发布,设计用于测试 AI 推理系统的符号解释与组合推理能力

    ARC Prize 官方介绍 ARC-AGI-2 基准,旨在压力测试最先进的 AI 推理系统并提供 AGI 进展信号。基准围绕符号解释、组合推理和上下文规则应用设计任务,所有评测集各含 120 题(由 100 增至 120),全部任务至少由 2 名人类在 2 次尝试内解出;从 ARC-AGI-2 起报告将附带以成本衡量的效率指标,官方目标为达到 85% 准确率。

    推荐理由:ARC Prize 官方介绍 ARC-AGI-2 的任务设计与校准方法,读者可了解新基准为何强调符号理解与效率度量。

  3. ARC Prize:官方博客33

    ARC Prize 发布 ARC-AGI 系列:以核心知识先验衡量通用智能

    ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。

  4. Preferred Networks:AI 研究与产品10

    Preferred Networks 发布多篇 AI 研究论文

    Preferred Networks 公布了一批由 PFN 研究员、实习生及兼职工程师学生撰写、含联合研究成果的论文,发表于日本及全球的会议与期刊。作者包括 Yoshihiko Ozaki、Shuhei Watanabe、Kenta Oono、Nontawat Charoenphakdee、Shin-ichi Maeda、Kohei Hayashi 等。

  5. Eugene Yan:Writing39

    RecSys 2022 回顾: favorite 论文与经验教训

    RecSys 2022 于 9 月 18-23 日在西雅图举办,行业投稿较 2021 年增长 50%、较 2020 年增长 260%,15 篇行业论文和 15 场行业演讲进入主会程。作者重点推荐三篇论文:用 recency sampling 提升序列推荐训练效率、将 Open Bandit Pipeline 扩展到模拟行业挑战、以及 Google 广告 CTR 模型的工业级 ML 工程实践。

  6. HuggingFace Daily Papers(社区热门论文)41

    WorldAttention:面向交互式视频世界模型的高效注意力架构

    研究者提出 WorldAttention,一种通过专用注意力内核与分层 KV cache 协同设计实现高效推理的注意力架构,用于文本条件交互式视频世界模型。其 Hybrid Sparse Attention 结合线性全局注意力与头自适应稀疏注意力,Hierarchical KV Cache 将历史 KV 对按语义索引分页存放于多级内存。

  7. HuggingFace Daily Papers(社区热门论文)44

    Marathoner:超长时程自主智能体模型

    研究者提出自主智能体模型 Marathoner,通过后训练流程赋予基座模型超长时程执行能力,在 5 个超长时程任务基准上稳定超越基座模型,甚至超过强闭源模型。该模型可持续工作 10+ 小时、完成 1000+ 次工具调用,训练数据来自 GitHub 仓库中新增 1000+ 行代码的重大发布 PR,并采用多任务链式合成与 Later Stage Bonus Reward 奖励策略。

  8. HuggingFace Daily Papers(社区热门论文)37

    LongLive-Plug:面向视频生成的一次性蒸馏框架

    LongLive-Plug 是一个一次性蒸馏框架,将可复用能力以 LoRA 形式学习在基座模型上,实现免训练、即插即用地部署到兼容的下游模型。这些能力涵盖单次 classifier-free guidance、少步采样和自回归生成的长上下文纠错,即使下游模型新增条件分支或扩展输出通道,适配器仍可复用。

  9. HuggingFace Daily Papers(社区热门论文)44

    EVO-WAM:通过视频-动作验证进化世界动作模型

    EVO-WAM 让世界动作模型无需额外专家演示即可适应新任务,通过视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频-动作一致性,再迭代训练。在 RoboTwin 2.0 的 7 个未见任务上,Cosmos3 平均成功率从 26.9% 提升至 68.0%,DreamZero 从 28.5% 提升至 46.4%;真实世界 3 个长程复合任务中 Cosmos3 从 20.0% 提升至 76.7%。

  10. HuggingFace Daily Papers(社区热门论文)37

    智能体的主动性问题:水平与垂直主动性研究

    研究提出智能体主动性的内容维度:水平主动性追求当前上下文已隐含但用户未明说的信息,垂直主动性追求只有早期证据才能揭示的需求。基于基准自身分解构建的“需求图”可在无模型评判的情况下对两种主动性及停止时机打分。所提 Q&D 方法在三个多跳问答基准的留出集上,同等检索开销下两种主动性均优于同模型提示版本,并在其中两个基准上超过参数量大 15 倍的提示模型。

  11. HuggingFace Daily Papers(社区热门论文)37

    SoL-Refiner:一步精修实现 4K 高分辨率视频生成

    SoL-Refiner 是一种单步视频精修器,可将低分辨率模型输出经一次去噪直接转为 4K 视频,方法结合高分辨率持续训练、RL 后训练与最终一步蒸馏。在约 2K 分辨率下,其单步效果在 VBench 与 UniPercept 均值上超过所有外部精修器,在 3840×2176 下两项指标均优于三步的 LTX-2.3 Refiner。

  12. HuggingFace Daily Papers(社区热门论文)35

    APM-Bench:面向第一人称流式视频助手的跨会话持久记忆基准

    APM-Bench 将真实流式交互重构为多会话生活轨迹,包含 549 个会话、104 条轨迹和 2,719 个候选问题,覆盖客观题与开放题。评测显示现有方法难以同时兼顾可靠的长期召回、低开销与有效的主动协助,存在明显的效用—延迟—存储权衡。该基准还测试模型能否识别证据不足的情况。

  13. HuggingFace Daily Papers(社区热门论文)33

    JEPA 世界模型新方法 AnisoWM:各向异性表示改进规划

    研究者提出 AnisoWM 与 ΛReg,用可学习的对角协方差替换固定各向同性高斯目标,并施加固定迹与各向异性约束,预测目标、预测器架构和欧氏规划器均不变,目标仅在训练时使用。在四个视觉控制环境中,AnisoWM 的规划成功率全部优于 LeWorldModel,其潜在规划代价与任务结果也更一致。

  14. HuggingFace Daily Papers(社区热门论文)38

    LLM 是通用异步智能体:Qwen 3.x 无需任务微调即可异步运行

    研究者提出异步 LLM 框架,让用户或智能体自身定义具有重叠内存状态的推理协程,从而把 LLM 从"读取—思考—回复"的串行循环推广为可适应多种并发类型的通用异步智能体。实验显示 Qwen 3.x 模型无需任务特定训练,即可完成流式视频理解、电子游戏和监控等异步任务。

  15. HuggingFace Daily Papers(社区热门论文)38

    Thinking Reward Model(TRM):先思考再打分的视觉生成奖励模型

    研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。

  16. HuggingFace Daily Papers(社区热门论文)41

    VoxMem:面向大型音频语言模型的多模态记忆基准

    研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。

  17. arXiv:cs.AI(全量分类)39

    SafeCoEvo:面向 LLM 智能体的测试时安全框架与守卫协同演化

    SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统仅凭过往任务积累的运行经验持续适配未来未见任务。它通过 S-Harness 将近期运行经验快速外化为可更新的显式安全知识,并用 GuardVPO 在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强基线,不安全结果率降低 10.05%,任务成功率提升 12.15%。

  18. arXiv:cs.AI(全量分类)44

    AdaLCPI:智能体能否从碎片中重建间接提示词注入?

    研究者提出自适应长上下文提示词注入 AdaLCPI,将攻击目标拆成不完整碎片嵌入智能体工具检索到的外部内容,并用重建线索诱导智能体自行拼接,再借助 OpenEvolve 结合分级评分与目标智能体的自然语言执行反馈迭代优化碎片和线索。实验显示其宏平均 ASR 达 61.4%,高于 Trojan Hippo 式的 32.8% 和 AgentVigil 的 30.0%。

  19. arXiv:cs.AI(全量分类)39

    视觉敏感不等于主张可撤回:多模态强化学习中的持久性感知信用分配

    针对多模态强化学习中视觉敏感度与主张可撤回性的脱节问题,研究者提出持久性感知信用门控(PACG),通过衰减异常持久视觉主张的正向信用来修正信用分配。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 的九基准三种子平均分从 58.1% 提升至 59.9%,VPPO 从 59.8% 提升至 60.9%,同时使无图像支持的主张更易撤回,且无需标注、不增加推理成本。

  20. arXiv:cs.AI(全量分类)33

    BRIDGE:面向检索信用感知的双层智能体强化学习

    BRIDGE 是一种内存高效的一阶双层优化方法,将检索器与 LLM 策略的联合训练建模为双层优化问题,以解决检索证据错误被错误归咎于 LLM 策略的"信息信用鸿沟"。在七个开放域 QA 基准上,BRIDGE 在 3B 和 7B 骨干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 点,并在医疗 QA 基准上取得最佳平均答案准确率与推理质量。