跳到正文

#论文/研究

今日 43 条
今天10月1日周四
  1. HuggingFace Daily Papers(社区热门论文)33

    并非每个 Token 都值得蒸馏:Direct-OPD 的选择性监督方法 S²D-OPD

    针对 Direct-OPD 用 token 级对数比做稠密监督的缺陷,研究者提出 S²D-OPD,按教师参考 JSD 对学生采样状态排序,屏蔽低散度状态的监督,每条回复仅保留前 10% 状态。在 1.7B 至 8B 的四个学生模型、两组教师模型上,该方法在 AIME 和 HMMT 基准的八种设置中有七种超越稠密 Direct-OPD,另一种持平,且无需额外前向计算。

  2. HuggingFace Daily Papers(社区热门论文)34

    CoEvoWhen:面向超长视频时序定位的策略-工具协同演化

    研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上的实验显示,该方法持续提升超长视频时序定位精度,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著性能提升。

  3. HuggingFace Daily Papers(社区热门论文)46

    DC-SAE:加速扩散模型收敛的深度压缩语义自编码器

    研究者提出 DC-SAE 解耦紧凑语义自编码器,通过语义编码器实现高压缩比、像素级编码器保留细节,兼顾高保真重建与快速扩散训练收敛。在 ImageNet 512×512 上实现 32 倍空间压缩,PSNR 29.79、gFID 3.37,较此前 SOTA 高压缩 tokenizer DC-AE 分别提升 13.5% 和 54.9%。

  4. HuggingFace Daily Papers(社区热门论文)42

    Physis-Lang:以自演化语言作为视频世界模型的物理表征

    Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 以原子断言方式评估物理描述。在 Wan 与 Cosmos 骨干上的四项物理视频基准实验中,物理合理性均有提升;基于开源 Cosmos3-Nano 的增强模型超过了闭源 Veo 3.1。

  5. HuggingFace Daily Papers(社区热门论文)37

    GGSD:通过游戏自对弈发现人类可直接操控的智能体技能

    研究者提出 Game-Guided Skill Discovery(GGSD)框架,利用游戏中的自对弈发现人类可直接操控的运动技能,由高层策略从少量离散技能中选择、低层策略学习对应行为。在 Ant、Franka-arm 和 Unitree G1 环境中,人类可替换高层策略直接操控智能体,并通过技能组合解决 Maze、CubePush 等未见任务,无需额外训练。

  6. HuggingFace Daily Papers(社区热门论文)36

    DuoOPD:基于师生联合结果的多任务在线策略蒸馏

    DuoOPD 提出一种多任务在线策略蒸馏方法,由学生结果决定反馈方向、师生联合结果决定教师如何支持:仅教师答对时用其答案作为评分上下文,仅学生答对时按任务内共享权重强化整个回答。在 Qwen3 和 Llama 上,其平均宏准确率超越全部五个基线,较 OPD 分别提升 2.58 和 5.98 个百分点,并在科学计算、指令遵循与代码生成等任务混合上领先。消融显示,联合结果设计贡献了主要增益。

  7. HuggingFace Daily Papers(社区热门论文)34

    生成式行为克隆中的多模态性研究:确定性回归为何在仿真基准上依然有效

    一项研究重新审视生成式行为克隆(BC)中的多模态假设,发现确定性动作 Transformer 在 LIBERO、Meta-World 等仿真基准上仍能匹配此前报告的 SOTA 结果,且推理延迟往往更低。作者通过 GMM 聚类构建条件模态估计器,估计结果显示所测仿真基准在采样状态下几乎都是单模态的;只有在机器人双模态操作概念验证任务上才观察到模态坍缩。

  8. HuggingFace Daily Papers(社区热门论文)42

    A2Z GameSpec-Bench:编码智能体能多忠实地按游戏设计文档生成游戏?

    研究者推出 A2Z GameSpec-Bench,用 100 份长篇游戏设计文档(GDD)评测编码智能体的端到端游戏开发忠实度,每份 GDD 被转为含规则、约束与前置依赖的契约,并结合源码检查与智能体生成的测试策略做场景回放和自适应试玩。评测显示当前智能体难以同时满足代码实现与实际游玩中的相互依赖需求;针对具体需求的反馈相比两轮自我修订可将 GDD Fidelity 提升 10.9%。

  9. HuggingFace Daily Papers(社区热门论文)40

    IDSpect:用 IDS 分解与细粒度奖励提升中文文本渲染精度

    针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并训练专家 IDS 识别器对齐裁剪级视觉预测,配合整字语义奖励提供部件与空间关系的细粒度反馈。

  10. HuggingFace Daily Papers(社区热门论文)39

    ThinkV2V:释放 MLLM 推理能力,实现指令引导的视频编辑

    ThinkV2V 是一个推理驱动的指令引导视频编辑框架,在视觉生成前显式激活 MLLM 思考,通过 MLLM-to-DiT 架构将思考转化为精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并构建了 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,显著超越更大的 10B 规模基线。

  11. HuggingFace Daily Papers(社区热门论文)49

    WorldAuditBench:用多模态智能体审计交互式 3D 世界

    研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五个前沿模型,两种审计范式的成功率仅 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。

  12. Rohan Paul40

    Meta 论文提出让 AI 智能体自行管理上下文,无需硬编码遗忘规则,模型能判断哪些内容仍重要并保留,效果更好且算力更省。在深度研究基准上,该方法比 Codex 式摘要得分高 11.4%,算力消耗少 21.5%,且无需训练、现有模型即可实现。

    引用Rulin Shao@RulinShao

    ‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness

  13. HuggingFace Daily Papers(社区热门论文)56

    研究揭示分块 KV-cache 压缩导致模型出现周期性相位敏感弱位

    论文发现采用分块 KV-cache 压缩的模型存在相位敏感,检索准确率随压缩 stride 周期性波动,弱位置足以翻转答案。在 DeepSeek-V4 系列上,128K tokens 下最优与最差相位组差距达 15 到 40 个点;从零预训练的 0.6B 对照实验显示周期始终跟随 stride,full attention 各位置差距仅 6.1 个点而压缩模型可达 78 个点。

  14. Nature:Machine Learning 主题(RSS)49

    语音“衰老时钟”:AI 通过声音特征评估衰老速度

    科学家开发出一款“语音时钟”,通过音高、语速等数百项声音特征预测人的年龄,并计算“语音年龄差”。研究基于阿根廷、智利、哥伦比亚、墨西哥和秘鲁 2928 名西班牙语使用者的录音,用机器学习提取 700 多项随衰老和痴呆变化的语音特征。较大的语音年龄差与痴呆等认知问题强烈相关,成果已发表于 Science Advances。

  15. Anthropic:Research(发表成果 · 网页)69

    Anthropic 研究测算机器人对各类工作的暴露度,驾驶和仓储岗位最靠前

    Anthropic 发布机器人职业暴露研究,用 Claude 对约 19,000 项工作任务评分,发现机器人目前可完成美国 74% 的体力任务、占 34% 工时,但仅在有限环境中,且只在 0.3% 的任务上具备成本竞争力。

    推荐理由:报告用当前机器人能力测度职业暴露,给出了成本竞争力等量化门槛,可帮助读者评估哪些体力工作更早受影响。

  16. Microsoft Research 博客(RSS)47

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可在风险出现前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、纬度、地质电导率和电网数据,评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

  17. Apple Machine Learning Research(RSS)41

    LLM 条件控制中的有效性-流畅性权衡:一项系统性研究

    研究系统考察了 LLM 概念注入与移除场景下的多种条件控制方法,发现高效激活引导(activation steering)方法常以流畅性大幅下降为代价。激活引导在指令微调模型上的效果远不如基座模型,而简单提示词与完整监督微调适合概念注入、却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。

  18. Nature:Machine Learning 主题(RSS)28

    FinnGen 人群规模免疫多组学图谱揭示疾病调控机制

    FinnGen 研究团队构建了人群规模的免疫多组学图谱,通过单核 caQTL、eQTL 与 peak–gene link 分析揭示调控性疾病的遗传机制。相关汇总统计数据已公开并可交互浏览,个体级单核计数矩阵等数据需经审批后向研究者开放。研究还整合了 BBJ、日本 COVID-19 工作组及 eQTL Catalogue、TenK10K、SingleBrain 等数据集进行再分析。