跳到正文

#多模态

今日 8 条
今天10月1日周四
  1. HuggingFace Daily Papers(社区热门论文)34

    CoEvoWhen:面向超长视频时序定位的策略-工具协同演化

    研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上的实验显示,该方法持续提升超长视频时序定位精度,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著性能提升。

  2. HuggingFace Daily Papers(社区热门论文)42

    Physis-Lang:以自演化语言作为视频世界模型的物理表征

    Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 以原子断言方式评估物理描述。在 Wan 与 Cosmos 骨干上的四项物理视频基准实验中,物理合理性均有提升;基于开源 Cosmos3-Nano 的增强模型超过了闭源 Veo 3.1。

  3. HuggingFace Daily Papers(社区热门论文)40

    IDSpect:用 IDS 分解与细粒度奖励提升中文文本渲染精度

    针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并训练专家 IDS 识别器对齐裁剪级视觉预测,配合整字语义奖励提供部件与空间关系的细粒度反馈。

  4. HuggingFace Daily Papers(社区热门论文)39

    ThinkV2V:释放 MLLM 推理能力,实现指令引导的视频编辑

    ThinkV2V 是一个推理驱动的指令引导视频编辑框架,在视觉生成前显式激活 MLLM 思考,通过 MLLM-to-DiT 架构将思考转化为精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并构建了 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,显著超越更大的 10B 规模基线。

  5. HuggingFace Daily Papers(社区热门论文)49

    WorldAuditBench:用多模态智能体审计交互式 3D 世界

    研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五个前沿模型,两种审计范式的成功率仅 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。

  6. Nature:Machine Learning 主题(RSS)49

    语音“衰老时钟”:AI 通过声音特征评估衰老速度

    科学家开发出一款“语音时钟”,通过音高、语速等数百项声音特征预测人的年龄,并计算“语音年龄差”。研究基于阿根廷、智利、哥伦比亚、墨西哥和秘鲁 2928 名西班牙语使用者的录音,用机器学习提取 700 多项随衰老和痴呆变化的语音特征。较大的语音年龄差与痴呆等认知问题强烈相关,成果已发表于 Science Advances。

9月30日周三
  1. Epoch AI:研究、数据与评测28

    Epoch AI 能力与基准测试中心:GPT-6 Astra 数学登顶,软件工程仍落后 Claude Fable 5.1

    Epoch AI 更新其 AI 基准与能力中心,汇总内部测试与外部数据。GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,Math-ECI 达 170 创纪录,但 SWE-ECI 164 仍落后 Claude Fable 5.1 的 167。该中心还显示,自 2023 年以来同等 AI 性能的成本每季度下降约 47%,年降约 13 倍。

  2. CMU:Machine Learning Blog28

    CMU 在 NeurIPS 2025 展示 156 篇论文

    卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。

  3. HuggingFace Daily Papers(社区热门论文)38

    LLM 是通用异步智能体:Qwen 3.x 无需任务微调即可异步运行

    研究者提出异步 LLM 框架,让用户或智能体自身定义具有重叠内存状态的推理协程,从而把 LLM 从"读取—思考—回复"的串行循环推广为可适应多种并发类型的通用异步智能体。实验显示 Qwen 3.x 模型无需任务特定训练,即可完成流式视频理解、电子游戏和监控等异步任务。

  4. HuggingFace Daily Papers(社区热门论文)38

    Thinking Reward Model(TRM):先思考再打分的视觉生成奖励模型

    研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。

  5. HuggingFace Daily Papers(社区热门论文)41

    VoxMem:面向大型音频语言模型的多模态记忆基准

    研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。

  6. arXiv:cs.AI(全量分类)39

    视觉敏感不等于主张可撤回:多模态强化学习中的持久性感知信用分配

    针对多模态强化学习中视觉敏感度与主张可撤回性的脱节问题,研究者提出持久性感知信用门控(PACG),通过衰减异常持久视觉主张的正向信用来修正信用分配。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 的九基准三种子平均分从 58.1% 提升至 59.9%,VPPO 从 59.8% 提升至 60.9%,同时使无图像支持的主张更易撤回,且无需标注、不增加推理成本。

  7. arXiv:cs.AI(全量分类)29

    AVIO:在音视频场景中学习添加与移除发声物体

    研究团队提出 AVIO,通过源条件特征调制改造预训练文本到音视频生成模型,让单一模型同时学会添加和移除发声物体,并支持仅凭指令编辑或可选视觉引导。配套数据集 AVIOBench 包含 37.9 小时配对音视频样本、覆盖 1,878 个目标物体名称,用共享身份与视觉掩码关联物体的视觉存在与声音贡献。参考帧课程训练逐步减少参考条件,使模型在添加物体时可通过可选参考控制外观与位置。

  8. arXiv:cs.AI(全量分类)31

    MERID:用递归自我改进智能体做多模态抑郁症分析

    研究者提出 MERID 框架,通过基于经验的递归自我改进(RSI)自动开发抑郁症预测流水线,包含 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个组件。在抑郁症基准上,MERID 在多项任务上优于多模态与智能体基线,分析还显示声学与语言线索对抑郁症检测有价值,代码已开源。

  9. arXiv:cs.AI(全量分类)35

    FigAct:把科学图表变成可交互讲解画布

    研究者提出 FigAct 框架,将静态科学图表转化为按问题定制的可视化演示,直接在图表现有图形元素上施加视觉动作以引导读者注意力。其分层搜索策略将元素定位的 token 消耗降低约 40 倍,并基于 grounding 准确率、搜索效率和渲染质量三项奖励训练出 FigAct-8B。团队还构建了经人工核验的真实论文图表 benchmark,用于评估 MLLM 生成有据可依的视觉解释的能力。

  10. arXiv:cs.LG(机器学习,全量分类)28

    图神经网络实现组织化信号集的采样不变嵌入

    该论文研究面向组织化信号集的神经网络编码器,可将异构采样的信号集投影到任意固定大小的向量空间,使信号集能作为向量处理而消除采样差异。研究以波形分离为重点,通过信号集判别能力评估表示相关性,编码与嵌入判别实验仅使用合成复值射频信号。

  11. arXiv:cs.LG(机器学习,全量分类)46

    感知计算的决定价值:DEEP 基准评估自适应感知分配

    研究提出"感知计算的决定价值"概念,定义为输入从廉价感知模式升级到昂贵模式时下游损失的变化,并指出该价值可能为负。为此推出 DEEP 基准,在 KITTI 和 nuScenes 上以已部署的单目几何模型评估升级前分配器,发现 34–54% 改变下游损失的升级反而使其变差。按感知增益而非决定价值选择固定信号,会使实际测试决策增益平均下降全廉价损失的 7.4%。

  12. arXiv:cs.CL(计算语言学,全量分类)38

    人类与视觉语言模型的跨模态关联:选择相似,注意力不同

    研究用相同刺激(一个伪词加两张图片)对比了视觉语言模型与 53 名人类的选择和眼动,发现部分较大 VLM 的选择与人类一致,但其显著性图与人类注视的吻合度低于图像中心的固定高斯基线。用人类选择微调小 VLM 可让其在未见词和图像上的选择对齐达到人类多数投票参考水平,但注意力仍不及该基线;用人类注视训练模型注意力能提升注意力—注视相关性,却不改善选择对齐。

  13. arXiv:cs.CL(计算语言学,全量分类)29

    不同分词生育率语言间的概念方向可靠性研究

    研究测量了英语、豪萨语和约鲁巴语在四个语言模型中的情感方向可复现性,使用最终 token 时 split-half 一致度分别为 0.737-0.870、0.589-0.762 和 0.101-0.399,该语言排序在全部 77 组完整模型对比中保持一致。基于相同层训练的分类器预测情感始终高于随机水平,表明预测准确率并不代表方向一致性。研究未证实分词生育率是跨语言差异的成因。

  14. arXiv:cs.CL(计算语言学,全量分类)36

    VisKG:面向高效视觉推理的问题特定知识图谱框架

    研究者提出 VisKG,一个用强化学习让模型把视觉内容转译为问题特定知识图谱(KG)表示的框架,过滤感知噪声并保留链式推理所需的实体-关系结构,所需 token 少于基于 caption 的表示。VisKG 采用 GDPO 稳定 RL 后训练,并用负向推理样本加强监督阶段;在科学、数学和通用视觉理解基准上表现与基线相当或更优,GDPO 训练版本平均准确率比 GRPO 版本高 2%。

  15. arXiv:cs.CL(计算语言学,全量分类)44

    MLLM 能否生成并检测多模态社交媒体假新闻?

    研究提出由 story agent、image agent 和 critic agent 协作的多智能体框架,在科学、健康、娱乐领域生成超 9,000 条配对多模态假新闻帖,并基准测试 16 个开源与闭源 MLLM 的自动检测能力。结果显示多数模型准确率远低于人类水平,在识别图像真实性上尤其失败。代码与数据已发布于 GitHub,论文被 EMNLP 2026 Findings 接收。

  16. CMU:Machine Learning Blog28

    CMU 在 ICLR 2026:194 篇论文概览

    CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。