跳到正文

#多模态

今日 20 条
9月30日周三
  1. Andrej Karpathy:Blog(网页)37

    Andrej Karpathy:计算机视觉与 AI 的现状——我们离目标还非常非常远

    Andrej Karpathy 以一张奥巴马踩在体重秤上的照片为例,说明人类半秒内就动用了 3D 场景结构、镜子造成的视觉混淆、人物身份、物体可供性、物理规律、他人心理状态乃至"对他人心理的推测"等海量知识,而当前计算机视觉只靠 ImageNet 分类、Pascal VOC 检测、姿态估计、动作识别等彼此割裂且仅"半可用"的任务来评测。

  2. Andrej Karpathy:Blog(网页)63

    Karpathy 实测人类在 ImageNet 上的分类准确率并与 GoogLeNet 对比

    Andrej Karpathy 撰文回顾 2014 年 ILSVRC,他亲自标注 1500 张测试集图像,得到 5.1% 的错误率,比冠军 GoogLeNet 的 6.8% 低约 1.7%(p = 0.022,统计显著)。他分析了双方错误类型:GoogLeNet 更易在过小过细物体、滤镜、抽象表现上出错,人则在细粒度识别(如 120 多种狗)和类别不熟悉上错误更多,并开源了标注界面供读者自行体验。

  3. HuggingFace Daily Papers(社区热门论文)38

    LLM 是通用异步智能体:Qwen 3.x 无需任务微调即可异步运行

    研究者提出异步 LLM 框架,让用户或智能体自身定义具有重叠内存状态的推理协程,从而把 LLM 从"读取—思考—回复"的串行循环推广为可适应多种并发类型的通用异步智能体。实验显示 Qwen 3.x 模型无需任务特定训练,即可完成流式视频理解、电子游戏和监控等异步任务。

  4. HuggingFace Daily Papers(社区热门论文)38

    Thinking Reward Model(TRM):先思考再打分的视觉生成奖励模型

    研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。

  5. HuggingFace Daily Papers(社区热门论文)41

    VoxMem:面向大型音频语言模型的多模态记忆基准

    研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。

  6. arXiv:cs.AI(全量分类)39

    视觉敏感不等于主张可撤回:多模态强化学习中的持久性感知信用分配

    针对多模态强化学习中视觉敏感度与主张可撤回性的脱节问题,研究者提出持久性感知信用门控(PACG),通过衰减异常持久视觉主张的正向信用来修正信用分配。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 的九基准三种子平均分从 58.1% 提升至 59.9%,VPPO 从 59.8% 提升至 60.9%,同时使无图像支持的主张更易撤回,且无需标注、不增加推理成本。

  7. arXiv:cs.AI(全量分类)29

    AVIO:在音视频场景中学习添加与移除发声物体

    研究团队提出 AVIO,通过源条件特征调制改造预训练文本到音视频生成模型,让单一模型同时学会添加和移除发声物体,并支持仅凭指令编辑或可选视觉引导。配套数据集 AVIOBench 包含 37.9 小时配对音视频样本、覆盖 1,878 个目标物体名称,用共享身份与视觉掩码关联物体的视觉存在与声音贡献。参考帧课程训练逐步减少参考条件,使模型在添加物体时可通过可选参考控制外观与位置。

  8. arXiv:cs.AI(全量分类)31

    MERID:用递归自我改进智能体做多模态抑郁症分析

    研究者提出 MERID 框架,通过基于经验的递归自我改进(RSI)自动开发抑郁症预测流水线,包含 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个组件。在抑郁症基准上,MERID 在多项任务上优于多模态与智能体基线,分析还显示声学与语言线索对抑郁症检测有价值,代码已开源。

  9. arXiv:cs.AI(全量分类)35

    FigAct:把科学图表变成可交互讲解画布

    研究者提出 FigAct 框架,将静态科学图表转化为按问题定制的可视化演示,直接在图表现有图形元素上施加视觉动作以引导读者注意力。其分层搜索策略将元素定位的 token 消耗降低约 40 倍,并基于 grounding 准确率、搜索效率和渲染质量三项奖励训练出 FigAct-8B。团队还构建了经人工核验的真实论文图表 benchmark,用于评估 MLLM 生成有据可依的视觉解释的能力。

  10. arXiv:cs.LG(机器学习,全量分类)28

    图神经网络实现组织化信号集的采样不变嵌入

    该论文研究面向组织化信号集的神经网络编码器,可将异构采样的信号集投影到任意固定大小的向量空间,使信号集能作为向量处理而消除采样差异。研究以波形分离为重点,通过信号集判别能力评估表示相关性,编码与嵌入判别实验仅使用合成复值射频信号。

  11. arXiv:cs.LG(机器学习,全量分类)46

    感知计算的决定价值:DEEP 基准评估自适应感知分配

    研究提出"感知计算的决定价值"概念,定义为输入从廉价感知模式升级到昂贵模式时下游损失的变化,并指出该价值可能为负。为此推出 DEEP 基准,在 KITTI 和 nuScenes 上以已部署的单目几何模型评估升级前分配器,发现 34–54% 改变下游损失的升级反而使其变差。按感知增益而非决定价值选择固定信号,会使实际测试决策增益平均下降全廉价损失的 7.4%。

  12. arXiv:cs.CL(计算语言学,全量分类)38

    人类与视觉语言模型的跨模态关联:选择相似,注意力不同

    研究用相同刺激(一个伪词加两张图片)对比了视觉语言模型与 53 名人类的选择和眼动,发现部分较大 VLM 的选择与人类一致,但其显著性图与人类注视的吻合度低于图像中心的固定高斯基线。用人类选择微调小 VLM 可让其在未见词和图像上的选择对齐达到人类多数投票参考水平,但注意力仍不及该基线;用人类注视训练模型注意力能提升注意力—注视相关性,却不改善选择对齐。

  13. arXiv:cs.CL(计算语言学,全量分类)29

    不同分词生育率语言间的概念方向可靠性研究

    研究测量了英语、豪萨语和约鲁巴语在四个语言模型中的情感方向可复现性,使用最终 token 时 split-half 一致度分别为 0.737-0.870、0.589-0.762 和 0.101-0.399,该语言排序在全部 77 组完整模型对比中保持一致。基于相同层训练的分类器预测情感始终高于随机水平,表明预测准确率并不代表方向一致性。研究未证实分词生育率是跨语言差异的成因。

  14. arXiv:cs.CL(计算语言学,全量分类)36

    VisKG:面向高效视觉推理的问题特定知识图谱框架

    研究者提出 VisKG,一个用强化学习让模型把视觉内容转译为问题特定知识图谱(KG)表示的框架,过滤感知噪声并保留链式推理所需的实体-关系结构,所需 token 少于基于 caption 的表示。VisKG 采用 GDPO 稳定 RL 后训练,并用负向推理样本加强监督阶段;在科学、数学和通用视觉理解基准上表现与基线相当或更优,GDPO 训练版本平均准确率比 GRPO 版本高 2%。

  15. arXiv:cs.CL(计算语言学,全量分类)44

    MLLM 能否生成并检测多模态社交媒体假新闻?

    研究提出由 story agent、image agent 和 critic agent 协作的多智能体框架,在科学、健康、娱乐领域生成超 9,000 条配对多模态假新闻帖,并基准测试 16 个开源与闭源 MLLM 的自动检测能力。结果显示多数模型准确率远低于人类水平,在识别图像真实性上尤其失败。代码与数据已发布于 GitHub,论文被 EMNLP 2026 Findings 接收。

  16. World Labs:官网76

    World Labs 宣布加入 AMD,李飞飞将出任 AMD 执行副总裁兼首席科学家

    World Labs 宣布已签署最终协议加入 AMD,交易预计在 2026 年底前完成,尚需监管批准。双方自去年起在 AMD GPU 上的模型训练与推理优化方面开展技术合作。

    推荐理由:收购方与被收购方核心人事和交易时间都由当事方直接说明,读者可以据此了解 World Labs 并入 AMD 后的研究安排。