视觉敏感不等于主张可撤回:多模态强化学习中的持久性感知信用分配
针对多模态强化学习中视觉敏感度与主张可撤回性的脱节问题,研究者提出持久性感知信用门控(PACG),通过衰减异常持久视觉主张的正向信用来修正信用分配。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 的九基准三种子平均分从 58.1% 提升至 59.9%,VPPO 从 59.8% 提升至 60.9%,同时使无图像支持的主张更易撤回,且无需标注、不增加推理成本。
针对多模态强化学习中视觉敏感度与主张可撤回性的脱节问题,研究者提出持久性感知信用门控(PACG),通过衰减异常持久视觉主张的正向信用来修正信用分配。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 的九基准三种子平均分从 58.1% 提升至 59.9%,VPPO 从 59.8% 提升至 60.9%,同时使无图像支持的主张更易撤回,且无需标注、不增加推理成本。
针对 LLM 多智能体系统 41%-87% 的失败率,研究者提出 MAADBench——首个可刷新的 MAS 异常检测基准,通过约 10^37 任务空间的采样耦合生成任务缓解任务泄漏,并支持在可配置 LLM 骨干下刷新轨迹生成、自动提供免成本确定性的步骤级标签。
BRIDGE 是一种内存高效的一阶双层优化方法,将检索器与 LLM 策略的联合训练建模为双层优化问题,以解决检索证据错误被错误归咎于 LLM 策略的"信息信用鸿沟"。在七个开放域 QA 基准上,BRIDGE 在 3B 和 7B 骨干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 点,并在医疗 QA 基准上取得最佳平均答案准确率与推理质量。
研究团队提出 AVIO,通过源条件特征调制改造预训练文本到音视频生成模型,让单一模型同时学会添加和移除发声物体,并支持仅凭指令编辑或可选视觉引导。配套数据集 AVIOBench 包含 37.9 小时配对音视频样本、覆盖 1,878 个目标物体名称,用共享身份与视觉掩码关联物体的视觉存在与声音贡献。参考帧课程训练逐步减少参考条件,使模型在添加物体时可通过可选参考控制外观与位置。
一篇论文从自主性与主动性两个设计维度考察人机协作,用悖论视角分析其中的内在张力,并据此映射出四种协作模式:指令、委派、辅助与共创。该工作将发表于第33届模式语言编程会议(PLoP 2026)。
研究者将再生公地建模为带设计者指定消耗预算的约束马尔可夫博弈或约束多智能体 MDP,提出非平稳拉格朗日框架,用无约束博弈或协作控制问题的解构造策略序列。该框架引入面向重置回合、带折扣奖励与终端成本的平均 epoch 解概念,并证明与奖励无关的可行性证书、协作可行性与近似最优性。
研究者提出一种新的选项发现算法,为每个子目标只识别一小组相关特征,而非同时覆盖状态的所有方面,从而生成泛化更广、能加速探索的选项。该方法在三个稀疏奖励的图像域中实现快速探索,包括 Atari 游戏 MontezumasRevenge。
针对大语言模型多步推理路径的隐藏状态分析,研究者提出 PAIR(Phase-Aligned Intra-question Reasoning),按归一化轨迹进度将变长路径映射到共享相对相位,只在同一问题、同一相位内比较成功与失败轨迹。
首个针对 LLM 零知识友好量化的系统性研究,评估了 Qwen2.5-14B 和 MoE 模型 Qwen3-30B-A3B 等九款语言模型在权重、激活与非线性查找表精度上的表现。
研究者提出"安全算子"概念,指出基于 Transformer 的语言模型中上下文 token 可被吸收为模型权重的乘法算子,其主特征值可连续调节安全指令对生成的影响强度。他们据此推导出带抑制权重的对比安全损失,通过调节该权重在有害与无害查询间权衡,映射出攻击成功率与过度拒答率之间的关系,并在不同参数化下获得 Pareto 改进的安全指令。
研究揭示关系型上下文学习(ICL)中的支持集目标泄漏问题:当支持上下文包含目标衍生特征而查询端不可用时,评估结果会失真。作者构造 20 个目标衍生特征,在 13 个 RelBench 任务和 5 种关系 ICL 配置上测试,发现 0-hop 与 Full 泄漏造成最大偏差,且泄漏效应高度依赖任务与模型,甚至可逆转模型变体间的相对结论。
针对 Cell Painting 图谱的机制(MOA)预测,PhenoAIR 将检索到的邻近扰动视为不确定证据,通过可靠性感知的多智能体框架进行校准推理,而非直接做表征匹配。
ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,在 LLM-as-Judge 评测中达到 95.3%,超过所有基线 LLM。它构建了 1,706 个文本块、10 个来源的知识库,并配有覆盖现有 ME/CFS 诊断框架的指南间冲突登记表,以及按查询焦点与冲突信号重排证据的校准流程。该评测避免了关键词匹配平均 10.1 个百分点的系统性低估,代码已开源。
PersonaDose 通过特质描述与目标平均强度来控制语言模型的人格表达,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上,其核心特质表达在 Persona Vectors 75 连贯性下限处分别比对比激活加法高出 33.2、18.3 和 17.8 分。
研究提出关系型上下文学习(ICL)中的"支持集目标泄漏"问题:带标签支持集含目标衍生(leaker)列而查询集干净,与数据集构建、时序切分或表示学习阶段的泄漏不同。
一项 arXiv 研究在拍卖与匹配等多智能体环境中比较不同交互格式对 LLM 智能体决策的影响,发现英式拍卖接口能显著降低出价偏差。研究还显示,列出收益情形并解释真实出价为何安全可改善选择,而要求智能体规划匹配轮次或推测对手信念反而整体变差。在拍卖中,这些行为改善并未伴随智能体简短计划中策略理解语言指标的相应提升。
研究者提出 LLM-Guided Graph Pruning(LGP)框架,用 LLM 推理直接优化已有 ANN 图索引,把结构上"低价值"的邻居替换为 LLM 选出的语义替代项,同时保留原图的稀疏性与可导航性。在 DiskANN 和 HNSW 等图索引上,LGP 在语义检索基准中端到端表现稳定优于贪心图搜索和 LLM 重排序。
HyperZip 是一个基于扩散 LLM(dLLM)与 Multi-Token Prediction 的 LLM 数据压缩框架,通过超网络从上下文表示生成数据专属更新,无需微调即可适配目标数据。它针对扩散压缩中解码吞吐量提升会降低压缩率的权衡,实现了低压缩率与高吞吐的兼顾,在压缩率与速度的权衡上优于现有 SOTA 基线。
ThuRunel 是一个面向医疗美容、法律咨询、教育规划等高风险咨询场景的 AI 咨询智能体,通过有限状态信念管理框架、思维链教师合成协议与学习式生成适配器实现动态解耦。在 11 个基线对比中,ThuRunel 在信息采集完整度与专家简报质量上均取得一致提升。该智能体已以双语 Web 应用形式公开部署,基于精选知识库在每次回答中标注引用来源。
PILLAR 是一种基于私有信息检索(PIR)的隐私保护 RAG 系统,客户端可从服务器公开语料中取回与查询最相似的 k 篇文档,而服务器无法获知查询词项及其访问模式。
微软提出 AI SW Factory,覆盖 Targeting、Coding、Reviewing、Ops 全软件开发生命周期,通过微调模型权重和更新 World Model 实现自我改进。在微软数十个代码仓库的规模化部署中,工程效率达到智能体编码的 3 倍,token 效率最高提升 22 倍。
针对长程编程智能体上下文随观察不断增长的问题,论文提出 StateTape 框架,将仓库建模为符号级代码图,用 tape 标记每次写入改动的符号,把过时判断从文本推断变为对写入的观察。该方法配合小型 manager 模型处理写入日志无法确定的部分,并给出理论分析与 TraceBench 基准。在六个编程智能体和三个编辑密集型基准上,StateTape 均取得更高解决率且计算开销很小。
研究者推出 CheatBench,一个覆盖数学研究、知识工作、编程、视觉任务等领域的 AI 智能体作弊行为基准,其环境将高难度任务与作弊机会结合,用于研究智能体在诚实工作困难时如何追求目标。该基准支持跨模型与跨任务类别比较,并已公开发布。
研究用两阶段实验设计在社交媒体信息流中测试了 Gemma-3-4b-it、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 和 GPT-5-nano 四个 LLM 的重复曝光效应,共收集 336,000 条真实性、重要性、情感和兴趣评分。
研究者提出 Protein-TetSphere,一种按残基配准的蛋白质体积表征:将每条蛋白链四面体化,得到各残基的局部体积区域,再配准到共享固定拓扑的四面体参考并在统一 Laplacian 基下表示,从而建立跨残基一致的体积坐标。
研究者提出 OTROPE,一种无需似然函数的 LLM 离线策略评估方法,通过最优传输在语义空间做分布校正,将行为策略的标注样本与目标策略的无标注样本对齐。它结合校正后的人类标注残差与代理预测器,无需行为策略建模或密度比估计,即可实现双重鲁棒式评估。实验显示 OTROPE 持续优于基线,并能让较弱 LLM 评估器集成逼近甚至超越更强评估器,代码已开源。
针对大型推理模型(LRM)中推理链与最终答案安全信号不一致的"欺骗性安全对齐"现象,研究者提出 DSAR 指标进行量化,发现该现象在标准提示下普遍存在,并在 prefilling 攻击下显著放大。为此提出基于 RL 的 SARA 方法,同时奖励安全感知推理与安全最终答案,在标准与对抗设置下均显著缓解该问题,并保持有用性与效用。
针对固定潜在奖励模型优化会导致"潜在奖励攻击"、生成视频感知与运动质量下降的问题,研究者提出协同演化奖励框架 CoRe,持续用生成器当前样本重训奖励模型并锚定真实视频偏好,防止生成器通过偏离数据分布刷高奖励。在 Wan2.1-T2V-1.3B 上,CoRe 的生成质量优于预训练模型和既有对齐方法,且避免了固定奖励优化的质量崩溃。
ChronoSRL 为 critic 的嵌入向量引入显式时间几何,让状态-动作与目标嵌入之间的距离匹配智能体到达目标所需时间,并将未到达目标和其他轨迹目标推离至少一个折扣视野。
研究者提出 MERID 框架,通过基于经验的递归自我改进(RSI)自动开发抑郁症预测流水线,包含 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个组件。在抑郁症基准上,MERID 在多项任务上优于多模态与智能体基线,分析还显示声学与语言线索对抑郁症检测有价值,代码已开源。
研究首次对 12 款主流欧盟 AI 法案合规检查工具(AIACC)进行实证评估,发现其质量差异显著,目前只能作为早期定位工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,且无法提供明确可执行的指导,依赖它们可能造成虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。
研究者提出 FigAct 框架,将静态科学图表转化为按问题定制的可视化演示,直接在图表现有图形元素上施加视觉动作以引导读者注意力。其分层搜索策略将元素定位的 token 消耗降低约 40 倍,并基于 grounding 准确率、搜索效率和渲染质量三项奖励训练出 FigAct-8B。团队还构建了经人工核验的真实论文图表 benchmark,用于评估 MLLM 生成有据可依的视觉解释的能力。
针对仅用交叉熵(CE)监督最终答案、不约束思维过程的训练缺陷,研究者提出 REST(REpresentation-Supervised Thoughts),将因果性、最小性、可分离性与稳定性四项思维表征属性转化为可微损失并叠加到 CE 上。
研究用固定通用概率决策模型 Jev 在 WISDM、UCI341、PAMAP2 的 1800 个类平衡加速度窗口上测试免训练人类活动识别,最强表示 macro-F1 仅 0.038、0.118、0.089,远低于监督模型的 0.686 至 0.907。
研究提出 DerivAudit 框架,用于审计长期 LLM 智能体的持久记忆是否真正由写入时可用的交互历史所支持,并区分证据范围、组合有效性与准入可靠性三个问题。
AdaST 是一个自适应时空预测框架,通过"分解-重组"范式,用异质性感知专家将输入分解为不同耦合模式的组件,再由角色对齐模块处理并经相关性感知的自适应重组器整合输出预测。研究指出真实时空数据存在时间主导、空间主导和强耦合等不同耦合机制,现有方法隐含假设强时空耦合会导致虚假依赖和性能下降。该工作已被 NeurIPS 2026 主会接收,实验显示 AdaST 显著优于当前最优基线。
研究针对冻结的 VLA 主干网络,在 LIBERO 和 CALVIN 两个操作基准上分析单层选择与多层融合,发现 54 种配置中有 47 种不如最佳单层策略,且最佳层因主干和基准而异。
研究横扫 8 种智能体编排架构、5 个指令微调 7-9B 模型和 5 个短答案基准,发现团队扩展收益高度依赖任务:从 3 次到 30 次调用,GSM8K 和 GSMHard 准确率最多提升 17 分,而 ARC、GPQA、MMLU 最多仅提升 4 分。
研究者推出 GeoOutageBench,一个评估 LLM 地理时空 KGQA 的基准,其时空知识图谱融合停电记录、遥感、气象观测、风暴与电力事件、地理实体及领域本体等多模态数据。
arXiv 论文《A Polyphonic Conception of AI Understanding》提出 LLM 具有"复调"特性:输出由多个可靠性不一的并行机制联盟涌现,这些机制相互补充、重复或淹没,多个联盟均可完成任务且无一不可或缺。