MERID:用递归自我改进智能体做多模态抑郁症分析
研究者提出 MERID 框架,通过基于经验的递归自我改进(RSI)自动开发抑郁症预测流水线,包含 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个组件。在抑郁症基准上,MERID 在多项任务上优于多模态与智能体基线,分析还显示声学与语言线索对抑郁症检测有价值,代码已开源。
研究者提出 MERID 框架,通过基于经验的递归自我改进(RSI)自动开发抑郁症预测流水线,包含 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个组件。在抑郁症基准上,MERID 在多项任务上优于多模态与智能体基线,分析还显示声学与语言线索对抑郁症检测有价值,代码已开源。
研究首次对 12 款主流欧盟 AI 法案合规检查工具(AIACC)进行实证评估,发现其质量差异显著,目前只能作为早期定位工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,且无法提供明确可执行的指导,依赖它们可能造成虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。
研究者提出 FigAct 框架,将静态科学图表转化为按问题定制的可视化演示,直接在图表现有图形元素上施加视觉动作以引导读者注意力。其分层搜索策略将元素定位的 token 消耗降低约 40 倍,并基于 grounding 准确率、搜索效率和渲染质量三项奖励训练出 FigAct-8B。团队还构建了经人工核验的真实论文图表 benchmark,用于评估 MLLM 生成有据可依的视觉解释的能力。
针对仅用交叉熵(CE)监督最终答案、不约束思维过程的训练缺陷,研究者提出 REST(REpresentation-Supervised Thoughts),将因果性、最小性、可分离性与稳定性四项思维表征属性转化为可微损失并叠加到 CE 上。
研究用固定通用概率决策模型 Jev 在 WISDM、UCI341、PAMAP2 的 1800 个类平衡加速度窗口上测试免训练人类活动识别,最强表示 macro-F1 仅 0.038、0.118、0.089,远低于监督模型的 0.686 至 0.907。
研究提出 DerivAudit 框架,用于审计长期 LLM 智能体的持久记忆是否真正由写入时可用的交互历史所支持,并区分证据范围、组合有效性与准入可靠性三个问题。
AdaST 是一个自适应时空预测框架,通过"分解-重组"范式,用异质性感知专家将输入分解为不同耦合模式的组件,再由角色对齐模块处理并经相关性感知的自适应重组器整合输出预测。研究指出真实时空数据存在时间主导、空间主导和强耦合等不同耦合机制,现有方法隐含假设强时空耦合会导致虚假依赖和性能下降。该工作已被 NeurIPS 2026 主会接收,实验显示 AdaST 显著优于当前最优基线。
研究针对冻结的 VLA 主干网络,在 LIBERO 和 CALVIN 两个操作基准上分析单层选择与多层融合,发现 54 种配置中有 47 种不如最佳单层策略,且最佳层因主干和基准而异。
研究横扫 8 种智能体编排架构、5 个指令微调 7-9B 模型和 5 个短答案基准,发现团队扩展收益高度依赖任务:从 3 次到 30 次调用,GSM8K 和 GSMHard 准确率最多提升 17 分,而 ARC、GPQA、MMLU 最多仅提升 4 分。
研究者推出 GeoOutageBench,一个评估 LLM 地理时空 KGQA 的基准,其时空知识图谱融合停电记录、遥感、气象观测、风暴与电力事件、地理实体及领域本体等多模态数据。
arXiv 论文《A Polyphonic Conception of AI Understanding》提出 LLM 具有"复调"特性:输出由多个可靠性不一的并行机制联盟涌现,这些机制相互补充、重复或淹没,多个联盟均可完成任务且无一不可或缺。
美团 LongCat 团队发布 LongCat-DeepResearch 深度研究系统,将增强版 LongCat 模型与多智能体工作流结合,用于生成有证据支撑的完整报告。
研究者提出 Structured Matrix Attention(SMat-Attention),用一类行支撑集 VC 维度为 d 的因果掩码连接 softmax 注意力与线性注意力。
研究者提出 Mirror-Score,一个面向异手性 D-肽/L-蛋白复合物的校准式纯推理打分框架,并发布覆盖四个靶点家族、含 31 个晶体复合物(其中 18 个有文献验证亲和力)的公开基准。
GeoWind2Plan 是一个"几何到风场再到规划"的框架,仅凭背景风向量、3D 建筑几何和起终点,即可预测任务相关的 3D 风场并优化 UAV 三维路径与速度。
PowerZooJax 是一个基于 JAX 的强化学习电力系统基准套件,提供覆盖发电、输电、配电、分布式能源和数据中心微电网的五个约束马尔可夫决策过程任务。它将潮流计算、经济调度、市场出清和设备动态改写为 JAX 计算图,使整个训练与评估循环留在 GPU 上,实验显示相较 CPU 仿真有显著加速。该开源基准支持对策略回报、安全违规和分布外压力条件进行标准化评估。
针对 LLM 智能体自进化中"只要聚合验证分提升就接受编辑"的门控规则,研究者提出统计接受门控 SAGE,用逐项配对比较暴露被平均分掩盖的回归,并以单侧配对检验仅在收益统计可靠时才提交编辑。
一项 arXiv 研究分析 158 名 18-25 岁年轻人的 19,930 段 ChatGPT 对话,并请十位临床医生评审五个体现用户痛苦的样例对话。
COFFEE 是一个即插即用框架,通过将序列依赖与目标分离,避免枚举所有未解析 token 组合带来的指数级计算,从而为离散扩散模型提供序列级引导。它用无目标载体吸收去噪器预测的边际分布构建联合模型,并用编译的有限状态模型记录 token 组合对序列级偏好的影响,无需重训练即可将全局偏好传递给未解析位置。该框架在符号、语言和生物多个基准上取得强控制效果,并支持显式硬约束与学习到的软目标。
剑桥大学与 Models2 AI 的 Haomin Luo 对自发现 RL 规则 Disco103 做了首次因果机制审计,围绕经验时代五大支柱检验学习历史何时是资产、何时是负担。
研究显示,矩阵 Muon 的极坐标归一化更新步长由梯度秩而非范数决定,在稳定性边缘会进入持续数千步的周期-2 损失振荡:周期均值损失持平或上升,但权重仍在移动、学到的特征持续对齐教师子空间。在 33 组 ReLU、GELU 和 SiLU 教师配置中,学生 AGOP 在振荡期间始终对齐或持续对齐教师子空间,投影头重拟合表明这些方向对预测有用。
研究者提出 transversal pooling 神经网络,将空间最大池化推广到仿射群作用,并证明其对选定子群具有等变性,同时给出单个池化小波系数在输入仿射扰动下的显式稳定性界。实验显示该网络在低数据环境下有效,并可用于预测热带气旋增强。
一项控制论视角的理论研究证明,Transformer 中自注意力之后的前馈层可作为一个独立控制项,无论 key、query、value 矩阵如何取值,都能将 token 驱动到任意接近共识的状态。该结论可扩展至多簇收敛与多头注意力情形,作者通过数值实验验证了结果,并将理论给出的阈值行为与真实 LLM 进行了对比。
针对 MoE 模型批量解码时专家权重传输开销大的问题,研究者提出 BASE,按“移除某专家对 MoE 层输出的影响”对专家排序,并在校准阶段训练轻量线性预测器估计每个 token 的专家移除代价,配合定制 GPU kernel 完成代价预测与专家选择。
研究在固定提示词长度下改变任务串行步数,测量17个开源权重模型每一层注意力头活动是集中还是分散。多数模型在接近中层前的层集中活动、后续层分散,且模型间差异可复现;Qwen2.5 0.5B至7B比平均模型更分散,Llama 1B至8B与OLMo-2则在第二半部分分散,Llama-3.1-70B与Qwen2.5-72B的对比在层数与头数相同时依然成立。
研究者提出预条件残差损失函数,实现物理信息神经算子的无标签训练,在 Poisson、Allen-Cahn 和稳态 Stokes 方程上精度匹配监督训练,比此前物理信息算子学习方法准确 4 至 25 倍。该方法通过几何与代数多重网格实现,对椭圆问题具备网格无关的条件数,并适用于线性与非线性、稳态或时变方程及结构化与非结构化网格,且不增加推理成本。
EnergyEminence 是一个早期测试平台,将 IEEE 118-bus 风格的图时序预测器、非线性 AC 级联仿真与类操作员仪表盘的时间回放耦合,并提出共享有界校准,把野火检测置信度与空间范围转换为来源可比的野火可解释证据。
研究提出用去噪器 Jacobian 的谱特性来刻画扩散、流匹配等生成式去噪模型之间的差异,发现生成性能更好的模型对应更大的 Jacobian 特征值。作者据此设计了一种正则化方案,通过在扰动输入上训练去噪器来抑制或放大 Jacobian 响应,并在 ImageNet 上验证:同时强化数据相关主特征方向、抑制噪声无关方向能改善生成效果。
研究者提出一种无需标签、损失或拟合模型的方法,从编码器等价类与固定对比设计计算可达对比空间,并给出任意无约束解码器的经验误差下限。
研究者提出物理驱动的跨模态掩码自编码器 CM-MAE,用于地震数据到测井的表示学习,将地震体与测井深度片段联合 token 化,并用四轴旋转位置嵌入映射到连续物理坐标。
EvoMO-SR 是一个由 LLM 驱动的符号回归框架,由 LLM 生成方程骨架、外部优化器单独拟合系数,并引入多目标生存选择与子结构引导机制。在 LSR-Synth 的 8 个域内与域外设置中,该框架使用 Llama-3.1-8B-Instruct 小模型在 7 个设置上取得最佳精度。基于规范化子树重叠与项匹配的两项符号精度指标显示,其恢复高精度符号结构的概率更高。
研究针对主次弱耦合马尔可夫决策过程(M2WCMDP)中的公平资源分配问题,用单调、凹、置换不变、归一化的公平函数替代传统效用总和目标。在同质次子MDP下,该问题可化简为在置换不变策略类上优化平台加平均参与者的效用目标;更一般情形则提出基于计数比例的深度强化学习方法和优先采样器。在机器更换与纽约市定价及出租车调度两个应用中验证了方法的公平性与可扩展性。
DSpine 是一种在骨干网络各层注入相邻因果条件的投机解码 drafter,通过门控相邻注入把前驱预测特征写入后继位置,使因果条件链随网络深度展开而所有位置并行更新。
针对车载自组网中联邦学习假设所有车辆训练同一模型的问题,论文提出编码器共享分层多任务联邦学习框架 EN-HMTFL,将基于聚类的分层联邦学习与全局共享编码器、车辆本地解码器结合,仅交换聚合编码器,原始数据与本地解码器参数保留在车辆端。
EHRFlow 是一个多边际流匹配框架,以编码后的患者病史为条件,让未来动力学依赖患者既往临床轨迹,支持不规则观测时间和任意时间跨度预测。在超过一百万患者的真实临床数据集(含独立外部验证队列)上,其 horizon 平均 top-5 临床代码准确率优于自回归与历史无关的流匹配基线。在受控反事实模拟中,条件引导无需训练任务特定结局模型即可近似抗高血压干预的已知效应。
arXiv 论文 arXiv:2609.36126 测试了使用严格局部连接和异步更新的 Neural Cellular Automata(NCA)在视觉推理任务上的能力,可解大迷宫、数独和 ARC-AGI-1。
ThinQuant 通过基于激活凸包几何结构的数据选择与精确降维优化,实现 LLM 低比特权重和激活量化中的高效旋转学习。Llama-3-70B 在 W4A4KV4 下旋转校准不到 12 分钟,WikiText-2 困惑度 5.63,优于 DartQuant 的 7.55(需 111 分钟)。
一项理论分析表明,特征学习会让神经网络更容易被植入后门:在干净准确率保持 O(π) 的前提下,懒惰学习需要触发强度 α ∝ π^{-1/2} 才能攻击成功,而特征学习将攻击预算改善至 α ∝ π^{-1/4}。这意味着在小投毒比例下,非线性特征学习大幅降低所需触发强度,基于线性启发式的安全审计会系统性低估后门脆弱性。
研究提出 Dyad 架构,通过环境条件化的动作编码器将候选动作描述并行嵌入,并与 LLM 内部状态打分,得到类型化动作分布。冻结 LLM 仅训练动作编码器即可在四个未见环境中稳定提升;联合优化在多种交互任务和模型规模上超越常规 RL 后训练,9B 模型在 ALFWorld 上平均绝对提升 3.80%,同时改善通用知识、推理与编码能力。
Koa-action 是一个面向低延迟原子动作(分类、语义端点检测、布尔判断、打分)的框架,通过引入原子标签 token 与监督微调,把分类变成确定性的单 token 解码。