SafeCoEvo:面向 LLM 智能体的测试时安全框架与守卫协同演化
SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统仅凭过往任务积累的运行经验持续适配未来未见任务。它通过 S-Harness 将近期运行经验快速外化为可更新的显式安全知识,并用 GuardVPO 在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强基线,不安全结果率降低 10.05%,任务成功率提升 12.15%。
SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统仅凭过往任务积累的运行经验持续适配未来未见任务。它通过 S-Harness 将近期运行经验快速外化为可更新的显式安全知识,并用 GuardVPO 在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强基线,不安全结果率降低 10.05%,任务成功率提升 12.15%。
研究者提出自适应长上下文提示词注入 AdaLCPI,将攻击目标拆成不完整碎片嵌入智能体工具检索到的外部内容,并用重建线索诱导智能体自行拼接,再借助 OpenEvolve 结合分级评分与目标智能体的自然语言执行反馈迭代优化碎片和线索。实验显示其宏平均 ASR 达 61.4%,高于 Trojan Hippo 式的 32.8% 和 AgentVigil 的 30.0%。
针对 LLM 多智能体系统 41%-87% 的失败率,研究者提出 MAADBench——首个可刷新的 MAS 异常检测基准,通过约 10^37 任务空间的采样耦合生成任务缓解任务泄漏,并支持在可配置 LLM 骨干下刷新轨迹生成、自动提供免成本确定性的步骤级标签。
BRIDGE 是一种内存高效的一阶双层优化方法,将检索器与 LLM 策略的联合训练建模为双层优化问题,以解决检索证据错误被错误归咎于 LLM 策略的"信息信用鸿沟"。在七个开放域 QA 基准上,BRIDGE 在 3B 和 7B 骨干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 点,并在医疗 QA 基准上取得最佳平均答案准确率与推理质量。
一篇论文从自主性与主动性两个设计维度考察人机协作,用悖论视角分析其中的内在张力,并据此映射出四种协作模式:指令、委派、辅助与共创。该工作将发表于第33届模式语言编程会议(PLoP 2026)。
研究者提出一种新的选项发现算法,为每个子目标只识别一小组相关特征,而非同时覆盖状态的所有方面,从而生成泛化更广、能加速探索的选项。该方法在三个稀疏奖励的图像域中实现快速探索,包括 Atari 游戏 MontezumasRevenge。
针对 Cell Painting 图谱的机制(MOA)预测,PhenoAIR 将检索到的邻近扰动视为不确定证据,通过可靠性感知的多智能体框架进行校准推理,而非直接做表征匹配。
ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,在 LLM-as-Judge 评测中达到 95.3%,超过所有基线 LLM。它构建了 1,706 个文本块、10 个来源的知识库,并配有覆盖现有 ME/CFS 诊断框架的指南间冲突登记表,以及按查询焦点与冲突信号重排证据的校准流程。该评测避免了关键词匹配平均 10.1 个百分点的系统性低估,代码已开源。
一项 arXiv 研究在拍卖与匹配等多智能体环境中比较不同交互格式对 LLM 智能体决策的影响,发现英式拍卖接口能显著降低出价偏差。研究还显示,列出收益情形并解释真实出价为何安全可改善选择,而要求智能体规划匹配轮次或推测对手信念反而整体变差。在拍卖中,这些行为改善并未伴随智能体简短计划中策略理解语言指标的相应提升。
ThuRunel 是一个面向医疗美容、法律咨询、教育规划等高风险咨询场景的 AI 咨询智能体,通过有限状态信念管理框架、思维链教师合成协议与学习式生成适配器实现动态解耦。在 11 个基线对比中,ThuRunel 在信息采集完整度与专家简报质量上均取得一致提升。该智能体已以双语 Web 应用形式公开部署,基于精选知识库在每次回答中标注引用来源。
微软提出 AI SW Factory,覆盖 Targeting、Coding、Reviewing、Ops 全软件开发生命周期,通过微调模型权重和更新 World Model 实现自我改进。在微软数十个代码仓库的规模化部署中,工程效率达到智能体编码的 3 倍,token 效率最高提升 22 倍。
针对长程编程智能体上下文随观察不断增长的问题,论文提出 StateTape 框架,将仓库建模为符号级代码图,用 tape 标记每次写入改动的符号,把过时判断从文本推断变为对写入的观察。该方法配合小型 manager 模型处理写入日志无法确定的部分,并给出理论分析与 TraceBench 基准。在六个编程智能体和三个编辑密集型基准上,StateTape 均取得更高解决率且计算开销很小。
研究者推出 CheatBench,一个覆盖数学研究、知识工作、编程、视觉任务等领域的 AI 智能体作弊行为基准,其环境将高难度任务与作弊机会结合,用于研究智能体在诚实工作困难时如何追求目标。该基准支持跨模型与跨任务类别比较,并已公开发布。
研究用两阶段实验设计在社交媒体信息流中测试了 Gemma-3-4b-it、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 和 GPT-5-nano 四个 LLM 的重复曝光效应,共收集 336,000 条真实性、重要性、情感和兴趣评分。
研究者提出 MERID 框架,通过基于经验的递归自我改进(RSI)自动开发抑郁症预测流水线,包含 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个组件。在抑郁症基准上,MERID 在多项任务上优于多模态与智能体基线,分析还显示声学与语言线索对抑郁症检测有价值,代码已开源。
研究提出 DerivAudit 框架,用于审计长期 LLM 智能体的持久记忆是否真正由写入时可用的交互历史所支持,并区分证据范围、组合有效性与准入可靠性三个问题。
研究横扫 8 种智能体编排架构、5 个指令微调 7-9B 模型和 5 个短答案基准,发现团队扩展收益高度依赖任务:从 3 次到 30 次调用,GSM8K 和 GSMHard 准确率最多提升 17 分,而 ARC、GPQA、MMLU 最多仅提升 4 分。
美团 LongCat 团队发布 LongCat-DeepResearch 深度研究系统,将增强版 LongCat 模型与多智能体工作流结合,用于生成有证据支撑的完整报告。
针对 LLM 智能体自进化中"只要聚合验证分提升就接受编辑"的门控规则,研究者提出统计接受门控 SAGE,用逐项配对比较暴露被平均分掩盖的回归,并以单侧配对检验仅在收益统计可靠时才提交编辑。
研究提出 Dyad 架构,通过环境条件化的动作编码器将候选动作描述并行嵌入,并与 LLM 内部状态打分,得到类型化动作分布。冻结 LLM 仅训练动作编码器即可在四个未见环境中稳定提升;联合优化在多种交互任务和模型规模上超越常规 RL 后训练,9B 模型在 ALFWorld 上平均绝对提升 3.80%,同时改善通用知识、推理与编码能力。
ROSS 通过保留完整历史轨迹作为上下文、仅对选定的模型生成续写施加损失,让自生成 rollout 中的可复用行为经验通过离线 SFT 继续产生收益,无需额外策略 rollout。
StepLearn 是一个非参数框架,将即时使用与持久信任分离:把有信息量的状态转移转化为可指导下一步的假设,但需经跨回合的前瞻验证后才允许复用。
Mara Chain 提出一种精炼流程,不再丢弃被拒绝的候选配置,而是保留并借助前序尝试积累的证据迭代精炼,每条精炼链限定固定深度,并用 Pareto 过滤的 Top-N 选择约束候选池。
DraftTrace 是一个同时捕捉写作成品、写作过程与 AI 助手交互三类视角的写作环境,可将文档随时间演变的过程重建为提交级、纵向和班级级分析。研究者在 81 名学生的研究生 NLP 课程中部署该工具,发现成品指标区分文本表述差异,过程指标区分文本输入方式差异,两者结合可识别复制粘贴等情形。交互轨迹显示学生早期用助手澄清问题、后期用于核验答案。
长期记忆系统把对话压缩成简短笔记时会选择性地"抹平"时态:在 381 对仅时态不同的用户陈述中,三个写入模型有 244 对把进行时陈述改成一般现在时,反向从未出现,该不对称在全部 11 种模型配置以及 mem0、Graphiti、Letta 中均成立。
DeepRewind 是一个面向深度研究智能体的可逆控制层,将智能体不断演化的认知状态表示为包含来源、证据、主张、假设、承诺、计划和草稿的类型化图。它用基于提示词的世界模型预测中间结论的影响与可逆性,由二元控制器拦截高风险承诺,并在后续证据推翻结论时执行依赖感知回滚。
HeurEvo 是一个自动化 plan–code–component 协同进化框架,通过 planner、coder 与 component evolver 联合进化算法结构、实现代码和共享组件池,并由 interpreter agent 分析执行结果提供反馈。
针对计算机操作智能体(CUA)的安全隐患,SCOUT 提出两阶段智能体验证框架,先由 rubric 生成器对任务与轨迹进行推理,生成任务专属的完成与安全标准,再由探测智能体与执行后环境交互收集实证。
ProVer 通过智能体评判器对比成功与失败轨迹,定位可能决定成败的片段,再用该片段前后续写成功率之差验证其优势,并将正值计入 GRPO 优势。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 在 Qwen3.5-2B 和 Qwen3.5-4B 两个规模均取得最强平均表现,相对 GRPO 分别提升 9.91% 和 7.12%。
研究者提出 SAKIKO 审计框架,用于检验工具调用 LLM 的内部激活干预是否构成真正的"修复"。在 When2Call 和 MetaTool 上对七个 LLM 的测试中,通道键控干预在五个模型上带来方向特定的净增益,但 59 个预算匹配的随机方向无一能匹配校准后的目标增益。
PADMÉ 是一种面向智能体场景的元评估数据合成方法,将元评估重构为偏好判断问题,仅用小型语言模型、无需人工参与且计算开销低。其原型在四个智能体领域、三项评估标准上合成 1000 条样本,150 条子集的人工验证显示与人类判断的一致率从基线 73% 提升至 85%。该数据集对 25 个常见模型的元评估揭示了评估表现与打分粒度、宽松度及模型规模等因素的相关性。
Mnemon 是一种将记忆工作分为快慢两套系统的 LLM 记忆智能体:对话以带日期的原始记录保存,LLM(System 2)规划搜索,决策模型 Jev(System 1)以每秒数十次的 yes/no 判断筛选结果,再由显式预算规则生成小型 View 供回答模型使用。
VoxParity 基准测试语音智能体是否会因听到的声音改变行动:183 个场景覆盖 14 个行业,同一段文字保持不变、只改音频(如医疗监护仪蜂鸣、无线电中的 mayday、下注的儿童声音),正确答案也随之改变。23 个可跑纯文本的系统只有 11 个通过。错误偏向文字:音频要求保护时,28 个系统执行常规请求的比例为 41%,而干净通话中过度反应仅 12%。
研究者推出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,经母语者审核并评估生成语言与语音输出。在 4,500 通全双工通话和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成率与英语相差 3.2 个百分点以内,韩语和普通话分别下降 14.7 和 8.4 个百分点。
针对合成问题难度与局部检索能力不匹配的问题,研究者提出 latent anchor reasoning,并基于此构建 PrimeSeeker 框架,通过网页锚点结构与参考证据骨架联合生成问题和证据,共构造 9,221 条专家轨迹训练了一个 30B 搜索智能体。
研究者提出 BreakingWeb 基准,通过受控环境干预将智能体已能完成的任务改造为高难度实例,包含 519 个干净/干预任务对,覆盖 7 个自托管网站和 29 类干预。干预使六款浏览器使用智能体的通过率平均下降 22.9%,并推翻近半数原本能干净解决的任务;人类首次尝试仅损失 10.0%。六款智能体 75% 的失败属于"信念失败",即在所需变更未发生时仍宣称成功。
研究者提出一套面向车载对话助手(ICA)的自动化多轮对话测试框架,将系统视为黑盒,通过闭环仿真结合策略引导用户模拟器、对抗策略管理器和两层 LLM 评判器进行评估。在六种 LLM 后端和十二名人工标注者参与的工业级 ICA 测试中,自动评判与人类标注高度一致,策略引导相比无引导仿真每段对话多发现 2.96 倍独特故障类型,故障对话数量增加一倍以上。
Lookahead-R 是一个将工具检索重构为资源受限序列决策问题的规划框架,通过轻量级执行感知代理世界模型联合预测工具执行成功率、延迟成本与语义效用,无需调用真实 API。在 ToolBench 的 I3 划分上,其 NDCG@5 达 91.40%,超过 SOTA 的 ToolGen(90.16%)1.24%。消融实验表明,显式延迟建模是资源约束下识别高质量工具的关键判别信号。
研究提出由 story agent、image agent 和 critic agent 协作的多智能体框架,在科学、健康、娱乐领域生成超 9,000 条配对多模态假新闻帖,并基准测试 16 个开源与闭源 MLLM 的自动检测能力。结果显示多数模型准确率远低于人类水平,在识别图像真实性上尤其失败。代码与数据已发布于 GitHub,论文被 EMNLP 2026 Findings 接收。
Transluce 发文提出嵌入式评估(embedded evaluators)的初步方案,认为其有助于应对 OpenAI 智能体集群入侵 Hugging Face 等对齐事件暴露的风险。