跳到正文

#Agent

今日 190 条
9月30日周三
  1. arXiv:cs.AI(全量分类)39

    SafeCoEvo:面向 LLM 智能体的测试时安全框架与守卫协同演化

    SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统仅凭过往任务积累的运行经验持续适配未来未见任务。它通过 S-Harness 将近期运行经验快速外化为可更新的显式安全知识,并用 GuardVPO 在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强基线,不安全结果率降低 10.05%,任务成功率提升 12.15%。

  2. arXiv:cs.AI(全量分类)44

    AdaLCPI:智能体能否从碎片中重建间接提示词注入?

    研究者提出自适应长上下文提示词注入 AdaLCPI,将攻击目标拆成不完整碎片嵌入智能体工具检索到的外部内容,并用重建线索诱导智能体自行拼接,再借助 OpenEvolve 结合分级评分与目标智能体的自然语言执行反馈迭代优化碎片和线索。实验显示其宏平均 ASR 达 61.4%,高于 Trojan Hippo 式的 32.8% 和 AgentVigil 的 30.0%。

  3. arXiv:cs.AI(全量分类)33

    BRIDGE:面向检索信用感知的双层智能体强化学习

    BRIDGE 是一种内存高效的一阶双层优化方法,将检索器与 LLM 策略的联合训练建模为双层优化问题,以解决检索证据错误被错误归咎于 LLM 策略的"信息信用鸿沟"。在七个开放域 QA 基准上,BRIDGE 在 3B 和 7B 骨干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 点,并在医疗 QA 基准上取得最佳平均答案准确率与推理质量。

  4. arXiv:cs.AI(全量分类)24

    人机协作:从悖论到模式

    一篇论文从自主性与主动性两个设计维度考察人机协作,用悖论视角分析其中的内在张力,并据此映射出四种协作模式:指令、委派、辅助与共创。该工作将发表于第33届模式语言编程会议(PLoP 2026)。

  5. arXiv:cs.AI(全量分类)32

    ARCagent:面向临床问答的自适应检索校准智能体

    ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,在 LLM-as-Judge 评测中达到 95.3%,超过所有基线 LLM。它构建了 1,706 个文本块、10 个来源的知识库,并配有覆盖现有 ME/CFS 诊断框架的指南间冲突登记表,以及按查询焦点与冲突信号重排证据的校准流程。该评测避免了关键词匹配平均 10.1 个百分点的系统性低估,代码已开源。

  6. arXiv:cs.AI(全量分类)38

    简单机制接口如何引导 LLM 智能体决策:arXiv 研究

    一项 arXiv 研究在拍卖与匹配等多智能体环境中比较不同交互格式对 LLM 智能体决策的影响,发现英式拍卖接口能显著降低出价偏差。研究还显示,列出收益情形并解释真实出价为何安全可改善选择,而要求智能体规划匹配轮次或推测对手信念反而整体变差。在拍卖中,这些行为改善并未伴随智能体简短计划中策略理解语言指标的相应提升。

  7. arXiv:cs.AI(全量分类)35

    ThuRunel:面向结构化咨询对话的动态解耦

    ThuRunel 是一个面向医疗美容、法律咨询、教育规划等高风险咨询场景的 AI 咨询智能体,通过有限状态信念管理框架、思维链教师合成协议与学习式生成适配器实现动态解耦。在 11 个基线对比中,ThuRunel 在信息采集完整度与专家简报质量上均取得一致提升。该智能体已以双语 Web 应用形式公开部署,基于精选知识库在每次回答中标注引用来源。

  8. arXiv:cs.AI(全量分类)40

    StateTape:面向长程编程智能体的动作条件证据生命周期建模

    针对长程编程智能体上下文随观察不断增长的问题,论文提出 StateTape 框架,将仓库建模为符号级代码图,用 tape 标记每次写入改动的符号,把过时判断从文本推断变为对写入的观察。该方法配合小型 manager 模型处理写入日志无法确定的部分,并给出理论分析与 TraceBench 基准。在六个编程智能体和三个编辑密集型基准上,StateTape 均取得更高解决率且计算开销很小。

  9. arXiv:cs.AI(全量分类)31

    MERID:用递归自我改进智能体做多模态抑郁症分析

    研究者提出 MERID 框架,通过基于经验的递归自我改进(RSI)自动开发抑郁症预测流水线,包含 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个组件。在抑郁症基准上,MERID 在多项任务上优于多模态与智能体基线,分析还显示声学与语言线索对抑郁症检测有价值,代码已开源。

  10. arXiv:cs.LG(机器学习,全量分类)37

    Dyad:为 LLM 引入原生类型化决策能力

    研究提出 Dyad 架构,通过环境条件化的动作编码器将候选动作描述并行嵌入,并与 LLM 内部状态打分,得到类型化动作分布。冻结 LLM 仅训练动作编码器即可在四个未见环境中稳定提升;联合优化在多种交互任务和模型规模上超越常规 RL 后训练,9B 模型在 ALFWorld 上平均绝对提升 3.80%,同时改善通用知识、推理与编码能力。

  11. arXiv:cs.CL(计算语言学,全量分类)35

    DraftTrace:面向 AI 辅助写作的多视角分析环境

    DraftTrace 是一个同时捕捉写作成品、写作过程与 AI 助手交互三类视角的写作环境,可将文档随时间演变的过程重建为提交级、纵向和班级级分析。研究者在 81 名学生的研究生 NLP 课程中部署该工具,发现成品指标区分文本表述差异,过程指标区分文本输入方式差异,两者结合可识别复制粘贴等情形。交互轨迹显示学生早期用助手澄清问题、后期用于核验答案。

  12. arXiv:cs.CL(计算语言学,全量分类)41

    DeepRewind:预测并修复深度研究智能体的过早承诺

    DeepRewind 是一个面向深度研究智能体的可逆控制层,将智能体不断演化的认知状态表示为包含来源、证据、主张、假设、承诺、计划和草稿的类型化图。它用基于提示词的世界模型预测中间结论的影响与可逆性,由二元控制器拦截高风险承诺,并在后续证据推翻结论时执行依赖感知回滚。

  13. arXiv:cs.CL(计算语言学,全量分类)42

    ProVer:面向智能体强化学习关键决策的细粒度信用分配框架

    ProVer 通过智能体评判器对比成功与失败轨迹,定位可能决定成败的片段,再用该片段前后续写成功率之差验证其优势,并将正值计入 GRPO 优势。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 在 Qwen3.5-2B 和 Qwen3.5-4B 两个规模均取得最强平均表现,相对 GRPO 分别提升 9.91% 和 7.12%。

  14. arXiv:cs.CL(计算语言学,全量分类)35

    PADMÉ:面向 LM 智能体评估器元评估的偏好对齐数据合成方法

    PADMÉ 是一种面向智能体场景的元评估数据合成方法,将元评估重构为偏好判断问题,仅用小型语言模型、无需人工参与且计算开销低。其原型在四个智能体领域、三项评估标准上合成 1000 条样本,150 条子集的人工验证显示与人类判断的一致率从基线 73% 提升至 85%。该数据集对 25 个常见模型的元评估揭示了评估表现与打分粒度、宽松度及模型规模等因素的相关性。

  15. arXiv:cs.CL(计算语言学,全量分类)48

    VoxParity:语音智能体在关键场景下能否听懂声音

    VoxParity 基准测试语音智能体是否会因听到的声音改变行动:183 个场景覆盖 14 个行业,同一段文字保持不变、只改音频(如医疗监护仪蜂鸣、无线电中的 mayday、下注的儿童声音),正确答案也随之改变。23 个可跑纯文本的系统只有 11 个通过。错误偏向文字:音频要求保护时,28 个系统执行常规请求的比例为 41%,而干净通话中过度反应仅 12%。

  16. arXiv:cs.CL(计算语言学,全量分类)50

    τ-Multilingual:跨语言语音智能体基准测试

    研究者推出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,经母语者审核并评估生成语言与语音输出。在 4,500 通全双工通话和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成率与英语相差 3.2 个百分点以内,韩语和普通话分别下降 14.7 和 8.4 个百分点。

  17. arXiv:cs.CL(计算语言学,全量分类)48

    BreakingWeb:通过受控环境干预构建高难度浏览器使用任务

    研究者提出 BreakingWeb 基准,通过受控环境干预将智能体已能完成的任务改造为高难度实例,包含 519 个干净/干预任务对,覆盖 7 个自托管网站和 29 类干预。干预使六款浏览器使用智能体的通过率平均下降 22.9%,并推翻近半数原本能干净解决的任务;人类首次尝试仅损失 10.0%。六款智能体 75% 的失败属于"信念失败",即在所需变更未发生时仍宣称成功。

  18. arXiv:cs.CL(计算语言学,全量分类)38

    车载对话助手多轮对话的自动化评估框架

    研究者提出一套面向车载对话助手(ICA)的自动化多轮对话测试框架,将系统视为黑盒,通过闭环仿真结合策略引导用户模拟器、对抗策略管理器和两层 LLM 评判器进行评估。在六种 LLM 后端和十二名人工标注者参与的工业级 ICA 测试中,自动评判与人类标注高度一致,策略引导相比无引导仿真每段对话多发现 2.96 倍独特故障类型,故障对话数量增加一倍以上。

  19. arXiv:cs.CL(计算语言学,全量分类)35

    Lookahead-R:基于执行中心规划的预算感知工具检索

    Lookahead-R 是一个将工具检索重构为资源受限序列决策问题的规划框架,通过轻量级执行感知代理世界模型联合预测工具执行成功率、延迟成本与语义效用,无需调用真实 API。在 ToolBench 的 I3 划分上,其 NDCG@5 达 91.40%,超过 SOTA 的 ToolGen(90.16%)1.24%。消融实验表明,显式延迟建模是资源约束下识别高质量工具的关键判别信号。

  20. arXiv:cs.CL(计算语言学,全量分类)44

    MLLM 能否生成并检测多模态社交媒体假新闻?

    研究提出由 story agent、image agent 和 critic agent 协作的多智能体框架,在科学、健康、娱乐领域生成超 9,000 条配对多模态假新闻帖,并基准测试 16 个开源与闭源 MLLM 的自动检测能力。结果显示多数模型准确率远低于人类水平,在识别图像真实性上尤其失败。代码与数据已发布于 GitHub,论文被 EMNLP 2026 Findings 接收。