跳到正文
原文
arXiv:cs.AI(全量分类)· Yu Cheng, Yongkang Hu, Shuaijie Ma, Zhihang Lin, Weicheng Meng, Jingyang Qiao, Jiuan Zhou, Yushuo Zhang, Yihang Chen, Weilin Luo, Kun Shao, Dong Li, Zhizhong Zhang, Yuan Xie, Zhaoxia Yin·· 1 天前AI 评分39

SafeCoEvo:面向 LLM 智能体的测试时安全框架与守卫协同演化

SafeCoEvo: Co-Evolving Safety Harnesses and Guards for LLM Agents at Test-Time

AI 导读

SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统仅凭过往任务积累的运行经验持续适配未来未见任务。它通过 S-Harness 将近期运行经验快速外化为可更新的显式安全知识,并用 GuardVPO 在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强基线,不安全结果率降低 10.05%,任务成功率提升 12.15%。

来源:arXiv:cs.AI(全量分类) · arxiv.org