跳到正文
热点事件持续更新

Safety Sentry 提出三路路由式智能体护栏

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Tianyu Chen、Chujia Hu、Wenjie Wang 提交论文,提出名为 Safety Sentry 的 LLM 智能体工具调用安全护栏,将动作安全防护重构为对每个实例在 {EXECUTE, ASK, REFUSE} 三路之间做路由决策,模型推理只需一次解码调用。 作者称,单个解码时阈值可让同一 checkpoint 在不重训练的情况下适配不同风险容忍度的部署;该轻量 guard model 在整体准确率与安全召回上超过多种开放权重和前沿闭源基线,并控制双向错误率。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.AI
    Safety Sentry:通过 EXECUTE-ASK-REFUSE 路由实现上下文感知的人工干预

    Safety Sentry 将 LLM agent 动作安全防护重构为 {EXECUTE, ASK, REFUSE} 三路逐实例路由决策,其推理仅需一次解码调用。单一解码时阈值可让同一 checkpoint 在不同风险容忍度部署中重新定位而无需重训练,该轻量 guard model 在整体准确率与安全召回上超越多种开放权重与前沿闭源基线,同时控制双向错误率。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。