跳到正文

#安全/对齐

今日 67 条
7月29日周二
7月17日周四
6月25日周三
  1. Johann Rehberger / Embrace The Red(RSS)68

    Anthropic Slack MCP Server 存在链接预览数据泄露漏洞,且已停止维护不会修复

    安全研究员 Johann Rehberger 披露 Anthropic 已弃用且停止维护的 Slack MCP Server 存在数据外泄漏洞:服务器发消息时不禁用链接 unfurling,攻击者可借助提示词注入让 AI Agent 在消息中夹带机密链接,经 Slack 抓取预览时把数据泄露给第三方服务器。

6月9日周一
5月25日周日
5月5日周一
5月3日周六
  1. Johann Rehberger / Embrace The Red(RSS)68

    MCP 安全风险解析:不可信服务器如何借工具元数据劫持 Claude 客户端

    安全研究员 Johann Rehberger 发文解析 MCP 的安全风险并展示一条新的漏洞利用链。文章指出仅将恶意工具服务器加入会话即可劫持对话,工具元数据中的隐藏 Unicode Tag 指令可穿透 API 和 UI 层,用户在界面检查时不可见,Claude 会执行这些隐藏指令。

4月15日周二
4月7日周一
3月13日周四
2月17日周一
2月10日周一
12月14日周六
11月28日周四
11月12日周二
  1. AI as Normal Technology(RSS)69

    Arvind Narayanan 解析英国肝移植匹配算法为何系统性不利于年轻患者

    Narayanan 等人撰文分析英国 NHS 肝移植匹配算法对年轻患者的系统性偏差。算法以预测患者有/无移植后 5 年存活率之差计算 TBS 评分,5 年上限低估了年轻患者终身获益,45 岁以下患者无论病情多重都难以获得优先排序,2024 年《柳叶刀》研究确认了这一偏差,患者群体早在 2015 年就通过官方渠道提出过警告。

10月25日周三
3月21日周日
  1. Lilian Weng:Lil'Log(RSS)47

    如何降低语言模型的有害输出

    大型预训练语言模型从互联网数据中不可避免地习得有害行为和偏见,安全部署需对生成过程施加强控制。Lilian Weng 在文中梳理了有害内容的定义分歧、Zampieri 等人提出的三级攻击性语言分类体系(OLID 数据集),以及专家标注、众包、专业审核员和合成数据四类毒性检测数据收集方式。