MIT News(RSS)· Adam Zewe | MIT News·· 2026-07-13AI 评分54
MIT 团队提出 Gaussian probing 方法,无需生成内容即可审计模型是否被微调生成 CSAM
New method aims to keep kids safe from illegal AI-generated content
AI 导读
MIT 与儿童安全非营利组织 Thorn 合作提出一种新的模型审计方法,通过 Gaussian probing 检查 LoRA 微调对模型内部表示的改变,在不生成任何输出的情况下判断模型是否被专门化用于生成 CSAM 等有害图像。
来源:MIT News(RSS) · news.mit.edu