跳到正文
原文
Goodfire Research(网页)·· 15 小时前AI 评分50

Goodfire 推出 Silico:用内部表征做奖励信号,幻觉降低 58%

Silico for LLMs

AI 导读

Goodfire 发布面向 LLM 的可解释性工具 Silico,用模型内部表征的轻量探针作为奖励信号训练 Google Gemma 3 12B,幻觉降低 58% 且性能基准无退化,成本比 LLM-as-a-judge 低约 90 倍。该工具还支持基于探针定位有害行为对应的训练数据点,过滤后重训可使相关行为减少 63%,识别并剔除问题数据源后减少 84%。Silico 已提供 macOS 版下载。

来源:Goodfire Research(网页) · goodfire.ai