热点事件持续更新
PG-SFT:离线Agent微调中能力获取与保持的平衡
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026年10月2日,arXiv cs.AI 分类发布一篇论文,针对离线智能体轨迹 SFT 会损害基座模型通用推理、工具调用、代码生成等能力的问题,研究者提出 Privilege-Guided SFT(PG-SFT),利用轨迹的轮次级信息增益动态调整监督强度。在评测基准上,PG-SFT 大幅降低分布漂移与广泛能力退化,代价是目标任务性能略有下降;而标准 SFT、KL 惩罚和限制更新幅度均未能避免能力回退。
AI 根据报道生成 · 3 小时前更新
最新进展10月2日 12:00
研究者提出 PG-SFT,以轮次级信息增益调整监督强度,缓解离线微调的能力退化。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv:cs.AI(全量分类)PG-SFT:离线智能体微调中如何平衡能力获取与保持
针对离线智能体轨迹 SFT 会损害基座模型通用推理、工具调用、代码生成等能力的问题,研究者提出 Privilege-Guided SFT(PG-SFT),利用轨迹的轮次级信息增益动态调整监督强度。在评测基准上,PG-SFT 大幅降低分布漂移与广泛能力退化,代价是目标任务性能略有下降;而标准 SFT、KL 惩罚和限制更新幅度均未能避免能力回退。
本事件热度走势
当前热度 9·可比范围峰值 10(10月2日 13:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。