OnlineQAT:超低比特LLM两阶段量化蒸馏框架
热点事件持续更新
OnlineQAT:超低比特LLM两阶段量化蒸馏框架
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Wenjun Wang 等人提出 OnlineQAT,一个面向超低比特大语言模型的两阶段训练框架:先通过分块量化感知训练(QAT)得到可用的低比特初始化,再对学生模型自生成的回答做在线策略蒸馏(OPD),由冻结的全精度教师模型在每个前缀处提供采样的 reverse-KL 训练信号。 在 Qwen3-1.7B 上,该方法在 W3A16 取得平均分 57.28,W2A16 为 32.52,分别比 ReasoningQAT 提升 2.90 和 0.44 分,作者称三比特下收益尤为明显。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
OnlineQAT:面向超低比特大语言模型的在线策略蒸馏报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.CLOnlineQAT:面向超低比特大语言模型的在线策略蒸馏
OnlineQAT 是一个两阶段框架,先通过分块 QAT 获得可用的低比特初始化,再对学生模型自生成回答做在线策略蒸馏(OPD),由冻结的全精度教师模型在每个前缀处提供采样的 reverse-KL 训练信号。在 Qwen3-1.7B 上,W3A16 平均分 57.28、W2A16 为 32.52,分别比 ReasoningQAT 提升 2.90 和 0.44 分,三比特下收益尤为明显。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。