跳到正文
热点事件持续更新

OnlineQAT:超低比特LLM两阶段量化蒸馏框架

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Wenjun Wang 等人提出 OnlineQAT,一个面向超低比特大语言模型的两阶段训练框架:先通过分块量化感知训练(QAT)得到可用的低比特初始化,再对学生模型自生成的回答做在线策略蒸馏(OPD),由冻结的全精度教师模型在每个前缀处提供采样的 reverse-KL 训练信号。 在 Qwen3-1.7B 上,该方法在 W3A16 取得平均分 57.28,W2A16 为 32.52,分别比 ReasoningQAT 提升 2.90 和 0.44 分,作者称三比特下收益尤为明显。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.CL
    OnlineQAT:面向超低比特大语言模型的在线策略蒸馏

    OnlineQAT 是一个两阶段框架,先通过分块 QAT 获得可用的低比特初始化,再对学生模型自生成回答做在线策略蒸馏(OPD),由冻结的全精度教师模型在每个前缀处提供采样的 reverse-KL 训练信号。在 Qwen3-1.7B 上,W3A16 平均分 57.28、W2A16 为 32.52,分别比 ReasoningQAT 提升 2.90 和 0.44 分,三比特下收益尤为明显。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。