跳到正文
原文
Hugging Face:Blog(RSS)·· 2026-08-10AI 评分45

如何让知识蒸馏便宜到可以大规模运行

Making Knowledge Distillation Cheap Enough to Run at Scale

AI 导读

最新论文《Efficient Knowledge Distillation for LLMs》提出离线 top-K logits 缓存与融合分块 KL 损失两项改动,让教师模型无需与学生同时驻留显存,也不再生成完整的词表×序列长度矩阵。

来源:Hugging Face:Blog(RSS) · huggingface.co