Hugging Face:Blog(RSS)·· 2026-08-10AI 评分45
如何让知识蒸馏便宜到可以大规模运行
Making Knowledge Distillation Cheap Enough to Run at Scale
AI 导读
最新论文《Efficient Knowledge Distillation for LLMs》提出离线 top-K logits 缓存与融合分块 KL 损失两项改动,让教师模型无需与学生同时驻留显存,也不再生成完整的词表×序列长度矩阵。
来源:Hugging Face:Blog(RSS) · huggingface.co