HuggingFace Daily Papers(社区热门论文)·· 3 小时前AI 评分43
合成预预训练在规模扩展下依然有效,但并非源于语法先验
Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior
AI 导读
一项覆盖 500M 至 7B 参数、PT 预算最高 100B tokens 的研究显示,合成非自然语言数据上的预预训练(PPT)带来的下游性能与 token 效率增益在规模扩展后依然成立,3B 规模下至少节省 21B PT tokens。
来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co