Common Corpus发布两万亿token开源预训练数据集
热点事件持续更新
Common Corpus发布两万亿token开源预训练数据集
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Pierre-Carl Langlais等作者发布Common Corpus,一个约两万亿token的开放LLM预训练数据集,数据均为无版权或开放许可内容,涵盖多语言(含低资源语言)和大量代码数据。作者称其为面向LLM预训练的最大开放数据集。 作者在数据集上训练了两个小模型,称性能与同规模其他模型相当,并公开了数据来源、筛选与整理细节。论文已被ICLR 2026接收为Oral。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
Common Corpus:面向 LLM 预训练的最大开放数据集论文报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.CLCommon Corpus:面向 LLM 预训练的最大开放数据集论文
论文介绍 Common Corpus,一个约两万亿 token 的开放 LLM 预训练数据集,数据均为无版权或开放许可内容,涵盖多语言(含低资源语言)和大量代码数据。作者在数据集上训练两个小模型,性能与同规模其他模型相当,并公开了数据来源、筛选与整理细节,论文被 ICLR 2026 接收为 Oral。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。