跳到正文
热点事件持续更新

Common Corpus发布两万亿token开源预训练数据集

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Pierre-Carl Langlais等作者发布Common Corpus,一个约两万亿token的开放LLM预训练数据集,数据均为无版权或开放许可内容,涵盖多语言(含低资源语言)和大量代码数据。作者称其为面向LLM预训练的最大开放数据集。 作者在数据集上训练了两个小模型,称性能与同规模其他模型相当,并公开了数据来源、筛选与整理细节。论文已被ICLR 2026接收为Oral。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.CL
    Common Corpus:面向 LLM 预训练的最大开放数据集论文

    论文介绍 Common Corpus,一个约两万亿 token 的开放 LLM 预训练数据集,数据均为无版权或开放许可内容,涵盖多语言(含低资源语言)和大量代码数据。作者在数据集上训练两个小模型,性能与同规模其他模型相当,并公开了数据来源、筛选与整理细节,论文被 ICLR 2026 接收为 Oral。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。