跳到正文
热点事件持续更新

TabiBERT土耳其语编码器与TabiBench基准发布

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

研究人员发布基于 ModernBERT 架构的土耳其语单语编码器 TabiBERT,从零预训练 1 万亿 token,语料取自 865.8 亿 token 的多领域数据集,其中网页文本占 72%、科学出版物 19%、源代码 6%、数学内容 0.3%,支持 8192 token 上下文,为现有土耳其语 BERT 模型的 16 倍。 作者 Melikşah Türker 等同时发布统一基准 TabiBench,并公开模型权重、训练配置与评估代码,称其可作为后续土耳其语编码器研究的可复现基础。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.CL
    TabiBERT:面向土耳其语的大规模 ModernBERT 基础模型与统一基准

    研究人员推出基于 ModernBERT 架构的土耳其语单语编码器 TabiBERT,从零预训练 1 万亿 token,语料来自 865.8 亿 token 的多领域数据集(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8192 token 上下文,为现有土耳其语 BERT 模型的 16 倍。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。