TabiBERT土耳其语编码器与TabiBench基准发布
热点事件持续更新
TabiBERT土耳其语编码器与TabiBench基准发布
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
研究人员发布基于 ModernBERT 架构的土耳其语单语编码器 TabiBERT,从零预训练 1 万亿 token,语料取自 865.8 亿 token 的多领域数据集,其中网页文本占 72%、科学出版物 19%、源代码 6%、数学内容 0.3%,支持 8192 token 上下文,为现有土耳其语 BERT 模型的 16 倍。 作者 Melikşah Türker 等同时发布统一基准 TabiBench,并公开模型权重、训练配置与评估代码,称其可作为后续土耳其语编码器研究的可复现基础。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
TabiBERT:面向土耳其语的大规模 ModernBERT 基础模型与统一基准报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.CLTabiBERT:面向土耳其语的大规模 ModernBERT 基础模型与统一基准
研究人员推出基于 ModernBERT 架构的土耳其语单语编码器 TabiBERT,从零预训练 1 万亿 token,语料来自 865.8 亿 token 的多领域数据集(网页文本 72%、科学出版物 19%、源代码 6%、数学内容 0.3%),支持 8192 token 上下文,为现有土耳其语 BERT 模型的 16 倍。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。