研究检验LM surprisal对中文阅读时间预测力
热点事件持续更新
研究检验LM surprisal对中文阅读时间预测力
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Hongao Zhu等作者发表论文,分析语言模型导出的token级surprisal对中文(普通话)阅读时间的预测能力。研究在三个段落级中文眼动语料库(GECO-CN、HKP、MECO)上检验,使用从零训练、30B tokens语料训练的Chinese-Pythia模型系列(14M至1.4B)。 为解决眼动语料分词与LM子词tokenization不一致的问题,研究提出Shortest Matching Sequence(SMS)对齐方案。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
语言模型 surprisal 对中文阅读时间预测能力的系统分析报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.AI语言模型 surprisal 对中文阅读时间预测能力的系统分析
研究提出 Shortest Matching Sequence(SMS)对齐方案,解决眼动语料分词与 LM 子词 tokenization 不一致问题,并用 14M-1.4B 的 Chinese-Pythia 模型(30B tokens 训练)检验 token 级 surprisal 对中文阅读时间的预测力。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。