跳到正文
热点事件持续更新

研究检验LM surprisal对中文阅读时间预测力

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Hongao Zhu等作者发表论文,分析语言模型导出的token级surprisal对中文(普通话)阅读时间的预测能力。研究在三个段落级中文眼动语料库(GECO-CN、HKP、MECO)上检验,使用从零训练、30B tokens语料训练的Chinese-Pythia模型系列(14M至1.4B)。 为解决眼动语料分词与LM子词tokenization不一致的问题,研究提出Shortest Matching Sequence(SMS)对齐方案。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    语言模型 surprisal 对中文阅读时间预测能力的系统分析

    研究提出 Shortest Matching Sequence(SMS)对齐方案,解决眼动语料分词与 LM 子词 tokenization 不一致问题,并用 14M-1.4B 的 Chinese-Pythia 模型(30B tokens 训练)检验 token 级 surprisal 对中文阅读时间的预测力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。