跳到正文
热点事件持续更新

多语言模型识别网络语域,F1达79%

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Erik Henriksson 等作者发布多语言深度学习模型,可在 16 种语言中识别新闻、论坛等网络语域,并发布含超 72,000 篇文档、覆盖 25 种语域层级分类的 Multilingual CORE 语料库。 研究称最佳模型多标签分类平均 F1 为 79%,经数据剪枝去除标签不确定文档后升至 90% 以上,据此认为性能上限源于网络语域本身的固有歧义。多语言模型持续优于单语言模型,在未见语言上零样本性能平均下降 7%(3%–8%)。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.CL
    用多语言深度学习自动识别开放网络上的语域

    研究提出多语言深度学习模型,可在 16 种语言中识别新闻、论坛等网络语域,并发布含超 72,000 篇文档、覆盖 25 种语域层级分类的 Multilingual CORE 语料库。最佳模型多标签分类平均 F1 达 79%,经数据剪枝去除标签不确定文档后升至 90% 以上,表明性能天花板源于网络语域本身的固有歧义。多语言模型持续优于单语言模型,在未见语言上零样本性能平均下降 7%(3%–8%)。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。