多语言模型识别网络语域,F1达79%
热点事件持续更新
多语言模型识别网络语域,F1达79%
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Erik Henriksson 等作者发布多语言深度学习模型,可在 16 种语言中识别新闻、论坛等网络语域,并发布含超 72,000 篇文档、覆盖 25 种语域层级分类的 Multilingual CORE 语料库。 研究称最佳模型多标签分类平均 F1 为 79%,经数据剪枝去除标签不确定文档后升至 90% 以上,据此认为性能上限源于网络语域本身的固有歧义。多语言模型持续优于单语言模型,在未见语言上零样本性能平均下降 7%(3%–8%)。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 12:00
用多语言深度学习自动识别开放网络上的语域报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.CL用多语言深度学习自动识别开放网络上的语域
研究提出多语言深度学习模型,可在 16 种语言中识别新闻、论坛等网络语域,并发布含超 72,000 篇文档、覆盖 25 种语域层级分类的 Multilingual CORE 语料库。最佳模型多标签分类平均 F1 达 79%,经数据剪枝去除标签不确定文档后升至 90% 以上,表明性能天花板源于网络语域本身的固有歧义。多语言模型持续优于单语言模型,在未见语言上零样本性能平均下降 7%(3%–8%)。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。