跳到正文
热点事件持续更新

研究审计三款LLM数学题跨语言改编

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

一项新研究审计了 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将英文数学应用题改编为其他语言时的文化翻译质量。研究者让三款模型把 60 道英文数学应用题改编成孟加拉语、印地语、旁遮普语、乌尔都语、信德语、意大利语和西西里语,共标注 6489 条实体转换进行分析。 研究者称,这套语言覆盖从高资源语言(如意大利语、印地语)到研究较少的信德语、西西里语和旁遮普语。研究由 Parisa Suchdev 和 Juniper Lovato 提交并发布为 v2 版本。

AI 根据报道生成 · 54 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.CL
    审计 Claude Opus 4、GPT-4.1 与 Gemini 2.5 Pro 跨语言改编数学应用题的文化翻译质量

    研究者审计 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将 60 道英文数学应用题改编为孟加拉语、印地语、旁遮普语、乌尔都语、信德语、意大利语和西西里语的表现,标注 6489 条实体转换。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。