研究审计三款LLM数学题跨语言改编
热点事件持续更新
研究审计三款LLM数学题跨语言改编
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
一项新研究审计了 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将英文数学应用题改编为其他语言时的文化翻译质量。研究者让三款模型把 60 道英文数学应用题改编成孟加拉语、印地语、旁遮普语、乌尔都语、信德语、意大利语和西西里语,共标注 6489 条实体转换进行分析。 研究者称,这套语言覆盖从高资源语言(如意大利语、印地语)到研究较少的信德语、西西里语和旁遮普语。研究由 Parisa Suchdev 和 Juniper Lovato 提交并发布为 v2 版本。
AI 根据报道生成 · 54 分钟前更新
最新进展10月8日 12:00
审计 Claude Opus 4、GPT-4.1 与 Gemini 2.5 Pro 跨语言改编数学应用题的文化翻译质量报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.CL审计 Claude Opus 4、GPT-4.1 与 Gemini 2.5 Pro 跨语言改编数学应用题的文化翻译质量
研究者审计 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将 60 道英文数学应用题改编为孟加拉语、印地语、旁遮普语、乌尔都语、信德语、意大利语和西西里语的表现,标注 6489 条实体转换。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。