跳到正文
热点事件持续更新

LLM数学推理能力诊断与修复研究

1 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年10月3日,arXiv cs.LG分类发布一项研究,提出“数学原语”概念及\hlei{}基准,从Discovery、Generation、Digestion、Execution四个维度评估大语言模型的数学推理能力。研究发现,解题准确率掩盖了不同的能力画像,Discovery是数学推理的主要瓶颈。基于此,研究者提出\abs{}原语优先自蒸馏框架,将原语引导的推理选择性迁移至学生模型,在多种模型规模和挑战性基准上持续提升数学推理表现。目前该研究处于预印本阶段,尚未见后续进展报道。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. arXiv:cs.LG(机器学习,全量分类)
    缺失的原语:诊断并修复大语言模型的数学推理能力

    研究者提出"数学原语"概念及 \hlei{} 基准,从 Discovery、Generation、Digestion、Execution 四个维度评估 LLM 的数学推理,发现解题准确率掩盖了不同的能力画像,Discovery 是数学推理的主要瓶颈。基于此提出 \abs{} 原语优先自蒸馏框架,将原语引导的推理选择性迁移至学生模型,在多种模型规模和挑战性基准上持续提升数学推理表现。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。