跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 61–65 条 · 共 65 条
9月24日周三
9月10日周三
  1. Thinking Machines Lab:官方博客(RSS)66

    Thinking Machines Lab 解析 LLM 推理非确定性的真正成因并发布批不变 kernel

    Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。

    推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。

7月23日周三
6月16日周一
  1. Sakana AI:Blog(网页)70

    Sakana AI 发布 ALE-Bench 基准与 ALE-Agent,在 AtCoder 启发式竞赛获第 21 名

    Sakana AI 与 AtCoder 合作发布 ALE-Bench 基准,基于 40 道历史 AtCoder 启发式竞赛(AHC)的 NP-hard 优化题,考察长周期迭代式算法工程能力,并开发了专用智能体 ALE-Agent。

    推荐理由:原文给出基准构成、竞赛名次和 agent 的具体改进策略,也如实写了局限,读者可据此评估 AI 做长周期算法工程的现状。

  2. Sakana AI:Blog(网页)70

    Sakana AI 与 AtCoder 联合发布 ALE-Bench 基准及 ALE-Agent,实测竞赛获 21 名

    Sakana AI 与 AtCoder 联合发布组合优化算法工程基准 ALE-Bench,并开发专用 AI 智能体 ALE-Agent,论文见 https://arxiv.org/abs/2506.09050。

    推荐理由:官方一手发布,给出基准构成、竞赛实测名次和 AI 与人类解题方式的差异分析,读者可据此评估长时推理能力的现状。