跳到正文
原文
Sakana AI:Blog(网页)·· 2025-09-24精选AI 评分78

Sakana AI 发布 ShinkaEvolve:用 LLM 高效进化新算法并开源

ShinkaEvolve: Evolving New Algorithms with LLMs, Orders of Magnitude More Efficiently

AI 导读

Sakana AI 发布开源进化式代码优化框架 ShinkaEvolve(Apache 2.0),用 LLM 进化程序并大幅提升样本效率,技术报告见 https://arxiv.org/abs/2509.19349 。

推荐理由

原文给出四个领域的实测结果和样本效率对比,读者可以据此评估它在自己的研发流程里能替代什么。

正文 · AI 翻译

Image 1

ShinkaEvolve:用LLM进化新算法,效率提升数个数量级

2025年9月25日视频 1 ShinkaEvolve生成的算法找到了最先进的Circle Packing解决方案。
我们推出ShinkaEvolve,一个进化式代码优化框架,它利用LLM发现新算法,并实现了前所未有的样本效率。在上图左侧,我们展示了具有挑战性的Circle Packing任务的进展,右侧则可视化了进化式程序搜索通往最佳程序的路径。

摘要

在Sakana AI,我们受自然界进化原则和集体智能的启发,构建人工智能的未来。自然界的进化是一种高超的搜索算法,历经数千年创造出精妙的解决方案。在我们的工作中,从Evolutionary Model Merge、LLM²、The AI Scientist、Automating the Search for Artificial Life,到Darwin Gödel Machine,我们一贯的主题是将这种不可思议的搜索算法带入AI驱动的发现之中。

Image 2ShinkaEvolve的高层概览。
ShinkaEvolve框架构建一个已评估程序的档案库,生成新程序,并评估其适应度。

Image 3
ShinkaEvolve提供了AlphaEvolve的样本高效替代方案,并在其Circle Packing解决方案上表现更优。 使用LLM的现代进化方法(例如AlphaEvolve)在科学发现方面展现出巨大前景。然而,它们存在一个关键局限:样本效率极低,往往需要数千次尝试才能找到好的解决方案。这使它们速度慢、成本高,并且许多人无法使用。我们想要改变这一点。

在我们的新工作《ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution》中,我们引入了一个新框架,利用LLM进化程序并发现具有最先进性能和惊人效率的新解决方案。

我们已发布技术报告(https://arxiv.org/abs/2509.19349),并将项目开源。代码非常易于使用,我们鼓励你亲自尝试:

GitHub项目:https://github.com/SakanaAI/ShinkaEvolve
论文:https://arxiv.org/abs/2509.19349

介绍ShinkaEvolve

日语词“Shinka”(進化)意为“进化”或“渐进发展”。ShinkaEvolve1是一个开源框架(Apache 2.0许可证),从一开始就旨在解决现有方法的关键局限:样本效率低下及其闭源性质。我们在四个完全不同的领域测试了ShinkaEvolve,结果证明了它的强大、通用性和高效:

1. 数学优化(Circle Packing)

ShinkaEvolve仅用150个样本就为经典的26圆填充问题发现了一个新的最先进解决方案。正如我们论文中的图表所示,与先前工作相比,这是效率上的巨大飞跃。所发现的算法是黄金角螺旋初始化、基于梯度的细化和模拟退火以逃离局部最优的复杂混合体。

Image 4
Circle Packing:ShinkaEvolve发现的解决方案仅在150代内就优于AlphaEvolve的解决方案。

Image 5
ShinkaEvolve在数代中产生的程序进化树。

Image 6
ShinkaEvolve 生成的算法找到了这个最先进的 Circle Packing 解决方案。

2. 智能体系统设计(AIME 数学推理)

我们让 ShinkaEvolve 设计一个用于解决高难度数学竞赛题的智能体脚手架。仅用 75 代,它就演化出一个高效的三阶段架构,采用多样化的专家角色、批判性同行评审以及最终的整合阶段。该设计在 AIME Math 基准上显著优于强基线。此外,该脚手架成功泛化到不同年份、甚至不同底层 LLM 的未见问题上。

Image 7
AIME 智能体脚手架设计:为数学推理演化智能体系统。ShinkaEvolve 照亮了智能体脚手架设计的空间,并发现了一条在数学推理性能与 LLM 查询次数之间权衡的帕累托前沿。

Image 8
ShinkaEvolve 发现的智能体成功泛化到不同年份、甚至不同底层 LLM 的未见问题上。

3. 竞技编程(ALE-Bench)

我们采用最先进的智能体(ALE-Agent)在 AtCoder 启发式竞赛中发现的最佳解决方案,这是一项针对 NP-Hard 优化问题的竞技编程竞赛,并使用 ShinkaEvolve 进一步改进它们。它成功地在多个任务上找到了改进,提升了智能体的平均性能。在一个任务上,其改进如此显著,以至于如果参加比赛,它将获得第 2 名。它为 ALE-Agent 解决方案引入了巧妙的增强,例如高级缓存和新颖的“定向边移动”算子。

Image 9
竞技编程:ShinkaEvolve 为 AtCoder 启发式编程竞赛改进 ALE-Agent 的初始解决方案。

Image 10
使用最佳公开分数(top-1,演化适应度)时,平均性能提升 2.3%,且 ShinkaEvolve 对公开测试用例的过拟合有限。

Image 11Image 12
AtCoder(AHC015)优化问题的结果。左:ALE-Agent 解决方案(分数 762,641),右:Shinka Agent 解决方案(分数:817,371)

4. LLM 训练设计(专家混合)

在一个与 LLM 核心高度相关的领域,ShinkaEvolve 发现了一种用于训练专家混合(MoE)模型的新型负载均衡损失(LBL)函数。仅经过 30 代 ShinkaEvolve,一个新发现的损失函数就超越了由 DeepSeek 团队设计的最先进的“Global LBL”,在七个基准上提升了效率和下游准确率,并泛化到活跃参数多 5 倍的更大 MoE。考虑到训练 LLM 的时间和资源成本,ShinkaEvolve 的效率再次成为这一发现的关键组成部分,展示了其甚至在改进未来几代 AI 模型本身的核心训练策略方面的潜力。

Image 13
改进 LLM 训练:迈向平衡且有效的专家分配。ShinkaEvolve 改进了最先进的负载均衡损失函数,减少了低效的 token 路由(-5.81%)并提高了任务性能(平均 +1.73%)。这种损失的效果仅对特别不平衡的 LLM 层自适应地激活和消失。

加速智能体演化

进化算法并不以样本高效著称。许多进化式 AI 系统虽然强大,却像暴力(随机搜索)引擎一样运行,需要消耗成千上万个样本才能找到好的解。这使得发现过程既缓慢又昂贵。ShinkaEvolve 通过三项协同工作的关键创新,实现了其卓越的样本效率:

  1. 平衡探索与利用:一种程序父代采样技术,能够智能地平衡对已知优质解的利用与对新想法的探索。
  2. 基于新颖性的程序拒绝采样:通过代码新颖性拒绝采样,避免浪费时间评估现有程序的微小、无趣变体。我们计算程序文本嵌入相似度,并利用 LLM 作为新颖性评判器的方法来评判提案的创造性。
  3. 任务相关的语言模型优先级排序:一种基于 bandit 的策略,能够针对当前任务从模型集合中动态选择最佳 LLM,并随着进化进程不断调整。由此,ShinkaEvolve 可以动态选择最合适的 LLM 来推动搜索进展。

我们进行了全面的消融实验,以研究 ShinkaEvolve 每一项方法贡献。更多细节请阅读我们的论文。

Image 14
ShinkaEvolve 方法在 Circle Packing 任务上的消融实验:所引入的新颖性加权采样、自适应 LLM 优先级排序和新颖性拒绝采样这些垫脚石收集动态机制,共同促成了 ShinkaEvolve 的样本效率。

面向科学家和工程师的副驾驶

我们的竞赛编程结果表明,ShinkaEvolve 可以与其他智能体协同工作,作为共同改进者。从长远来看,我们对 ShinkaEvolve 的愿景是成为一款易于使用的伴侣工具,帮助科学家和工程师完成日常工作。例如,在当前形态下,该工具可以帮助机器学习研究人员和工程师进行研究与开发工作。

Image 15
ShinkaEvolve 会生成一份搜索摘要文档,其中包含先前的代码提案摘要、草稿本中列出的一组洞见,以及未来解决方案方向的建议。这可以帮助人类实现进一步的改进。 为了进一步辅助这一过程,我们发布 ShinkaEvolve 时还附带了一个交互式 WebUI,用于可视化解决方案和发现运行过程。

Image 16
ShinkaEvolve 附带一个交互式 Web 界面,用于监控和分析程序进化结果。

未来:开源一个科学发现引擎

我们相信 ShinkaEvolve 可以成为全世界研究人员和从业者的强大工具。通过大幅降低计算和 LLM 查询成本,并提供一个开放、可扩展的框架,我们希望加速广泛科学与工程问题的发现进程。

Image 17
我们的系统正在运行。 展望未来,我们将 ShinkaEvolve 视为未来扩展乃至更宏大目标的基础。我们的框架可以利用所有 AI 模型提供商,其性能和效率已经随着 GPT-5 和 Claude 4.1 等最新 AI 版本的发布而不断提升。

此外,一个引人注目的未来扩展方向是超越人类定义的性能指标,让我们的框架自行生成问题,并对其解决方案提供初步评估,以应对医学和设计等更广泛的领域,在这些领域中,成功并不容易衡量。

通过开源 ShinkaEvolve,我们发布了一个强大的通用发现引擎,希望它能赋能社区,并加速我们工作之外的未来突破。

我们很期待看到社区用它构建出什么!

Image 18

Sakana AI

想打造能改进 AI 的 AI?请查看我们的招聘页面了解更多信息。

脚注

  1. 我们理解 ShinkaEvolve 这个名字对部分日语读者来说可能有点好笑,因为它听起来像 Evolve-Evolve 或 進化ー進化。不过,类似的双语重复词在日本其实相当常见。例如:Nihonbashi bridge 或 Arakawa river。你还能想到其他的吗?🤭↩

© Sakana AI 株式会社

来源:Sakana AI:Blog(网页) · sakana.ai