跳到正文
热点事件持续更新

研究者提出AlgoREval基准评测LLM算法代码检索

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究者 Nickil Maveli、Antonio Vergari、Shay B. Cohen 提出并发布基准 AlgoREval,用于单独评估大语言模型的参数化代码检索能力,即模型是真正掌握算法代码还是靠合成或回忆。该基准包含 599 道题,覆盖 77 种经典算法、14 个领域、7 种编程语言和 4 种图输入表示。 研究者在零样本设置下评测了 15 个参数规模 7B–34B 的模型。论文称代码与数据集已公开。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    LLM 是在合成还是回忆?AlgoREval 基准评估算法代码检索能力

    研究者提出 AlgoREval 基准,用 599 道题覆盖 77 种经典算法、14 个领域、7 种编程语言和 4 种图输入表示,在零样本设置下评估 15 个 7B–34B 参数模型的参数化代码检索能力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。