D2K-Bench:衡量LLM Agent将专家设计转化为GPU内核
热点事件持续更新
D2K-Bench:衡量LLM Agent将专家设计转化为GPU内核
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
研究者 Daifeng Li 等人发布诊断性基准 D2K-Bench,包含 26 项任务、85 个工作负载,用于衡量 LLM 智能体把专家设计指导转化为高效 GPU Kernel 的能力。 在 NVIDIA B200 GPU 上对五个模型测试,有指导与无指导的配对运行共享任务描述、工作负载、工具、硬件和 350 轮预算。结果显示,指导使 130 个模型-任务对的正确率从 93.1% 升至 98.5%,全部 26 项任务的 Performance Score 从 1.46 升至 1.95。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
D2K-Bench:LLM 智能体能否把专家设计转化为高效 GPU Kernel?报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.LGD2K-Bench:LLM 智能体能否把专家设计转化为高效 GPU Kernel?
研究者推出 D2K-Bench,一个包含 26 项任务、85 个工作负载的诊断性基准,用于衡量 LLM 智能体将专家设计指导转化为高效 GPU Kernel 的能力。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。