METR:Blog(网页)·· 13 小时前AI 评分34
METR 悬赏征集用于评测自主 LLM 智能体的多样化高难度任务
Bounty: Diverse hard tasks for LLM agents December 16, 2023 METR (formerly ARC Evals) is looking for (1) ideas, (2) detailed specifications, and (3) well-tested implementations for tasks to measure performance of autonomous LLM agents. Read more
AI 导读
METR(原 ARC Evals)公开悬赏征集用于衡量自主 LLM 智能体能力的任务,包括任务创意、详细规格和经过测试的实现。任务需足够难,人类专业人士完成需超过 2 小时、理想情况超过 20 小时,且最好能通过写代码、命令行等文本交互完成。创意奖励 $20,规格 $200,实现按人工完成成本 3 倍起付并叠加最高 50% 的加分。
来源:METR:Blog(网页) · metr.org