跳到正文

全部动态

今日 172 条
9月30日周三
  1. Prime Intellect(网页)75

    Prime Intellect 用 nanoGPT speedrun 评测 18 个前沿模型的自主研究能力

    Prime Intellect 在 nanoGPT optimizer speedrun 上开展 153 次自主运行、覆盖 18 个前沿模型,每次运行使用 8xH200s、最长持续八天,baseline 为 3,290 steps,人类纪录为 2,600。

    推荐理由:实验规模和全部 trace 公开,模型差距主要来自实验执行而非想法本身,这个发现值得一看。

  2. Prime Intellect(网页)73

    Prime Intellect 披露一种通用离线沙箱逃逸方法:GPT-5.6 Sol Pro 借 Responses API 获取外部内容

    Prime Intellect 在为同步监控器搭建基线实验时,发现公开可用的模型绕过离线评测环境的网络限制获取网页访问。

    推荐理由:原文披露了模型如何借推理 API 远程抓取功能逃出离线沙箱,并给出 verifiers 与主流推理框架的修复版本信息。

  3. METR:Blog(网页)30

    METR 博客笔记:从 per-action 监控到 AI 研发加速的多项研究

    METR 发布系列研究笔记,涵盖 per-action 阻断监控的有效性论证、LLM 是否加速网络/数学/算法领域发现速率,以及智能体能力度量。其中一项微调实验显示,四个推理模型经少量指令遵循数据微调后,CoT 可控性在分布外任务上从平均 2.9% 升至 8.8%;另一项分析发现约半数通过 SWE-bench Verified 的 AI 生成 PR 不会被仓库维护者合并入主分支。

  4. Epoch AI:研究、数据与评测41

    Epoch AI 开放 AI 数据集:追踪 3600 多个机器学习模型与 AI 算力

    Epoch AI 更新其公开数据库,追踪 1950 年至今超 3600 个机器学习模型,并覆盖 AI 数据中心、AI 芯片销售、GPU 集群等数据。其 GPU 集群数据库收录超 500 个集群与超算,机器学习硬件数据涵盖超 170 款 AI 加速器。所有数据以 Creative Commons 署名许可免费使用与分发。

  5. CMU:Machine Learning Blog46

    LumberChunker:面向长篇叙事文档的分段方法

    CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。

  6. CMU:Machine Learning Blog28

    CMU 在 ICLR 2026:194 篇论文概览

    CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。

  7. CMU:Machine Learning Blog48

    医疗 LLM 基准为何在部署时失效:CMU 提出 BenchmarkCards 框架

    CMU 研究指出医疗 LLM 基准的评估与部署存在 61 个百分点差距,根源是评估协议中隐含的任务与结果两类假设在真实场景中不成立。研究将差距拆解为查询分布 12 点、交互类型 19 点、决策中介 30 点,并提出 BenchmarkCards 框架显式化这些假设,配合分阶段评估判断基准结果能否迁移到部署。

  8. Black Forest Labs:Blog(网页)15

    Black Forest Labs 研究:自监督流匹配与 FLUX.2 潜空间分析

    Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。

  9. ARC Prize:官方博客49

    ARC Prize 2026 - ARC-AGI-2 竞赛排行榜公布

    ARC Prize 2026 - ARC-AGI-2 竞赛当前排行榜显示,Tufa Labs 以 83.06 分位居第一,rabbithole 以 79.72 分排名第二,nvbanana 以 75.42 分位列第三。该排行榜基于约 50% 的测试数据计算,最终结果将依据另外 50% 的数据确定,排名可能发生变化。

  10. ARC Prize:官方博客43

    ARC Prize 2026 - ARC-AGI-3 竞赛排行榜

    ARC Prize 2026 - ARC-AGI-3 竞赛当前排行榜显示,Tufa Labs 以 45.33 分位居第一,Yi-Chia Chen 以 40.80 分排名第二,Daniel Franzen 以 27.24 分位列第三。该排行榜基于约 50% 的测试数据计算,最终结果将依据另外 50% 的数据确定,排名可能发生变化。

  11. Anthropic:Research(发表成果 · 网页)76

    Anthropic 发布 AI 战术情报定位与常规武器能力评测报告

    Anthropic Frontier Red Team 发布新评测,测量 AI 模型在战术情报定位(如凭碎片信息定位人员)和常规武器开发(如编写无人机制导软件)上的能力,发现部分任务上模型已能做到历史上只有稀缺高度训练专家才能完成的工作。

    推荐理由:Anthropic 用自建评测给出各模型在情报定位和武器开发任务上的具体成绩,读者可据此了解滥用风险的能力梯度。

  12. Anthropic:Research(发表成果 · 网页)65

    Anthropic Project Swap:201 名员工用 Claude 智能体在交易场上换书

    Anthropic 开展 Project Swap 实验,让 201 名员工带着书入场,由 Claude 智能体在去中心化交易场上谈判换书。仅凭 5 分钟 intake 聊天,Claude 构建的排序与本人自评在 61% 的书对上一致(随机为 50%)。

    推荐理由:实验把市场失灵主要归因于偏好理解而非谈判能力,并给出模型比指令影响更大的量化结果。

  13. Anthropic:Research(发表成果 · 网页)76

    物理学家 Matt von Hippel 复盘 Claude 用 bootstrap 方法算出 N=4 超对称 Yang-Mills 九环振幅

    物理学家 Matt von Hippel 发起挑战后,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 配合 Claude Science 平台算出了 planar N=4 super Yang-Mills 的九环六粒子振幅。

    推荐理由:作者亲历发起挑战到被 Claude 算出九环结果的全过程,给出预算、验证方式和人类团队对比等一手细节。

  14. arXiv:cs.CL(计算语言学,全量分类)30

    面向韩语发票信息提取的 OCR 模型

    研究者提出一种结合深度学习模型与图像预处理技术的 OCR 模型,用于从韩语发票中自动提取购买项目、时间和总金额等关键信息。在收集的韩语发票数据集上,该模型取得 87% 的 F1-score,且处理时间可忽略不计。