WUSH-KV:基于数据自适应变换的 KV Cache 量化
WUSH-KV 是一种低比特 KV cache 量化方法,利用矩阵乘积两个因子的二阶统计量构建数据感知变换,分别生成 key 和 value 变换,其中 value 变换折叠进模型权重、key 变换在 RoPE 之后应用。
WUSH-KV 是一种低比特 KV cache 量化方法,利用矩阵乘积两个因子的二阶统计量构建数据感知变换,分别生成 key 和 value 变换,其中 value 变换折叠进模型权重、key 变换在 RoPE 之后应用。
针对 Direct-OPD 用 token 级对数比做稠密监督的缺陷,研究者提出 S²D-OPD,按教师参考 JSD 对学生采样状态排序,屏蔽低散度状态的监督,每条回复仅保留前 10% 状态。在 1.7B 至 8B 的四个学生模型、两组教师模型上,该方法在 AIME 和 HMMT 基准的八种设置中有七种超越稠密 Direct-OPD,另一种持平,且无需额外前向计算。
RIDE(RL-Induced Direction Extrapolation)直接在表征空间外推强化学习带来的变化:在每一层和每个 token 位置计算教师模型与其 RL 前检查点的残差,并将学生隐藏状态回归到沿该残差方向超越教师的目标上。
EvoDuet 是一种双层优化方法,在固定模型参数下让解与搜索查询协同进化,通过检索门让 LLM 判断知识缺口并选择检索新文档、复用已有文档或直接求解。
Imagine3D-LLM 让多模态大模型在图像 token 后附加一小组可学习的 summary tokens,将其解码为紧凑的 3D Gaussian Splatting 表示,并以光度重建损失监督、与标准下一 token 预测目标联合训练。
ThinkV2V 是一个推理驱动的指令引导视频编辑框架,在视觉生成前显式激活 MLLM 思考,通过 MLLM-to-DiT 架构将思考转化为精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并构建了 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,显著超越更大的 10B 规模基线。
论文发现采用分块 KV-cache 压缩的模型存在相位敏感,检索准确率随压缩 stride 周期性波动,弱位置足以翻转答案。在 DeepSeek-V4 系列上,128K tokens 下最优与最差相位组差距达 15 到 40 个点;从零预训练的 0.6B 对照实验显示周期始终跟随 stride,full attention 各位置差距仅 6.1 个点而压缩模型可达 78 个点。
UC Berkeley 等机构发布论文(arXiv:2509.21016),提出合成编程任务套件 DELTA 与两阶段奖励策略,证明 RL 可以让基础模型在 pass@128=0 的任务上出现 grokking 式相变,准确率跳升至约 100%。方法先用逐测试密集奖励脱离全零区,再切换二值全通过奖励巩固策略;迁移实验显示学会的技能可组合外推,但在需要新不变量的变换性变化上较弱。
Prime Intellect 通过对合成推理轨迹做微调来改进在线强化学习的策略初始化,训练出 7B 数学推理模型 INTELLECT-MATH,在多个数学推理基准上超过 Eurus-2-7B-PRIME,并以 10 倍更少的 GPU 小时达到同等性能(47 步 RL 对比 592 步)。
Prime Intellect 推出 TOPLOC,一种用于无信任可验证推理的局部敏感哈希方法,通过对最后隐藏状态张量的 top-k 值进行多项式编码生成证明,再由验证方重算校验。
Prime Intellect 推出 SYNTHETIC-1,基于 DeepSeek-R1 生成 140 万条覆盖数学、编程、软件工程、STEM 和合成代码理解的任务与验证器,目标是构建最大的开源验证推理数据集。
Prime Intellect 发布 SYNTHETIC-1,一个由全球算力贡献者协作生成、基于 DeepSeek-R1 的 200 万条推理轨迹开放数据集,覆盖数学、编码和科学任务,并用任务专属验证器确认正确性。
Prime Intellect 发布开源数据集 SYNTHETIC-2,包含 400 万条经过验证的推理轨迹,覆盖迄今最全面的复杂强化学习任务与验证器。数据由全球算力贡献者通过流水线并行分布式推理生成,3 天内共有 1,253 块 GPU 参与,涵盖 4090 到 H200。
Prime Intellect 发布关于递归语言模型(RLM)的研究文章,认为它是 2026 年应对超长上下文的范式。RLM 让模型通过持久 Python REPL 检查和转换输入数据,并把任务委派给可调用工具、可并行的 sub-LLM,而不直接摘要上下文。
METR 于 2024 年 9 月 12 日发布对 OpenAI o1-mini 和 o1-preview 的初步评估:在通用自主任务套件上两者未超过已评估的最佳公开模型 Claude 3.5 Sonnet,但 METR 表示无法在有限的评估时间内自信地给出能力上界。
METR 发布 RE-Bench 基准,包含 7 个 ML 研究工程环境、71 次人类专家尝试,以及 Claude 3.5 Sonnet 和 o1-preview 智能体的结果,全部开源。
METR 发布对 DeepSeek-R1 的危险自主能力评测,未发现其具备超出 Claude 3.5 Sonnet、GPT-4o 等现有模型的危险能力。
METR 提出用任务长度(按人类专家耗时衡量)来度量 AI 能力,发现 6 年来模型能以 50% 可靠性自主完成的任务长度呈指数增长,翻倍时间约 7 个月。当前模型对耗时 4 分钟以内任务成功率近 100%,超过约 4 小时则不足 10%;Claude 3.7 Sonnet 的 50% 成功率时间视界约一小时。
推荐理由:METR 用人类任务时长衡量智能体能力,给出 6 年约 7 个月翻倍的指数趋势及其外推含义。
METR 对 Claude 3.7 Sonnet 开展初步评估,未发现危险水平的自主能力证据,但模型在提供真实分数信息的 5 项 RE-Bench AI 研发任务上表现出较强能力。
METR 研究者 Vincent Cheng 与 Thomas Kwa 复现了 Google DeepMind 论文第 5 节,用 Claude 4 Sonnet。
METR 研究者发布关于 QA 设置下监控能力(monitorability)的早期研究笔记,测试智能体如何在完成主任务(GPQA 生物题)的同时隐秘完成副任务(数学题)而不被 LLM 监控器发现。
METR 对 DeepSeek 和 Qwen 共六个模型进行初步评估,发现 2025 年年中的 DeepSeek 模型自主能力水平与 2024 年末的前沿模型相当。
METR 基于其时间视野论文,用 logistic 模型分析 GPQA、MATH、Mock AIME、LiveCodeBench、OSWorld、WebArena、Tesla FSD 等 9 个基准,发现各领域普遍呈指数或略超指数增长。
METR 发布研究,复现并改进 Anthropic 的 CoT 忠实性评估,测试 Claude Sonnet 3.7、Claude Opus 4 和 Qwen 3 235B。
METR 发布时间视界估计新版本 TH1.1,任务套件从 170 个增至 228 个(8 小时以上长任务从 14 增至 31 个),评估基础设施从自研 Vivaria 迁移到 UK AI Security Institute 开发的 Inspect,并重新估计了 14 个模型的时间视界。
METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做少量指令跟随微调(240 条样本、约 100K-300K tokens),在分布外任务集 CoTControl 上的 CoT 可控性从平均 2.9% 升至 8.8%。
METR 提出"支出视界"指标,用人类与智能体在优化问题上成本收益曲线的交点来量化智能体优化能力。以 NanoGPT speedrun 为例,人类每提升 1% 训练速度约需 16 小时劳动。
METR 研究人员检视漏洞、数学和算法发现的公开时间序列,判断 LLM 是否加速了整体发现率。漏洞发现明显加速,如 cURL CVE 从 2025 年的 9 个增至 2026 年 6 月 24 日前的 36 个(其中 15 个标注 AI);数学发现有所加速但难以客观衡量,arXiv 数学提交部分领域 12 个月内翻倍;算法优化未见明显加速。
推荐理由:原文汇总多个公开时间序列,比较 AI 对不同领域发现速度的影响,提供了可核查的数据和方法。
Liquid AI 基于 1.3B 的 LFM 模型提出一套后训练方案,通过约 4.5M 样本的 SFT 加短程强化学习,得到 LFM-1.3B-Math,在有限回复预算下实现较强数学推理。SFT 采用 3e-4 学习率、训练 3 个 epoch(约 1000 亿 token),首轮即提升平均性能 36%,后两轮再增 7.6%。该模型无需数学专用预训练,面向边缘设备等资源受限部署。
Epoch AI 的 FrontierMath 是一个由数百道未公开、高难度数学题组成的基准,分为 Tiers 1–4 四个难度层级。Tiers 1–3 覆盖从本科到适合高年级研究生的探索性问题,Tier 4 则是研究级数学。
OpenAI 的 GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,Math-ECI 达 170 创下新纪录,但软件工程 SWE-ECI 为 164,仍落后 Claude Fable 5.1 的 167。
Epoch AI 更新其 AI 基准与能力中心,汇总内部测试与外部数据。GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,Math-ECI 达 170 创纪录,但 SWE-ECI 164 仍落后 Claude Fable 5.1 的 167。该中心还显示,自 2023 年以来同等 AI 性能的成本每季度下降约 47%,年降约 13 倍。
Epoch AI 的 FrontierMath 开放问题基准新增 human + AI 解题状态,用于 AI 有实质贡献但非自主解决的问题。
ARC Prize 官方推出 ARC-AGI-Pub 公开排行榜,使用公开评测集,取消算力限制、允许联网,并提供 15 万美元验证基金,对复现并验证的高分提交报销最高 $2,500 API 费用。
ARC Prize 官方公布 2024 年获奖名单并发布技术报告,共 1,430 支团队提交 17,789 份方案,大奖仍未被认领。the ARChitects 以 53.5% 获第一名并获 2.5 万美元,Kaggle 竞赛期间 ARC-AGI-1 SOTA 从 33% 升至 55.5%(MindsAI 因未开源不符获奖资格)。
ARC Prize 介绍 2024 年 ARC Prize 竞赛末期两个登上 ARC-AGI 公开榜单新 SOTA 的开源方案。
ARC Prize 发布实验性基准 SnakeBench,用 2.8K 场 LLM 贪吃蛇头对头对战测试模型在动态环境中的实时决策与长期策略。o3-mini 与 DeepSeek-R1 在排行榜领先,ELO 分别为 1825 和 1801,推理模型在对阵其他 LLM 时赢下 78% 的对局。代码与结果已开源,完整 50 个 LLM 排行榜见 SnakeBench.com。
ARC Prize 基金会发布 ARC-AGI-2 基准并同步启动 ARC Prize 2025 竞赛,总奖金 100 万美元,Kaggle 赛程为 3 月 26 日至 11 月 3 日。
推荐理由:官方同步给出人机对比分数和成本数据,读者可以据此了解 AI 推理系统在新基准上的真实差距。
ARC Prize 发布 ARC-AGI-2 技术报告,推出比 ARC-AGI-1 更细粒度评估抽象推理的新基准。400 人实测 1,417 个任务全部可被人类解出,平均每题约 2.3 分钟;发布时所有前沿模型成功率不足 5%,而同类模型在 ARC-AGI-1 上通常达 20%-50%。
推荐理由:原文给出人类与当前模型在同一新基准上的实测对比,读者可以据此评估推理能力的差距所在。
ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。
推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。