WUSH-KV:基于数据自适应变换的 KV Cache 量化
WUSH-KV 是一种低比特 KV cache 量化方法,利用矩阵乘积两个因子的二阶统计量构建数据感知变换,分别生成 key 和 value 变换,其中 value 变换折叠进模型权重、key 变换在 RoPE 之后应用。
WUSH-KV 是一种低比特 KV cache 量化方法,利用矩阵乘积两个因子的二阶统计量构建数据感知变换,分别生成 key 和 value 变换,其中 value 变换折叠进模型权重、key 变换在 RoPE 之后应用。
Agents write application code, but you still get paged at 2am when it breaks. We wanted to know whether AI could handle that part of the job too. Introducing Incident Arena: a benchmark that puts coding agents on call! Check out our paper & full dataset release below!
Google 在 TPU 上通过稀疏注意力内核优化加速视频扩散模型的时空注意力计算。视频扩散中自注意力在单层延迟占比可从 720p 的 55.5% 升至 1440p 的 88.2%。
Prime Intellect 发布 OpenDiLoCo,一个对 DeepMind DiLoCo 方法的开源实现与扩展,代码见 https://github.com/PrimeIntellect-ai/OpenDiLoCo,论文见 https://arxiv.org/abs/2407.07852。
Prime Intellect 推出 TOPLOC,一种用于无信任可验证推理的局部敏感哈希方法,通过对最后隐藏状态张量的 top-k 值进行多项式编码生成证明,再由验证方重算校验。
Prime Intellect 发布开源数据集 SYNTHETIC-2,包含 400 万条经过验证的推理轨迹,覆盖迄今最全面的复杂强化学习任务与验证器。数据由全球算力贡献者通过流水线并行分布式推理生成,3 天内共有 1,253 块 GPU 参与,涵盖 4090 到 H200。
METR 发布对开源权重模型 DeepSeek-V3 的评估报告(2025年2月12日),未发现其具备超越 Claude 3.5 Sonnet 和 GPT-4o 等现有模型的危险自主能力。
Epoch AI 上线 AI chip owners 探索器,基于公司披露和第三方分析师估算全球 AI 算力在主要公司和客户类别间的分布,数据于 2026 年 5 月 12 日更新。该项目追踪的是芯片所有权而非使用情况,多数前沿 AI 开发者的训练和推理芯片并非自有;数据、方法论及按设计商、芯片类型划分的 CSV 数据集均公开可下载。
Zyphra 推出面向持续增长训练语料的增量模糊去重系统 PUFFER,在十小时吞吐测试中处理最多 10 亿文档,较现有 CPU 去重方法提速 11x-35x,单进程 1.75 小时可摄入 10 亿文档,已在超 300 亿文档的生产环境部署,并以 Apache 2.0 开源。
针对 MoE 模型批量解码时专家权重传输开销大的问题,研究者提出 BASE,按“移除某专家对 MoE 层输出的影响”对专家排序,并在校准阶段训练轻量线性预测器估计每个 token 的专家移除代价,配合定制 GPU kernel 完成代价预测与专家选择。
DSpine 是一种在骨干网络各层注入相邻因果条件的投机解码 drafter,通过门控相邻注入把前驱预测特征写入后继位置,使因果条件链随网络深度展开而所有位置并行更新。
Koa-action 是一个面向低延迟原子动作(分类、语义端点检测、布尔判断、打分)的框架,通过引入原子标签 token 与监督微调,把分类变成确定性的单 token 解码。
NVIDIA 联合 SGLang 团队推出 SWE-Serve 基准,从 83 个已合并的 SGLang pull request 中构建 53 个可执行任务,用于评估智能体对推理服务软件仓库级改动的真实效果。
HeadGuard 是一种可组合的注意力头保护方法,通过离线选取约 1/8 的图像敏感与输出敏感 KV 头并保持其图像 key(可选 value)为 BF16 精度,来缓解低比特 KV-Cache 量化对 VLM 精度的损害。
微软研究院对移动机器人操作负载做系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现与电池续航。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出了卸载到边缘或云端 GPU 在任务成功率与续航上的量化差异。
Introducing VC-Attention: fast and accurate low-bit attention without retraining. On MiniMax-H3, VC-Attention speeds up attention by 1.6× on B200 and 1.5× on B300 over FlashAttention-4, with better fidelity than SageAttention2. It also works with existing sparse attention methods. Two key innovations: • V-Smooth reduces value quantization error. • ExpCast-FP8 speeds up softmax. Nunchux Attention, our proprietary extension, pushes the speedup to 1.9× on B200 and 1.8× on B300. Blog: http://www.nunchux.ai/blog/attention-is-the-video-bottleneck Technical Report: http://arxiv.org/pdf/2609.15810 Joint work by researchers at MIT, CMU, UC Berkeley, Stanford, and NVIDIA.
Apple 研究团队提出 Glyph,一个将列描述生成与列类型标注建模为有状态图编排的多智能体 LLM 生产系统。其 Descriptor 通过推理-行动工具循环从企业 GitHub 按需检索管道源码来支撑生成,Tagger 并行运行描述、业务线正则与元数据三种策略,并用 RRF 融合排序结果,从 275 叶节点的数据分类本体中打标。
MIT 研究人员提出 HardFlow,一种在部署阶段即可用于预训练生成模型的即插即用方法,让模型在机器人操作、迷宫导航和文本引导图像编辑等任务中实现完美的硬约束满足,同时解的质量持续优于基线方法。
Multiverse Computing 发布论文 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型做 KL 蒸馏。
SemiAnalysis 发布 AgentX 1.0,称其为全球首个 Apache 2.0 开源、100 万上下文的多轮智能体编码推理基准,投入超过 300 万美元构建数据集。
Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。
推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。
SkyRL 提出 IsoExec,通过跨框架统一执行抽象消除 RL 训练与推理引擎之间的数值不匹配,包含执行契约与对齐的批不变内核两部分,已在 SkyRL 中结合 vLLM 和 Megatron 实现。
Meta 为广告排序提出多阶段序列模型,将离线用户建模与在线排序解耦,并引入稠密 tokenization 与 target-aware attention,使序列模型呈现可预测的 LLM 式缩放定律。该平台已带来 Instagram 转化率 6%、Facebook 转化率 3%、Facebook 广告点击 3.5% 的累计提升,并成为 Meta 生成式广告推荐模型 GEM 的核心组件。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 框架扩展出 MLX 后端,并设计结构化 CUDA-to-MLX 翻译层,让进化式内核搜索把已有 CUDA 内核当作知识库适配到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核搜索的方法与实测数据。
Together AI 联合佐治亚理工、UIUC 和 CMU 推出 ThunderAgent,一种高吞吐智能体推理调度系统,论文被 ICML 2026 接收为 Spotlight。
Together AI 宣布其 9 篇论文入选 ICML 2026(7 月 6 日至 11 日,首尔,展位 B714),覆盖从智能体到 GPU kernel 的全栈研究。
Google 宣布将 Multi-Token Prediction(MTP)改造性地部署到已冻结的 Gemini Nano v3 模型上,并已向 Pixel 9 和 10 系列推送。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境测试数月后,内存占用降低 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用可转为几行 C++ 代码的浅层决策树预测页面 TTL,并在缓存写满时回退到 LRU 淘汰。
MIT 与微软 Azure 研究人员提出智能体工作流优化系统 Murakkab,开发者只需用自然语言描述意图,系统即自动选择模型与工具、并行调度并动态分配云端硬件资源。
Together AI 发布多GPU kernel生成基准 ParallelKernelBench(PKB),含87道源自 Megatron-LM、DeepSpeed、TensorRT-LLM 等真实代码库的问题,任务是将 PyTorch + NCCL 参考实现替换为直接通过 NVLink 通信的 CUDA kernel。
Together AI 发布面向编码智能体的高并发推理基准,用 4×NVIDIA B200 在 Kimi K2.5 上对比 Together Inference Engine、TensorRT-LLM 与 SGLang。
Together AI 提出 DBPlanBench,将 Apache DataFusion 的物理执行计划暴露给 LLM,把查询优化从统计计算转为语义推理。其序列化层将计划压缩约 10 倍,LLM 通过 JSON Patch 做局部改写而非重生成整个计划。
Google Research 发布压缩算法 TurboQuant,在零精度损失下大幅压缩模型体积,可同时用于 KV cache 压缩与向量搜索。它结合 PolarQuant 与 QJL 两种方法:前者通过随机旋转与极坐标量化消除传统量化每块数据需全精度存储常数的内存开销,后者仅用 1 bit 残差纠偏。
Together AI 等团队发布 FlashAttention-4,通过算法与内核协同设计在 Blackwell B200 上最大化 matmul 与其他资源瓶颈的重叠。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力与三项联合训练目标,让扩散语言模型在少步推理下保持质量,并支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
Thinking Machines Lab 发布研究,系统实验表明在满足两个条件时 LoRA 与全量微调(FullFT)样本效率相同、最终性能相当:将 LoRA 应用于所有层尤其是 MLP/MoE 层,且可训练参数量超过数据集信息量。
安全研究员 Johann Rehberger 在 Month of AI Bugs 期间发布 AgentHopper,一个利用 GitHub Copilot、Amp Code、Amazon Q Developer 和 AWS Kiro 间接提示词注入远程代码执行漏洞实现跨智能体传播的 AI 病毒概念验证。