Upstage 发布 Solar Mini 4:Artificial Analysis 实测 24 分推理模型,单任务成本约为 GPT-6 Luna 的 5 倍
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,Artificial Analysis 智能指数得分 24,高于上代旗舰 Solar Pro 3 的 8 分,每百万 token 定价 $0.10/$0.40。
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,Artificial Analysis 智能指数得分 24,高于上代旗舰 Solar Pro 3 的 8 分,每百万 token 定价 $0.10/$0.40。
Artificial Analysis 评测 Google DeepMind 新模型 Gemini 4 Argon,其在 Artificial Analysis Intelligence Index 得 53 分,追平 GPT-6 Astra(max),高于 GPT-6.1 Sol(52),为 Google 超 7 个月来首个高于 Flash 档的专有模型。
推荐理由:第三方评测给出了智能指数、单位任务成本、幻觉率等多项横向数据,可用于比较 Gemini 4 Argon 与竞品的实际表现。
Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。
推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 面向可信网络防御者开放,价格为每百万输入 token $2、输出 token $10,缓存输入 token 为输入价的 5%。
推荐理由:官方公告给出定价、输出 token 上限和多个基准分数,读者可以据此评估它在编码与安全防御场景的落点。
推出 Gemini 4 Argon——我们的全新前沿模型。 它专为编码、企业知识工作和网络安全防御等复杂工作流打造——今天起通过我们的 Fairwind Program 向一批受信任的测试者逐步开放。
xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点提升长程智能体和交互视觉类任务能力,在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平(61 分)。
推荐理由:官方公告给出了各基准对比数字、API 定价和开放入口,读者可据此评估 Grok 4.6 在智能体编码上的位置。
UC Berkeley 等机构发布论文(arXiv:2509.21016),提出合成编程任务套件 DELTA 与两阶段奖励策略,证明 RL 可以让基础模型在 pass@128=0 的任务上出现 grokking 式相变,准确率跳升至约 100%。方法先用逐测试密集奖励脱离全零区,再切换二值全通过奖励巩固策略;迁移实验显示学会的技能可组合外推,但在需要新不变量的变换性变化上较弱。
METR 于 2024 年 9 月 12 日发布对 OpenAI o1-mini 和 o1-preview 的初步评估:在通用自主任务套件上两者未超过已评估的最佳公开模型 Claude 3.5 Sonnet,但 METR 表示无法在有限的评估时间内自信地给出能力上界。
METR 发布 RE-Bench 基准,包含 7 个 ML 研究工程环境、71 次人类专家尝试,以及 Claude 3.5 Sonnet 和 o1-preview 智能体的结果,全部开源。
MiniMax 发布 MiniMax-M2.5,在 SWE-Bench Verified 得分 80.2%、Multi-SWE-Bench 51.3%、BrowseComp 76.3%,完成 SWE-Bench Verified 评测比 M2.1 快 37%,与 Claude Opus 4.6 的 22.9 分钟持平。
推荐理由:官方公布了 M2.5 在编码、搜索和办公场景的成绩与价格细节,读者可以据此比较它与同类模型的性价比。
METR 发布对 DeepSeek-R1 的危险自主能力评测,未发现其具备超出 Claude 3.5 Sonnet、GPT-4o 等现有模型的危险能力。
METR 提出用任务长度(按人类专家耗时衡量)来度量 AI 能力,发现 6 年来模型能以 50% 可靠性自主完成的任务长度呈指数增长,翻倍时间约 7 个月。当前模型对耗时 4 分钟以内任务成功率近 100%,超过约 4 小时则不足 10%;Claude 3.7 Sonnet 的 50% 成功率时间视界约一小时。
推荐理由:METR 用人类任务时长衡量智能体能力,给出 6 年约 7 个月翻倍的指数趋势及其外推含义。
METR 对 Claude 3.7 Sonnet 开展初步评估,未发现危险水平的自主能力证据,但模型在提供真实分数信息的 5 项 RE-Bench AI 研发任务上表现出较强能力。
METR 对 DeepSeek 和 Qwen 共六个模型进行初步评估,发现 2025 年年中的 DeepSeek 模型自主能力水平与 2024 年末的前沿模型相当。
METR 基于其时间视野论文,用 logistic 模型分析 GPQA、MATH、Mock AIME、LiveCodeBench、OSWorld、WebArena、Tesla FSD 等 9 个基准,发现各领域普遍呈指数或略超指数增长。
METR 发布研究,复现并改进 Anthropic 的 CoT 忠实性评估,测试 Claude Sonnet 3.7、Claude Opus 4 和 Qwen 3 235B。
SGLang 团队与蚂蚁集团 DeepXPU 团队宣布在 SGLang 内实现 Diffusion LLM(dLLM)框架,并 Day-0 支持 LLaDA 2.0。
推荐理由:原文给出 SGLang 支持 Block Diffusion LLM 的实现思路和实测吞吐数据,读者可据此评估 dLLM 推理方案的可用性。
LMSYS SpecForge 团队与 Ant、Meituan、Nex-AGI、EigenAI 合作发布 SpecBundle Phase 1,为 Llama。
METR 发布时间视界估计新版本 TH1.1,任务套件从 170 个增至 228 个(8 小时以上长任务从 14 增至 31 个),评估基础设施从自研 Vivaria 迁移到 UK AI Security Institute 开发的 Inspect,并重新估计了 14 个模型的时间视界。
Novita AI 发布基于 SGLang 部署 GLM4-MoE 模型的端到端推理优化方案,TTFT 最高降低 65%,agentic coding 负载下 TPOT 提升 22%,结果在 H200 集群 TP8、FP8 配置下验证。
METR 提出"支出视界"指标,用人类与智能体在优化问题上成本收益曲线的交点来量化智能体优化能力。以 NanoGPT speedrun 为例,人类每提升 1% 训练速度约需 16 小时劳动。
NVIDIA 与 SGLang 团队公布在 GB300 NVL72 上优化 DeepSeek R1-NVFP4 长上下文推理的进展,128K/8K 场景下 SGLang 达到 226.2 TPS/GPU,较 GB200 提升 1.53 倍。
NVIDIA 宣布 Nemotron 3 Super 发布,SGLang 于 Day-0 提供支持。
SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。
推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求智能体 RL 中每一轮的总 token 序列(prompt + response)必须是下一轮 prompt token 序列的逐位完美前缀,以保证训练与推理一致。
Z Lab、Modal 与 SGLang 联合发布 DFlash 推测解码模型及 SGLang 新默认 Spec V2 引擎,为 Qwen 3.5 397B-A17B 提供更低延迟的 LLM 推理服务。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms,降幅 53%。
SGLang 宣布正式支持 DSpark 投机解码算法(PR sgl-project/sglang#30261),覆盖 Qwen3 等稠密模型和 DeepSeek-V4 等稀疏模型。
SGLang 团队为 GLM-5.2 NVFP4 检查点优化推理,在 8xB300(bs=1)上实现超过 500 TPS,两周内完成。默认开启的 Spec V2 重叠调度带来 11% 端到端 TPS 提升,IndexShare MTP 让草稿步成本在长上下文下最多降低约 1.9 倍。
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并新增稀疏的逐位置候选 token 打分流程,避免 O(R²K) 的密集 payload。
SGLang 团队与 Miles 宣布在发布当天支持 Moonshot AI 的 Kimi K3,覆盖 SGLang 推理和 Miles RL 训练。K3 是首个 3 万亿参数级的开源模型,2.8T 参数、1M token 上下文,采用 69 层 KDA 线性注意力加 24 层 MLA 的混合架构及 LatentMoE 和 Attention Residuals。
推荐理由:K3 的混合架构打破了多数推理框架的既有假设,文中给出的内存管理、投机解码与并行方案对同类服务栈有直接参考价值。
Miles 团队在 Miles 中实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8,以及面向 MoE 专家的 per-token NVFP4,覆盖 checkpoint 转换、Megatron 训练、SGLang rollout 与实时权重更新。
LMSYS SpecForge 团队发布 SpecForge v0.3.0,将目标模型推理与草稿模型训练解耦,统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并用 YAML 单一入口配置拓扑。
腾讯混元 AI Infra 与 SGLang 团队宣布,HPC-Ops 的 Attention、Router GEMM 和 MoE 算子已合入 SGLang 主分支。
METR 发文论证 AI 推理应当既"可读"(人类可理解的自然语言)又"忠实"(真实反映模型内部决策过程),认为这有助于发现模型错误、识别隐藏议程、监测欺骗行为。
Liquid AI 发布第一代 Liquid Foundation Models(LFM),包括 1.3B、3.1B 密集模型和 40.3B MoE 模型(推理激活 12B 参数)。
Liquid AI 基于 1.3B 的 LFM 模型提出一套后训练方案,通过约 4.5M 样本的 SFT 加短程强化学习,得到 LFM-1.3B-Math,在有限回复预算下实现较强数学推理。SFT 采用 3e-4 学习率、训练 3 个 epoch(约 1000 亿 token),首轮即提升平均性能 36%,后两轮再增 7.6%。该模型无需数学专用预训练,面向边缘设备等资源受限部署。
Liquid AI 发布可在设备端运行的推理模型 LFM2.5-1.2B-Thinking,手机上内存占用低于 900MB,现已在 Hugging Face、LEAP 和 Playground 提供。
Fireworks AI 发布低成本嵌入模型微调方法,用 InfoNCE 对比学习在平台上微调 Qwen3-Embedding-8B,成本不到 $10、约 150 步。
推荐理由:原文给出用 Qwen3-Embedding-8B 做对比微调的完整配方和三个真实检索任务的实测数据,还总结了哪些场景不会有效。
Fireworks 上线 DeepSeek-V4.1-Flash,在 DeepSWE 上以 74.34% 的 Pass@1 达到 GPT-6 Astra 水平,每任务成本 $0.43,约为 Astra 的 1/15。
推荐理由:原文给出 DeepSWE、Terminal-Bench 2.1 和 HLE 的具体成本与准确率数据,可帮助开发者评估智能体编码工作流的模型选型。