Upstage 发布 Solar Mini 4:Artificial Analysis 实测 24 分推理模型,单任务成本约为 GPT-6 Luna 的 5 倍
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,Artificial Analysis 智能指数得分 24,高于上代旗舰 Solar Pro 3 的 8 分,每百万 token 定价 $0.10/$0.40。
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,Artificial Analysis 智能指数得分 24,高于上代旗舰 Solar Pro 3 的 8 分,每百万 token 定价 $0.10/$0.40。
xAI 将编码模型 grok-build-0.1 以公开测试形式上线 xAI API,该模型专为智能体编码任务训练,支持 Web 开发、调试和 MCP,也是驱动 Grok Build 的同一模型。
推荐理由:xAI 官方公告给出了 grok-build-0.1 的定位、速度、定价和适配工具,读者可据此评估是否接入自己的编码工作流。
Prime Intellect 启动 INTELLECT-1,称其为首个全球分布式训练的 10B 参数模型,基于 Llama-3 架构,使用超过 6 万亿 token 的数据混合(55% Fineweb-Edu、20% DLCM、20% Stack v2、5% OpenWebMath),并邀请任何人贡献算力。
推荐理由:原文给出INTELLECT-1的训练规模、数据配比和通信优化细节,读者可据此了解全球分布式训练10B模型的可行路径。
Prime Intellect 发布 SYNTHETIC-2,一个基于 DeepSeek-R1-0528 的开源推理数据集,配合全球分布的流水线并行推理运行,支持从消费级 GPU 到 NVIDIA 和 AMD 集群的异构算力贡献。
LMSYS SpecForge 团队与 Ant、Meituan、Nex-AGI、EigenAI 合作发布 SpecBundle Phase 1,为 Llama。
SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。
推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。
Z Lab、Modal 与 SGLang 联合发布 DFlash 推测解码模型及 SGLang 新默认 Spec V2 引擎,为 Qwen 3.5 397B-A17B 提供更低延迟的 LLM 推理服务。
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning,这是一款可定制的开源模型,总参数 30B、每 token 仅激活 3B,上下文最长 100 万 token,由 Nemotron 3 Ultra 蒸馏而来。
Liquid AI 官方文档介绍其 Liquid Foundation Models (LFM) 多模态模型家族,面向快速推理和端侧部署,统一支持 32K 上下文(LFM2.5-8B-A1B 为 128K)。
Liquid AI 发布 LFM2 系列目前最大的模型 LFM2-2.6B,共 2.6B 参数,训练使用 10 万亿 token,官方称性能超过 Llama 3.2-3B-Instruct、Gemma-3-4b-it 和 SmolLM3-3B 等 3B+ 级模型。
Liquid AI 发布 Liquid Nanos 系列 350M–2.6B 参数的端侧基础模型,主打在手机、笔记本和嵌入式设备上本地运行,并已在 LEAP 平台和 Hugging Face 上线。
Liquid AI 发布 LFM2-24B-A2B 的早期 checkpoint,总参数 24B、每 token 激活约 2.3B,是迄今最大的 LFM2 模型,开放权重已上线 Hugging Face。
Liquid AI 发布开源桌面智能体 LocalCowork,展示 LFM2-24B-A2B 完全在本地笔记本上执行工具调用,无云端、无 API 密钥、数据不出设备。
Liquid AI 发布 LFM2.5-350M,基于 LFM2 架构,预训练从 10T 扩至 28T tokens 并加入大规模强化学习,Base 和后训练模型已在 Hugging Face、LEAP 和 Playground 开放。
Liquid AI 发布两款 350M 参数多语言检索模型 LFM2.5-ColBERT-350M 和 LFM2.5-Embedding-350M,是 LFM 家族首批双向模型,支持 11 种语言的跨语言搜索。
Liquid AI 发布其最小的模型 LFM2.5-230M,基于 LFM2 架构,预训练 19T tokens,Base 和 post-trained 版本已在 Hugging Face 开放下载。
Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,Base 与后训练版本已在 Hugging Face 开放。
推荐理由:原文给出完整的四阶段后训练流程、多基准对比和 CPU 与手机端实测速度,读者可据此评估它对端侧 Agent 部署的适配度。
Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。
推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。
Fireworks 上线 DeepSeek-V4.1-Flash,在 DeepSWE 上以 74.34% 的 Pass@1 达到 GPT-6 Astra 水平,每任务成本 $0.43,约为 Astra 的 1/15。
推荐理由:原文给出 DeepSWE、Terminal-Bench 2.1 和 HLE 的具体成本与准确率数据,可帮助开发者评估智能体编码工作流的模型选型。
Cognition 训练了 SWE-grep 和 SWE-grep-mini 两个快速智能体模型,专攻高度并行的上下文检索,检索能力匹敌前沿编码模型,耗时低一个数量级。
推荐理由:官方公布了模型设计、RL 训练细节和评测数字,读者可以借此了解并行上下文检索的实现路径。
World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可在用户交互时实时生成视频,现已以研究预览形式开放浏览器演示。RTFM 在单张 H100 GPU 上以交互帧率运行推理,不依赖显式 3D 表示,作为端到端训练的学习式渲染器工作;它将带位姿的帧作为空间记忆并通过 context juggling 检索邻近帧,使世界在长时间交互中持续存在而不丢失。
GLM-5.3-Flash 出现在 Baseten Base Labs 的模型研究内容中,原始标题仅给出该模型名称,正文为一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。
BAAI/bge-en-icl 是一个文本嵌入模型,输入文本后输出一维嵌入向量,常用于聚类等下游任务并配合向量数据库使用。该模型量化至 FP8 部署,由 Nvidia 最新 GPU(如 H100、H100_40GB 或 L4)支持,量化可选但能带来更高效率。
TypeSafe 发布新模型 Jev,可将自然语言问题直接输出为 0 到 1 的概率或自定义类别,供代码直接调用。它原生支持结构化输出,无需像 DSPy 那样额外引导 LLM,因此速度极快、成本极低,适合在后台为 AI 智能体做实时判定。其实际效果目前仍待验证。
千问(Qwen)团队开源 Qwen3.8-Flash-Next,一个多模态 MoE 模型,被视为 Qwen4 架构的早期预览。模型总参数 125B 加 51B N-gram Embedding,每 token 激活 6B,48 层中含 36 层 GDN 线性注意力和 12 层 QSA 稀疏注意力,MoE 使用 512 专家 top-10 路由。
推荐理由:原文给出该模型混合架构细节和 SGLang 的 day-0 推理支持数据,读者可以据此评估长上下文部署的实际收益。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpot 草稿模型权重,通过投机解码在不改变输出质量的前提下大幅提升解码速度,草稿模型约为 3 亿参数。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以约 280M 参数(增加 8.9% 内存占用)换取更快解码,GPU 解码吞吐最高提升 2.66 倍、边缘设备最高 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍。
Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。
推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。
DeepSeek 在 GitHub 开源 DeepGEMM-Ascend,一个面向华为昇腾 NPU 的简洁高效矩阵乘法算子库。该仓库定位为 Ascend NPU 上的 GEMM 内核实现,延续 DeepGEMM 的轻量高效路线。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更高效、单任务成本更低的 Sonnet 模型,适合范围明确的编码与知识工作。
推荐理由:文章给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它适合承接哪类持续运行的编码任务。
推荐理由:作者给出 Opus 5.5 相对 Opus 5 的价格降幅,并提供成本计算器,读者可自行估算 Claude Code 任务成本变化。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上达 2.5x,分别使用 vLLM 搭配 NVIDIA Dynamo 和 TensorRT-LLM。
SemiAnalysis 在自建 AgentX 智能体推理基准上发布 Rubin 平台首批经核验的实测结果,称在 170 TPS、自有 TCO 口径下,Vera Rubin NVL72 相比 GB300 Dynamo TRTLLM 实现约 67 倍的总吞吐;在更常见的 60-100 TPS 区间为 1.4-3 倍。
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,一个构建在 Qwen/Qwen3.6-35B-A3B 之上的轻量流式安全防护探针,复用基座模型隐藏状态在每个 token 上打分查询意图、回复不安全性与幻觉风险。
蚂蚁 inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3.5-4B 之上的内在流式护栏探针,复用基座模型隐藏状态在每个 token 上输出查询意图、响应不安全度和幻觉风险评分。
蚂蚁 inclusionAI 发布 Hy3-singprobe,一个构建在 tencent/Hy3 上的轻量流式安全探针,复用基座模型隐藏状态在每个 token 上评分查询意图、回复不安全性和幻觉风险。
推荐理由:上线方直接给出参数结构、上下文窗口、KV cache 对比和许可证信息,读者可据此评估实际部署选型。