SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning,这是一款可定制的开源模型,总参数 30B、每 token 仅激活 3B,上下文最长 100 万 token,由 Nemotron 3 Ultra 蒸馏而来。
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning,这是一款可定制的开源模型,总参数 30B、每 token 仅激活 3B,上下文最长 100 万 token,由 Nemotron 3 Ultra 蒸馏而来。
Liquid AI 在 GitHub 上公开了基于 LFM 基础模型和 LEAP SDK 的示例、端到端教程与应用仓库,获 2.5k star。同批仓库还包括语音到语音模型 Liquid Audio、用于减少模型重复循环的偏好数据生成训练工具 Antidoom,以及 LFM 全流程定制仓库和 LeapSDK 的 Kotlin 示例应用。
Liquid AI 官方文档介绍其 Liquid Foundation Models (LFM) 多模态模型家族,面向快速推理和端侧部署,统一支持 32K 上下文(LFM2.5-8B-A1B 为 128K)。
Liquid AI 在 Hugging Face Spaces 上线一批 LFM2.5 演示,包括可在浏览器用 WebGPU 本地运行的 LFM2.5-VL-3B 和端侧 LFM2.5 研究智能体。另有英语拼写检查、多语言 PII 检测、掩码扩散与策略检查等 Space,基于 LFM2.5 或 LFM2.5 Encoder 在 CPU 上运行。
Liquid AI 发布 LFM2.5 模型家族,主打端侧 AI 部署与设备上 Agentic AI,预训练从 10T 扩展到 28T tokens,并通过强化学习扩展后训练流程。
Liquid AI 发布第一代 Liquid Foundation Models(LFM),包括 1.3B、3.1B 密集模型和 40.3B MoE 模型(推理激活 12B 参数)。
Liquid AI 发布 LFM-7B,一款基于 Liquid Foundation Model 非 Transformer 架构的语言模型,面向聊天场景。官方称其在 7B-8B 级别英文、阿拉伯语和日语对话评测中领先,上下文窗口为 32k(RULER 有效长度 32k),内存占用低于同类 Transformer 模型,适合本地、低延迟和成本受限部署。
Liquid AI 发布新一代 Liquid Foundation Models(LFM2),定位市场上最快的端侧生成式 AI 基础模型,采用混合架构,包含 10 个双门控短程卷积块和 6 个分组查询注意力块。
推荐理由:官方博客给出了 LFM2 的架构细节、CPU 推理对比和训练方法,读者可以据此评估它在端侧部署中的实际取舍。
Liquid AI 发布首批视觉语言基础模型 LFM2-VL,包含 LFM2-VL-450M 和 LFM2-VL-1.6B 两个开源变体,面向手机、笔记本、可穿戴等资源受限设备的低延迟部署。
Liquid AI 发布 LFM2 系列目前最大的模型 LFM2-2.6B,共 2.6B 参数,训练使用 10 万亿 token,官方称性能超过 Llama 3.2-3B-Instruct、Gemma-3-4b-it 和 SmolLM3-3B 等 3B+ 级模型。
Liquid AI 发布 Liquid Nanos 系列 350M–2.6B 参数的端侧基础模型,主打在手机、笔记本和嵌入式设备上本地运行,并已在 LEAP 平台和 Hugging Face 上线。
Liquid AI 发布 LFM2-Audio-1.5B,一个支持音频与文本输入输出的端到端基础模型,将 LFM2 家族扩展到音频领域。
Liquid AI 发布 LFM2-8B-A1B,这是其首个端侧 MoE 模型,总参数 8.3B、每 token 激活 1.5B,以约 1.5B 级模型的计算量获得更高的模型质量。
推荐理由:官方详细给出 MoE 架构参数、多基准评测和 CPU/GPU 推理数据,读者可据此评估端侧部署的实际表现。
Liquid AI 发布 30 亿参数视觉语言模型 LFM2-VL-3B,基于 LFM2-2.6B 主干并集成 SigLIP2 400M NaFlex 编码器,现已在 Hugging Face 和 LEAP 平台上线。
Liquid AI 发布 LFM2-ColBERT-350M,一个基于 LFM2 骨干的晚交互检索模型,支持用一种语言存储文档、用其他语言查询检索。在扩展的 NanoBEIR 多语言基准上,其跨语言检索能力显著优于 150M 参数的 GTE-ModernColBERT-v1,尤其在德语、阿拉伯语、韩语和日语上;尽管模型体积更大,查询和文档编码吞吐与对方相当。
Liquid AI 发布 LFM2.5-1.2B 模型家族,称其为迄今最强的边缘 AI 版本,预训练从 10T 扩展到 28T tokens,并大规模引入强化学习后训练。
Liquid AI 发布 LFM2-2.6B-Transcript,专为 30–60 分钟长会议转录的本地总结设计,无需云端,已在 LEAP 和 Hugging Face 开放下载。
Liquid AI 发布可在设备端运行的推理模型 LFM2.5-1.2B-Thinking,手机上内存占用低于 900MB,现已在 Hugging Face、LEAP 和 Playground 提供。
Liquid AI 发布 LFM2-24B-A2B 的早期 checkpoint,总参数 24B、每 token 激活约 2.3B,是迄今最大的 LFM2 模型,开放权重已上线 Hugging Face。
Liquid AI 发布开源桌面智能体 LocalCowork,展示 LFM2-24B-A2B 完全在本地笔记本上执行工具调用,无云端、无 API 密钥、数据不出设备。
Liquid AI 发布 LFM2.5-350M,基于 LFM2 架构,预训练从 10T 扩至 28T tokens 并加入大规模强化学习,Base 和后训练模型已在 Hugging Face、LEAP 和 Playground 开放。
Liquid AI 发布 LFM2.5-VL-450M,是 LFM2-VL-450M 的升级版,新增边界框定位和文本函数调用支持,预训练从 10T 扩展到 28T tokens。
Liquid AI 发布 LFM2.5-8B-A1B 端侧 MoE 模型,上下文窗口从 32,768 扩展到 128K tokens,预训练从 12T 增至 38T tokens,词表翻倍到 128,000 以提升非拉丁文字的编码效率。
推荐理由:官方详细给出上下文、训练管线和实测基准,读者可以据此评估这款端侧 MoE 模型是否适合本地 Agent 工作流。
Liquid AI 发布两款 350M 参数多语言检索模型 LFM2.5-ColBERT-350M 和 LFM2.5-Embedding-350M,是 LFM 家族首批双向模型,支持 11 种语言的跨语言搜索。
Liquid AI 发布其最小的模型 LFM2.5-230M,基于 LFM2 架构,预训练 19T tokens,Base 和 post-trained 版本已在 Hugging Face 开放下载。
Liquid AI 发布基于 LFM2 混合架构的双向编码器 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,支持 8,192 token 上下文,面向分类、自然语言理解和 token 级任务微调,模型已上线 Hugging Face。
Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,Base 与后训练版本已在 Hugging Face 开放。
推荐理由:原文给出完整的四阶段后训练流程、多基准对比和 CPU 与手机端实测速度,读者可据此评估它对端侧 Agent 部署的适配度。
Meta 发布 Muse Glimmer 30B 开源模型(Apache 2.0),并已在 Fireworks 提供 serverless 和按需部署。
推荐理由:原文给出 Muse Glimmer 的架构细节、基准对比和推荐参数,读者可据此评估它是否适合长期运行的多轮 Agent 工作流。
Harvey 发布首个模型 Tenet,基于 Kimi K3 用 Fireworks Training API 的异步强化学习后训练,面向长周期法律工作。
Fireworks AI 用 CyberGym 测评 DeepSeek V4 Pro 0813、Kimi K3、GPT-5.5 和 Claude Opus 4.8,V4 Pro 在 840 个对抗性安全任务中零拒绝、全部产生原生工具调用,进入验证率 97.3%。
Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。
推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。
Genspark 与 Fireworks Lab 合作,将开放权重多模态模型 MiniMax M3 后训练为 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
Fireworks 上线 DeepSeek-V4.1-Flash,在 DeepSWE 上以 74.34% 的 Pass@1 达到 GPT-6 Astra 水平,每任务成本 $0.43,约为 Astra 的 1/15。
推荐理由:原文给出 DeepSWE、Terminal-Bench 2.1 和 HLE 的具体成本与准确率数据,可帮助开发者评估智能体编码工作流的模型选型。
Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。
推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。
Cognition 训练了 SWE-grep 和 SWE-grep-mini 两个快速智能体模型,专攻高度并行的上下文检索,检索能力匹敌前沿编码模型,耗时低一个数量级。
推荐理由:官方公布了模型设计、RL 训练细节和评测数字,读者可以借此了解并行上下文检索的实现路径。
Cognition 发布面向软件工程的 SWE-1.5 模型,参数量为数千亿级,与 Cerebras 合作以最高 950 tok/s 推理,比 Haiku 4.5 快 6 倍、比 Sonnet 4.5 快 13 倍,现已在 Windsurf 上线。
推荐理由:原文给出速度对比、SWE-Bench Pro 成绩和训练细节,读者可以据此评估这款高速编码模型是否改变现有工作流。
Cognition 分享正在训练中的 SWE-1.6 早期预览:当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%(51.7% 对 40.1%),推理速度同为 950 tok/s,并向小部分用户开放早期访问。
Cognition 发布面向软件工程智能体的新模型 SWE-1.6,已在 Windsurf 全面开放,未来 3 个月免费。模型针对智能水平和模型 UX 联合训练,相比 Preview 减少了过度思考、循环行为和串行工具调用,更多使用并行工具调用;训练中引入长度惩罚以抑制过长轨迹。
Cognition 与 Applied Compute 合作 RL 训练了专用 bug 检测模型 SWE-check,在内部 in-distribution 评测中对 Opus 4.6 的 delta F1 从 0.09 降到 0,out-of-distribution 的 delta F1 从 0.49 降到 0.29,同时运行时间快约 10 倍且推理更便宜。
Cognition 发布 SWE-1.7,称其为自己训练过的最强模型,以更低成本达到前沿级智能,已通过 Cerebras(1000 TPS)在 Devin 的 Web、Desktop 和 CLI 中可用。