跳到正文

#部署/工程

今日 8 条
9月30日周三
  1. LMSYS:Blog(Chatbot Arena 团队)65

    SGLang 与 Miles 为 Thinking Machines Lab 的 Inkling 提供Day-0支持

    SGLang 团队与 Thinking Machines Lab 合作,为 975B 参数、1M 上下文的多模态模型 Inkling 提供Day-0推理与 RL 支持,并为 Modal 训练的 DFlash 草稿模型提供投机解码。

    推荐理由:原文出自 SGLang 团队,给出针对 Inkling 新架构的具体优化手段和实测吞吐数字,读者可评估其对自建推理或 RL 流程的参考价值。

  2. LMSYS:Blog(Chatbot Arena 团队)71

    SGLang 与 Miles 为 Kimi K3 提供 Day-0 推理与 RL 训练支持

    SGLang 团队与 Miles 宣布在发布当天支持 Moonshot AI 的 Kimi K3,覆盖 SGLang 推理和 Miles RL 训练。K3 是首个 3 万亿参数级的开源模型,2.8T 参数、1M token 上下文,采用 69 层 KDA 线性注意力加 24 层 MLA 的混合架构及 LatentMoE 和 Attention Residuals。

    推荐理由:K3 的混合架构打破了多数推理框架的既有假设,文中给出的内存管理、投机解码与并行方案对同类服务栈有直接参考价值。

  3. LMSYS:Blog(Chatbot Arena 团队)67

    SGLang 为 Meta 30B 多模态模型 Muse Glimmer 提供 Day-0 支持

    SGLang 团队与 Meta Superintelligence Labs 合作,为 30B 参数多模态稠密模型 Muse Glimmer 提供 Day-0 支持,面向本地硬件上的智能体工作流推理。

    推荐理由:原文给出 Muse Glimmer 在 SGLang 上的多硬件部署方案和分平台实测数据,读者可据此评估本地智能体推理的可行配置。

  4. LMSYS:Blog(Chatbot Arena 团队)63

    SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持

    SGLang 团队宣布与 Qwen、阿里百炼、NVIDIA 和 AMD 合作,在 SGLang 和 Miles 中于发布当日支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B。

    推荐理由:原文给出 Qwen3.8 混合注意力架构的推理支撑细节和实测性能数字,读者可据此评估新模型在自建推理栈上的部署可行性。

  5. Liquid AI 模型与工程博客(网页)30

    Liquid AI 发布五套 LFM 本地部署方案演示

    Liquid AI 展示五套基于 LFM 的可运行系统,每套将微调后的 Liquid 模型部署在手机、边缘 GPU 或用户自控 VPC 中,支持断网运行。模型覆盖文本、视觉与音频,量化与推理引擎按目标硬件联合选型并在用户实际硬件上做性能剖析。训练在单张 GPU 上数小时完成,并以留出集评分。

  6. Liquid AI 模型与工程博客(网页)72

    Liquid AI 发布端侧智能体模型 LFM2.5-2.6B

    Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,Base 与后训练版本已在 Hugging Face 开放。

    推荐理由:原文给出完整的四阶段后训练流程、多基准对比和 CPU 与手机端实测速度,读者可据此评估它对端侧 Agent 部署的适配度。

  7. Fireworks AI(网页)83

    Kimi K3 开源发布并上线 Fireworks:2.8T 参数、Day-0 推理与训练支持

    月之暗面的 Kimi K3 以开源权重发布,共 2.8T 总参数、104B 激活参数、896 专家、1M 上下文,并在 Fireworks 上线 Day-0 推理与训练。

    推荐理由:原文汇总了 K3 的参数规格、多项第三方基准成绩和与 Opus 5 的成本对比,读者可据此评估开源模型在自有工作流中的可行性。

  8. Fireworks AI(网页)55

    Fireworks AI 通过三组受控实验给出从 LoRA 切换到 FullFT 前的测试方法

    Fireworks AI 在 Qwen3.5-9B 上用 Placement、寄存器分配和 Nexa VM 三个可自动验证任务做对照实验,提出在把 LoRA 换成 FullFT 前先依次测试数据覆盖、学习率等训练配方和 adapter rank。实验显示单任务场景下调数据或配方基本消除 FullFT 优势,固定预算混合任务中 FullFT 仍领先 4.29 个百分点,并将进一步发布后续实验。

  9. Fireworks AI(网页)67

    Fireworks 实测 DeepSeek V4 Pro 0813:SWE-Bench 达 95.2%,单任务成本约为 Fable 5 的三分之一

    Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。

    推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。

  10. Cursor Blog70

    Cursor 团队分享如何搭建云端智能体开发环境

    Cursor 团队分享为云端智能体搭建开发环境的经验,核心思路是把开发环境当作用户是智能体的产品来做。他们让云端 VM 与本地开发环境对齐,构建 anydev CLI 简化智能体运行服务的流程,并通过 Cursor Cloud MCP 和 Cloud Doctor 自动化功能实现环境的自愈与持续改善。

    推荐理由:Cursor 团队分享了自家云端智能体环境的搭建经验,包含 anydev CLI、Cursor Cloud MCP 等做法和可迁移的判断标准。