跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

114条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 101–114 条 · 共 114 条
6月5日周五
  1. vLLM 官方博客(RSS)69

    vLLM Semantic Router v0.3 Themis 发布:从信号到有状态的生产级路由

    vLLM Semantic Router 发布 v0.3 版本 Themis,推出规范化 v0.3 配置契约、投影机制和首个生产可用的会话感知智能体路由(SAAR),并强化协议兼容、仪表盘运维控制台与 CLI。

    推荐理由:版本把信号、投影、决策到模型选择收敛为统一契约,并引入会话感知路由,适合关注生产级流量治理的团队参考。

6月4日周四
  1. vLLM 官方博客(RSS)67

    NVIDIA Nemotron 3 Ultra 在 vLLM 获 Day-0 支持

    NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。

    推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。

5月11日周一
  1. Together AI 研究与产品博客(RSS)68

    Together AI 解析 DeepSeek-V4 服务化:百万 token 上下文为何是推理系统工程问题

    Together AI 发文解析 DeepSeek-V4 的服务化挑战,认为其核心变化是在 token 轴压缩 KV cache 的混合注意力设计(CSA、HCA、SWA),使模型支持 1M token 上下文窗口。

    推荐理由:原文基于 Together 在 HGX B200 上的实际 bring-up,给出 KV cache 布局和缓存策略如何决定 DeepSeek-V4 长上下文吞吐的具体经验。

5月6日周三
5月4日周一
4月29日周三
4月27日周一
  1. DeepSeek66

    DeepSeek 宣布即刻起整个 API 系列的输入缓存命中价格降至原价的 1/10。图中显示 DeepSeek-V4-Pro 缓存命中输入价为 $0.003625,DeepSeek-V4-Flash 为 $0.0028;DeepSeek-V4-Pro 75% 折扣促销持续至 2026 年 5 月 5 日 15:59(UTC)。

    推荐理由:官方公布 API 缓存命中输入价格降至原价十分之一,并给出各型号具体单价,可据此估算构建成本变化。

1月28日周三
  1. Mistral AI:News(网页)62

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,搭载 Devstral 2

    Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新增自定义 subagents、多选项澄清、slash 命令技能、统一 agent 模式和自动更新;产品现已在 Le Chat Pro 和 Team 套餐开放,支持按量付费或自带 API key。

    推荐理由:官方宣布 Mistral Vibe 2.0 上线,列出 subagents、slash 命令技能等新能力和 Le Chat Pro/Team 套餐与 Devstral 2 定价,读者可据此评估工作流适配。

1月22日周四
10月1日周三
  1. Answer.AI 官方研发博客(RSS)65

    Answer.AI 开源 cachy:缓存 LLM 响应让 notebook 测试提速 60 倍

    Answer.AI 开源 cachy 包,通过修改 httpx 的 send 方法把 LLM 响应缓存到本地文件,无需手写 mock。测试运行从 2 分钟缩短到约 2 秒,并让 CI/CD 测试和 notebook diff 更干净。

    推荐理由:开源工具 cachy 通过拦截 httpx 缓存 LLM 响应,测试从 2 分钟降到约 2 秒,方法可直接迁移到自己的项目。

9月10日周三
  1. Thinking Machines Lab:官方博客(RSS)66

    Thinking Machines Lab 解析 LLM 推理非确定性的真正成因并发布批不变 kernel

    Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。

    推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。

7月23日周三
5月7日周三
3月7日周五