跳到正文

#部署/工程

今日 8 条
7月23日周四
7月22日周三
  1. vLLM 官方博客(RSS)68

    vLLM 预告 Kimi K3 生产级支持:2.8T 参数、1M 上下文与 KDA 前缀缓存方案

    vLLM 发布 Kimi K3 生产级支持的预览博客,正与 Moonshot AI、NVIDIA、AMD 等推进最终集成,计划在 2026 年 7 月 27 日权重发布时提供 day-0 开源服务,包括模型实现、Docker 镜像和部署方案。

    推荐理由:vLLM 团队详解 KDA 混合架构带来的前缀缓存改造与内核优化,对部署混合注意力模型的工程团队有可迁移参考价值。

7月21日周二
7月20日周一
  1. Together AI 研究与产品博客(RSS)49

    Together AI 与 Y Combinator 合作推出首个 YC 专属 GPU 集群

    Together AI 与 Y Combinator 宣布合作推出首个 YC 专属 GPU 集群,为 YC 投资组合中的 AI 初创公司提供推理和训练算力。初创公司可通过 Together 自助门户直接预留和管理 GPU,几分钟内就绪,支持短期冲刺并按长期费率计费,无需长期承诺。该集群目前已满负荷运行,双方计划后续扩展规模。

7月16日周四
  1. Together AI 研究与产品博客(RSS)53

    Together AI 解析 99.9% 推理可用性背后的架构与 SLA 定义

    Together AI 发文解释推理服务 99.9% 可用性的实际含义,自述为 Cursor、Decagon、Cartesia、Yutori 等团队提供推理。文章按层拆解故障模式(计算、网络、存储、软件),说明 99%、99.9%、99.99% 各等级分别要求抗节点故障、抗单数据中心故障和抗区域故障,强调多活双设施部署与自持基础设施的差异。

  2. Sierra:Blog(RSS)67

    Sierra 推出内部云智能体 Pinecone

    Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。

    推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。

  3. Hugging Face:Blog(RSS)61

    IBM Research:模型路由看似简单,实则是系统优化问题

    IBM Research 分享在智能体系统中构建模型路由的经验,认为路由不应被当作分类问题而是系统优化问题。在 AppWorld Test Challenge 上用 CodeAct 智能体实测 417 个任务,Claude Sonnet 4.6 总成本 $79($0.19/任务),反而低于单价更低的 GPT-4.1 的 $155($0.37/任务),差异源于缓存命中。

    推荐理由:作者基于 AppWorld 实测给出路由成本、难度与延迟被低估的三点原因,并分享了可迁移的优化思路。

7月15日周三
7月14日周二
7月13日周一
7月11日周六
7月10日周五
  1. Hugging Face:Blog(RSS)68

    Hugging Face 发布 Profiling in PyTorch 系列第三篇:用 profiler 对比各注意力实现

    Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 profiler trace 对比手写注意力、in-place 掩码、SDPA math/efficient/flash/cuDNN 各后端的 kernel 表现。

    推荐理由:原文用 profiler trace 逐一对比 PyTorch 各注意力实现的 kernel 差异,读者可以学到一套先猜测再看 trace 的可迁移分析方法。

7月8日周三
  1. Hugging Face:Blog(RSS)63

    Hugging Face 发布 native-speed vLLM transformers 后端

    Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。

    推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。

7月7日周二
  1. Hugging Face:Blog(RSS)63

    Hugging Face 模型上线 Microsoft Foundry Managed Compute,数千个开源权重模型可一键部署

    Microsoft Build 2026 上宣布 Foundry Managed Compute 以及 Hugging Face 模型精选目录,数千个开源权重模型每周更新,可一键部署到 Foundry Managed Compute,支持 NVIDIA A100、H100 和 AMD MI300X。

    推荐理由:原文完整说明了精选模型目录、策展管线和运行时选择,读者可以据此评估在私有网络内部署开源模型的路径。

  2. Hugging Face:Blog(RSS)67

    SkyPilot 与 Hugging Face 联合推出 store: hf,Hub 存储成为一等后端,多云读取零出口费

    SkyPilot 与 Hugging Face 联合推出 store: hf,把 Hugging Face Storage 作为 SkyPilot 的一等存储后端,用一个 hf:// URL 和现有 HF_TOKEN 即可把 Bucket 或 Hub 仓库挂载进任意云上的任务。

    推荐理由:两家联合发布 store: hf,给出了零出口费读取、MOUNT/COPY 用法和实测写入速度,读者可以据此评估多云 GPU 训练的存储方案。

7月6日周一
7月1日周三
6月30日周二
6月29日周一
6月27日周六
6月25日周四
  1. Google Research47

    Google 用线性弹性缓存优化云成本,Spanner 内存占用降 15.5%

    Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境测试数月后,内存占用降低 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用可转为几行 C++ 代码的浅层决策树预测页面 TTL,并在缓存写满时回退到 LRU 淘汰。

6月23日周二
6月16日周二
6月12日周五