跳到正文

#部署/工程

今日 41 条
8月7日周五
8月6日周四
  1. Meta Engineering Blog(RSS)47

    Meta 广告排序的多阶段序列模型:从用户序列到 LLM 式缩放定律

    Meta 为广告排序提出多阶段序列模型,将离线用户建模与在线排序解耦,并引入稠密 tokenization 与 target-aware attention,使序列模型呈现可预测的 LLM 式缩放定律。该平台已带来 Instagram 转化率 6%、Facebook 转化率 3%、Facebook 广告点击 3.5% 的累计提升,并成为 Meta 生成式广告推荐模型 GEM 的核心组件。

8月5日周三
  1. Google Cloud:Databases(RSS)30

    Target 如何用 Spanner Graph 提升零售发现体验并将数据库维护成本降低 50%

    Target 基于 Spanner Graph 构建企业本体,将图关系、向量嵌入、全文检索与事务数据统一到同一数据库引擎,替代原有 Elasticsearch 加 NoSQL 的碎片化架构。迁移采用零停机四阶段方案,完成后下线旧 Elasticsearch 集群,数据库维护成本降低 50%。该平台为 Gift Finder 等对话式购物助手提供结构化上下文,支撑 GraphRAG 式商品发现。

8月4日周二
8月1日周六
  1. Together AI 研究与产品博客(RSS)82

    Together AI 发布 Kimi K3 开发者完整指南

    Together AI 发布 Kimi K3 开发者指南。Kimi K3 是 Moonshot AI 的 2.8 万亿参数开源权重模型,支持 1M 上下文、KDA 与 AttnRes 架构,API 兼容 OpenAI,定价为缓存命中输入每 1M token $0.30、未命中 $3.00、输出 $15.00。

    推荐理由:Together AI 官方上手指南,覆盖 Kimi K3 的架构要点、推理与缓存等 API 细节和定价,便于开发者直接接入生产。

7月31日周五
7月30日周四
  1. Sierra:Blog(RSS)48

    Sierra 推出 Agency:为 AI 智能体打造安全可扩展的沙箱基础设施

    Sierra 发布 Agency,一个基于 Kubernetes 的智能体沙箱编排层,为 Pinecone 和 Ghostwriter 的每个会话与任务提供安全运行环境。Agency 分无状态控制平面与有状态 runner 两层,通过 IAM 鉴权、DynamoDB 记录状态,每个 runner 配备 8+ 核、24GiB 内存和持久化存储。默认不向智能体暴露任何 API key 或密钥。

7月29日周三
  1. BAIR:Berkeley AI Research Blog62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 框架扩展出 MLX 后端,并设计结构化 CUDA-to-MLX 翻译层,让进化式内核搜索把已有 CUDA 内核当作知识库适配到 Apple Silicon。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核搜索的方法与实测数据。

7月28日周二
7月27日周一
  1. vLLM 官方博客(RSS)72

    vLLM 发布 Kimi K3 Day-0 支持,2.8T MoE 模型最高 370 tok/s

    vLLM 宣布对月之暗面 Kimi K3 提供 Day-0 高效支持。Kimi K3 是 2.8 万亿参数的 MoE 多模态模型,每 token 激活 896 个专家中的 16 个,基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口。

    推荐理由:vLLM 官方详述 Kimi K3 的服务适配与内核优化,读者可以据此了解 2.8T 混合 MoE 的生产部署配方和性能数据。

7月23日周四
  1. Hugging Face:Blog(RSS)69

    Diffusers 原生集成 Nunchaku Lite 4-bit 扩散模型推理

    Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,可像普通模型一样用 from_pretrained() 加载 SVDQuant 4-bit (W4A4) 检查点,无需单独推理引擎或本地 CUDA 编译,内核经 kernels 包从 Hub 下载。

    推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,附带基准数据和自己量化模型的完整流程,适合关注消费级显卡跑扩散模型的读者。

7月22日周三
  1. vLLM 官方博客(RSS)68

    vLLM 预告 Kimi K3 生产级支持:2.8T 参数、1M 上下文与 KDA 前缀缓存方案

    vLLM 发布 Kimi K3 生产级支持的预览博客,正与 Moonshot AI、NVIDIA、AMD 等推进最终集成,计划在 2026 年 7 月 27 日权重发布时提供 day-0 开源服务,包括模型实现、Docker 镜像和部署方案。

    推荐理由:vLLM 团队详解 KDA 混合架构带来的前缀缓存改造与内核优化,对部署混合注意力模型的工程团队有可迁移参考价值。

7月21日周二
7月20日周一
  1. Together AI 研究与产品博客(RSS)49

    Together AI 与 Y Combinator 合作推出首个 YC 专属 GPU 集群

    Together AI 与 Y Combinator 宣布合作推出首个 YC 专属 GPU 集群,为 YC 投资组合中的 AI 初创公司提供推理和训练算力。初创公司可通过 Together 自助门户直接预留和管理 GPU,几分钟内就绪,支持短期冲刺并按长期费率计费,无需长期承诺。该集群目前已满负荷运行,双方计划后续扩展规模。

7月16日周四
  1. Together AI 研究与产品博客(RSS)53

    Together AI 解析 99.9% 推理可用性背后的架构与 SLA 定义

    Together AI 发文解释推理服务 99.9% 可用性的实际含义,自述为 Cursor、Decagon、Cartesia、Yutori 等团队提供推理。文章按层拆解故障模式(计算、网络、存储、软件),说明 99%、99.9%、99.99% 各等级分别要求抗节点故障、抗单数据中心故障和抗区域故障,强调多活双设施部署与自持基础设施的差异。

  2. Sierra:Blog(RSS)67

    Sierra 推出内部云智能体 Pinecone

    Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。

    推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。

  3. Hugging Face:Blog(RSS)61

    IBM Research:模型路由看似简单,实则是系统优化问题

    IBM Research 分享在智能体系统中构建模型路由的经验,认为路由不应被当作分类问题而是系统优化问题。在 AppWorld Test Challenge 上用 CodeAct 智能体实测 417 个任务,Claude Sonnet 4.6 总成本 $79($0.19/任务),反而低于单价更低的 GPT-4.1 的 $155($0.37/任务),差异源于缓存命中。

    推荐理由:作者基于 AppWorld 实测给出路由成本、难度与延迟被低估的三点原因,并分享了可迁移的优化思路。

7月15日周三
7月14日周二
7月13日周一
7月11日周六
7月10日周五
  1. Hugging Face:Blog(RSS)68

    Hugging Face 发布 Profiling in PyTorch 系列第三篇:用 profiler 对比各注意力实现

    Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 profiler trace 对比手写注意力、in-place 掩码、SDPA math/efficient/flash/cuDNN 各后端的 kernel 表现。

    推荐理由:原文用 profiler trace 逐一对比 PyTorch 各注意力实现的 kernel 差异,读者可以学到一套先猜测再看 trace 的可迁移分析方法。