跳到正文

#部署/工程

今日 34 条
10月6日周一
10月1日周三
  1. Answer.AI 官方研发博客(RSS)65

    Answer.AI 开源 cachy:缓存 LLM 响应让 notebook 测试提速 60 倍

    Answer.AI 开源 cachy 包,通过修改 httpx 的 send 方法把 LLM 响应缓存到本地文件,无需手写 mock。测试运行从 2 分钟缩短到约 2 秒,并让 CI/CD 测试和 notebook diff 更干净。

    推荐理由:开源工具 cachy 通过拦截 httpx 缓存 LLM 响应,测试从 2 分钟降到约 2 秒,方法可直接迁移到自己的项目。

9月29日周一
9月23日周二
  1. Sam Altman:Blog(RSS)36

    Sam Altman 提出"丰裕智能"愿景:每周造出 1GW AI 基础设施

    Sam Altman 发文提出"丰裕智能"愿景,目标是建成一座每周可产出 1 吉瓦新 AI 基础设施的工厂,并称这一里程碑需数年、需在芯片到机器人各层创新。他举例称 10 吉瓦算力或可用于攻克癌症或为全球每个学生提供定制辅导,并透露未来数月将公布计划与合作伙伴,今年晚些时候谈及融资方式。

9月16日周二
9月10日周三
  1. Thinking Machines Lab:官方博客(RSS)66

    Thinking Machines Lab 解析 LLM 推理非确定性的真正成因并发布批不变 kernel

    Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。

    推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。

9月8日周一
8月30日周六
8月14日周四
  1. OpenAI Developers(RSS)48

    OpenAI API 速率限制指南:RPM、TPM 与用量层级详解

    OpenAI 发布 API 速率限制指南,说明速率限制按组织级和项目级而非用户级设定,并随所用模型不同而变化。限制指标包括 RPM、RPD、TPM、TPD、IPM 及部分流式音频模型的每分钟音频分钟数,任一指标先触顶即受限。付费用量层级分为 Build、Launch、Grow,随累计充值额自动升级,层级越高速率限制越高。

7月30日周三
7月23日周三
7月22日周二
  1. OpenAI Developers(RSS)56

    OpenAI 发布 Flex processing 测试版:以更低价格换取更慢响应

    OpenAI 推出 Flex processing(beta),以更慢的响应速度和偶发的资源不可用换取更低成本,适合模型评估、数据增强和异步等非生产任务。token 按 Batch API 费率计价,叠加 prompt caching 折扣,通过在 API 请求中设置 service_tier 为 flex 使用;资源不足时返回 429 且不计费,官方建议用指数退避重试或改回标准处理。

7月21日周一
  1. OpenAI Developers(RSS)60

    OpenAI 发布 Evals 最佳实践指南

    OpenAI 发布 Evals 最佳实践指南,讲解如何为 LLM 应用设计评估,并宣布 Evals 平台将于 2026 年 10 月 31 日对现有用户转为只读、11 月 30 日关停。指南覆盖从单轮交互到多智能体四种架构中非确定性出现的环节,给出指标型评估、人工评估和 LLM-as-a-judge 的取舍建议,并提醒用 gpt-6-astra 构建 LLM 评审时需先与人工标注校验一致性。

7月18日周五
  1. OpenAI Developers(RSS)61

    OpenAI 开源 openai-testing-agent-demo:用 CUA 模型自动化前端测试

    OpenAI 发布 openai-testing-agent-demo 仓库,演示如何用 CUA 模型和 computer use 工具自动化前端测试。项目包含 frontend、cua-server、sample-test-app 三个应用,通过 Playwright 启动浏览器执行测试用例,MIT 协议开源,官方提醒 computer use 仍处预览阶段,不建议在认证环境或高风险任务中信任。

6月11日周三
  1. Mistral AI:News(网页)50

    Mistral AI 发布 Mistral Compute AI 基础设施服务

    Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成 AI 基础设施,涵盖 GPU、编排、API、产品和服务。该服务与 NVIDIA 合作提供最新参考架构,首批可用数万块 GPU 并计划快速扩张,主打欧洲及美中以外地区的数据主权需求,启动合作伙伴包括 BNP Paribas、Orange、Thales、SNCF 等。

5月7日周三
3月17日周一
3月13日周四
3月7日周五
2月27日周四
2月26日周三
2月21日周五
2月17日周一
2月13日周四
2月10日周一
2月9日周日
1月11日周三
  1. Lilian Weng:Lil'Log(RSS)52

    Lilian Weng 长文解读大型 Transformer 模型的推理优化方法

    Lilian Weng 发布长文综述大型 Transformer 模型推理优化的主要方法,指出 KV cache 内存占用和注意力随序列长度二次增长的推理瓶颈。文章覆盖知识蒸馏、量化(PTQ/QAT、LLM.int8()、GPTQ、SmoothQuant)、结构化剪枝与 N:M 稀疏、MoE 路由改进以及高效注意力架构等方向,并给出 DistilBERT 等具体效果数据。

9月24日周五
  1. Lilian Weng:Lil'Log(RSS)52

    Lilian Weng 长文解读如何在多 GPU 上训练超大模型

    Lilian Weng 在博客中系统讲解在多 GPU 上训练超大模型的方法,覆盖数据并行、模型并行、流水线并行、张量并行和 MoE 等并行范式。文章结合 GPipe、PipeDream、Megatron-LM、GShard、Switch Transformer 等工作分析流水线气泡、门控路由设计,并介绍激活重计算、混合精度训练和 ZeRO 等节省显存的方法。