跳到正文

#部署/工程

今日 1 条
今天10月1日周四
9月30日周三
  1. TensorZero:实验与工程博客47

    TensorZero:把 LLM 应用看作 POMDP,而不是 Agent

    TensorZero 提出把 LLM 应用建模为部分可观测马尔可夫决策过程(POMDP),而非 Agent,认为应用与 LLM 的接口应是变量间的函数 f:X→Y,而不是提示词与生成结果。该框架由此推导出推理、可观测性、优化、评估与实验的闭环方法,并已开源其生产级子集,还在一项 AI 电话智能体试点中取得显著提升。

  2. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz:OpenRouter 上 GPT-OSS-120b 仍占 Claude Opus 4.8 三分之一流量,token 市场加速分层

    Tomer Tunguz 撰文指出,OpenRouter 数据显示发布于 2025 年 8 月的 GPT-OSS-120b 仍承载 Claude Opus 4.8 约 36% 的日 token 量,GLM 5.2 以每日 495B token 超过前沿模型,token 市场正按成本、速度和准确度分层。

    推荐理由:作者用 OpenRouter 流量数据和自己本地实测,说明 token 市场正按成本、速度与准确度分层,MoE 正在抬高端侧模型上限。

  3. Eugene Yan:Writing40

    AI Engineer Summit 2023 参会反思:LLM 系统落地的评测与成本难题

    首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。

  4. Tomer Tunguz 博客(VC 分析)62

    Tomer Tunguz:专用判定模型让 if-then 分类成本降两个数量级且准确率翻倍

    Tomer Tunguz 撰文提出 AI 正在优化 if-then 判定这一编程原语:Jev(TypeSafe)和 SemIf(MIT 协议开源,配合 Jared Palmer 的 kev)只运行一次注意力计算即从少量输出 token 判定结果,成本比传统 AI 低约 99%。

    推荐理由:作者以自己 agent 的实测数据展示专用小型判定模型可同时大幅降本并提升分类准确率,方法有可迁移性。

  5. Tomer Tunguz 博客(VC 分析)57

    Tomer Tunguz 解析 GPU 租金翻倍而 AI 成本仍下降的原因

    GPU 租赁价六个月内从 $4.40 涨到 $8.08 每卡时,但 AI 价格仍在下降。文章归因于数据中心建设推高电力、材料和信贷成本,需求激增放大竞价;同时模型效率快速提升,Claude Opus 5.5 运行成本降 40%,同一基准的通过成本从 $0.55 降至 $0.0015。Microsoft 称每 GPU 生成的 token 年增 90%,效率与成本两股力量大致相当。

9月29日周二
  1. MIT Technology Review · AI12

    HPE:如何让 AI 从费用变成资产

    HPE 提出企业 AI 从按 token 消费转向自建容量的判断框架:当需求稳定、可预测且规模足够时,拥有算力可能比逐次购买更经济。文中引用 Deloitte 2026 企业 AI 状况报告称,2025 年员工 AI 使用率上升 5%,至少 40% 的 AI 项目进入生产的公司比例预计半年内翻倍。企业需先回答三个问题:需求是否稳定、在什么使用水平下自建更划算、能否通过采用与治理让容量保持高产。

9月28日周一
9月27日周日
9月8日周二
  1. Jensen Huang57

    黄仁勋转发 H100 租金行情并称 NVIDIA 算力是可互换、耐用且高出租率的生产性资产。被引用内容显示,三年前的训练芯片 H100 租金月涨 22% 至 $3.28/小时,与折旧假设相反,市场反而在为这块老芯片支付更高价格。

    引用Ornn@OrnnExchange

    The H100 is a three-year-old training chip. Its rental price is up 22 percent on the month, to $3.28 an hour. Every depreciation schedule assumes a chip this old only loses value. The market is paying up for it instead.

9月2日周三
  1. Microsoft:Official Blog(RSS)46

    微软:AI 基础设施的“良率”命题——从算力投入转向有用智能产出

    微软提出 AI 基础设施的“良率命题”,主张衡量标准应从建了多少算力转向产出多少有用智能。文中指出单个智能体任务消耗的 token 可达普通对话的 3400 倍以上,而全球 AI 渗透率仅为劳动人口的 18%,且以聊天为主。微软认为内存、网络与功耗的瓶颈需通过跨层协同设计解决,而非在单层堆叠资源。

8月30日周日
8月12日周三
  1. Chips and Cheese(RSS)33

    Synopsys 谈芯片设计的物理学:从 3DIC 到热管理

    Synopsys 的 Ravi Subramanian 在 DAC 2026 音频访谈中讨论了芯片设计中的物理学与 EDA 工具,重点谈及 3DIC 与热管理。他指出典型移动 SoC 约 2 到 25 亿门,而典型汽车 ECU 芯片约 70 亿门,功耗已直接影响到电动车续航。随着芯片变大,机械应力等原本的二三阶效应正变成一阶效应,签核需同时考虑机械与电学性能。

7月7日周二
5月4日周一
4月7日周二
  1. Together AI 研究与产品博客(RSS)25

    什么是 AI Native Cloud?

    Together AI 提出 AI Native Cloud 概念,指围绕 AI 全生命周期(预训练、微调、评估、大规模推理)垂直整合的云平台,而非为 Web 应用优化的传统 CPU 云。其核心特征包括从 GPU、NVLink/RDMA 高速互联到训练与推理框架的统一全栈,以及持续吸收前沿研究、快速将研究转化为生产的能力。

9月23日周二
  1. Sam Altman:Blog(RSS)36

    Sam Altman 提出"丰裕智能"愿景:每周造出 1GW AI 基础设施

    Sam Altman 发文提出"丰裕智能"愿景,目标是建成一座每周可产出 1 吉瓦新 AI 基础设施的工厂,并称这一里程碑需数年、需在芯片到机器人各层创新。他举例称 10 吉瓦算力或可用于攻克癌症或为全球每个学生提供定制辅导,并透露未来数月将公布计划与合作伙伴,今年晚些时候谈及融资方式。