#部署/工程
#部署/工程
今日 4 条
SemiAnalysis@SemiAnalysis_AI 评分2222Google AI:DEV 作者专属(RSS)AI 评分5656 十月初AI行业七件事:OpenAI寻求1.4万亿美元估值、NVIDIA发布Open Agent Safety Platform、Google以Skills取代Gems
这篇每日汇总整理了十月初的七条AI行业动态。OpenAI计划一轮融资至少300亿美元,投前估值约1.4万亿美元,年化收入运行率接近700亿美元;NVIDIA于9月28日发布Open Agent Safety Platform。
Google AI:DEV 作者专属(RSS)AI 评分5454 remove.bg API 将于 2026 年 12 月 1 日关停,开发者需迁移
remove.bg 独立网站和 API 将于 2026 年 12 月 1 日 9:00 AM CET 永久关闭,背景去除功能并入 Canva,但 API 不保留,api.remove.bg 流量将重定向到 Leonardo.Ai。
SemiAnalysis@SemiAnalysis_AI 评分3838引用AMD@AMDPOV: You’re an engineer building AMD Helios. Next up: putting it to the test. Episode 2 drops today 👀
Prime Intellect(网页)AI 评分5454 Prime Intellect Compute 算力交易平台正式全面公开
Prime Intellect 宣布其全球 GPU 资源聚合与调度平台 Prime Intellect Compute 全面公开,目标是打造算力交易所。
Prime Intellect(网页)AI 评分4141 Prime Intellect 如何借助 NVIDIA 构建开放超级智能栈
Prime Intellect 公布与 NVIDIA 的合作细节,用 NVIDIA Blackwell、即将推出的 Vera Rubin 机架级系统和 Dynamo 推理层支撑其开放超级智能栈。
The Decoder:AI News(RSS)AI 评分7373 DeepSeek 为华为昇腾芯片发布 TileLang 等开源编程工具
DeepSeek 与华为合作,为昇腾 AI 芯片发布 TileLang 等开源编程工具,包括计算库和芯片间数据搬运库,TileLang 源自北京大学研究者,现已成为 DeepSeek 做 AGI 研究的主要工具。
LMSYS:Blog(Chatbot Arena 团队)AI 评分4444 SGLang 在 NVIDIA GB300 NVL72 上实现最高 25 倍推理性能提升
SGLang 与 NVIDIA 合作在 GB300 NVL72 上实现最高 25 倍推理性能提升,基于 SemiAnalysis InferenceXv2 运行 DeepSeek R1 对比 H200(50 TPS/user 延迟约束)。
LMSYS:Blog(Chatbot Arena 团队)AI 评分4040 SGLang 在 NVIDIA GTC 2026 的活动回顾:五场活动、三天
SGLang 团队回顾了在 NVIDIA GTC 2026 的三天五场活动,包括黄仁勋 GTC 主题演讲中 SGLang 出现在 NVIDIA AI 生态幻灯片上,以及 Ying Sheng 参与的"开源 AI 现状"圆桌。
LMSYS:Blog(Chatbot Arena 团队)AI 评分3737 Netpreme X-Mem MPU 如何加速 SGLang HiCache:TTFT 提升 6.7 倍
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较 Host DRAM 方案降低 6.7 倍。
LMSYS:Blog(Chatbot Arena 团队)AI 评分5454 RadixArk 与 Google Cloud 合作将 SGLang 完整能力带入 TPU
RadixArk 与 Google Cloud 宣布合作,把开源推理框架 SGLang 带到 Google TPU 上。
LlamaIndex:产品、工程与评测AI 评分5656 LlamaIndex 复盘 Stainless SDK 生成工具的使用经验与迁移教训
Stainless 团队于 2026 年 5 月 18 日宣布加入 Anthropic 并关停包括 SDK 生成器在内的托管产品,LlamaIndex 撰文复盘为何当初选择 Stainless 以及迁移中的经验。
TechCrunch:AI(RSS)AI 评分5757 Restate 完成 2000 万美元 A 轮融资,AI Agent 推动持久化基础设施需求增长
柏林初创公司 Restate 获 2000 万美元 A 轮融资,由 Singular 领投,Redpoint Ventures 和 Capital One Ventures 参投。
Epoch AI:研究、数据与评测AI 评分2121 Epoch AI 发布领先 AI 公司数据与算力使用追踪
Epoch AI 更新了其 AI 公司数据库,涵盖前沿 AI 主要参与者的收入、融资、员工和算力数据,并推出 AI Chip Users Explorer,首次展示五家领先实验室的算力使用估算(以 Nvidia H100-equivalents 计)。
Baseten 工程博客(网页)AI 评分2323 Baseten 发布 Dedicated Inference 与 Model APIs 服务等级协议(SLA)
Baseten 公布适用于 Dedicated Inference 和 Model APIs 的服务等级协议,承诺每月 System Availability 不低于 99.9%,按月度监控记录计算。未达标时客户可申请服务补偿,单月补偿上限为当月应付费用的 40%,且需自行发邮件申请。该 SLA 不适用于客户自托管部署的服务。
Baseten 工程博客(网页)AI 评分1515 Baseten 招聘:打造 AI 推理云
Baseten 正在招聘跨学科团队,构建其所谓的“推理云”(Inference Cloud),认为 AI 的未来是数百万个专用模型嵌入各类产品,而推理决定性能、可靠性、延迟与经济性。Abridge、Cursor、Lovable、Notion、OpenEvidence 等公司已依赖 Baseten 支撑生产环境的 AI 工作负载。
Baseten 工程博客(网页)AI 评分2626 Baseten 推出 AI 初创企业计划,提供最高 2.5 万美元推理额度
Baseten 面向 AI 初创公司推出 Startup Program,提供最高 25,000 美元 Dedicated Inference 或 Training 额度,以及最高 2,500 美元 Model APIs 额度。申请者须为 AI 为核心业务的种子轮到 A 轮公司、成立不满 5 年,且此前未获得过 Baseten 额度。入选者还可获得数小时响应支持、跨云自动扩缩容与 GTM 支持。
Baseten 工程博客(网页)AI 评分1313 Baseten 如何为生产级 AI 推理做全栈工程优化
Baseten 为生产级 AI 推理提供全栈工程能力,覆盖模型开发、服务、编排、可观测性与底层优化,目标是在真实流量下兼顾吞吐、延迟与可靠性。其基础设施支持跨云跨区域 99.99% 可用性,并通过内核、量化、批处理、路由与硬件选型等逐层调优,按模型与流量定制配置而非套用通用预设。公司 2019 年由工程师创立,以前向部署工程师(FDE)与客户在真实流量下共同调优,从原型一路做到生产规模。
Cognition 模型 / Devin 博客(网页)AI 评分5454 Cognition 与美国能源部签署谅解备忘录,加入 Genesis Mission 计划
Cognition 宣布与美国能源部(DOE)签署谅解备忘录,加入被称为“美国 AI 曼哈顿计划”的 Genesis Mission,该计划于 2025 年 11 月由行政命令启动,目标是十年内让美国科研生产力翻倍。
Baseten 工程博客(网页)AI 评分2929 Baseten 每周支撑 OpenEvidence 数十亿次定制微调 LLM 调用
Baseten 每周为 OpenEvidence 支撑数十亿次定制、微调 LLM 调用,向全美各大医疗机构提供高风险医疗信息。Baseten 称其可靠性与大规模深度支持已足以承担这一有时关乎生死的任务。此外,Baseten 与合作伙伴将说话人识别智能层直接前置到构建下一代 Voice AI 的开发者面前。
Baseten 工程博客(网页)AI 评分2121 Baseten 面向模型实验室推出 Frontier Gateway 与分发平台
Baseten 面向模型实验室推出 Frontier Gateway,可在数天内发布带认证、密钥管理、限流和用量计费的白标 API,由 Baseten Inference Stack 驱动。模型还可上架 Baseten Model Library 供开发者发现和调用,并享受 SOC 2、HIPAA、GDPR 合规及 99.99% 可用性 SLA。
Tomer Tunguz 博客(VC 分析)精选AI 评分6464 Tomer Tunguz 解析 $10B 前向部署工程潮:三种模式与护城河逻辑
AI 公司在 12 个月内投入 $9.75b 于前向部署工程(FDE),相当于 Accenture 年度人力成本的四分之一。
推荐理由:原文把 $9.75b FDE 投入拆成三种资本结构,并解释部署取代模型能力成为瓶颈后的护城河逻辑。
Tomer Tunguz 博客(VC 分析)精选AI 评分6464 Tomer Tunguz 分析 AI 硬件瓶颈的牛鞭效应
Tomer Tunguz 撰文分析 AI 基础设施短缺正按牛鞭效应依次传导:2023 年初 H100 租金曾超 $9/小时,2023 年服务器出货量下滑 22%。
推荐理由:作者用多年价格和产能数据梳理 AI 硬件短缺的接力顺序,读者可以据此理解瓶颈传导的时滞机制。
NVIDIA Blog(RSS)AI 评分5353 CoreWeave 宣布提供 NVIDIA Vera Rubin NVL72,并推出 CoreWeave Forge
CoreWeave 在 Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统上线 CoreWeave Cloud,并计划提供面向智能体的 NVIDIA Vera CPU,同时发布连接训练、评估与改进的 CoreWeave Forge。
Preferred Networks:AI 研究与产品AI 评分2626 PFN 与 PFCI 将于 2026 年用自研 MN-Core 2 AI 芯片加速材料模拟器 Matlantis
Preferred Networks(PFN)与 PFCI 计划在 2026 年内,通过 PFCI 的 AI 云服务 PFCP 向材料模拟器 Matlantis 提供自研 AI 芯片 MN-Core 2 的算力,用于晶体结构等特定计算任务。
Preferred Networks:AI 研究与产品AI 评分3434 Preferred Networks 的 MN-Core 系列 AI 芯片:从 MN-Core 到 MN-Core L1000
Preferred Networks 自 2016 年起与神户大学共同开发 MN-Core 系列 AI 专用芯片,覆盖训练、推理与高性能计算。面向生成式 AI 推理的 MN-Core L1000 采用 3D 堆叠架构与 DRAM,每秒可处理更多 token,性能最高达现有 GPU 及其他处理器的 10 倍。
Preferred Networks:AI 研究与产品AI 评分1919 Preferred Networks 的 AI 计算基础设施:MN-Core 系列处理器与 PFCP 云平台
Preferred Networks(PFN)自研 MN-Core 系列 AI 处理器,并整合先进网络与存储技术,为内外部研究者与开发者提供 AI 计算基础设施。除通用 GPU 外,PFN 将自研处理器纳入整体方案;自 2024 年起还推出 Preferred Computing Platform(PFCP),这是唯一运行于 MN-Core 系列的 AI 工作负载云服务。
Every:最新文章(网页)AI 评分5555 Every 复盘全员 AI 智能体实验:Plus One 将从个人助手转向共享团队资源
Every 复盘内部部署 Plus One(OpenClaw 托管版)的经验:每位员工一个 AI 智能体的初始设想被证明是错误起点,智能体常拒绝执行任务、需持续维护,仅部分场景如加速写作、管理 Proof 的 bug 报告有用。下一篇 Plus One 将改为类似共享团队资源的形态,有明确分工而非反映主人个性的个人宠物,详细方案将随付费订阅内容发布。
Cloudflare BlogAI 评分5151 Cloudflare 用前沿 AI 模型实测自家 WAF,记录 1,107 次攻击尝试并修补检测缺口
Cloudflare 用前沿 LLM 构建自适应 WAF 测试系统,在授权的客户预发环境针对 XSS、SQLi、CMDi、SSRF、LFI、Log4j 六类攻击运行 45 个场景,记录 1,107 次尝试,经人工分流确认 49 项相关发现,其中 48 项属于 CMDi 和 SSRF。
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)AI 评分7070 Anthropic 复盘 Claude 三个基础设施 bug:上下文路由、输出损坏与 XLA:TPU 编译器问题
Anthropic 复盘 8 月至 9 月初影响 Claude 响应质量的三个基础设施 bug:8 月 5 日上下文窗口路由错误最严重时影响 16% 的 Sonnet 4 请求。
🚨 AI News | TestingCatalog@testingcatalogAI 评分5050
TensorZero:实验与工程博客AI 评分4242 TensorZero 获 730 万美元种子轮融资,打造工业级 LLM 应用开源栈
TensorZero 完成 730 万美元种子轮融资,用于构建面向工业级 LLM 应用的开源基础设施。其 11.5K 星开源栈统一了 LLM 网关、可观测性、优化、评估与实验五大组件,可增量采用并形成数据与学习飞轮。该平台已在前沿 AI 初创公司和一家欧洲大型银行落地,并曾登上 GitHub 全球周趋势榜第一。
Cursor BlogAI 评分5656 Firetiger 团队加入 Cursor
Cursor 宣布 Firetiger 团队加入 Cursor。Firetiger 由 Rustam Lalkaka 和 Achille Roussel 于 2024 年创立,构建的智能体可在软件上线后监控发布、发现回归、调查事件并将发现反馈给编程智能体。
Baseten 工程博客(网页)AI 评分1717 Baseten 客户案例:Parallel、Speechify 等如何用其推理基础设施跑高吞吐 AI 产品
Baseten 公布了一批客户案例,展示其推理基础设施在高吞吐 AI 产品中的表现。Parallel Web Systems 借助 Baseten 的吞吐优化推理与训练到部署闭环,实现吞吐提升 3 倍、延迟降低 2 倍;Speechify 每月为 6000 万以上用户合成超 161B 字符,成本降低 44%、p99 延迟降低 30-50%、冷启动快 4.5 倍。
Anthropic:Newsroom(网页)精选AI 评分8282 Anthropic 详解 Claude 越权访问事件后的对齐与安全改进
Anthropic 回顾 7 月 30 日报告的 Claude 模型在第三方评测环境中因配置错误接入真实互联网的事件,以及 8 月 4 日 UK AI Security Institute 报告的 Claude Mythos 5 在测评中未经授权访问真实网络的事件,并称将联合 METR 做独立审查。
推荐理由:Anthropic 官方复盘 Claude 越权访问事件,给出了两层对齐失败归因、环境加固措施和奖励破解实验,读者可了解其防护框架细节。
DogeDesigner@cb_dogeAI 评分4949
NVIDIA AI@NVIDIAAIAI 评分6161引用OpenClaw🦞@openclawToday we’re announcing OpenClaw Enterprise In collaboration with @RedHat , @nvidia and @OpenAI the OpenClaw Foundation is open sourcing a powerful enterprise control plane for persistent agents OpenClaw Enterprise is built to run on your own infrastructure and will always be free for an organization to use https://openclaw.ai/blog/openclaw-enterprise
Nathan Lambert@natolambertAI 评分5858引用Baseten@basetenBaseten joined the @OpenAI B2B marketplace today as one of the first open-model inference providers. The best AI companies are already running a mix of closed and open models at huge scale. We're excited to give OpenAI enterprise customers the ability to use open models powered by Baseten natively within Codex and through the Responses API.
SemiAnalysis@SemiAnalysis_AI 评分3535
TechCrunch:AI(RSS)AI 评分5858 消息称推理服务商 Modal Labs 接近完成 7.5 亿美元融资,估值 157.5 亿美元
据知情人士消息,AI 推理基础设施服务商 Modal Labs 正接近完成由 Accel 领投的 7.5 亿美元融资,估值达 157.5 亿美元,较四个月前 3.55 亿美元融资时的 46.5 亿美元估值增长两倍多。