#部署/工程
#部署/工程
今日 50 条
ginobefun@hongming731AI 评分4040
SemiAnalysis 长文 RSS(RSS)AI 评分5555 SemiAnalysis 拆解 Intel Panther Lake:18A 的 PowerVia、RibbonFET 与 Foveros-S 实现
SemiAnalysis 拆解 Intel Panther Lake,解析 Intel 18A 首个商用背面供电(PowerVia)、RibbonFET 四层纳米片和 Foveros-S 封装。实测显示 18A 计算逻辑密度与 TSMC N3E GPU 逻辑相近,但不及 N3P、N2 和 Samsung SF2 的峰值密度;NPU 5 面积缩小 36.9%,GPU 高端版本仍用 TSMC N3E。
Peter Steinberger 🦞@steipeteAI 评分3838
ClaudeDevs@ClaudeDevs精选AI 评分6565推荐理由:作者给出 Opus 5.5 相对 Opus 5 的价格降幅,并提供成本计算器,读者可自行估算 Claude Code 任务成本变化。
AWS Machine Learning BlogAI 评分3131 在 Amazon EKS 上用 EFA 和 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 负载,用 DeepEP 优化专家并行(EP)在 EFA 上的 all-to-all 通信,缓解跨节点带宽瓶颈。适用于 RLHF、PPO 和 GRPO 等大规模 RL 训练流程。
AWS Machine Learning BlogAI 评分3131 在 Amazon SageMaker HyperPod 上用 SkyRL 加速多模态 RL 训练
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多轮强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
AWS Machine Learning BlogAI 评分4646 NarrateAI 如何在 Amazon Bedrock 上实现生产级 LLM 质量保障
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 的复杂查询进入并行批处理路径。
AWS Machine Learning BlogAI 评分5757 在 Amazon SageMaker AI 上部署 Qwen3-TTS-12Hz-1.7B-Base 实现实时语音克隆
AWS 博客演示如何通过 SageMaker JumpStart 将 Qwen3-TTS-12Hz-1.7B-Base 部署到实时推理端点,用几秒参考音频和转录文本克隆说话人音色,无需重训模型。
Google Cloud:Databases(RSS)AI 评分4444 Google Cloud 正式发布 Memorystore for Valkey 9.1,QPS 提升至 3 倍
Google Cloud 宣布 Memorystore for Valkey 9.1 正式可用,相比 Memorystore for Redis Cluster 实现最高 3 倍 QPS 且保持微秒级延迟。该版本用无锁多队列消息架构替代列表轮询,并引入两阶段动态线程扩展引擎。新增数据库级 ACL 和拓扑感知的 CLUSTERSCAN 命令。
Databricks:Blog(RSS)AI 评分5252 S&P Global Energy 如何用 Databricks Genie Agents 和 MCP 让结构化数据可对话
S&P Global Energy 在 Databricks 博客详解如何让覆盖 LNG、Chemicals、Crude Oil、Refined Products、Gas & Power 等的结构化数据资产可供 AI 智能体对话。
SemiAnalysis 长文 RSS(RSS)AI 评分6666 SemiAnalysis 发布中国数据中心模型:测算超24GW容量与AI建设热潮
SemiAnalysis 推出 China Datacenter Model,追踪 1,000+ 设施、60+ 运营方,估算中国已建成数据中心容量超 24GW,另有约 20GW 在建管线和 30GW 已公布项目。
AWS Machine Learning BlogAI 评分3333 Amazon SageMaker HyperPod 与 Qumulo 实现跨区域训练
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Native Qumulo(CNQ)与 Cloud Data Fabric(CDF),可让训练集群直接读取另一 AWS Region 或本地数据中心的数据集,无需复制数据或修改代码。
Simon Willison 博客AI 评分3232 Datasette 1.0a41 发布,新增 OpenTelemetry 支持
Datasette 1.0a41 发布,Alec Garcia 为该版本加入了 OpenTelemetry 支持。此版本还将 Datasette 的所有模态对话框重构为单一 Web Component,并已编写文档供其他插件使用。
ClaudeDevs@ClaudeDevsAI 评分5959Databricks:Blog(RSS)AI 评分4747 在 Databricks SQL 中运行开源决策模型 open-Jev
Databricks 展示了如何在 SQL 中直接运行开源决策模型 SemIf-OpenJev,通过 ai_query 对受治理数据做结构化分类。该流程借助 AI Runtime 提供 Serverless GPU 算力,自动下载模型、用 Express Deployments 注册并创建 GPU Model Serving 端点,三步即可从 Notebook 到端点。
AWS Machine Learning BlogAI 评分4545 在 SageMaker AI 上用 WhisperX 实现带说话人标注的转录
AWS 发布 WhisperX Deep Learning Container(DLC),在 OpenAI Whisper 基础上加入 wav2vec2 强制对齐的逐词时间戳和说话人分离,可部署到 Amazon SageMaker AI 实时或异步端点,无需自建镜像。
Google Cloud:Databases(RSS)AI 评分5050 Google Cloud 发布 AlloyDB 智能体数据库架构,支持零到数千节点扩展且不影响生产
Google Cloud 发布 AlloyDB 智能体数据库架构并开放 AlloyDB PostgreSQL for agents 预览,提出隔离、亚毫秒延迟、弹性扩展三大原则。
NVIDIA Blog(RSS)AI 评分88 CONTROL Resonant 登陆 GeForce NOW,DragonSword: Awakening 领衔九款新游
Remedy Entertainment 的 CONTROL Resonant 在发售当日加入 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级云端性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 和最高 5K HDR,无需 100GB 本地安装。
OpenBMB@OpenBMBAI 评分4545FIT-GGUF 为 MiniCPM5-2B 提供可控尺寸的混合精度量化,开发者 @Scorp1o_117 据此构建了 4 个 GGUF 变体,体积从约 1.14 GiB 到 1.46 GiB。
Google Blog:AI(RSS)精选AI 评分6161 Google Project Suncatcher 即将首次在轨测试太空 TPU
Google 宣布 Project Suncatcher 将通过 SpaceX Transporter-18 拼车任务发射首颗原型卫星,测试 Google TPU 能否在太空运行,并与 Planet 合作开发。
推荐理由:原文给出 Project Suncatcher 首次在轨测试安排,以及振动、辐射、散热和星间激光互联的实测进展。
vLLM 官方博客(RSS)精选AI 评分6666 vLLM 支持基于 Gumbel-max 的无损文本水印
vLLM 现已支持基于 Gumbel-max 算法的无失真文本水印,通过 PRF 生成可复现的 keyed 噪声并把 PRNG、Gumbel 变换和 argmax 融合为单个 GPU kernel。
推荐理由:作者亲自实现了 vLLM 的水印功能,给出了算法原理、吞吐实测数据和启用命令,读者可以据此评估在现有推理服务中采用的成本。
SemiAnalysis 长文 RSS(RSS)AI 评分5959 SemiAnalysis 发布 ClusterMAX 3.0 GPU 云评级,覆盖 77 家 neocloud
SemiAnalysis 发布 ClusterMAX 3.0,覆盖 77 家 neocloud 供应商、323 家市场全景,并访谈超 200 名终端用户。Nebius 加入 CoreWeave 进入铂金级,Google Cloud 升入金级,Azure 降至银级,全球仅 19 家获得奖章评级,另新增介于铜级与不合格之间的 Participation Ribbon 级。
Boris Cherny@bcherny精选AI 评分6565引用ClaudeDevs@ClaudeDevsWe made claude.ai 3x faster in two weeks. Here’s how we use Claude to measure, debug and improve performance. Prompts and methods included. https://claude.dev/blog/how-we-made-claude-ai-faster/
推荐理由:Anthropic 团队分享了用 Claude 测量、调试并让 claude.ai 在两周内提速 3x 的具体方法,文中附带了可直接复用的提示词。
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分2727 NVIDIA:如何在 AI 工作负载落地前验证 GPU 集群就绪状态
NVIDIA 指出 GPU 集群即使所有 GPU、网络链路和 pod 均报告健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单个慢速 GPU、负载下性能劣化的链路,或悄悄将流量导向慢速路径的配置。运维人员往往要到训练运行数小时后才会发现问题。
Hugging Face:Blog(RSS)AI 评分3434 如何用 NVIDIA Warp 和 MJWarp 加速机器人仿真与学习工作流
NVIDIA Warp 与 MuJoCo Warp(MJWarp)可将兼容的 MuJoCo 模型扩展到最多 2,048 个并行 GPU 环境,本文以 SO-101 机械臂为例演示从 CPU MuJoCo 工作流迁移到 GPU 批量仿真的过程。
GitHub BlogAI 评分2424 GitHub Copilot 应用如何渲染超大 pull request
GitHub Copilot 应用重建了 pull request 视图,用一个含 2200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按需测量、修正幅度小且锚定在用户当前查看位置,从而避免滚动跳动。
Cohere@cohereAI 评分2626Model Vault 现已在加拿大上线 🇨🇦 对于身处"真北"的用户,现在可以通过自动扩缩容工作负载、单租户部署和更低的 TCO,全面掌控你的 AI。Cohere 模型。完全私有。
eric zakariasson@ericzakariassonAI 评分4141智能体在工作前后喜欢大量读取以收集上下文,所以针对读取做优化会带来很大差别! 如果你在构建智能体,我强烈推荐读一读这个(或者把它交给你的智能体,让它去实现这些发现)
引用Cursor@cursor_aiWe've reduced token costs in Cursor by 7% with no drop in agent quality. Savings came from tighter prompts, selective tool loading, better caching, and compressed file reads.
Microsoft Research 博客(RSS)精选AI 评分6262 微软研究:把物理 AI 推理卸载出机器人可提升任务成功率与续航
微软研究院对移动机器人操作负载做系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现与电池续航。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出了卸载到边缘或云端 GPU 在任务成功率与续航上的量化差异。
Google DeepMind:Blog(RSS)精选AI 评分6060 Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆
Google DeepMind 公布 Private AI Compute 架构更新,将持久化的服务端记忆引入该平台,使 AI 助手能跨设备保留上下文。数据被密封在加密存储中,解锁密钥仅保存在用户个人设备上,模型访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。
推荐理由:Google 公开了 Private AI Compute 的持久化服务端记忆方案,读者可了解云端记忆如何在设备持钥前提下实现。
Together AI 研究与产品博客(RSS)AI 评分6262 Together AI 教程:花 17 美元微调自己的 Jev 式分类模型
Together AI 发布教程,演示如何以 Qwen3.5 4B 为基础模型,用 MultiNLI、BoolQ、Banking77 等 6 个数据源共 37,840 条样本微调一个 Jev 式分类模型,训练成本约 $17.0,耗时约 25 分钟。
NVIDIA@nvidiaAI 评分2727
Pragmatic Engineer(RSS)AI 评分6060 Pragmatic Engineer 解析 Windows 如何在系统层面集成 AI Agent
Gergely Orosz 采访微软 Windows 团队,解析 Windows 在操作系统层面集成 AI Agent 的计划。
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分2727 NVIDIA Topograph:拓扑感知的 GPU 工作负载调度
NVIDIA 推出 Topograph,用于拓扑感知的 GPU 工作负载调度。AI 工厂是功率受限系统,工作负载放置不当会割裂拓扑域、迫使流量走共享链路,降低吞吐并推高作业成本,GPU 还会在等待数据时白白消耗已分配功率。
Claude Code:GitHub Releases(RSS)精选AI 评分6565 Claude Code v2.1.280 发布:新增 Claude Opus 5.5 默认模型
Claude Code 发布 v2.1.280,新增 Claude Opus 5.5(claude-opus-5-5)并设为默认 Opus 模型,支持 1M 上下文,价格 $4/$20 per Mtok、缓存读取 $0.20/Mtok;Pro 和 Team Standard 计划默认模型也从 Sonnet 改为 Opus。
推荐理由:原文列出该版本新增 Claude Opus 5.5 默认模型、MCP 描述长度可配置等改动,读者可对照修复清单决定是否升级。
NVIDIA Blog(RSS)精选AI 评分6262 NVIDIA 发布 Isaac ROS 5.0,为机器人开发引入智能体工作流
NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,为基于 ROS 的机器人开发引入智能体工作流和新的平台支持。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出从 Jetson Orin 到 Thor 的部署路径,可据此判断机器人开发方式的变化。
elsewhere:文章(RSS)AI 评分2222 超聚变提出"智企"与 Token Factory:企业 AI 如何从算力投资走向业务价值
超聚变在 2026 国际探索者大会上提出"智企"概念,并发布 FusionOne AI 企业级 Token Factory 解决方案,贯通算力、模型与 Token 度量运营。
Huawei Cloud@HuaweiCloud1AI 评分4444
Kimi.ai@Kimi_MoonshotAI 评分4848Together AI 研究与产品博客(RSS)AI 评分5252 Together AI 推出 Canary 发布功能,在不中断服务的情况下升级生产模型
Together AI 上线 endpoints rollout 功能,支持 Canary、蓝绿、滚动三种策略在同一端点的两个部署之间迁移流量,实现生产模型不停机升级。