跳到正文

#部署/工程

今日 41 条
8月26日周三
8月25日周二
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)51

    NVIDIA 发布 CUDA Python 1.0:稳定 API、统一基础与完整平台访问

    NVIDIA 技术博客宣布 CUDA Python 1.0,主打稳定 API、统一基础和对完整平台的访问。文章指出此前 Python 开发者要用 GPU 只有两条现实路径:学 CUDA C++ 写扩展并维护 Python 绑定,或依赖 PyTorch、CuPy、RAPIDS 等上层库,而后者虽有局限却推动了 Python GPU 生态的繁荣。

  2. Hugging Face:Blog(RSS)70

    Gradio gr.Workflow 指南:用节点图搭建并部署 AI 工作流

    Hugging Face 发布 gr.Workflow 实用指南,介绍 Gradio 内置的工作流功能:用户把步骤描述为带类型的节点图,Gradio 提供可拖拽画布,每个节点可单独运行、中间结果可见,同一张图自动成为 REST API 并可一键部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.Workflow 的节点图构建、REST API 调用和 Spaces 部署的完整示例,读者可直接 Duplicate 改造成自己的流程。

  3. Chips and Cheese(RSS)58

    Hot Chips 2026:Nvidia 提出在 RISC-V CPU 上运行 CUDA 的要求

    Nvidia 在 Hot Chips 2026 上介绍将 CUDA 扩展到 RISC-V CPU 的要求,包括 RVA23 Profile、RISC-V 服务器 SoC 与平台规范、ACPI、PCIe 一致性和点对点 PCIe 通信等,并与 SiFive 合作演示运行 CUDA 的服务器系统。作者指出绝大多数现有 RISC-V 硬件尚不满足要求,近期支持可能仅限于服务器级系统。

  4. Mistral AI:News(网页)32

    Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布在 AI 基础设施、先进模型开发和 AI 解决方案部署上展开战略合作,聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。

8月24日周一
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)21

    NVIDIA Vera CPU 如何解决智能体 AI 集群难题

    NVIDIA 发文阐述用 Vera CPU 应对智能体 AI 集群挑战:GPU 负责运行模型,CPU 承担编排、工具执行与沙箱计算。文章指出,与传统负载稳定的运行特征不同,智能体工作负载不可预测且波动极大,AI 工厂的集群经济性取决于整个技术栈将电力与资本转化为已完成智能体任务的效率。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)24

    NVIDIA DSX MaxLPS 如何最大化 AI 工厂每瓦性能

    NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分兆瓦电力,并非每兆瓦都能转化为产生收入的算力。

8月23日周日
8月22日周六
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)26

    NVIDIA 用 GPU 加速的 AdaptGrow 实现大规模金融工具聚类

    NVIDIA 提出 GPU 加速的矩阵分解算法 AdaptGrow,可将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构突变信号,支持单 GPU 与多节点规模。该算法面向量化策略中的投资组合构建、风险聚合、统计套利与交易监控等场景,错误的工具分组会带来问题。

8月21日周五
  1. Together AI 研究与产品博客(RSS)69

    Together AI 实测 GLM-5.3 与 Claude Fable 5 在 DeepSWE 上的成本、编码与路由表现

    Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。

    推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。

  2. Hugging Face:Blog(RSS)62

    Hugging Face 解析 Papers with Code 混合搜索背后的架构实践

    Hugging Face 详解 Papers with Code 论文搜索引擎的架构:用 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合为混合搜索,已为超过 11 万篇 arXiv 论文维护嵌入向量。

    推荐理由:作者亲述 Papers with Code 混合搜索的架构与生产经验,读者可以借鉴其离线批量与在线查询分离的设计方法。

  3. Hugging Face:Blog(RSS)66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。

    推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。

8月19日周三
8月18日周二
  1. Hugging Face:Blog(RSS)33

    同一集群利用率提升 33 个百分点:约束感知 GPU 分配器如何改变分配顺序

    一个约束感知 GPU 分配器在相同硬件与负载下,相比 FIFO 调度器将 GPU 利用率最多提升 33 个百分点,优先级加权产出在全部场景中上升,最高增幅 105%。在五个真实争用场景中,利用率从 52–85% 提升至 72–88%,优先级加权价值平均增长 52%。该分配器把实时推理需求当作随时步变化的曲线而非全天峰值预留,并按优先级在整个调度周期内放置批式任务。

8月17日周一
  1. Together AI 研究与产品博客(RSS)51

    Together AI 推出端点级 LLM A/B 测试功能

    Together AI 在平台上推出端点级 LLM A/B 测试功能,让团队用真实用户流量比较候选模型与现网模型,而非只看 benchmark 或影子流量。实验挂在端点上,须有一个 control 和一至多个 variant,variant 部署权重须为 0,百分比为固定流量份额且与副本数无关。

8月15日周六
8月14日周五
  1. Hugging Face:Blog(RSS)69

    Hugging Face 发布 2026 夏季开源模型生态观察报告

    Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告,指出 Hub 公开模型仓库从 243 万增至 296 万、数据集突破 100 万,但 85.6% 的模型终身下载不足 200 次。

    推荐理由:报告用 Hub 下载、许可证与衍生模型数据区分关注度与真实采用,读者可据此校准自己对开源模型生态的判断。

8月12日周三
  1. Meta Engineering Blog(RSS)56

    WhatsApp 推出端侧 Scam Alert 功能,在端到端加密下实现可验证的诈骗提醒

    WhatsApp 推出可选的 Scam Alert 功能,在设备端运行机器学习模型,对非联系人消息进行诈骗概率分类,消息内容不出设备、不自动上报。模型下载经 Cloudflare Ed25519 签名与第三方 append-only 透明账本校验,遥测数据经 TEE、OHTTP 与差分隐私聚合处理;该功能已在 Beta 有限推出,并扩展了 Bug Bounty 计划。

  2. vLLM 官方博客(RSS)70

    vLLM 宣布 Day-0 支持 Qwen3.8-2.4T-A95B

    vLLM 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是 Qwen 家族首个以开放权重发布的 Qwen-Max 级模型,基于 Qwen 3.5 架构开箱即用。

    推荐理由:原文给出 Qwen3.8-2.4T-A95B 的架构细节、多精度权重和部署要求,读者可据此评估自建推理的成本与硬件门槛。

  3. Chips and Cheese(RSS)33

    Synopsys 谈芯片设计的物理学:从 3DIC 到热管理

    Synopsys 的 Ravi Subramanian 在 DAC 2026 音频访谈中讨论了芯片设计中的物理学与 EDA 工具,重点谈及 3DIC 与热管理。他指出典型移动 SoC 约 2 到 25 亿门,而典型汽车 ECU 芯片约 70 亿门,功耗已直接影响到电动车续航。随着芯片变大,机械应力等原本的二三阶效应正变成一阶效应,签核需同时考虑机械与电学性能。

8月11日周二
  1. Mistral AI:News(网页)60

    Mistral 推出区域推理端点与优先级层,并接入第三方开源模型 GLM-5.2

    Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理端点、SLA 优先级层与第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地方式。

  2. Kimi.ai37

    Kimi K3 现已在 @databricks 上线!

    引用Databricks@databricks

    Moonshot AI's latest open-weight model, Kimi K3, is now available on Databricks through Unity AI Gateway. @Kimi_Moonshot Run Kimi K3 where your data already lives - governed, secure, and ready for custom AI apps and agents built with the data in your Lakehouse. Unity AI Gateway lets you deploy Kimi K3 with enterprise-grade access controls. Govern every call, monitor performance, and scale securely across your AI apps. Test Kimi K3 alongside other frontier models without changing your application code. The open-weight frontier just arrived on Databricks. Try it today. https://www.databricks.com/blog/kimi-k3-moonshot-ai-now-available-databricks-through-unity-ai-gateway

8月10日周一