跳到正文

#部署/工程

今日 41 条
9月30日周三
  1. Baseten 工程博客(网页)21

    Baseten 推出 Embeddings 推理服务:支持任意嵌入模型与弹性扩缩容

    Baseten 上线 Embeddings 服务,可用任意嵌入模型快速处理数百万数据点,支持自定义 Docker 镜像、Truss 库和 Baseten Chains。该服务覆盖 BGE、Stella、SFR-Embedding、Nomic、NV-Embed、Voyage 等模型系列,面向语义搜索与推荐系统,提供五个 9 可用性、优化冷启动和弹性自动扩缩容,可缩容至零以节省成本。

  2. Baseten 工程博客(网页)13

    Baseten 解读 Compound AI:用多模型组合替代单体大模型

    Baseten 工程博客提出 Compound AI 系统,主张用多个专用模型组合替代庞大的全能单体模型,以获得更快、更便宜的推理。该系统让模型之间直接互相调用,减少网络开销、额外延迟和出网成本,并让每个步骤独立使用自动扩缩容的 GPU。文中列举的典型场景包括 AI 电话呼叫、AI 智能体和 RAG 流水线。

  3. Baseten 工程博客(网页)18

    Baseten 图像生成推理服务:支持 FLUX.1 dev 与 SDXL Lightning

    Baseten 推出面向图像生成模型的推理服务,支持部署 FLUX.1 dev、SDXL Lightning 等开源模型及用户微调、自定义模型,兼容 ComfyUI 等框架。SDXL Lightning 可在 4 个 UNet 步内生成 1024x1024 图像,接近实时出图。平台提供弹性自动扩缩容、冷启动优化,并支持 SOC 2 Type II、HIPAA、GDPR 合规部署。

  4. Baseten 工程博客(网页)21

    Baseten 的前向部署工程师:从 POC 到规模化的嵌入式推理支持

    Baseten 推出前向部署工程师(forward deployed engineers)团队,以嵌入式工程方式帮客户架构系统、部署并优化模型。该团队提供跨云自动扩缩容与 99.99% 可用性保障,并针对不同模态应用推理栈优化,代码归客户所有。服务覆盖从 POC 到规模化的全过程,持续引入社区最新研究优化性能与成本。

  5. Baseten 工程博客(网页)35

    Baseten 推出 Hybrid 混合部署方案:VPC 自托管与 Baseten Cloud 无缝溢出

    Baseten 发布 Hybrid 混合部署方案,让模型推理在自有 VPC 内运行,并在流量高峰时无缝溢出到 Baseten Cloud。该方案支持多云端路由、区域锁定数据驻留与快速冷启动,可沿用现有云资源承诺以优化成本,并继承 Baseten Cloud 的 SOC 2 Type II、HIPAA 和 GDPR 合规能力。

  6. Baseten 工程博客(网页)23

    Baseten 推出自托管部署方案,支持在自有 VPC 内运行推理

    Baseten 推出 Self-hosted 部署方案,让企业在自有 VPC 内获得与托管服务一致的毫秒级低延迟和高吞吐推理,模型输入输出不会经过 Baseten 服务器。该方案支持数据驻留与区域锁定部署,可满足 GDPR、HIPAA 等合规要求,并允许使用自有硬件或现有云厂商 credits 与 commits 优化成本。

  7. Baseten 工程博客(网页)48

    Baseten 推出多云容量管理 MCM,覆盖 20+ 云与区域

    Baseten 为 20 多个云和区域构建了多云容量管理(MCM),支撑低延迟与 99.99% 可用性。MCM 通过 SLA 感知的自动扩缩容,把跨云 GPU 资源视为可互换,实现跨云动态路由与扩缩模型副本,以应对云故障和容量限制。该能力支持数据驻留与主权合规,可运行在 Baseten Cloud、自托管或混合模式中。

  8. Baseten 工程博客(网页)24

    Baseten 推出跨云自动扩缩容推理基础设施

    Baseten 发布面向推理优化的基础设施,支持多节点、多云、多区域部署,通过跨云自动扩缩容让模型在全球低延迟服务,并以跨云容量管理实现四个九可用性。其自动扩缩容器实时匹配流量与资源,冷启动优化可在数秒内拉起新副本,并提供自托管、云和混合三种部署方式。

  9. Baseten 工程博客(网页)18

    Baseten Inference Runtime:可配置的模型推理运行时

    Baseten 推出 Inference Runtime,将 TensorRT、SGLang、vLLM、TGI、TEI 等开源推理框架与自研优化整合进单一可配置运行时,宣称可在数分钟内完成配置。该运行时原生支持 Medusa、Eagle 等投机解码技术,并通过 KV cache 卸载与缓存感知路由、prefill 优先调度、TP 与 EP 混合并行等手段降低延迟。

  10. Augment Code 博客(网页)52

    Augment Code 构建 Verifier 智能体自动验证 Agent 代码的端到端表现

    Augment Code 内部构建了 Verifier 智能体,在每个 PR 上自动部署变更到隔离环境、端到端验证并附带日志、API 响应和截图发回 PR 评论。该智能体运行在其 Cosmos 云智能体平台上,依靠仓库中可组合的 SKILL.md 技能库决定验证哪些界面,且只提交证据不做通过与否的结论;文中记录了一例 CI 全绿但实际 /chat-stream 路径未生效的真实发现。

  11. Anthropic:The Institute(旗舰研究长文 · 网页)67

    Claude 正式登陆 Microsoft Foundry,可通过 Azure 账单计费并计入 MACC

    Claude 现已在 Microsoft Foundry 正式可用,企业可用现有 Azure 认证、计费与治理体系构建生产应用和企业智能体,用量计入 Azure 账单,符合条件的支出可计入 MACC。

    推荐理由:原文说明 Claude 在 Microsoft Foundry 正式可用后的计费、合规与部署方式,读者可据此评估接入 Azure 工作流的可行性。

  12. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz:OpenRouter 上 GPT-OSS-120b 仍占 Claude Opus 4.8 三分之一流量,token 市场加速分层

    Tomer Tunguz 撰文指出,OpenRouter 数据显示发布于 2025 年 8 月的 GPT-OSS-120b 仍承载 Claude Opus 4.8 约 36% 的日 token 量,GLM 5.2 以每日 495B token 超过前沿模型,token 市场正按成本、速度和准确度分层。

    推荐理由:作者用 OpenRouter 流量数据和自己本地实测,说明 token 市场正按成本、速度与准确度分层,MoE 正在抬高端侧模型上限。

  13. Anthropic:The Institute(旗舰研究长文 · 网页)71

    Anthropic 发布 Claude 桌面与移动应用统一下载页

    Anthropic 上线 Claude 应用的统一下载页,提供 macOS、Windows、Linux(beta)桌面端和 iOS、Android 移动端。桌面应用内可直接运行 Claude Code,支持远程控制、跨设备记忆同步、Chrome 等扩展连接本地工具,并面向企业提供 MSIX/PKG 安装包和 SSO 部署;Linux 端暂不支持 Computer Use 和听写功能。

    推荐理由:页面汇总了 Claude 桌面与移动应用的下载入口、各平台支持情况和常见使用限制,方便读者判断适配自己的版本。

  14. Anthropic:The Institute(旗舰研究长文 · 网页)67

    Anthropic 发布 Claude Science 科研工作台公测版

    Anthropic 发布 Claude Science,一款面向科学家的 AI 工作台应用,目前为 macOS、Windows 和 Linux 上的公开 beta,面向 Pro、Max、Team 和 Enterprise 计划。

    推荐理由:官方产品页列出可复现分析、60+ 科学数据库连接和 HPC 计算管理等具体能力,读者可据此判断它对科研工作流的影响。

  15. Google Developers Blog(RSS)66

    Google 发布在 Raspberry Pi 5 上用 LiteRT 部署 Gemma 的端侧 AI 指南

    Google 介绍如何在 Raspberry Pi 5 上用 LiteRT 和 Gemma 模型实现完全离线的实时端侧 AI,并以 Reachy Mini 机器人演示目标检测、语音识别、推理和语音合成的完整本地流水线。

    推荐理由:原文给出 Gemma 各型号在 Raspberry Pi 5 上的实测数据和完整部署流程,读者可以据此选择合适的端侧模型并复现本地推理。

  16. Google Developers Blog(RSS)62

    Google 用 ADK 构建零信任 AI Agent 的三层安全实践

    Google 开源了基于 ADK 和 Gemini 的客服退款 Agent 示例,演示提示词注入可导致超额退款、密钥泄露等风险。文章提出三层零信任防护:用 Cloud KMS 硬件签名保证写入不可抵赖,用 gVisor 沙箱零网络出口隔离动态生成代码,用确定性语义网关加 CI/CD 回归测试校验输入输出;完整代码见 zero-trust-agents 仓库。

    推荐理由:文章用开源示例和代码讲解三层零信任防护的具体做法,读者可以直接在本地复现攻击与防御流程。