跳到正文

全部动态

今日 45 条
9月30日周三
  1. Baseten 工程博客(网页)21

    Baseten 推出 Embeddings 推理服务:支持任意嵌入模型与弹性扩缩容

    Baseten 上线 Embeddings 服务,可用任意嵌入模型快速处理数百万数据点,支持自定义 Docker 镜像、Truss 库和 Baseten Chains。该服务覆盖 BGE、Stella、SFR-Embedding、Nomic、NV-Embed、Voyage 等模型系列,面向语义搜索与推荐系统,提供五个 9 可用性、优化冷启动和弹性自动扩缩容,可缩容至零以节省成本。

  2. Baseten 工程博客(网页)13

    Baseten 解读 Compound AI:用多模型组合替代单体大模型

    Baseten 工程博客提出 Compound AI 系统,主张用多个专用模型组合替代庞大的全能单体模型,以获得更快、更便宜的推理。该系统让模型之间直接互相调用,减少网络开销、额外延迟和出网成本,并让每个步骤独立使用自动扩缩容的 GPU。文中列举的典型场景包括 AI 电话呼叫、AI 智能体和 RAG 流水线。

  3. Baseten 工程博客(网页)18

    Baseten 图像生成推理服务:支持 FLUX.1 dev 与 SDXL Lightning

    Baseten 推出面向图像生成模型的推理服务,支持部署 FLUX.1 dev、SDXL Lightning 等开源模型及用户微调、自定义模型,兼容 ComfyUI 等框架。SDXL Lightning 可在 4 个 UNet 步内生成 1024x1024 图像,接近实时出图。平台提供弹性自动扩缩容、冷启动优化,并支持 SOC 2 Type II、HIPAA、GDPR 合规部署。

  4. Baseten 工程博客(网页)21

    Baseten 的前向部署工程师:从 POC 到规模化的嵌入式推理支持

    Baseten 推出前向部署工程师(forward deployed engineers)团队,以嵌入式工程方式帮客户架构系统、部署并优化模型。该团队提供跨云自动扩缩容与 99.99% 可用性保障,并针对不同模态应用推理栈优化,代码归客户所有。服务覆盖从 POC 到规模化的全过程,持续引入社区最新研究优化性能与成本。

  5. Baseten 工程博客(网页)35

    Baseten 推出 Hybrid 混合部署方案:VPC 自托管与 Baseten Cloud 无缝溢出

    Baseten 发布 Hybrid 混合部署方案,让模型推理在自有 VPC 内运行,并在流量高峰时无缝溢出到 Baseten Cloud。该方案支持多云端路由、区域锁定数据驻留与快速冷启动,可沿用现有云资源承诺以优化成本,并继承 Baseten Cloud 的 SOC 2 Type II、HIPAA 和 GDPR 合规能力。

  6. Baseten 工程博客(网页)23

    Baseten 推出自托管部署方案,支持在自有 VPC 内运行推理

    Baseten 推出 Self-hosted 部署方案,让企业在自有 VPC 内获得与托管服务一致的毫秒级低延迟和高吞吐推理,模型输入输出不会经过 Baseten 服务器。该方案支持数据驻留与区域锁定部署,可满足 GDPR、HIPAA 等合规要求,并允许使用自有硬件或现有云厂商 credits 与 commits 优化成本。

  7. Baseten 工程博客(网页)48

    Baseten 推出多云容量管理 MCM,覆盖 20+ 云与区域

    Baseten 为 20 多个云和区域构建了多云容量管理(MCM),支撑低延迟与 99.99% 可用性。MCM 通过 SLA 感知的自动扩缩容,把跨云 GPU 资源视为可互换,实现跨云动态路由与扩缩模型副本,以应对云故障和容量限制。该能力支持数据驻留与主权合规,可运行在 Baseten Cloud、自托管或混合模式中。

  8. Baseten 工程博客(网页)24

    Baseten 推出跨云自动扩缩容推理基础设施

    Baseten 发布面向推理优化的基础设施,支持多节点、多云、多区域部署,通过跨云自动扩缩容让模型在全球低延迟服务,并以跨云容量管理实现四个九可用性。其自动扩缩容器实时匹配流量与资源,冷启动优化可在数秒内拉起新副本,并提供自托管、云和混合三种部署方式。

  9. Baseten 工程博客(网页)18

    Baseten Inference Runtime:可配置的模型推理运行时

    Baseten 推出 Inference Runtime,将 TensorRT、SGLang、vLLM、TGI、TEI 等开源推理框架与自研优化整合进单一可配置运行时,宣称可在数分钟内完成配置。该运行时原生支持 Medusa、Eagle 等投机解码技术,并通过 KV cache 卸载与缓存感知路由、prefill 优先调度、TP 与 EP 混合并行等手段降低延迟。

  10. Augment Code 博客(网页)44

    Augment Code:AI 原生转型的四个阶段,从智能体采纳到智能体编排

    Augment Code 提出 AI 原生转型分四个阶段:约 70% 组织仍停留在第一阶段(将智能体接入日常工作流),不到 10% 让智能体自主拥有工作,几乎无人达到第四阶段全智能体编排。在软件开发生命周期六个环节中,代码生成、验证、构建失败诊断三个环节已由智能体主导,代码审查中低风险改动可自动批准。某企业客户开发者每周因代码审查阻塞的时间占比从 30% 降至 10% 以下。

  11. Augment Code 博客(网页)46

    Augment Code:单模型工程时代已经结束

    Augment Code 本月在 Claude 和 GPT-5 之外新增 Gemini 3.1 Pro,成为其第三个可选模型,并称单模型工程时代已经结束。过去十三个月里领先模型三次易主,GPT-5.4 的每条消息价格比此前所用模型便宜约 2.6 倍。其做法是把模型、harness(Context Engine)与编排层(Intent)解耦,切换模型只需改一个设置而非迁移。

  12. Augment Code 博客(网页)65

    Augment 发布 Prism 模型路由,按任务分流降低成本

    Augment Code 推出 Prism,一种模型路由选项,为每轮用户请求自动选择底层模型,称团队月发 1 万次请求可省约 2 万美元,成本最多降 30%,质量与所对标的前沿推理模型差异可忽略。

    推荐理由:官方给出多基准成本与质量数据及缓存感知路由方法,读者可据此评估模型路由能否降低自己的智能体开销。

  13. Augment Code 博客(网页)48

    Cosmos 让智能体跑通完整 SDLC,工程师的角色变成什么?

    Augment Code 的 Cosmos 平台让智能体串联代码审查与事故响应等环节,大型 PR 的人工审查时间从六七小时降到 45 分钟,周产出提升至三倍。事故响应中智能体已处理 81.3% 的告警,值班工程师每周合并的 PR 增加 44%,首次 RCA 时间从约 30 分钟降至 6 分钟。人类仍负责设计判断、风险把控与最终决策。

  14. Artificial Analysis 完整文章(网页)75

    Artificial Analysis 评测 GPT-6 Astra:与 Claude Fable 5.1 并列两大指数第一且成本更低

    Artificial Analysis 发布 GPT-6 Astra 基准测试报告,该模型在 Intelligence Index 得 53 分、Coding Agent Index 得 62 分,均与 Claude Fable 5.1 并列第一,且成本分别约为其 40% 和 60%。

    推荐理由:原文给出 GPT-6 Astra 在两大指数中的得分、成本和 token 效率数据,可据此比较它与 Claude Fable 5.1 的实际表现。

  15. Augment Code 博客(网页)52

    Augment Code 构建 Verifier 智能体自动验证 Agent 代码的端到端表现

    Augment Code 内部构建了 Verifier 智能体,在每个 PR 上自动部署变更到隔离环境、端到端验证并附带日志、API 响应和截图发回 PR 评论。该智能体运行在其 Cosmos 云智能体平台上,依靠仓库中可组合的 SKILL.md 技能库决定验证哪些界面,且只提交证据不做通过与否的结论;文中记录了一例 CI 全绿但实际 /chat-stream 路径未生效的真实发现。

  16. ARC Prize:官方博客35

    ARC Prize 社区通讯:用 ARC-AGI 赢下黑客松

    ARC Prize 社区通讯披露,Aditya Advani 团队凭 ARC-AGI-Pub 项目在旧金山 AGI House 黑客松拿下第三名。ARC-AGI-Pub 排行榜已上线,官方为其设立 15 万美元验证基金,该榜不计入 ARC Prize 2024 且无奖金。Kaggle 参赛者增至 6,539 人、434 支队伍,每日提交上限从 5 次降至 3 次以抑制过拟合。