跳到正文

#Agent

今日 14 条
9月10日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)66

    OpenAI 发布 Agents API,用于构建云端 Agent 托管服务

    OpenAI 发布 Agents API,这是一个用于构建和启动云端 Agent 的托管服务。该服务由 Codex harness 驱动,支持编排、长时间运行的会话和工具使用。

    推荐理由:原文来自 OpenAI 官方公告,可了解基于 Codex harness 的云端 Agent 托管服务入口与定位。

  2. a16z:News(RSS)30

    a16z 领投 Lightfield 4700 万美元 A 轮,打造智能体时代的 AI 原生 CRM

    a16z 领投 Lightfield 4700 万美元 A 轮融资,这是一款面向智能体时代的 AI 原生 CRM。它用无需配置的灵活数据模型,几分钟内从邮件和通话中自动构建,底层是捕捉每笔交易背后原因的时序上下文图谱,人类与智能体通过同一 API 在同一平台协作。自去年年底上线以来已有数千家公司采用,部分团队正替换 Salesforce、HubSpot 和 Attio。

9月9日周三
  1. Mistral AI:News(网页)54

    Mistral 如何用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。

  2. Together AI 研究与产品博客(RSS)67

    Together AI 深入解析开源 AI 编码栈:用 MIGHT 框架从闭源模型迁移到开源模型

    Together AI 发布长文,解析开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由模型、推理、网关与路由、Harness、工具(Skills 与 MCP)组成的 MIGHT 五层框架。

    推荐理由:Together AI 把开源编码栈拆为 MIGHT 五层,给出大小模型分工和分层组合的具体实践方法。

9月8日周二
  1. vLLM 官方博客(RSS)65

    vLLM 联合 AgentX 优化真实智能体推理服务,成本较 Opus 5 API 最多低 106×

    vLLM 团队发布针对智能体负载的全栈优化方案,覆盖 KV 缓存管理、并行策略与 P/D 分离配比,并在 SemiAnalysis AgentX 公开基准上验证。

    推荐理由:原文给出 vLLM 针对 AgentX 基准的全栈优化路径与可复现结果,读者可以借此理解智能体负载的服务优化思路。

  2. vLLM 官方博客(RSS)45

    GLM 5.3 优化第一部分:vLLM 中的 Hybrid HiSparse 卸载

    vLLM 为 GLM 5.3 引入 Hybrid HiSparse 卸载机制,在单台 8× H200 节点上首次实现 100 万上下文长度运行,并在各上下文长度下大幅提升并发量。该机制基于稀疏 MLA 的 top-K 选择,将未被选中的 KV cache 卸载至 CPU,仅在 KV cache 承压时才付出 CPU-GPU 传输代价,热缓冲页与常驻页共用同一 HMA 块池。

9月6日周日
9月5日周六
  1. Sierra:Blog(RSS)45

    呼叫中心 AI 落地运营指南:如何规划部署与扩展

    Sierra 发布呼叫中心 AI 运营与推广指南,主张把 AI 部署当作运营模式变革而非单点演示,需在迁移流量前设定基线与扩展标准。指南覆盖语音、消息、邮件等渠道,Sierra 支持单一智能体跨渠道部署,Voice 支持呼入呼出、语音模拟、多语言与带上下文升级。落地需围绕路由与队列行为、人力排班、人机质量校准等环节设计运营模型。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)34

    NVIDIA Jetson 如何部署与优化前沿推理模型

    NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。

  3. GitHub Blog69

    GitHub 发布 Project HydraFusion 研究预览:通过多模型编排实现前沿级编码质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级智能,所有 GitHub Copilot 计划用户可通过 Copilot CLI 的 /experimental 使用。

    推荐理由:官方详解了 HydraFusion 三种执行模式与基准成本质量数据,读者可据此判断多模型编排是否值得在 Copilot CLI 中试用。

9月4日周五
  1. Mark Chen80

    OpenAI 首席研究官 Mark Chen 宣布 GPT-6 Astra 发布,称其汇集多年预训练、强化学习和后训练工作,是该团队迄今能力最强、对齐程度最高的模型。

    引用OpenAI@OpenAI

    This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast.

    推荐理由:OpenAI 首席研究官亲自说明 GPT-6 Astra 的能力变化与对齐工作,可帮助读者了解官方对 Computer Use 和 Agent 监督的进展表述。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)36

    NVIDIA PAIR 虚拟推理路由器:把本地网络上的可用算力扩展给 AI 智能体

    NVIDIA 推出 PAIR 虚拟推理路由器,可将本地网络中的可用算力扩展给 AI 智能体使用。该方案面向多智能体协作场景:主智能体把复杂任务拆解后分派给专用子智能体,用户也会同时运行多个智能体会话。这种广度优先的方式可提升任务完成速度。

9月3日周四
  1. Google DeepMind:Blog(RSS)60

    Google DeepMind 推出 Fairwind Program,向政府与企业提供 Gemini 3.8 Flash Cyber 网络防御能力

    Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 与 CodeMender 组合,用于自主发现、验证并修复漏洞。

    推荐理由:原文给出受限访问计划的能力组合与准入对象,读者可据此判断前沿模型在漏洞修复环节的落地方式。

9月2日周三
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)22

    用 NVIDIA Nemotron 构建自适应智能体网络安全系统

    NVIDIA 发布技术博客,介绍如何用 NVIDIA Nemotron 构建自适应智能体网络安全系统。文章指出,当前多数安全智能体实现仍依赖既有告警、预定义工作流和已知攻击行为,更难的问题在于识别防御盲区并将其转化为改进。

9月1日周二
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)35

    在 Claude Science 中运行 NVIDIA BioNeMo NIM 微服务进行蛋白质结构预测

    NVIDIA 发布指南,介绍如何在 Claude Science 中运行 BioNeMo NIM 微服务完成蛋白质结构预测。该方案面向可读取论文、提出假设并调用模型的 AI 科学家,用于判断后续实验优先级。正文指出,科研比软件工程更依赖反复评估证据与修正假设,编码智能体已在生产代码中验证价值。

8月31日周一
  1. MIT News(RSS)30

    MIT 研究项目 Julia 如何成为全球编程语言

    MIT 研究项目 Julia 已发展为拥有超 100 万用户的免费开源编程语言,被全球数千家公司和大学用于科学计算与复杂系统建模。Julia 依靠即时编译(just-in-time compilation)兼顾易用性与高性能,其联合创始团队还创办了 JuliaHub,并于 4 月推出 AI 平台 Dyad 3.0,帮助工程团队以智能体方式加速火箭、热泵、卫星等物理系统设计。

8月29日周六
8月28日周五
  1. SiliconFlow66

    智谱(Z.ai)的 GLM-5.3 已开源,并上线 SiliconFlow,提供 Day-0 支持。该模型总参数 744B、激活 40B,与 GLM-5.2 同底座,经后训练大幅提升,官方称在编程与智能体基准上可与 Fable 5 和 GPT-5.6 Sol 竞争。SiliconFlow 还提到其在 OpenRouter 上 GLM-5.2 token 份额排名第一。

    推荐理由:原文给出了 GLM-5.3 的参数规模、开源状态和基准表现,读者可以据此评估是否迁移现有工作流。

8月27日周四