跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 181–200 条 · 共 280 条
9月24日周四
  1. Google DeepMind:Blog(RSS)60

    Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆

    Google DeepMind 公布 Private AI Compute 架构更新,将持久化的服务端记忆引入该平台,使 AI 助手能跨设备保留上下文。数据被密封在加密存储中,解锁密钥仅保存在用户个人设备上,模型访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。

    推荐理由:Google 公开了 Private AI Compute 的持久化服务端记忆方案,读者可了解云端记忆如何在设备持钥前提下实现。

9月23日周三
  1. Latent Space(RSS)84

    Claude Opus 5.5 发布成新默认模型,OpenAI 同日推 GPT-6 Sol 和 Luna 降价应战

    AINews 汇总:Anthropic 发布 Claude Opus 5.5,称多数任务达 Fable 5.1 水平、比 Opus 5 便宜 40% 且快 30%,成为 Claude Code 和应用新默认模型;OpenAI 数小时后推出 GPT-6 Sol($2/$10)和 Luna($0.10/$0.50),价格比 GPT-5.6 前代低约 50%。

    推荐理由:除了两家降价发布,原文还汇总了缓存定价拆解、effort 异常和第三方评测口径问题,提供了单一官方稿之外的交叉信息。

9月22日周二
  1. Xiaomi MiMo66

    小米 MiMo 发布 MiMo-V2.6 Pro 与 Flash 两款全模态模型,通过规模化强化学习训练。官方称 Pro 在多数 agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 相当,Artificial Analysis Intelligence Index 得分 46,为开源模型中最高;能力覆盖编码、computer use、3D 推理和创作。

    推荐理由:原文给出 Pro 与 Claude Opus 5、GPT-5.6 Sol 的 agent 基准对比和开源范围,可据此评估其相对位置。

9月18日周五
  1. AI at Meta64

    Meta 官宣 Muse for Mac 当日推出,下载入口为 http://ai.meta.com/muse/download/。该个人智能体可在用户明确授权下直接在电脑上执行任务,例如整理下载文件夹、找回丢失的文件、总结消息和笔记,官方表示后续还有更多功能。

    引用Muse@Muse

    Muse is now available on Mac 💻. Your personal agent can get things done for you directly on your computer (all with your explicit permission). - Organize your downloads folder - Find a file you’ve lost track of - Summarize your messages and notes …more coming soon. Try Muse for Mac: http://ai.meta.com/muse/download/

    推荐理由:官方宣布 Muse 智能体登陆 Mac,列出了整理文件夹、找文件、总结消息等具体用途,读者可据此了解它的桌面端用法。

9月17日周四
  1. jietang66

    唐杰发文复盘,GLM-5.3-Flash 从首次在国内加速器上运行到承接全部生产流量只用两周,端到端吞吐达 3.2 倍,大量工作由 GLM-5.3 驱动的 Infra Agent 完成。

    引用Z.ai@Zai_org

    We’re sharing how GLM-5.3 helped build and optimize the inference infrastructure serving GLM-5.3-Flash. The system went from its first successful run to production readiness in less than two weeks, with end-to-end throughput tripling relative to the initial baseline. The key was dense feedback: local correctness tests, execution traces, microbenchmarks, and end-to-end measurements that enabled targeted hypothesis testing rather than reliance on aggregate performance metrics alone. https://z.ai/blog/glm-built-its-inference-infrastructure

    推荐理由:作者复盘了 GLM-5.3 智能体优化推理基础设施的两周过程,提出了可迁移的分层密集反馈方法与工程师角色转变的判断。

  2. GitHub Blog85

    GitHub Copilot 用 Copilot 把运行时迁移到 Rust:80 万行代码、128 个 PR

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量合入 main,性能提升数个数量级,主要由一名开发者几个月内完成。

    推荐理由:GitHub Copilot 运行时迁移 Rust 的完整复盘,给出智能体并行协作、提示缓存与评审流程的可迁移工程方法。

9月16日周三
  1. Hugging Face:Blog(RSS)62

    Hugging Face 发布 ALTK-Evolve 一致性指南与 Consistency Analyzer,将智能体一致性差距减半

    IBM Research 与 Hugging Face 在 ALTK-Evolve 中推出一致性指南和 Consistency Analyzer,用于诊断和改善智能体重复运行的不稳定性。

    推荐理由:原文给出一致性差距的量化诊断方法与开源实现,读者可据此评估和改进智能体在重复运行下的可靠性。

9月15日周二
  1. Apple:Newsroom(RSS)82

    Apple 发布 Siri AI 与新一代 Apple Intelligence 功能

    Apple 于 2026 年 9 月 14 日发布新一代 Apple Intelligence,推出全新版本的 Siri AI,具备个人上下文理解、屏幕感知、更广泛的系统级应用操作,并在 iPhone 相机、iPad 截图、Mac 快捷键和 Apple Vision Pro 中集成 Visual Intelligence。

    推荐理由:官方完整列出了 Siri AI 的具体能力、设备要求和区域限制,读者可以据此核对自己设备上的功能可用范围。

9月12日周六
  1. Dwarkesh Patel:Podcast & Blog(RSS)61

    Dwarkesh 对谈 John Schulman、Beren Millidge 与 Charlie O'Neill:AI 研究者激辩递归自我改进还有多远

    Dwarkesh Patel 邀请 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman 和 Baseten 模型训练负责人 Charlie O'Neill 对谈递归自我改进(RSI)何时到来。

    推荐理由:三位一线研究者围绕递归自我改进给出了各自不同的技术瓶颈判断,涵盖蒸馏、sim-to-real 与持续学习等具体分歧。

9月10日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)66

    OpenAI 发布 Agents API,用于构建云端 Agent 托管服务

    OpenAI 发布 Agents API,这是一个用于构建和启动云端 Agent 的托管服务。该服务由 Codex harness 驱动,支持编排、长时间运行的会话和工具使用。

    推荐理由:原文来自 OpenAI 官方公告,可了解基于 Codex harness 的云端 Agent 托管服务入口与定位。

9月9日周三
  1. Together AI 研究与产品博客(RSS)67

    Together AI 深入解析开源 AI 编码栈:用 MIGHT 框架从闭源模型迁移到开源模型

    Together AI 发布长文,解析开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由模型、推理、网关与路由、Harness、工具(Skills 与 MCP)组成的 MIGHT 五层框架。

    推荐理由:Together AI 把开源编码栈拆为 MIGHT 五层,给出大小模型分工和分层组合的具体实践方法。

9月8日周二
  1. vLLM 官方博客(RSS)65

    vLLM 联合 AgentX 优化真实智能体推理服务,成本较 Opus 5 API 最多低 106×

    vLLM 团队发布针对智能体负载的全栈优化方案,覆盖 KV 缓存管理、并行策略与 P/D 分离配比,并在 SemiAnalysis AgentX 公开基准上验证。

    推荐理由:原文给出 vLLM 针对 AgentX 基准的全栈优化路径与可复现结果,读者可以借此理解智能体负载的服务优化思路。

9月5日周六
  1. GitHub Blog69

    GitHub 发布 Project HydraFusion 研究预览:通过多模型编排实现前沿级编码质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级智能,所有 GitHub Copilot 计划用户可通过 Copilot CLI 的 /experimental 使用。

    推荐理由:官方详解了 HydraFusion 三种执行模式与基准成本质量数据,读者可据此判断多模型编排是否值得在 Copilot CLI 中试用。

9月4日周五
  1. Mark Chen80

    OpenAI 首席研究官 Mark Chen 宣布 GPT-6 Astra 发布,称其汇集多年预训练、强化学习和后训练工作,是该团队迄今能力最强、对齐程度最高的模型。

    引用OpenAI@OpenAI

    This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast.

    推荐理由:OpenAI 首席研究官亲自说明 GPT-6 Astra 的能力变化与对齐工作,可帮助读者了解官方对 Computer Use 和 Agent 监督的进展表述。

9月3日周四
  1. Google DeepMind:Blog(RSS)60

    Google DeepMind 推出 Fairwind Program,向政府与企业提供 Gemini 3.8 Flash Cyber 网络防御能力

    Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴提供受限访问,首批开放 Gemini 3.8 Flash Cyber 与 CodeMender 组合,用于自主发现、验证并修复漏洞。

    推荐理由:原文给出受限访问计划的能力组合与准入对象,读者可据此判断前沿模型在漏洞修复环节的落地方式。