跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 121–140 条 · 共 280 条
9月30日周三
  1. Fireworks AI(网页)68

    Fireworks Research 发布 Ember-1:以 Kimi K3 为基础实现同等质量下更省 token

    Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。

    推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。

  2. Cursor Blog74

    Cursor 推出 Projects:用协调智能体承接大规模开发工作

    Cursor 推出 Projects,让开发者以项目为单位承接功能开发、迁移和长期维护等工作,可维持数月上下文、向数千个子智能体委派任务并自动处理周期性工作。每个 Project 默认在云端运行并同步共享上下文,协调智能体只负责委派而不写代码,还可订阅 Slack 频道、按计划运行或跟踪 PR。

    推荐理由:官方介绍了 Projects 的协调智能体机制和内部使用数据,读者可以对照自己的多 PR 工作流评估是否适用。

  3. Cursor Blog61

    Cursor 推出软件开发 Bots:Rollouts 与 Security Reviewer

    Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。

    推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。

  4. Cursor Blog61

    Cursor 详解智能体 harness 效率优化,token 成本降低 7%

    Cursor 团队发布文章,介绍过去几个月为提升长时间智能体运行的 token 效率所做的 harness 改动,整体将用户 token 成本降低 7% 且智能体质量未下降。

    推荐理由:Cursor 团队逐项拆解了降低智能体 token 成本的 harness 改动,给出系统提示精简、动态工具加载与缓存断点等可借鉴的做法。

  5. Cognition 模型 / Devin 博客(网页)67

    Cognition 完成 2B+ 美元 E 轮融资,估值 480 亿美元

    Cognition 宣布完成逾 20 亿美元 E 轮融资,估值达 480 亿美元,由 Andreessen Horowitz 和 Accel 领投,Founders Fund、General Catalyst、Avenir 等跟投。

    推荐理由:融资公告附上营收增长和 Devin 新功能细节,读者可以据此了解这家智能体公司的业务进展。

  6. Cognition 模型 / Devin 博客(网页)78

    Cognition 研究员用 Devin 构建 GPU 格子筛分解 RSA-260,成本较此前公开最优低约 10 倍

    Cognition 研究员 Eric Lu 带领多个 Devin 会话构建了目前性能最高的 GPU lattice siever,用修改版 CADO-NFS 在约 4,900 GPU 天、约 $400k 的成本上完成 RSA-260 分解,创下公开解决的 RSA Factoring Challenge 最大规模纪录,超过 2020 年 2 月的 RSA-250。

    推荐理由:原文详细披露 GPU 格子筛实现、成本估算和人机分工,读者可以了解 Agent 驱动大型科研工程的实际工作流。

  7. Cognition 模型 / Devin 博客(网页)71

    Cognition 将 Fusion 双智能体 harness 引入 Devin Desktop 和 CLI

    Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。

    推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。

  8. Cognition 模型 / Devin 博客(网页)69

    Cognition 宣布年化收入运行率突破 10 亿美元

    Cognition 宣布年化收入运行率突破 $1B。公司成立于 2024 年 1 月,Devin 正式开放不到两年,已在 GE Aerospace、Rivian、Rohlik、Exa 等公司的工程团队中协作使用,官方称这一里程碑属于客户。

    推荐理由:Cognition 官方宣布 ARR 突破 10 亿美元,并列出 GE Aerospace、Rivian 等客户,可据此了解 Devin 的商业化进展。

  9. Claude:Blog(网页)72

    Claude 合并 Cowork 与聊天,并推出 Claude Docs、Slides 和 Design 集成

    Anthropic 宣布 Claude Cowork 与聊天合并为一个 Claude,任务不再需要用户选择入口,可在合上电脑后继续完成。同时发布 Claude Docs 和 Claude Slides,Claude Design 也可在对话中直接使用,三者均在付费计划上处于 beta。

    推荐理由:官方说明了 Cowork 与聊天合并的原因和落地方式,读者可以据此判断现有工作流会受哪些影响。

  10. Claude:Blog(网页)73

    Claude 桌面与移动端应用提供 macOS、Windows、Linux、iOS、Android 下载

    Claude 提供桌面与移动端应用下载,覆盖 macOS、Windows(含 arm64)、Linux(beta,支持 Ubuntu 和 Debian)以及 iOS 和 Android,所有套餐(Free、Pro、Max、Team、Enterprise)均可使用,部分功能仅限付费计划。

    推荐理由:原文汇总了 Claude 桌面与移动端应用的下载入口、各平台支持范围和付费限制,读者可据此判断是否迁移工作流。

  11. Trail of Bits:AI安全研究74

    Trail of Bits实测:GPT 5.6-Cyber三次逃出QEMU/KVM虚拟机,VM沙箱不再可靠

    Trail of Bits作者在Patch the Planet项目中获得GPT 5.6-Cyber预览权,让它在CTF任务中逃出自己Debian 12机器上的QEMU/KVM虚拟机,结果它三次成功逃逸。

    推荐理由:作者以一手实验展示GPT 5.6-Cyber三次逃出VM的具体漏洞链,指出单靠虚拟机隔离AI智能体已不可靠。

  12. Trail of Bits:AI安全研究70

    Trail of Bits 批评 1Password 的 AI 补丁基准有误导性,并发布两个补丁验证 Agent 技能

    Trail of Bits 发文批评 1Password 2026 年 8 月 6 日报告的 26% 干净修复率有误导性,指出其样本被挑选为复杂修复、22% 数据使用故意指示错误修复的提示词、36% 试验禁止编译测试,并披露评分规则与人工审查的分歧。

    推荐理由:作者用自有的 Patch the Planet 合并率和开发者首次修复失败率作对照,说明该基准在样本、指令和评分上的问题。

  13. Trail of Bits:AI安全研究68

    Trail of Bits 复盘 Miden zkVM 审计:用智能体自建工具链与 Lean 形式化模型

    Trail of Bits 在审计 Miden zkVM 前,用智能体在六个月内从零构建了 MASM 的 LSP 服务器、反编译器、静态分析引擎和 Lean 形式化模型。

    推荐理由:作者复盘如何让智能体在审计前自建 LSP、反编译器、静态分析和 Lean 形式化模型,方法可迁移到其他安全审计场景。

  14. Cloudflare Blog77

    Cloudflare:互联网出现第二个受众,智能体流量增长超 1700% 并推动内容付费新机制

    Cloudflare 发文指出互联网出现了由软件代理人类访问的第二个受众:其网络 HTTP 请求从 2024 年底的每秒 6300 万增至近 1.15 亿,一年内 AI 智能体日请求增长超 1700%,今年首次过半流量非人类。

    推荐理由:Cloudflare 用自家网络数据说明智能体流量如何改变流量与收入的关系,并给出可控授权和按使用付费的应对思路。

  15. Augment Code 博客(网页)68

    Augment Code 复盘如何搭建软件工厂,人均规模调整产出提升 4.5 倍

    Augment Code 官方复盘其软件工厂搭建过程:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台陆续部署 PR Author、Deep Reviewer、Verifier、Incident Investigator 等专用智能体,覆盖需求、工单、PR、生产四个环节,量化分析覆盖 17,200 个已合并 PR。

    推荐理由:官方复盘给出九个月内部数据与逐月部署节点,读者可以据此了解团队级智能体工厂的搭建路径与取舍。

  16. Artificial Analysis 完整文章(网页)78

    Claude Sonnet 5.5 登上 Artificial Analysis 智能指数第 2 名,token 用量创测量新高

    Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis 智能指数得分 56(max 档较 Sonnet 5 提升 18 分),仅次于 Opus 5.5 (max)。

    推荐理由:原文给出 Sonnet 5.5 在智能指数、token 用量和成本上的具体数据,读者可据此对比其与 Opus 5.5 和 GPT-6 系列的实际取舍。

  17. Anthropic:Research(发表成果 · 网页)73

    Anthropic:Claude 优化 30 多个开源生物分子模型,平均加速约 4 倍

    Anthropic 发布研究,Claude 在不到四周内优化了超过 30 个用于结构预测、蛋白质设计、基因组学和蛋白质语言模型的开源模型,平均加速约 4 倍、输出完全一致时约 2 倍,并开源了全部优化代码。

    推荐理由:原文给出具体加速倍数、低内存模式和开源入口,读者可评估这些优化对自身生物分子建模工作流的实际收益。