跳到正文

#Agent

今日 112 条
8月5日周二
  1. Johann Rehberger / Embrace The Red(RSS)69

    Amp Code 通过提示词注入实现任意命令执行的漏洞已修复

    Sourcegraph 旗下编程智能体 Amp 存在漏洞:AI 可写项目外文件,通过修改 settings. 加入 allowlist 命令(如 curl、sh 或 *)或添加恶意 MCP 服务器,实现任意代码执行。作者 Johann Rehberger 于 7 月初报告,Sourcegraph 数日内修复,用户应更新到最新版本;作者建议 AI 不得在未经开发者明确同意下修改关键文件。

8月4日周一
  1. Johann Rehberger / Embrace The Red(RSS)72

    Cursor IDE 通过 Mermaid 图表外泄任意数据漏洞披露(CVE-2025-54132)

    Johann Rehberger 披露 Cursor 的 Mermaid 图表渲染可加载外部图片,在间接提示词注入下无需用户确认即可将数据外泄到攻击者服务器,并演示窃取 API 密钥和用户记忆两种利用方式。该漏洞于 2025 年 6 月 30 日报告、7 月 7 日修复,编号 CVE-2025-54132,已随 7 月 29 日起可用的 Cursor v1.3 发布。

8月3日周日
8月2日周六
7月30日周三
7月29日周二
7月22日周二
7月21日周一
7月18日周五
  1. OpenAI Developers(RSS)43

    OpenAI 发布构建智能体指南:Agents API、Agents SDK 与 Responses API 选型对比

    OpenAI 发布构建智能体指南,对比 Agents API、Agents SDK 与 Responses API 三种运行时的选型。Agents API 由 OpenAI 托管 Codex harness,支持自动上下文压缩、多智能体编排、程序化工具调用和 MCP 服务器;Agents SDK 在应用内运行,由 runner 处理智能体循环与 handoff。

  2. OpenAI Developers(RSS)61

    OpenAI 开源 openai-testing-agent-demo:用 CUA 模型自动化前端测试

    OpenAI 发布 openai-testing-agent-demo 仓库,演示如何用 CUA 模型和 computer use 工具自动化前端测试。项目包含 frontend、cua-server、sample-test-app 三个应用,通过 Playwright 启动浏览器执行测试用例,MIT 协议开源,官方提醒 computer use 仍处预览阶段,不建议在认证环境或高风险任务中信任。

  3. OpenAI Developers(RSS)70

    OpenAI 开源 Computer Use API 示例应用,含浏览器与桌面两个智能体

    OpenAI 发布 Computer Use API 的示例应用 openai-cua-sample-app,包含两个计算机操作智能体:一个用 JavaScript 和 Playwright 控制浏览器,另一个用 Python 和 PyAutoGUI 通过截图、鼠标和键盘控制桌面。

    推荐理由:OpenAI 官方开源了计算机操作智能体的示例应用,读者可以据此了解用代码驱动浏览器和桌面的模式。

7月11日周五
6月11日周三
  1. Sam Altman:Blog(RSS)54

    Sam Altman 发文《温和的奇点》:人类已越过事件视界

    Sam Altman 发文称技术起飞已经开始,人类接近构建数字超级智能,且过程比想象中平缓。他判断 2025 年出现能完成真实认知工作的 Agent,2026 年可能产生能发现新洞见的系统,2027 年可能出现能在现实世界执行任务的机器人;科学家用 AI 后生产力提升两到三倍,ChatGPT 平均每次查询耗电约 0.34 瓦时、用水约 0.000085 加仑。

6月4日周三
5月27日周二
  1. Mistral AI:News(网页)67

    Mistral 发布 Agents API,内置连接器与智能体编排

    Mistral AI 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与多智能体编排。

    推荐理由:官方原文给出内置连接器、有状态对话和智能体编排的具体能力,还附 SimpleQA 对比数字,便于评估它在实际工作流中的用法。

5月25日周日
5月21日周三
5月3日周六
  1. Johann Rehberger / Embrace The Red(RSS)68

    MCP 安全风险解析:不可信服务器如何借工具元数据劫持 Claude 客户端

    安全研究员 Johann Rehberger 发文解析 MCP 的安全风险并展示一条新的漏洞利用链。文章指出仅将恶意工具服务器加入会话即可劫持对话,工具元数据中的隐藏 Unicode Tag 指令可穿透 API 和 UI 层,用户在界面检查时不可见,Claude 会执行这些隐藏指令。

3月13日周四
3月4日周二
2月17日周一
2月10日周一
  1. Sam Altman:Blog(RSS)43

    Sam Altman 提出关于 AI 经济学的三点观察

    Sam Altman 提出关于 AI 经济学的三点观察:AI 模型智能约等于训练与运行资源投入的对数,可预测的 scaling laws 在多个数量级上成立;使用特定智能水平的成本约每 12 个月下降 10 倍,GPT-4 到 GPT-4o 的每 token 价格下降约 150 倍;线性增长的智能带来的社会经济价值呈超指数级。

1月8日周三
  1. Answer.AI 官方研发博客(RSS)79

    Answer.AI 团队实测 Devin 一个月:20 个任务仅 3 个成功

    Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。

    推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。

12月5日周四
6月23日周五
  1. Lilian Weng:Lil'Log(RSS)80

    Lilian Weng 长文解析 LLM 驱动的自主智能体系统

    Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。

    推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。

3月15日周三