GitHub Copilot 提示词注入可致远程代码执行(CVE-2025-53773)
Johann Rehberger 披露 GitHub Copilot 的提示词注入漏洞 CVE-2025-53773:注入内容可让 Copilot 写入 .vscode/settings. 并添加 "chat.tools.autoApprove"。
推荐理由:作者亲测复现了从提示词注入到本机代码执行的完整链条,并给出缓解建议,适合评估 Agent 自改配置的安全风险。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Johann Rehberger 披露 GitHub Copilot 的提示词注入漏洞 CVE-2025-53773:注入内容可让 Copilot 写入 .vscode/settings. 并添加 "chat.tools.autoApprove"。
推荐理由:作者亲测复现了从提示词注入到本机代码执行的完整链条,并给出缓解建议,适合评估 Agent 自改配置的安全风险。
OpenAI 发布 Computer Use API 的示例应用 openai-cua-sample-app,包含两个计算机操作智能体:一个用 JavaScript 和 Playwright 控制浏览器,另一个用 Python 和 PyAutoGUI 通过截图、鼠标和键盘控制桌面。
推荐理由:OpenAI 官方开源了计算机操作智能体的示例应用,读者可以据此了解用代码驱动浏览器和桌面的模式。
Cognition 已签署最终协议收购智能体 IDE Windsurf,交易涵盖其 IP、产品、商标、品牌和业务,Windsurf 团队近期将照常运营,后续 Cognition 将把 Windsurf 能力整合进自家产品。公告披露 Windsurf 拥有 82M ARR(企业 ARR 环比翻倍)、350+ 企业客户和数十万日活用户,且全部员工将获得经济参与、豁免归属悬崖并加速归属既有股权。
推荐理由:收购方官方公告披露了交易范围和 Windsurf 的 ARR、客户数等经营数据,可据此了解双方产品整合的方向。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两个模型的 SWE-Bench Verified 成绩、许可证和 API 定价,读者可据此评估在编码智能体工作流中的成本与部署选择。
Sakana AI 与 AtCoder 合作发布 ALE-Bench 基准,基于 40 道历史 AtCoder 启发式竞赛(AHC)的 NP-hard 优化题,考察长周期迭代式算法工程能力,并开发了专用智能体 ALE-Agent。
推荐理由:原文给出基准构成、竞赛名次和 agent 的具体改进策略,也如实写了局限,读者可据此评估 AI 做长周期算法工程的现状。
Sakana AI 与 AtCoder 联合发布组合优化算法工程基准 ALE-Bench,并开发专用 AI 智能体 ALE-Agent,论文见 https://arxiv.org/abs/2506.09050。
推荐理由:官方一手发布,给出基准构成、竞赛实测名次和 AI 与人类解题方式的差异分析,读者可据此评估长时推理能力的现状。
TensorZero 团队将自研开源网关部署为 Cursor 与 LLM 提供商之间的自托管代理,成功观察并替换 Cursor 的模型调用。
推荐理由:作者以第一手实验给出自建代理查看 Cursor 提示词的完整路径,还分享了系统提示词和模型分层等可复核的细节。
Mistral AI 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与多智能体编排。
推荐理由:官方原文给出内置连接器、有状态对话和智能体编排的具体能力,还附 SimpleQA 对比数字,便于评估它在实际工作流中的用法。
Mistral AI 与 All Hands AI 合作发布软件工程智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:Mistral 自家发布,给出 SWE-Bench Verified 具体分数、开源许可和部署门槛,读者可据此评估其在本地或企业编码场景的可用性。
Anthropic 发布 Claude Code 智能体编码最佳实践指南,指出上下文窗口是最需要管理的资源,性能会随上下文填满而下降。指南覆盖给 Claude 提供可运行的验证标准、先探索再规划再编码、编写精简 CLAUDE.md、配置权限与 hooks、用子代理隔离调查、用 /clear 和 /rewind 管理会话,以及并行会话、非交互模式和对抗式审查等规模化用法。
推荐理由:Anthropic 官方系统梳理 Claude Code 使用模式,围绕上下文管理与验证闭环给出可直接套用的实践方法。
Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。
推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。
Anthropic 基于与数十个团队合作的经验发布构建高效 Agent 的工程指南,主张用简单、可组合的模式而非复杂框架,并区分了工作流与 Agent 两类系统。文章给出增强 LLM 这一基础构件,以及提示链、路由、并行化、编排者-工作者、评估者-优化者五种工作流模式,并建议仅在简单方案失效时增加复杂度;附录还讲解了工具提示词工程与 Agent-计算机接口(ACI)设计实践。
推荐理由:Anthropic 基于大量客户实践总结了构建智能体的可组合模式与工具设计方法,开发者可直接对照自己的场景选用。
Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。
推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。
Lilian Weng 在 Lil'Log 发表 Prompt Engineering 长文,系统介绍不更新模型权重、靠提示引导大语言模型行为的方法。
推荐理由:Lilian Weng 系统梳理了从 few-shot 到 CoT、自洽采样和 Toolformer 的提示词方法,附带示例选择与偏差校准的可迁移经验。