跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

197条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 181–197 条 · 共 197 条
10月20日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 为 Claude Code 推出沙箱功能并开源沙箱运行时

    Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。

    推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。

10月1日周三
  1. Answer.AI 官方研发博客(RSS)65

    Answer.AI 开源 cachy:缓存 LLM 响应让 notebook 测试提速 60 倍

    Answer.AI 开源 cachy 包,通过修改 httpx 的 send 方法把 LLM 响应缓存到本地文件,无需手写 mock。测试运行从 2 分钟缩短到约 2 秒,并让 CI/CD 测试和 notebook diff 更干净。

    推荐理由:开源工具 cachy 通过拦截 httpx 缓存 LLM 响应,测试从 2 分钟降到约 2 秒,方法可直接迁移到自己的项目。

9月24日周三
9月8日周一
  1. Cognition 模型 / Devin 博客(网页)81

    Cognition 融资超 4 亿美元,估值达 102 亿美元

    Cognition 宣布融资超 4 亿美元,投后估值 102 亿美元,由 Founders Fund 领投,Lux Capital、8VC、Neo、Elad Gil 等老股东跟投,Bain Capital Ventures、Hanabi Capital 和 D1 Capital 为新投资方。

    推荐理由:作者以当事方身份披露融资与经营数据,读者可以据此了解 Devin 与 Windsurf 合并后的增长和产品布局。

8月20日周三
  1. Johann Rehberger / Embrace The Red(RSS)79

    Amazon Q Developer VS Code 扩展存在提示词注入导致远程代码执行漏洞

    安全研究者 Johann Rehberger 披露 Amazon Q Developer VS Code 扩展(下载量超 100 万)存在间接提示词注入漏洞:executeBash 将 find 归类为 readonly 并跳过人工确认。

    推荐理由:作者亲测复现了 Amazon Q Developer 的间接提示词注入到任意命令执行路径,读者可借此理解 Agent 权限模型的风险。

8月19日周二
  1. Johann Rehberger / Embrace The Red(RSS)77

    Amazon Q Developer 提示词注入可经 DNS 请求泄露开发者密钥

    安全研究人员 Johann Rehberger 披露 Amazon Q Developer VS Code 扩展(下载量超 100 万)存在高危漏洞:处理不可信数据时可被提示词注入劫持,通过 ping 等 readOnly 命令将开发者 .env 文件内容经 DNS 请求外泄。

    推荐理由:作者第一手复现了 Amazon Q Developer 通过 DNS 请求泄露 .env 密钥的提示词注入漏洞,并披露 AWS 已静默修复但未发公告或 CVE。

8月13日周三
  1. Johann Rehberger / Embrace The Red(RSS)84

    GitHub Copilot 提示词注入可致远程代码执行(CVE-2025-53773)

    Johann Rehberger 披露 GitHub Copilot 的提示词注入漏洞 CVE-2025-53773:注入内容可让 Copilot 写入 .vscode/settings. 并添加 "chat.tools.autoApprove"。

    推荐理由:作者亲测复现了从提示词注入到本机代码执行的完整链条,并给出缓解建议,适合评估 Agent 自改配置的安全风险。

7月18日周五
  1. OpenAI Developers(RSS)70

    OpenAI 开源 Computer Use API 示例应用,含浏览器与桌面两个智能体

    OpenAI 发布 Computer Use API 的示例应用 openai-cua-sample-app,包含两个计算机操作智能体:一个用 JavaScript 和 Playwright 控制浏览器,另一个用 Python 和 PyAutoGUI 通过截图、鼠标和键盘控制桌面。

    推荐理由:OpenAI 官方开源了计算机操作智能体的示例应用,读者可以据此了解用代码驱动浏览器和桌面的模式。

7月14日周一
  1. Cognition 模型 / Devin 博客(网页)84

    Cognition 签署最终协议收购智能体 IDE Windsurf

    Cognition 已签署最终协议收购智能体 IDE Windsurf,交易涵盖其 IP、产品、商标、品牌和业务,Windsurf 团队近期将照常运营,后续 Cognition 将把 Windsurf 能力整合进自家产品。公告披露 Windsurf 拥有 82M ARR(企业 ARR 环比翻倍)、350+ 企业客户和数十万日活用户,且全部员工将获得经济参与、豁免归属悬崖并加速归属既有股权。

    推荐理由:收购方官方公告披露了交易范围和 Windsurf 的 ARR、客户数等经营数据,可据此了解双方产品整合的方向。

7月11日周五
6月16日周一
  1. Sakana AI:Blog(网页)70

    Sakana AI 发布 ALE-Bench 基准与 ALE-Agent,在 AtCoder 启发式竞赛获第 21 名

    Sakana AI 与 AtCoder 合作发布 ALE-Bench 基准,基于 40 道历史 AtCoder 启发式竞赛(AHC)的 NP-hard 优化题,考察长周期迭代式算法工程能力,并开发了专用智能体 ALE-Agent。

    推荐理由:原文给出基准构成、竞赛名次和 agent 的具体改进策略,也如实写了局限,读者可据此评估 AI 做长周期算法工程的现状。

  2. Sakana AI:Blog(网页)70

    Sakana AI 与 AtCoder 联合发布 ALE-Bench 基准及 ALE-Agent,实测竞赛获 21 名

    Sakana AI 与 AtCoder 联合发布组合优化算法工程基准 ALE-Bench,并开发专用 AI 智能体 ALE-Agent,论文见 https://arxiv.org/abs/2506.09050。

    推荐理由:官方一手发布,给出基准构成、竞赛实测名次和 AI 与人类解题方式的差异分析,读者可据此评估长时推理能力的现状。

6月5日周四
5月21日周三
4月18日周五
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    Anthropic 发布 Claude Code 智能体编码最佳实践指南

    Anthropic 发布 Claude Code 智能体编码最佳实践指南,指出上下文窗口是最需要管理的资源,性能会随上下文填满而下降。指南覆盖给 Claude 提供可运行的验证标准、先探索再规划再编码、编写精简 CLAUDE.md、配置权限与 hooks、用子代理隔离调查、用 /clear 和 /rewind 管理会话,以及并行会话、非交互模式和对抗式审查等规模化用法。

    推荐理由:Anthropic 官方系统梳理 Claude Code 使用模式,围绕上下文管理与验证闭环给出可直接套用的实践方法。

1月8日周三
  1. Answer.AI 官方研发博客(RSS)79

    Answer.AI 团队实测 Devin 一个月:20 个任务仅 3 个成功

    Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。

    推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。

12月19日周四
  1. Answer.AI 官方研发博客(RSS)76

    Answer.AI 与 LightOn 发布 ModernBERT 编码器模型家族

    Answer.AI 与 LightOn 发布 ModernBERT,一个替换 BERT 的 encoder-only 模型家族,含 base(149M 参数)和 large(395M 参数)两个尺寸,上下文长度达 8192 tokens。

    推荐理由:发布方给出了速度、上下文长度和训练数据的具体改进点,读者可以据此评估它能否替换现有 BERT 类工作流。