跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

165条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 21–40 条 · 共 165 条
9月30日周三
  1. METR:Research(网页)66

    METR 将重新设计开发者生产力实验,因 AI 选择效应致新数据不可靠

    METR 宣布重新设计其开发者生产力实验,认为 2025 年 8 月启动的二次研究中因开发者拒绝无 AI 工作而出现选择效应,使数据无法可靠反映 AI 工具的生产力影响。

    推荐理由:原文解释了为何 AI 更广泛采用带来的选择效应使其实验结果不可靠,并给出初步数据与后续研究设计思路。

  2. Fireworks AI(网页)67

    Fireworks 实测 DeepSeek V4 Pro 0813:SWE-Bench 达 95.2%,单任务成本约为 Fable 5 的三分之一

    Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。

    推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。

  3. Cursor Blog70

    Cursor 团队分享如何搭建云端智能体开发环境

    Cursor 团队分享为云端智能体搭建开发环境的经验,核心思路是把开发环境当作用户是智能体的产品来做。他们让云端 VM 与本地开发环境对齐,构建 anydev CLI 简化智能体运行服务的流程,并通过 Cursor Cloud MCP 和 Cloud Doctor 自动化功能实现环境的自愈与持续改善。

    推荐理由:Cursor 团队分享了自家云端智能体环境的搭建经验,包含 anydev CLI、Cursor Cloud MCP 等做法和可迁移的判断标准。

  4. Cursor Blog69

    Cursor 与 SpaceXAI 联合发布 Grok 4.6,聚焦长时程智能体任务

    Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。

    推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。

  5. Claude:Blog(网页)71

    Claude Marketplace 上线 340 个插件支持一键安装

    Claude 推出插件市场,收录 340 个插件,可一键安装为 Claude 添加工具、技能和集成。示例包括 GitHub 官方 MCP 服务器、Playwright 浏览器自动化、Figma 设计转代码、Supabase、Vercel 集成,以及代码审查、语言服务器和 CLAUDE.md 维护等开发类插件。

    推荐理由:页面列出了插件市场的主要品类和代表性插件,读者可以据此了解 Claude 现有可扩展能力的范围。

  6. Claude:Blog(网页)65

    Claude Code Projects 改版:从文件夹到多线程对话协调

    Anthropic 改版 Claude Code 的 Projects 功能,用户描述目标后由 Claude 负责拆解任务、并行协调多个线程、审查输出并汇总结果,例如按仓库开线程迁移调用、跑测试并开 PR。

    推荐理由:官方介绍了 Projects 从文件夹到对话的改版机制,读者可以了解多线程协调与共享记忆如何改变 Claude Code 的长任务工作流。

  7. Claude:Blog(网页)69

    Anthropic 前线工程师详解如何准备 AI 驱动的代码现代化项目

    Anthropic 前线部署工程师分享大型代码现代化项目的准备方法:过去需多年的项目如今可在数月或数周完成,但组织流程不变,瓶颈从产出变更转向动员组织。

    推荐理由:Anthropic 前线工程师基于真实客户部署,给出智能体驱动代码现代化的六步准备方法,可直接迁移到企业大型改造项目。

  8. Claude:Blog(网页)60

    Claude Code 推出 Artifacts:把会话工作变成可共享的实时网页

    Claude Code 推出 Artifacts,可基于会话完整上下文(代码库、连接器、对话)生成实时可共享的网页,如 PR 讲解、事故页、仪表盘和发布清单,页面随会话进展原地刷新,每次发布为新版本并支持历史回滚。

    推荐理由:官方说明了 Artifacts 的构建方式、版本共享机制和权限策略,读者可以判断它能否替换团队现有的状态同步流程。

  9. Cognition 模型 / Devin 博客(网页)65

    Cognition 发布 SWE-grep 和 SWE-grep-mini,用 RL 训练快速并行上下文检索模型

    Cognition 训练了 SWE-grep 和 SWE-grep-mini 两个快速智能体模型,专攻高度并行的上下文检索,检索能力匹敌前沿编码模型,耗时低一个数量级。

    推荐理由:官方公布了模型设计、RL 训练细节和评测数字,读者可以借此了解并行上下文检索的实现路径。

  10. Cognition 模型 / Devin 博客(网页)69

    Cognition 发布 SWE-1.5 编码模型,最高 950 tok/s 并登陆 Windsurf

    Cognition 发布面向软件工程的 SWE-1.5 模型,参数量为数千亿级,与 Cerebras 合作以最高 950 tok/s 推理,比 Haiku 4.5 快 6 倍、比 Sonnet 4.5 快 13 倍,现已在 Windsurf 上线。

    推荐理由:原文给出速度对比、SWE-Bench Pro 成绩和训练细节,读者可以据此评估这款高速编码模型是否改变现有工作流。

  11. Cognition 模型 / Devin 博客(网页)74

    Cognition 融资超 10 亿美元,估值达 260 亿美元

    Cognition 宣布融资超 10 亿美元,估值 260 亿美元,由 Lux Capital、General Catalyst 和 8VC 领投。企业用量今年初以来增长超 10 倍,run-rate 收入达 4.92 亿美元;Mercedes-Benz 将八个月的遗留系统改造项目缩短到八天,Itaú 用 Devin 自动修复 70% 的安全漏洞。

    推荐理由:原文由当事公司自述融资规模与业务数据,读者可以据此了解 Devin 的企业采用情况和自研模型进展。

  12. Cognition 模型 / Devin 博客(网页)70

    Cognition 发布 Devin Desktop,作为 Windsurf 下一代版本

    Cognition 发布 Devin Desktop,定位为 Windsurf 的下一代版本,将 Agent Command Center 设为 IDE 默认界面,可从一处管理本地与云端 Agent、PR 和上下文。

    推荐理由:官方完整说明了产品定位与 ACP 开放设计,读者可以据此判断它与现有 Windsurf 工作流的衔接方式。