Claude in Chrome 正式全面可用,支持在浏览器中自主执行操作
Anthropic 宣布 Claude in Chrome 正式面向所有付费 Claude 计划开放,Claude 现在可以在浏览器中自主执行操作,无需每个动作都经人工批准,操作前由安全分类器校验其安全性并匹配用户请求。
推荐理由:官方宣布 Claude in Chrome 全量开放并支持自主操作,同时给出提示注入防护机制与评测数据,便于读者评估其浏览器自动化能力。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Anthropic 宣布 Claude in Chrome 正式面向所有付费 Claude 计划开放,Claude 现在可以在浏览器中自主执行操作,无需每个动作都经人工批准,操作前由安全分类器校验其安全性并匹配用户请求。
推荐理由:官方宣布 Claude in Chrome 全量开放并支持自主操作,同时给出提示注入防护机制与评测数据,便于读者评估其浏览器自动化能力。
Anthropic 为 Claude for Small Business 推出 43 个工作流和 27 个新集成,接入 Shopify、Salesforce、Stripe、Zoom、Xero 等工具,覆盖周报、线索响应、提案撰写、营销内容和月末关账等场景,产品自 5 月上线以来安装量超过 90 万次。
推荐理由:官方公布了新增工作流和集成的具体数量与用户案例,读者可以对照自己的工具链判断是否值得接入。
Cognition 训练了 SWE-grep 和 SWE-grep-mini 两个快速智能体模型,专攻高度并行的上下文检索,检索能力匹敌前沿编码模型,耗时低一个数量级。
推荐理由:官方公布了模型设计、RL 训练细节和评测数字,读者可以借此了解并行上下文检索的实现路径。
Cognition 发布面向软件工程的 SWE-1.5 模型,参数量为数千亿级,与 Cerebras 合作以最高 950 tok/s 推理,比 Haiku 4.5 快 6 倍、比 Sonnet 4.5 快 13 倍,现已在 Windsurf 上线。
推荐理由:原文给出速度对比、SWE-Bench Pro 成绩和训练细节,读者可以据此评估这款高速编码模型是否改变现有工作流。
Cognition 在 Devin 上线 18 个月之际发布年度绩效复盘,称其已进入数千家公司的工程团队,累计合并数十万个 PR。
推荐理由:Cognition 以自家客户数据和指标复盘 Devin 的强弱项,为评估智能体实际部署效果提供了可参照的框架。
Cognition 发布 Devin Review,一款面向 GitHub PR 的 AI 代码审查工具,认为代码审查已成为比代码生成更大的瓶颈。
推荐理由:原文给出了 Devin Review 的三种使用入口和具体功能细节,读者可以据此判断它如何改进自己的 PR 审查流程。
Cognition 为 Devin 推出 bot triggers 功能:Devin 可被配置为自动修复 Devin Review 及其他 review bot 在 PR 上留下的评论,并继续自动修复 lint 和 CI/CD 问题。
推荐理由:原文由官方说明功能配置入口和适用范围,读者可以判断它如何改变团队 PR 审查流程。
Cognition 发布长文复盘,认为多智能体系统目前只在写入保持单线程、其他智能体贡献智能的模式下有效。
推荐理由:Cognition 一线团队复盘了真正跑通的多智能体模式,给出干净的审查上下文和单线程写入等可迁移经验。
Cognition 发布 Devin CLI,可把 Devin 作为本地编码智能体在终端运行,通过 curl -fsSL https://cli.devin.ai/install.sh | bash 一分钟内安装。
推荐理由:发布方自述了本地会话与云端接力的具体玩法,读者可以据此评估是否把它接入自己的终端工作流。
Cognition 宣布融资超 10 亿美元,估值 260 亿美元,由 Lux Capital、General Catalyst 和 8VC 领投。企业用量今年初以来增长超 10 倍,run-rate 收入达 4.92 亿美元;Mercedes-Benz 将八个月的遗留系统改造项目缩短到八天,Itaú 用 Devin 自动修复 70% 的安全漏洞。
推荐理由:原文由当事公司自述融资规模与业务数据,读者可以据此了解 Devin 的企业采用情况和自研模型进展。
Cognition 发布 Devin Desktop,定位为 Windsurf 的下一代版本,将 Agent Command Center 设为 IDE 默认界面,可从一处管理本地与云端 Agent、PR 和上下文。
推荐理由:官方完整说明了产品定位与 ACP 开放设计,读者可以据此判断它与现有 Windsurf 工作流的衔接方式。
Cognition 推出 Devin Fusion 预览,一个混合模型 harness,通过并行前沿模型与低成本 sidekick 智能体、以及基于轻量分类器在上下文压缩时动态切换模型。
推荐理由:官方披露了 sidekick 双智能体与中途动态路由两类可参考的降本架构,并给出 FrontierCode 上的成本与性能数据。
Trail of Bits 发布研究称,公共技能市场正被窃取凭据、外传数据、劫持智能体的恶意技能淹没,而现有扫描器难以拦截。
推荐理由:Trail of Bits 用四个自研恶意技能实测并绕过多家技能扫描器,读者可以从中了解静态扫描在供应链攻击面前的结构性局限。
Trail of Bits 与 OpenAI Daybreak 合作发起 Patch the Planet,用 GPT-5.5-Cyber 和 Codex 等前沿模型为关键开源项目找漏洞并完成修复。
推荐理由:原文给出第一周具体产出数字和维护者应对 AI 报告的方法,读者可以了解安全工作重心向修复端的转移。
Trail of Bits 在与 OpenAI 合作的 Patch the Planet 项目中,用 Codex 的 /goal 对 Rust、curl、zlib 等代码库挖洞,找到了 Rust 1.98 已修复的 soundness 漏洞和误编译、11 处变体命中,以及 Keycloak SAML 的两个潜在高危提权漏洞。
推荐理由:原文来自亲历团队,给出了 /goal 挖漏洞的三条可迁移技巧和 Rust 变体分析流水线,读者可以照此改进自己的 Agent 审计流程。
Augment Code 用内部评测 AuggieBench 测量数十个 AGENTS.md 对代码生成的影响,最好的文件带来相当于从 Haiku 升级到 Opus 的质量提升,最差的比没有文件更糟。
推荐理由:作者基于内部评测给出了 AGENTS.md 的可用与失效模式,读者可以按自身模块选择对应写法。
Augment Code 在 OpenClaw 的 40 个 PR 上测试 Auggie、Claude Code 和 Codex,对比在 AGENTS.md 前加入约 2.5k 字符的 Karpathy 式编码规则的效果。
推荐理由:原文用三个 Agent 和 40 个 PR 的实测数据,说明 Karpathy 式规则能降本提速但质量不升,可迁移到自家工作流。
Augment Code 推出 Prism,一种模型路由选项,为每轮用户请求自动选择底层模型,称团队月发 1 万次请求可省约 2 万美元,成本最多降 30%,质量与所对标的前沿推理模型差异可忽略。
推荐理由:官方给出多基准成本与质量数据及缓存感知路由方法,读者可据此评估模型路由能否降低自己的智能体开销。
Anthropic 发布新报告,让 Claude 自主训练模型以改进 10 类对齐失败的基准表现,并开源自动化对齐研究框架。平均闭合 85% 的安全差距,在欺骗一项上比 28 名人类安全研究者的最佳方案高 20%;用 Claude Sonnet 5 训练早期 Opus 4.8 检查点,约 2,000 条训练样本的方案效率约为生产对齐流程的 15,000 倍。
推荐理由:报告给出自动化对齐研究在十类对齐失败上的量化结果与开源工具,读者可据此评估该方向的实际可行性。
Anthropic 为 Claude 推出插件市场,收录 340 个插件,可将工具、技能与集成打包为一键安装。
推荐理由:原文列出了插件市场的实际内容和安装方式,读者可以据此挑选适合自己的 Claude 扩展组合。