Liquid AI 发布端侧智能体模型 LFM2.5-2.6B
Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,Base 与后训练版本已在 Hugging Face 开放。
推荐理由:原文给出完整的四阶段后训练流程、多基准对比和 CPU 与手机端实测速度,读者可据此评估它对端侧 Agent 部署的适配度。
Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,Base 与后训练版本已在 Hugging Face 开放。
推荐理由:原文给出完整的四阶段后训练流程、多基准对比和 CPU 与手机端实测速度,读者可据此评估它对端侧 Agent 部署的适配度。
Fireworks 发布 FireRouter with Opus,将常规轮次路由到开源模型、仅在需要的轮次保留 Claude Opus 5.5,单次会话成本降低 57%,并支持缓存感知路由。
Trilogy AI Center of Excellence 围绕 Fireworks 上的 Kimi K3 发布公开 AI 网络安全手册与练习包,包含交互式手册、仓库和十个针对本地训练应用的练习。
Meta 发布 Muse Glimmer 30B 开源模型(Apache 2.0),并已在 Fireworks 提供 serverless 和按需部署。
推荐理由:原文给出 Muse Glimmer 的架构细节、基准对比和推荐参数,读者可据此评估它是否适合长期运行的多轮 Agent 工作流。
Harvey 发布首个模型 Tenet,基于 Kimi K3 用 Fireworks Training API 的异步强化学习后训练,面向长周期法律工作。
Fireworks AI 用 CyberGym 测评 DeepSeek V4 Pro 0813、Kimi K3、GPT-5.5 和 Claude Opus 4.8,V4 Pro 在 840 个对抗性安全任务中零拒绝、全部产生原生工具调用,进入验证率 97.3%。
Fireworks AI 发文梳理企业迈向专业化智能的三阶段路径:先租用闭源前沿模型并围绕其搭建提示词、上下文与 harness 工程,再引入更便宜的开源模型优化成本与延迟,最终为真正属于自己的问题训练定制模型。文中以 Kimi K3 与 GPT 5.6 Sol 在 OSWorld 2.0、UIPad 上的对比为例,说明基准只能用于初筛,自建评测才是性能的最佳指标。
Genspark 与 Fireworks Lab 合作,将开放权重多模态模型 MiniMax M3 后训练为 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
Phylo 在 Fireworks 上部署开源权重模型,实现月环比用户增长 2 倍、成本降低 60%,大部分流量已转向开源模型,首 token 时间约减半。其 Biomni Lab 是首个集成生物学环境,智能体单次任务可运行数小时至数天、调用数百次工具,新开源模型可在 24 小时内上线生产。
Cursor 团队分享为云端智能体搭建开发环境的经验,核心思路是把开发环境当作用户是智能体的产品来做。他们让云端 VM 与本地开发环境对齐,构建 anydev CLI 简化智能体运行服务的流程,并通过 Cursor Cloud MCP 和 Cloud Doctor 自动化功能实现环境的自愈与持续改善。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建经验,包含 anydev CLI、Cursor Cloud MCP 等做法和可迁移的判断标准。
Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。
推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。
Cursor 推出构建功能,在后台预先准备可直接使用的开发环境副本,智能体启动即可运行,无需额外费用。默认每小时创建一次新构建,环境损坏时智能体沿用上一次成功构建;Cursor 内部环境启动速度提升 10 倍、首个 token 生成速度提升 3 倍。8 月 17 日起所有新建和现有环境将默认启用构建。
推荐理由:官方原文给出启动速度倍数、构建频率和失败回退机制,读者可据此评估其对云端智能体工作流的影响。
Cursor 宣布通过 AIUC-1 智能体安全、安全性和可靠性认证,认证由 Schellman 开展独立审计,并在数千个场景中对智能体进行对抗性测试,覆盖 IDE 和云端智能体的规则、钩子和 Auto-review 等防护措施。
Claude 介绍 Artifacts 功能,可在对话旁生成设计、演示文稿、文档、仪表盘或小型交互工具,支持画布编辑、链接分享(默认私有)和导出为 PowerPoint、PDF、HTML 等格式。
推荐理由:官方页面对 Artifacts 及 Claude Design、Claude Slides、Claude Docs 的功能、协作与导出方式做了较完整说明,便于了解可用范围。
Anthropic 公布 Claude 的 Free、Pro、Max 三档订阅方案,Free 档 $0 面向所有用户,可在 web、iOS、Android 和桌面端使用,支持联网搜索、跨对话记忆以及创建文件并执行代码。
Anthropic 发布 AI-native SDLC playbook,主张在代码不再瓶颈后重构传统软件开发生命周期,将流程改为以提交工件驱动的闭环。
推荐理由:Anthropic 把内部 agentic 编码实践整理成六阶段方法论,覆盖从需求捕获到自动回环的每一步落地与治理细节。
Anthropic 发布《构建 AI 原生营收组织》指南,介绍在销售组织中推广 Claude 的配置决策、三阶段落地计划和 ROI 衡量框架。指南包含成熟度模型、试点前的负责人/连接器/IT 安全/成功指标/支出可见性等决策,以及按角色映射的高频用例。
Anthropic 发布 beta 版 Salesforce in Claude 插件,由双方共同构建,在既有 Salesforce 权限下将客户的账户、商机和管线引入 Claude,包含 37 项面向销售的技能,如账户调研、电话准备、管线回顾和 CRM 更新。
Anthropic 改版 Claude Code 的 Projects 功能,用户描述目标后由 Claude 负责拆解任务、并行协调多个线程、审查输出并汇总结果,例如按仓库开线程迁移调用、跑测试并开 PR。
推荐理由:官方介绍了 Projects 从文件夹到对话的改版机制,读者可以了解多线程协调与共享记忆如何改变 Claude Code 的长任务工作流。
Balyasny Asset Management 在数千个真实金融任务上评测 Claude Fable 5,Fable 取得 89.4% 对前代生产模型 86.1% 的成绩,并在复杂规划、分析与智能体执行上表现突出。该机构自建执行框架与 BAMAgent 平台,支持数千个自主智能体 7×24 小时运行,Fable 成为其投资团队系统化与编码工作的首选前沿模型。
Anthropic 前线部署工程师分享大型代码现代化项目的准备方法:过去需多年的项目如今可在数月或数周完成,但组织流程不变,瓶颈从产出变更转向动员组织。
推荐理由:Anthropic 前线工程师基于真实客户部署,给出智能体驱动代码现代化的六步准备方法,可直接迁移到企业大型改造项目。
CodeRabbit、Power Digital 和 ThoughtSpot 通过 Claude Marketplace 用已有的 Anthropic 承诺额度扩展了 Vercel 与 Snowflake 用量。
Anthropic 宣布 Claude Tag(beta)支持个人连接器:在 Slack 频道中让 Claude 使用成员自己账号连接的工具,如 Google Drive、日历、CRM 或 staging 部署,此前只能使用管理员附加到频道的连接器。
Claude 推出插件目录提交门户,插件可打包 MCP 连接器、Agent Skills 或两者,经审核通过后上架 Claude 目录,成为第三方扩展的主要形式。
推荐理由:官方说明插件提交流程、审核与使用分析功能,开发者可据此了解如何为 Claude 构建第三方扩展。
NVIDIA 发布 Open Agent Safety Platform,Anthropic 与其合作,将 NVIDIA 开源软件 OpenShell 引入 Claude Managed Agents 的智能体安全体系。
推荐理由:Anthropic 官方说明与 NVIDIA OpenShell 的分层安全设计,读者可以据此评估企业智能体的权限控制方案。
Asana 让 AI 智能体直接运行在其 Work Graph 模型内,与人类同事一样拥有角色、任务、消息读写和活动流记录,并由 Claude 驱动复杂任务。每个智能体按内容撰写、洞察分析、项目管理等角色预置技能与集成,其有效访问权限受触发者权限约束。智能体的共享记忆仅允许管理员和编辑者写入永久记忆,普通成员反馈只作用于当前任务。
Anthropic 销售团队基于 Claude Managed Agents(beta)构建了一个购买智能体,每天承接数千次对话,将客户从咨询直接引导至结账。该智能体转交的线索转化为商机的概率是旧表单的两倍以上,成交速度快约五天,且客户可选择与智能体或销售代表沟通。一名工程师用几周时间完成初版,销售与内容团队可直接在 Console 中修改系统提示词,上线后每周持续迭代提示词。
Anthropic 宣布 Claude Managed Agents 的记忆功能即日起以公测形式上线。记忆以文件形式挂载在文件系统上,智能体可跨会话学习并共享经验,记忆可通过 API 导出和管理,并带有权限范围、审计日志、版本回滚和内容修订等企业级控制。
推荐理由:官方公告讲清了文件式记忆的机制和企业级控制能力,还给出多家团队的具体效果数字,便于评估对长时程智能体工作的价值。
Claude 官方宣布在 Managed Agents 中以研究预览形式推出 dreaming,通过回顾过往会话提取模式、整理记忆,让智能体随时间自我改进,开发者可申请访问。
推荐理由:官方发布给出 dreaming、outcomes 与多智能体编排的能力细节和测试数字,读者可据此评估其在复杂任务工作流中的作用。
Anthropic 宣布 Claude Managed Agents 可在用户自控沙箱中运行工具并连接私有网络内的 MCP 服务器。
Claude Code 推出 Artifacts,可基于会话完整上下文(代码库、连接器、对话)生成实时可共享的网页,如 PR 讲解、事故页、仪表盘和发布清单,页面随会话进展原地刷新,每次发布为新版本并支持历史回滚。
推荐理由:官方说明了 Artifacts 的构建方式、版本共享机制和权限策略,读者可以判断它能否替换团队现有的状态同步流程。
Claude 在桌面端 Cowork 中内置浏览器,任务需要访问网站时侧边栏会打开浏览器,由 Claude 导航、读取、点击和填写表单。浏览器与用户浏览器分离,不共享标签页、书签或密码,银行、邮箱和单点登录站点默认排除,企业版可由管理员开启,本周起向 Pro、Max 和 Team 计划推送。
推荐理由:原文说明内置浏览器与 Claude in Chrome 的分工、隐私隔离和推送范围,读者可以据此判断哪种方式适合自己。
Anthropic 宣布 Claude in Chrome 正式面向所有付费 Claude 计划开放,Claude 现在可以在浏览器中自主执行操作,无需每个动作都经人工批准,操作前由安全分类器校验其安全性并匹配用户请求。
推荐理由:官方宣布 Claude in Chrome 全量开放并支持自主操作,同时给出提示注入防护机制与评测数据,便于读者评估其浏览器自动化能力。
Anthropic 为 Claude for Small Business 推出 43 个工作流和 27 个新集成,接入 Shopify、Salesforce、Stripe、Zoom、Xero 等工具,覆盖周报、线索响应、提案撰写、营销内容和月末关账等场景,产品自 5 月上线以来安装量超过 90 万次。
推荐理由:官方公布了新增工作流和集成的具体数量与用户案例,读者可以对照自己的工具链判断是否值得接入。
Cognition 为 Claude Sonnet 4.5 重构了 Devin,新版本速度快 2 倍,Junior Developer Evals 提升 12%,现已开放 Agent Preview,旧版 Devin 仍可使用。团队观察到该模型会感知自身上下文窗口、主动写笔记和并行执行工具调用,为此调整了提示词和记忆管理架构,并分享了子智能体、元智能体提示词等后续探索方向。
Cognition 宣布 Claude Sonnet 4.5 今日起可在 Devin 中使用,同时发布新的 Devin Agent Preview,速度提升超过 2 倍,Jr. Developer Evals 提升 12%。
Cognition 训练了 SWE-grep 和 SWE-grep-mini 两个快速智能体模型,专攻高度并行的上下文检索,检索能力匹敌前沿编码模型,耗时低一个数量级。
推荐理由:官方公布了模型设计、RL 训练细节和评测数字,读者可以借此了解并行上下文检索的实现路径。
Cognition 的 Devin 可将 .NET Framework 到 .NET Core 的 Strangler Fig 迁移从数月缩短至最快两周。Devin 通过 DeepWiki 生成架构文档、Ask Devin 产出迁移计划、独立环境执行迁移并实时验证每个 PR,覆盖依赖共享、控制器、视图和 Session State 等环节。
Cognition 发布面向软件工程的 SWE-1.5 模型,参数量为数千亿级,与 Cerebras 合作以最高 950 tok/s 推理,比 Haiku 4.5 快 6 倍、比 Sonnet 4.5 快 13 倍,现已在 Windsurf 上线。
推荐理由:原文给出速度对比、SWE-Bench Pro 成绩和训练细节,读者可以据此评估这款高速编码模型是否改变现有工作流。
Cognition 发布 Windsurf Codemaps,由 SWE-1.5 和 Claude Sonnet 4.5 驱动的 AI 标注结构化代码地图,用于帮助工程师快速理解代码库。