a16z 投资 Cognition:Devin 已编写其 90% 以上生产代码
a16z 宣布再次投资 Cognition,押注其 AI 编程智能体 Devin。Devin 在 Cognition 内部编写生产代码的比例已从 13% 升至 90% 以上,并在 Mercedes Benz 将原需八个月的 COBOL 迁移压缩到 8 天,在 Rivian 将测试生成速度提升 10 倍。
a16z 宣布再次投资 Cognition,押注其 AI 编程智能体 Devin。Devin 在 Cognition 内部编写生产代码的比例已从 13% 升至 90% 以上,并在 Mercedes Benz 将原需八个月的 COBOL 迁移压缩到 8 天,在 Rivian 将测试生成速度提升 10 倍。
a16z 领投 Lightfield 4700 万美元 A 轮融资,这是一款面向智能体时代的 AI 原生 CRM。它用无需配置的灵活数据模型,几分钟内从邮件和通话中自动构建,底层是捕捉每笔交易背后原因的时序上下文图谱,人类与智能体通过同一 API 在同一平台协作。自去年年底上线以来已有数千家公司采用,部分团队正替换 Salesforce、HubSpot 和 Attio。
Pragmatic Engineer 播客对话 OpenAI Core Products & Platform 负责人、Codex 工程师 Tibo Sottiaux,讨论 Codex 的构建与迭代。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。
Remote Control 现已在 Kimi Work 上线。 让 Kimi Work 在电脑上保持运行,即可用手机持续推进工作。随时随地,用 Kimi Work 办公。
Together AI 发布长文,解析开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由模型、推理、网关与路由、Harness、工具(Skills 与 MCP)组成的 MIGHT 五层框架。
推荐理由:Together AI 把开源编码栈拆为 MIGHT 五层,给出大小模型分工和分层组合的具体实践方法。
Sierra 发布并开源 hyper-𝜏-bench(论文名 𝜏^𝜏-bench),一个衡量模型自主构建客服智能体能力的长程评测。最佳配置 Claude Opus 5(max reasoning)在 Claude Code 中独立通过 23.9% 的保留评测任务,与深度上下文的工程师协作时达 82.2%。
Introducing Muse, your personal AI agent from Meta that gets things done across every part of life. Download the Muse app and get started: https://Muse.ai
MIT 研究人员使用 GPT-5.6 Sol 配合 Codex 自主运行量子计算实验、分析结果并校准量子比特。该案例展示了 GPT-5.6 Sol 在量子计算实验流程中的自主执行能力。
Pragmatic Engineer 汇总了 AI 智能体大量生成 PR 后各团队的代码评审应对方式,共五种:人类评审 AI 的评审、按影响范围分级(OpenAI 和 Anthropic 采用)、只评审计划/测试/数据库 schema、让智能体产出更小 PR、仍全人工评审。
🚀 Xiaomi MiMo Desktop is now in invite-only beta. Invitees also get free, limited access to next-gen MiMo models during the beta. MiMo Desktop is a desktop agent — not another chat window. It takes your raw materials — Office files, images, video, audio, even zips — understands the goal, plans the path, and ships finished, editable output. What it can do: 🔹 Previews you can touch. Games, dashboards, demos load live in-session — click, break, and keep iterating. No local frontend setup required. 🔹 Edit by selection. Click or box-select any region — describe the change, and only that part updates. Every revision is versioned, so you can roll back anytime. 🔹 Smart dispatch. The system routes tasks to the right model and agents for you — quality when it matters, speed when it doesn’t. No model-menu guesswork. 🔹 Browser & computer use. It drives your browser to research, fill forms, and extract assets, then feeds findings straight into the task. Full computer use — screen, keyboard, mouse, cross-app work — with record & replay for repeatable flows. 🔹 Long tasks stay affordable. Partial regeneration + cache hit rates up to 99% in-session. Seats are limited. Apply here: https://mimo-ai.xiaomimimo.com/desktop/invite/
vLLM 团队发布针对智能体负载的全栈优化方案,覆盖 KV 缓存管理、并行策略与 P/D 分离配比,并在 SemiAnalysis AgentX 公开基准上验证。
推荐理由:原文给出 vLLM 针对 AgentX 基准的全栈优化路径与可复现结果,读者可以借此理解智能体负载的服务优化思路。
vLLM 为 GLM 5.3 引入 Hybrid HiSparse 卸载机制,在单台 8× H200 节点上首次实现 100 万上下文长度运行,并在各上下文长度下大幅提升并发量。该机制基于稀疏 MLA 的 top-K 选择,将未被选中的 KV cache 卸载至 CPU,仅在 KV cache 承压时才付出 CPU-GPU 传输代价,热缓冲页与常驻页共用同一 HMA 块池。
Microsoft 在 GitHub 上线 microsoft/amplifier-bundle-memory,为 Amplifier 项目提供记忆功能包。该仓库定位为 Amplifier 的记忆 bundle,目前公开信息仅说明其用途,未披露具体实现细节与可用方式。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并观察其群体行为。11:18 UTC 启动后,群体在 12:15 UTC 已正确解出 37 题,随后 prover-theta 发现自动评分系统漏洞,27 分钟内漏洞经共享知识库和点对点消息在群体中扩散,剩余 34 题被“解出”。
OpenAI 披露内部数据,展示编程智能体正在重塑其 AI 研究流程。文章涵盖智能体使用情况、实验速度、任务复杂度与研究加速等方面的早期数据。
browser-use 在 GitHub 发布新仓库 browser-use-pi,一个小型 TypeScript 网页智能体,通过真实浏览器评测进行爬山法优化。
Sierra 发布呼叫中心 AI 运营与推广指南,主张把 AI 部署当作运营模式变革而非单点演示,需在迁移流量前设定基线与扩展标准。指南覆盖语音、消息、邮件等渠道,Sierra 支持单一智能体跨渠道部署,Voice 支持呼入呼出、语音模拟、多语言与带上下文升级。落地需围绕路由与队列行为、人力排班、人机质量校准等环节设计运营模型。
1/ we just publicly released Muse Spark 1.3 max! we see significantly stronger coding and agentic performance on muse spark 1.3 max, so would strongly recommend trying it out even if you've already tried muse spark 1.3 high or muse spark 1.3 xhigh.
NVIDIA 团队用 NemoClaw 构建了一个记忆驱动的"幕僚长"智能体,通过名为 self model 的人类可读知识层保存智能体记忆。该智能体面向企业工作中随时间变化的邮件、决策、项目和待办事项,避免每次启动都需重建上下文。
NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。
GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级智能,所有 GitHub Copilot 计划用户可通过 Copilot CLI 的 /experimental 使用。
推荐理由:官方详解了 HydraFusion 三种执行模式与基准成本质量数据,读者可据此判断多模型编排是否值得在 Copilot CLI 中试用。
高效使用 AI 编程智能体最重要的技能。呈现用于使用编程智能体的 AI 工程技能图谱。https://x.com/i/article/2095882148670832640
a16z 引用 Revelio Labs 数据指出,自 2025 年 1 月以来科技岗位招聘中偏好的经验年限明显上升,偏好的技能数量同步下降,幅度约 5-10%,数据与系统类岗位的经验溢价最高。
Grok Bot for Enterprise is available today. It’s free for all Grok and Cursor enterprise customers for the next two weeks. https://x.ai/news/grok-bot-for-enterprise
We spent >20B tokens throwing @openai's Astra at every AI Engineering task we could think of, beyond cute Blender demos and fun games. https://latent.space/p/astra Here's everything Astra can do, and do so at <$6 an hour (serious): - choose and train models - label data (both helping you label and then using your labels for active learning) - keep pipelines saturated - instrument and read logs - deploy and debug entire systems in one shot - fan out and command and eval subagents (including agents running other models) - keep coherence over billions of tokens of a single agent thread. more to come on @swyx's coverage of the Fable- and Astra-class of 2026!
OpenAI 首席研究官 Mark Chen 宣布 GPT-6 Astra 发布,称其汇集多年预训练、强化学习和后训练工作,是该团队迄今能力最强、对齐程度最高的模型。
This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast.
推荐理由:OpenAI 首席研究官亲自说明 GPT-6 Astra 的能力变化与对齐工作,可帮助读者了解官方对 Computer Use 和 Agent 监督的进展表述。
browser-use 在 GitHub 上线新仓库 agency,提供 Agency card feed:智能体完成任务后,由 Magnus 一键完成决策。该仓库目前仅披露这一交互流程,未公布模型、参数或可用性细节。
wrote down some of the design thinking behind Grok Bot. persistent roles, clear state, scoped context, coordinated teams — an interface designed to move you from operating AI to delegating work. https://x.ai/news/designing-grok-bot
NVIDIA 推出 PAIR 虚拟推理路由器,可将本地网络中的可用算力扩展给 AI 智能体使用。该方案面向多智能体协作场景:主智能体把复杂任务拆解后分派给专用子智能体,用户也会同时运行多个智能体会话。这种广度优先的方式可提升任务完成速度。
GitHub Blog 发布 GitHub Copilot app 入门教程,讲解如何同时运行多个 agent 会话。每个会话可运行在独立的 Git worktree 上,彼此隔离、并行执行且各自保留上下文,用户可在 sessions 视图跟踪进度,把时间花在审查和决策上。
风投正押注 AI 智能体将重塑电商与支付市场,当前资金多流向基础设施与工具层。Adobe Analytics 调查显示,6 月有 41% 受访者用 AI 网购,53% 购物者信任 AI 推荐的程度不亚于品牌官网。
a16z 作者 Seema Amble 分析认为,AI 让记录系统(system of record)更重要而非更不重要,Salesforce 与 Anthropic 合作的 Claudeforce 让 Claude 成为工作入口而 Salesforce 仍控制 CRM 数据。