掩码扩散语言模型中的可靠并行解码(RPD)
研究者提出免训练的可靠并行解码方法 RPD,按逐层预测稳定性与最终置信度筛选候选 token,并在其前置掩码位置的累积熵预算下并行提交。在 LLaDA 和 Dream 上的数学推理与代码生成基准中,RPD 在评测方法中取得最高解码吞吐,同时保持或提升准确率。诊断显示,仅凭置信度无法确定可靠的提交顺序,序列末端的高置信预测可能在上游计算尚未建立时锁定答案。
研究者提出免训练的可靠并行解码方法 RPD,按逐层预测稳定性与最终置信度筛选候选 token,并在其前置掩码位置的累积熵预算下并行提交。在 LLaDA 和 Dream 上的数学推理与代码生成基准中,RPD 在评测方法中取得最高解码吞吐,同时保持或提升准确率。诊断显示,仅凭置信度无法确定可靠的提交顺序,序列末端的高置信预测可能在上游计算尚未建立时锁定答案。
Docent 团队发布技术演示,展示如何在生产环境的编码智能体流量中测量失准行为。该团队此前已将 Docent 以 Apache 2.0 协议开源,并与 SWE-Bench 合作实现对智能体轨迹的可扩展分析。Docent 是用于分析和干预智能体行为的系统。
xAI 为 Grok Build 推出记忆功能,在每轮对话完成后于后台记录约定、决策和项目事实,后续会话会先读取相关笔记再修改代码。记忆按项目保存并另有全局偏好集合,不记录任务状态、临时结论、密钥及仓库文档已覆盖的内容;新增 /memory 浏览命令和 /dream 整理命令,后者也会定期在后台运行。
TensorZero 团队发布开源方法,在每次 Git commit 时自动为 Cursor 的 LLM 推理计算反馈奖励。
Sarvam AI 汇总首届 Sarvam Epoch 活动上发布的全部内容,覆盖模型、推理、Agent 平台与硬件。
Berkeley RDI 扫描发现 1,960 个 GitHub Pages 站点(18,384 个页面,合计超过 530K stars,含 microsoft/AirSim 和 UC Berkeley 课程页)仍在加载 polyfill.io 等 Funnull 系列 CDN,该运营商已被 OFAC 制裁。
推荐理由:原文实测四款大模型仍会推荐已被制裁的恶意 CDN 域名,并给出可执行的排查命令和修复清单,方法可迁移到自身项目。
UC Berkeley、MIT、Microsoft、Cursor等机构的研究者发布立场论文《Towards Autonomous Software Development》,提出软件开发自主性三级框架:Level I代码自主、Level II流水线自主、Level III需求自主。
Berkeley RDI 等机构发布 Vero 基准,要求 AI 智能体在仓库级同时编写实现与 Lean 4 证明,包含 43 个多模块实例、743 个评分 API 和 2,705 条形式化规范。
微软推出 MAI-Code-1.1-Flash 模型,已用于 GitHub Copilot,在命令行编码和 .NET 开发任务上表现提升,用更少 token 完成任务且成本低于 6 月版本。微软还发布开源智能体框架 Orchard,为训练和评估能写代码、浏览网页的 AI 智能体提供可复用环境。此外,微软研究模型 CARE-X 可将多项放射学任务整合,在胸部 X 光任务和真实患者数据上表现良好。
METR 发布系列研究笔记,涵盖 per-action 阻断监控的有效性论证、LLM 是否加速网络/数学/算法领域发现速率,以及智能体能力度量。其中一项微调实验显示,四个推理模型经少量指令遵循数据微调后,CoT 可控性在分布外任务上从平均 2.9% 升至 8.8%;另一项分析发现约半数通过 SWE-bench Verified 的 AI 生成 PR 不会被仓库维护者合并入主分支。
Meta Superintelligence Labs 发布 Muse Spark 1.1,一个面向智能体任务的多模态推理模型,在工具与计算机使用、编码和多模态理解上较 Muse Spark 有明显提升,支持 100 万 token 上下文管理和多智能体编排。
Z.AI 发布面向智能体工程的新模型 GLM-5.3,沿用与 GLM-5.2 相同的 744B-A40B MoE 底座,能力提升全部来自在更多样真实任务环境上的规模化后训练。
Fireworks AI 基于 DeepSWE v1.1 的 113 个任务分析称,按任务选模型的 oracle 路由在 18 个模型上可达 97.6% 通过率、每任务 $1.88,比最佳单模型 GPT-6 Astra(74.1%、$6.52)高 23 分且成本不到三分之一;仅用开源权重模型也能达 90.3%、$1.45。
Fireworks AI 发布 Specialized Intelligence Index(SII),汇集开放、闭源和专用模型在医疗、法律、网络安全、金融、客服、生产力、软件七个领域的从业者设计基准上的表现。
Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。
推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。
Eugene Yan 分享与 AI 高效协作的工作流与复利方法,提出五条原则:提供良好上下文、把品味编码为配置、让验证变得简单、委托更大任务、闭合反馈循环。具体做法包括用 INDEX.md 注解组织上下文、将 CLAUDE.md 当作入职文档、把每周任务沉淀为 skill 并通过会话记录迭代、用 hooks 和 evals 左移验证、用 tmux 并行 3-6 个会话并挖掘过往会话记录更新配置。
NVIDIA 联合 SGLang 团队推出 SWE-Serve 基准,从 83 个已合并的 SGLang pull request 中构建 53 个可执行任务,用于评估智能体对推理服务软件仓库级改动的真实效果。
Cursor 官宣已被 SpaceX 正式收购,始于 4 月与 SpaceXAI 合作的收购流程正式完成。Cursor 表示将使用全球最大的 GPU 集群,以更低成本构建和提供能力更强的模型,并提及周三发布的 Grok 4.6 初步展示了合作成果;Cursor 将继续帮助用户少写代码、专注于更有挑战性的问题。
推荐理由:收购方官方亲述交易完成与后续算力、模型计划,读者可借此了解 Cursor 未来产品与成本走向。
Cursor 推出 Projects,让开发者以项目为单位承接功能开发、迁移和长期维护等工作,可维持数月上下文、向数千个子智能体委派任务并自动处理周期性工作。每个 Project 默认在云端运行并同步共享上下文,协调智能体只负责委派而不写代码,还可订阅 Slack 频道、按计划运行或跟踪 PR。
推荐理由:官方介绍了 Projects 的协调智能体机制和内部使用数据,读者可以对照自己的多 PR 工作流评估是否适用。
xAI 发布 Grok 4.7,定位为面向编码和知识工作的最强模型,价格和速度与 Grok 4.6 相同,输入每百万 token $2、输出 $6。
推荐理由:官方给出了 Grok 4.7 的基准成绩、价格和防护数据,读者可以据此与 Grok 4.6 等模型比较编码和安全表现。
Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。
推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。
Cognition 发布 SWE-2,其最强编码模型在 FrontierCode 1.1 Main 得分 50.0%,与 Fable 5.1 差距不到 1 分且便宜 64%。
Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。
推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。
Cognition 与 AWS 签署多年战略合作协议,帮助企业将 Devin 自主工程师部署到生产环境,并加速遗留工作负载迁移上 AWS。客户已可通过 AWS Marketplace 购买 Devin,并在 Devin 内直接使用 Agent Toolkit for AWS。
Cognition 宣布拓展拉丁美洲业务,首站设在圣保罗,此前已与 Itaú、Nubank、Santander 等区域大型机构合作使用 Devin。Itaú 超 75% 技术团队使用 Devin,完成 30 万+ 代码库文档化、.NET 迁移 Java 提速 6 倍、自动修复约 70% 安全漏洞,工程吞吐量提升 20-30%。
Anthropic 上线 Claude 平台 Console,提供两种开发方式:Messages 为直连模型,需自行构建每轮对话、管理会话状态并编写工具循环;Managed Agents 提供全托管智能体基础设施,支持有状态会话与持久事件历史。平台同时提供 Claude 模型家族选型指引,涵盖研究、编码、写作等场景,Haiku 4.5 主打最快速度与最低成本。
Anthropic 发布 Claude Code 入门文档,该智能体编程工具可读取代码库、编辑文件、运行命令,支持终端、IDE、桌面应用和浏览器四种使用界面。终端 CLI、VS Code 和 JetBrains 插件还支持第三方模型提供商,多数界面需 Claude 订阅或 Anthropic Console 账户。
Claude 提供桌面与移动端应用下载,覆盖 macOS、Windows(含 arm64)、Linux(beta,支持 Ubuntu 和 Debian)以及 iOS 和 Android,所有套餐(Free、Pro、Max、Team、Enterprise)均可使用,部分功能仅限付费计划。
推荐理由:原文汇总了 Claude 桌面与移动端应用的下载入口、各平台支持范围和付费限制,读者可据此判断是否迁移工作流。
Trail of Bits 发文批评 1Password 2026 年 8 月 6 日报告的 26% 干净修复率有误导性,指出其样本被挑选为复杂修复、22% 数据使用故意指示错误修复的提示词、36% 试验禁止编译测试,并披露评分规则与人工审查的分歧。
推荐理由:作者用自有的 Patch the Planet 合并率和开发者首次修复失败率作对照,说明该基准在样本、指令和评分上的问题。
Trail of Bits 在审计 Miden zkVM 前,用智能体在六个月内从零构建了 MASM 的 LSP 服务器、反编译器、静态分析引擎和 Lean 形式化模型。
推荐理由:作者复盘如何让智能体在审计前自建 LSP、反编译器、静态分析和 Lean 形式化模型,方法可迁移到其他安全审计场景。
Cloudflare 为 Workers 推出内置错误监控功能 Issues,现处开放测试阶段。无需额外 SDK,一行配置即可自动归组重复异常、5xx 响应和错误日志。
CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。
Augment Code 将其 Cosmos 代码审查系统从单纯审查扩展到完整的 PR-to-merge 闭环,新增 Verifier、PR Fixer、Review Dashboard 和 cosmos approve 四项能力,由专职专家智能体承担修复、运行时验证与自动审批,人类保留最终合并决定权。该系统此前已帮助其工程组织将代码产出提升 3 倍,同时降低中位合并时间并维持质量。
Augment Code 今年早些时候从零重构了 Auggie CLI 的 harness,在 SWE-bench Pro(731 实例,opus4.7)上 Auggie v2 通过率与 Claude Code 相当的情况下,单任务成本 $1.27 对 $2.70,便宜 53%,平均耗时 330s 对 409s。
Augment Code 的两人 Cosmos Advisor 团队用 Cosmos 构建了 Feedback Triager 智能体,把每周产品反馈从约 5 条增至 30+ 条的压力接了过来。
Augment Code 发布 Cosmos Advisor,一个内置于 Cosmos 平台的专家智能体,可在同一对话中回答、配置、部署、检查并改进系统,让定制智能体约十分钟接入企业工作流。
Artificial Analysis 评测 GPT-6 Sol 和 Luna,两者价格较 GPT-5.6 减半,Intelligence Index 持平,Sol 编码指数升 2 分至 57,Luna 降 2 分至 41。
推荐理由:原文以统一基准实测两款新模型的成本与能力变化,读者可据此判断价格减半后智能与编码表现的取舍。
Augment Code 官方复盘其软件工厂搭建过程:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台陆续部署 PR Author、Deep Reviewer、Verifier、Incident Investigator 等专用智能体,覆盖需求、工单、PR、生产四个环节,量化分析覆盖 17,200 个已合并 PR。
推荐理由:官方复盘给出九个月内部数据与逐月部署节点,读者可以据此了解团队级智能体工厂的搭建路径与取舍。
Anthropic 发布研究,Claude 在不到四周内优化了超过 30 个用于结构预测、蛋白质设计、基因组学和蛋白质语言模型的开源模型,平均加速约 4 倍、输出完全一致时约 2 倍,并开源了全部优化代码。
推荐理由:原文给出具体加速倍数、低内存模式和开源入口,读者可评估这些优化对自身生物分子建模工作流的实际收益。
Anthropic 宣布 Claude Design 现可在任意 Claude 对话中使用,包括 Claude Code 和 Artifacts 标签页,Claude Tag 支持即将推出。
推荐理由:原文给出可用范围、连接器和设计系统管理等具体变化,读者可据此判断它对设计到交付流程的影响。