Claude Code v2.1.277 发布:新增 AGENTS.md 支持
Claude Code v2.1.277 新增 AGENTS.md 支持:项目无 CLAUDE.md 时会改读 AGENTS.md,可在 /config 的 "Project instructions" 中修改(Bedrock、Vertex、Foundry 暂不支持)。
Claude Code v2.1.277 新增 AGENTS.md 支持:项目无 CLAUDE.md 时会改读 AGENTS.md,可在 /config 的 "Project instructions" 中修改(Bedrock、Vertex、Foundry 暂不支持)。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,MCP 提供工具与数据的标准接入,Skills 封装团队流程与最佳实践,二者可组合使用;RAG 并未消亡,检索能为模型提供训练数据之外的信息,减少 token 消耗并让回答更有依据。
a16z 图表周报引用近期论文和 SensorTower 数据指出,AI 代码生成工具让每月新应用数量在 iOS、Android 和 Chrome 上翻倍甚至翻两番,但下载量和评分基本停滞,达到 10+ 评分或 100+ 下载等规模的应用占比大幅下降。
MiniMax Code CLI 现已开放: https://github.com/MiniMax-AI/minimax-code
https://x.com/i/article/2100908964779040768
Claude Code 发布 v2.1.276,修复了当 ANTHROPIC_BASE_URL 指向代理或网关时每个请求都因 400 报错而失败的问题,该问题为 2.1.275 引入的回归。此版本自 v2.1.275 以来共合并 43 个提交。
一家全球金融科技公司把编码智能体工作负载迁到 Together 的 Dedicated Model Inference,运行 GLM-5.2 并采用多副本 B200、256K 上下文配置。
唐杰发文复盘,GLM-5.3-Flash 从首次在国内加速器上运行到承接全部生产流量只用两周,端到端吞吐达 3.2 倍,大量工作由 GLM-5.3 驱动的 Infra Agent 完成。
We’re sharing how GLM-5.3 helped build and optimize the inference infrastructure serving GLM-5.3-Flash. The system went from its first successful run to production readiness in less than two weeks, with end-to-end throughput tripling relative to the initial baseline. The key was dense feedback: local correctness tests, execution traces, microbenchmarks, and end-to-end measurements that enabled targeted hypothesis testing rather than reliance on aggregate performance metrics alone. https://z.ai/blog/glm-built-its-inference-infrastructure
推荐理由:作者复盘了 GLM-5.3 智能体优化推理基础设施的两周过程,提出了可迁移的分层密集反馈方法与工程师角色转变的判断。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量合入 main,性能提升数个数量级,主要由一名开发者几个月内完成。
推荐理由:GitHub Copilot 运行时迁移 Rust 的完整复盘,给出智能体并行协作、提示缓存与评审流程的可迁移工程方法。
NVIDIA 技术博客介绍 cuTile Rust(cutile-rs),一个用 Rust 编写 GPU kernel 的 tile 系统,将 Rust 所有权模型扩展到 tile 级 GPU kernel,把可变输出拆分为互不重叠的片段,并在 kernel 启动间保持主机侧所有权契约。
研究者提出共享选择性持久记忆架构,为多轮工具调用的 Agentic LLM 系统保留任务规格、数据 schema、工具配置和输出约束四类可复用上下文,并丢弃会话专属推理轨迹。
Cognition 用 GPT-6 Astra 提升 Devin 测试软件并证明其可用的能力,目标是让工程师少审代码、多交付。该能力聚焦于 Devin 对自身工作的验证环节。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需在编辑器、终端和浏览器之间切换即可完成 AI 编码闭环。diff 面板以绿色标注新增、红色标注删除,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令并支持多窗口;浏览器面板可用 Pick & Polish 工具选中元素并让智能体调整。
Hugging Face 博客介绍 TRL v1.14 的 AsyncGRPOTrainer 新支持:只训练 LoRA 适配器并仅同步适配器(rank-1 仅几 MB)到 vLLM,训练器与 vLLM 副本作为独立 HF Jobs 运行在分开的机器上,通过挂载 Storage Bucket 共享适配器路径,无需 NCCL 或共享本地盘。
Marc Andreessen 发文回顾十五年前“软件吞噬世界”的论断,指出全球前十大公司中科技市值占比已从 31.5% 升至 94.4%,并宣布 a16z 第二次投资 Cognition。
a16z 宣布再次投资 Cognition,押注其 AI 编程智能体 Devin。Devin 在 Cognition 内部编写生产代码的比例已从 13% 升至 90% 以上,并在 Mercedes Benz 将原需八个月的 COBOL 迁移压缩到 8 天,在 Rivian 将测试生成速度提升 10 倍。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。
Together AI 发布长文,解析开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由模型、推理、网关与路由、Harness、工具(Skills 与 MCP)组成的 MIGHT 五层框架。
推荐理由:Together AI 把开源编码栈拆为 MIGHT 五层,给出大小模型分工和分层组合的具体实践方法。
Sierra 发布并开源 hyper-𝜏-bench(论文名 𝜏^𝜏-bench),一个衡量模型自主构建客服智能体能力的长程评测。最佳配置 Claude Opus 5(max reasoning)在 Claude Code 中独立通过 23.9% 的保留评测任务,与深度上下文的工程师协作时达 82.2%。
1Password 工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到生产可用状态,工程效率提升 21%。
OpenAI 披露内部数据,展示编程智能体正在重塑其 AI 研究流程。文章涵盖智能体使用情况、实验速度、任务复杂度与研究加速等方面的早期数据。
GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级智能,所有 GitHub Copilot 计划用户可通过 Copilot CLI 的 /experimental 使用。
推荐理由:官方详解了 HydraFusion 三种执行模式与基准成本质量数据,读者可据此判断多模型编排是否值得在 Copilot CLI 中试用。
GLOBAL BUILD is live 🌍🔥 GLM-5.3-Flash, FREE in ZCode. 10 hours a day. Sep 3 – 18. Who gets it 👑 Coding Plan members — free every day, all 15 days. Our VIPs go first. 🥚 New users — 100M free tokens on sign-up. One-time, valid until the window closes When it opens 🇺🇸 8 AM PT · 11 AM ET 🇬🇧 4 PM London 🇨🇳 11 PM Beijing How to claim 1️⃣ Open ZCode → tap the card in the bottom-left corner 👀 2️⃣ Not there? Restart the app 😏 http://zcode.z.ai
GitHub Blog 发布 GitHub Copilot app 入门教程,讲解如何同时运行多个 agent 会话。每个会话可运行在独立的 Git worktree 上,彼此隔离、并行执行且各自保留上下文,用户可在 sessions 视图跟踪进度,把时间花在审查和决策上。
Hugging Face 发布教程,用 TRL 库对 LiquidAI/LFM2.5-350M 做 GRPO 微调,仅用约 500 个样本和 100 步训练,将其在 IFStruct benchmark 上的通过率从 22.6% 提升到 29.7%。
推荐理由:教程给出完整可复现的低成本 GRPO 微调流程和逐项评测数字,读者可以照着在免费 GPU 上复刻这一结构化输出改进方法。
LongCat-2.0 is now free in Command Code. 1.6T params. 1M context. 48B activate. Available on all plans to all subscribers. npm i -g command-code 🐐
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两款模型,前者面向长时程编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:官方给出两款 Flash 变体的能力、定价与开放渠道,可据此判断长时程编码与安全场景的选型。
推荐理由:原文给出了 GLM-5.3 的参数规模、开源状态和基准表现,读者可以据此评估是否迁移现有工作流。
推荐理由:智谱官方宣布 GLM-5.3 开放权重,定位为智能体编码与网络防御能力最强的模型,附权重与博客入口。
LongCat-2.0 now available in Go 1.6T/48B · 1M context · fully open source
推荐理由:LongCat 官方宣布模型接入 opencode,读者可以了解该开源模型在编码工具中的可用入口。
GLM-5.3 × ZCode Weekend Build, Round 2 🚀 New users: log in to ZCode for the first time from Aug 22, 00:00 to Aug 24, 09:00 (UTC+8) and automatically get 100M free GLM-5.3 tokens. 50,000 packs, first come, first served; ZCode only. Unused tokens expire when the event ends. Grab yours: http://zcode.z.ai
Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。
推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。
Together AI 在全部 113 个 DeepSWE 任务上对 GLM-5.3 (max) 与 GPT-5.6 Sol (max) 各跑 4 次试验,共 904 次 rollout。
推荐理由:原文基于904次实测给出两模型在成本、速度和任务类型上的具体差异,并提供了可直接套用的级联路由方案。
NVIDIA 探索通用编程智能体能否借助 HoloHub 中的示例、文档和开发工具来开发 Holoscan 边缘实时 AI 应用。Holoscan 是面向医疗影像、机器人等边缘实时 AI 应用的平台,HoloHub 是其配套仓库,汇集了不断增长的参考应用与组件。
Pol Alvarez Vecino 借 Peter Naur 的《Programming as Theory building》指出,真正要降低的复杂度是存在于工程师头脑中的程序 Theory,而非代码本身,因此 LoC、圈复杂度等指标无法约束 LLM 的复杂度膨胀。
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。