DeepSeek V4 Pro 0813 对比 Claude Fable 5:DeepSWE 上的成本、编码与路由实测
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。
Z.ai 发布 GLM-5.3,目前仅在编码计划中提供,即将上线 API 并在两周后于 Hugging Face 开放权重,模型约 750B 参数,在多个 agentic coding 基准上超越 Kimi K3,部分超越 Claude Fable 5 或 GPT-5.6-Sol。
推荐理由:作者以第一手分析解释中国实验室如何保持前沿,给出发布节奏、RL 环境数据产业和模型定位等可迁移的判断框架。
Cursor is now part of @SpaceX. Today, we have officially closed our acquisition. We will join the @SpaceXAI team to help make Grok the world's most useful AI and improve Grok Build, Grok Bot, Grok API, Cursor, and more. SpaceX has built some of the most inspiring and impressive technology in the world, and we’re grateful for the opportunity to become part of such a special company. Onwards.
推荐理由:Cursor CEO 亲自宣布收购交割完成,是当事人的一手信息,可用作该交易状态的直接依据。
Gemini 3.7 Flash is here. It’s stronger for coding, knowledge work, and web development. 🧵
推荐理由:DeepMind 官方宣布 Gemini 3.7 Flash 发布,写明了能力方向和半价定价,读者可据此评估是否替换现有模型。
Google DeepMind 发布 Gemini 3.7 Flash,称其为迄今最智能的主力模型,面向编码与 Agent 场景,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方博客给出具体评测分数与限时定价,读者可以据此评估 Flash 系列在编码、Web 开发和知识工作上的实际提升。
Introducing Grok 4.6. It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price.
推荐理由:转发并补充了 Grok 4.6 在难度任务和知识工作上更强、兼顾低成本低速度的定位,可作了解该版本能力方向的参考。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:官方开源了环境服务和三条训练配方,小参数量模型在 SWE-bench Verified 等基准上的具体结果可直接对照复用。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款模型,面向大规模 AI agent 构建。
推荐理由:官方发布三款 Gemini Flash 模型,给出具体价格、token 效率与多项基准对比,读者可据此评估 agent 工作流的成本与选型。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证并修复漏洞,将通过限access试点先面向政府和可信伙伴经 CodeMender 开放。
推荐理由:以轻量模型多次调用替代单次大模型调用做漏洞挖掘,并用 Chrome 真实流水线等无污染基准展示对比结果,方法与数据都可参考。
Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。
推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。
Sierra 分享把全公司接入 AI 智能体的经验:工程团队用 git worktrees、Claude Code 和 Codex 并行跑 agent,部分任务产出达 5 倍,随后成立六人团队推进全员采用。
推荐理由:Sierra 复盘了内部全员 Agent 化的落地过程,单一入口、上下文瓶颈和成果度量三处经验可迁移到其他团队。
Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。
推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。
Arvind Narayanan 撰文认为现有证据足以否定 AI 达到某能力阈值就会引发大规模裁员的叙事。
推荐理由:作者用裁员数据和 decide-execute-deliver 框架解释为何 AI 未取代软件工程师,提供了可迁移的分析视角。
小米 MiMo 发布并开源终端编程智能体 MiMo Code V0.1,采用 MIT 许可,内置 MiMo V2.5 多模态模型(限时免费、百万 token 上下文)。
推荐理由:官方宣布 MiMo Code V0.1 开源,列出无限上下文、语音输入等具体能力和一行安装命令,可据此评估迁移成本。
Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowledge work, scientific research, and vision. The longer and more complex the task, the larger Fable 5’s lead over our other models.
推荐理由:作者补充了基准之外的第一手使用感受,指出长难题求解能力跃升和安全护栏偏敏感,可作选型参考。
Ethan Mollick 分享了他提前试用首个面向公众发布的 Mythos 级模型 Claude 5 Fable 的体验,认为其明显超越此前所有模型,单个提示词即可连续工作最多十二小时执行多页规格。
推荐理由:作者以亲历测试描述使用感受与局限,给出了可验证的工作时长、成本和黑盒化体验等一手细节。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体在不到四个月内基本独自完成 Agent Studio 本地化,而他在 Slack 参与的同类项目曾需 10 人团队耗时 9 到 12 个月支持 4 个语言。
推荐理由:作者亲历两轮本地化项目,复盘单人用 AI 完成团队级工作的流程设计与坑,包含可直接迁移的工作流经验。
Mistral 发布统一 AI 智能体 Vibe,Le Chat 整体升级为 Vibe,原有对话、设置与套餐全部迁移。Work Mode 处理跨企业工具的多步骤长任务,如邮件日历跟进、深度研究、文档撰写和定时任务;Code Mode 从网页发起远程编码会话直至生成 PR,并推出 VS Code 扩展和更新的 CLI(新增 /teleport、权限控制等)。
推荐理由:官方发布说明写清了 Le Chat 升级为 Vibe 后的工作与编码两大模式、各端入口和定价,可据以评估是否替换现有工作流。
Mistral 发布 Mistral Medium 3.5(128B 密集模型,256k 上下文窗口,修改版 MIT 许可开源权重),并将其设为 Le Chat 和 Vibe CLI 的默认模型。
推荐理由:官方公布了模型规模、基准成绩与定价,并说明云端异步智能体如何嵌入现有工程工作流。
Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 已在 Gemini 应用、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。
推荐理由:官方发布稿给出了具体基准成绩、速度倍数和开放渠道,读者可以据此评估 3.5 Flash 在智能体和编码场景的可用性。