跳到正文

#编码

今日 5 条
今天10月1日周四
  1. Google DeepMind:Blog(RSS)77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。

    推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。

  2. Google Blog:AI(RSS)76

    Google 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 面向可信网络防御者开放,价格为每百万输入 token $2、输出 token $10,缓存输入 token 为输入价的 5%。

    推荐理由:官方公告给出定价、输出 token 上限和多个基准分数,读者可以据此评估它在编码与安全防御场景的落点。

  3. Claude Code:GitHub Releases(RSS)40

    Claude Code v2.1.286 发布

    Claude Code 发布 v2.1.286,为堆叠的权限请求加上"2 of 5"计数,并支持在全屏列表中点击"N more"行跳转。该版本修复了 claude --resume 和 --continue 在并行工具调用后丢失全部轮次、工具或 hook 返回对象/数字/布尔值时触发 API 400 错误,以及云会话因容器在 transcript 加载中被停止而无法唤醒等问题。

9月30日周三
  1. xAI:News(网页)67

    xAI 发布终端编码智能体 Grok Build 早期测试版

    xAI 发布终端编码智能体 Grok Build 的早期测试版,面向所有 SuperGrok 和 X Premium Plus 订阅者开放。它支持计划模式审批、AGENTS.md、hooks、skills 和 MCP 服务器开箱即用,可将任务分派给并行运行的子代理,并提供 headless 模式(-p)与完整 ACP 支持。用户可输入 /feedback 提交反馈。

    推荐理由:官方介绍覆盖计划模式、并行子代理和 headless 模式等能力,读者可据此判断如何接入现有终端工作流。

  2. xAI:News(网页)62

    xAI 发布编码模型 grok-build-0.1,API 公测上线

    xAI 将编码模型 grok-build-0.1 以公开测试形式上线 xAI API,该模型专为智能体编码任务训练,支持 Web 开发、调试和 MCP,也是驱动 Grok Build 的同一模型。

    推荐理由:xAI 官方公告给出了 grok-build-0.1 的定位、速度、定价和适配工具,读者可据此评估是否接入自己的编码工作流。

  3. xAI:News(网页)56

    xAI 为 Grok Build 推出 Agent Dashboard,支持同时管理多个编码会话

    xAI 为 Grok Build 推出 Agent Dashboard,把所有会话集中到一屏,支持并行运行、按状态排序并优先处理等待输入的会话。用户可在 shell 运行 grok dashboard,或在会话内用 /dashboard(Ctrl+\)打开;支持不离开面板查看并回复输出、底部输入框派发新会话、接管任意会话,关闭面板后所有会话继续运行。

  4. xAI:News(网页)58

    xAI 在 Grok Build 推出 /goal 长时自主任务执行模式

    xAI 在 Grok Build 中推出 /goal 模式,支持长时自主执行任务,智能体会持续工作直到任务完成并验证,包括审查代码、检查网页或执行脚本。用户只需一行给出目标,智能体会规划方案、把工作拆成进度清单并开始执行,期间可继续追加指令,另有新命令用于监控和引导长时任务,完成后面板显示 Complete 且清单全部勾选。

  5. xAI:News(网页)56

    Grok 4.5 现已在 GitHub Copilot 中可用

    xAI 宣布 Grok 4.5 上线 GitHub Copilot,覆盖云 Agent、Copilot CLI 和 VSCode IDE,用户可在模型选择器中直接选用,部分企业和商业用户需在 Copilot 设置中启用。该模型也可通过 SpaceXAI console 直接使用,定价为每百万输入 token $2、每百万输出 token $6。

  6. xAI:News(网页)54

    Grok 4.6 上线 GitHub Copilot

    xAI 宣布最新编程模型 Grok 4.6 在 GitHub Copilot 上线,覆盖云 agent、Copilot CLI 和 VS Code IDE,用户在模型选择器中选 "Grok 4.6" 即可使用,部分企业和商业用户需在 Copilot 设置中启用。该模型也可通过 SpaceXAI 控制台使用,价格为每百万输入 token $2、每百万输出 token $6。

  7. TensorZero:实验与工程博客32

    某大型银行如何用 LLM 与 TensorZero 自动化代码变更日志

    欧洲一家大型银行的 DevOps 工程师 Mark 借助开源平台 TensorZero 构建变更日志自动化系统,接入 GitLab merge request 与 CI/CD 流程,并用 Ollama 实现全自托管部署,数据不出内网。系统利用内置的动态上下文学习(DICL),将工程师对 AI 生成日志的修改自动用于优化后续推理,无需微调或标注数据集。

  8. MiniMax:Blog(网页)75

    MiniMax 发布 M2.5 模型,SWE-Bench Verified 达 80.2%

    MiniMax 发布 MiniMax-M2.5,在 SWE-Bench Verified 得分 80.2%、Multi-SWE-Bench 51.3%、BrowseComp 76.3%,完成 SWE-Bench Verified 评测比 M2.1 快 37%,与 Claude Opus 4.6 的 22.9 分钟持平。

    推荐理由:官方公布了 M2.5 在编码、搜索和办公场景的成绩与价格细节,读者可以据此比较它与同类模型的性价比。

  9. MiniMax:Blog(网页)72

    MiniMax 发布 M2.7:SWE-Pro 得分 56.22%,展示模型自进化工作流

    MiniMax 发布 M2.7 模型,已在 MiniMax Agent 和 API 平台全面可用。该模型在 SWE-Pro 得分 56.22%(接近 Opus 4.6),VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高,MM Claw 准确率 62.7%。

    推荐理由:官方给出了各基准的具体分数和自进化工作流细节,读者可以据此与同档模型做直接比较。

  10. METR:Research(网页)78

    METR 提出"任务时长"指标:AI 可完成任务长度每约 7 个月翻倍

    METR 提出用任务长度(按人类专家耗时衡量)来度量 AI 能力,发现 6 年来模型能以 50% 可靠性自主完成的任务长度呈指数增长,翻倍时间约 7 个月。当前模型对耗时 4 分钟以内任务成功率近 100%,超过约 4 小时则不足 10%;Claude 3.7 Sonnet 的 50% 成功率时间视界约一小时。

    推荐理由:METR 用人类任务时长衡量智能体能力,给出 6 年约 7 个月翻倍的指数趋势及其外推含义。

  11. METR:Research(网页)77

    METR 研究:早期 2025 年 AI 工具使资深开源开发者效率下降 19%

    METR 开展随机对照试验,16 名资深开源开发者在自己的大型开源仓库(平均 22k+ stars、1M+ 行代码)上完成 246 个真实 issue,允许使用 AI(主要是 Cursor Pro 与 Claude 3.5/3.7 Sonnet)时完成任务反而慢 19%。

    推荐理由:METR 的随机对照试验给出了 AI 使资深开源开发者变慢 19% 的实测结果,可用于校准基准分数与自我感知之间的落差。

  12. METR:Research(网页)66

    METR 将重新设计开发者生产力实验,因 AI 选择效应致新数据不可靠

    METR 宣布重新设计其开发者生产力实验,认为 2025 年 8 月启动的二次研究中因开发者拒绝无 AI 工作而出现选择效应,使数据无法可靠反映 AI 工具的生产力影响。

    推荐理由:原文解释了为何 AI 更广泛采用带来的选择效应使其实验结果不可靠,并给出初步数据与后续研究设计思路。

  13. Fireworks AI(网页)67

    Fireworks 实测 DeepSeek V4 Pro 0813:SWE-Bench 达 95.2%,单任务成本约为 Fable 5 的三分之一

    Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。

    推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。