跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

165条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 101–120 条 · 共 165 条
9月23日周三
  1. Latent Space(RSS)84

    Claude Opus 5.5 发布成新默认模型,OpenAI 同日推 GPT-6 Sol 和 Luna 降价应战

    AINews 汇总:Anthropic 发布 Claude Opus 5.5,称多数任务达 Fable 5.1 水平、比 Opus 5 便宜 40% 且快 30%,成为 Claude Code 和应用新默认模型;OpenAI 数小时后推出 GPT-6 Sol($2/$10)和 Luna($0.10/$0.50),价格比 GPT-5.6 前代低约 50%。

    推荐理由:除了两家降价发布,原文还汇总了缓存定价拆解、effort 异常和第三方评测口径问题,提供了单一官方稿之外的交叉信息。

  2. Simon Willison 博客84

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 和 GPT-6 Luna 掀起新一轮价格战

    Anthropic 于9月22日发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。GPT-6 Luna 价格降至 $0.10/M 输入、$0.50/M 输出,为 GPT-5.6 Luna 的一半;GPT-6 Sol 同样减半至 $2/$10。

    推荐理由:作者用自己实测的价格表和 pelican 测试对比了三款新模型,还发现 Opus 5.5 max 会想满输出上限,可直接参考。

  3. Greg Brockman79

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,基于 GPT-6 Astra 的技术进展,提供更快、更实惠的模型以支持大规模工作,覆盖专业工作、事实性、编码、computer use 和对齐等能力。两者还通过更高效的缓存和推理降价,API 价格比 GPT‑5.6 促销价低 50%。

    引用OpenAI@OpenAI

    Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe. GPT-6 Sol and Luna build on the advances behind GPT-6 Astra, bringing much of its strengths into faster and more affordable models to support work at scale. We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

    推荐理由:原文给出了两个新模型的能力来源与 API 降价幅度,读者可据此评估在大规模任务中替代 GPT‑5.6 的成本。

  4. Boris Cherny70

    Boris Cherny 称 Claude Opus 5.5 已成为他近几周的日常主力模型。他让 Opus 5.5 与 Fable 5.1 各自把 HAProxy 从 C 移植到 Rust,两者都通过了几乎全部测试,但 Opus 5.5 用时 9.5 小时,快于 Fable 5.1 的 12 小时,成本低 51%。据其引用的官方介绍,Opus 5.5 是 Claude 5.5 家族首个模型,大多数任务表现达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%。

    引用Claude@claudeai

    Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family. It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.

    推荐理由:作者实测对比 Opus 5.5 与 Fable 5.1 移植 HAProxy 的用时和成本,给出第一手数据供选型参考。

  5. Claude Code:GitHub Releases(RSS)65

    Claude Code v2.1.280 发布:新增 Claude Opus 5.5 默认模型

    Claude Code 发布 v2.1.280,新增 Claude Opus 5.5(claude-opus-5-5)并设为默认 Opus 模型,支持 1M 上下文,价格 $4/$20 per Mtok、缓存读取 $0.20/Mtok;Pro 和 Team Standard 计划默认模型也从 Sonnet 改为 Opus。

    推荐理由:原文列出该版本新增 Claude Opus 5.5 默认模型、MCP 描述长度可配置等改动,读者可对照修复清单决定是否升级。

9月22日周二
  1. Xiaomi MiMo66

    小米 MiMo 发布 MiMo-V2.6 Pro 与 Flash 两款全模态模型,通过规模化强化学习训练。官方称 Pro 在多数 agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 相当,Artificial Analysis Intelligence Index 得分 46,为开源模型中最高;能力覆盖编码、computer use、3D 推理和创作。

    推荐理由:原文给出 Pro 与 Claude Opus 5、GPT-5.6 Sol 的 agent 基准对比和开源范围,可据此评估其相对位置。

9月17日周四
  1. jietang66

    唐杰发文复盘,GLM-5.3-Flash 从首次在国内加速器上运行到承接全部生产流量只用两周,端到端吞吐达 3.2 倍,大量工作由 GLM-5.3 驱动的 Infra Agent 完成。

    引用Z.ai@Zai_org

    We’re sharing how GLM-5.3 helped build and optimize the inference infrastructure serving GLM-5.3-Flash. The system went from its first successful run to production readiness in less than two weeks, with end-to-end throughput tripling relative to the initial baseline. The key was dense feedback: local correctness tests, execution traces, microbenchmarks, and end-to-end measurements that enabled targeted hypothesis testing rather than reliance on aggregate performance metrics alone. https://z.ai/blog/glm-built-its-inference-infrastructure

    推荐理由:作者复盘了 GLM-5.3 智能体优化推理基础设施的两周过程,提出了可迁移的分层密集反馈方法与工程师角色转变的判断。

  2. GitHub Blog85

    GitHub Copilot 用 Copilot 把运行时迁移到 Rust:80 万行代码、128 个 PR

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量合入 main,性能提升数个数量级,主要由一名开发者几个月内完成。

    推荐理由:GitHub Copilot 运行时迁移 Rust 的完整复盘,给出智能体并行协作、提示缓存与评审流程的可迁移工程方法。

9月9日周三
  1. Together AI 研究与产品博客(RSS)67

    Together AI 深入解析开源 AI 编码栈:用 MIGHT 框架从闭源模型迁移到开源模型

    Together AI 发布长文,解析开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由模型、推理、网关与路由、Harness、工具(Skills 与 MCP)组成的 MIGHT 五层框架。

    推荐理由:Together AI 把开源编码栈拆为 MIGHT 五层,给出大小模型分工和分层组合的具体实践方法。

9月5日周六
  1. GitHub Blog69

    GitHub 发布 Project HydraFusion 研究预览:通过多模型编排实现前沿级编码质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级智能,所有 GitHub Copilot 计划用户可通过 Copilot CLI 的 /experimental 使用。

    推荐理由:官方详解了 HydraFusion 三种执行模式与基准成本质量数据,读者可据此判断多模型编排是否值得在 Copilot CLI 中试用。

9月3日周四
  1. Hugging Face:Blog(RSS)63

    Hugging Face 教程:用 TRL 对 LFM2.5-350M 做 100 步 GRPO 微调提升结构化输出

    Hugging Face 发布教程,用 TRL 库对 LiquidAI/LFM2.5-350M 做 GRPO 微调,仅用约 500 个样本和 100 步训练,将其在 IFStruct benchmark 上的通过率从 22.6% 提升到 29.7%。

    推荐理由:教程给出完整可复现的低成本 GRPO 微调流程和逐项评测数字,读者可以照着在免费 GPU 上复刻这一结构化输出改进方法。

8月29日周六
  1. Michael Truell64

    Cursor CEO Michael Truell 表示,OpenAI 已发通知计划在三个月后阻止 Cursor 用户访问 OpenAI 模型。他称 OpenAI 模型约占 Cursor 用户流量的 5%,正在与 OpenAI 团队沟通解决,并表示 Cursor 是 OpenAI 最早的客户之一,多年密切合作,曾信任其平台作为业务的中立基础设施。

    推荐理由:Cursor CEO 回应 OpenAI 计划限制访问,补充了自家流量占比和沟通进展等一手信息。

8月28日周五
  1. SiliconFlow66

    智谱(Z.ai)的 GLM-5.3 已开源,并上线 SiliconFlow,提供 Day-0 支持。该模型总参数 744B、激活 40B,与 GLM-5.2 同底座,经后训练大幅提升,官方称在编程与智能体基准上可与 Fable 5 和 GPT-5.6 Sol 竞争。SiliconFlow 还提到其在 OpenRouter 上 GLM-5.2 token 份额排名第一。

    推荐理由:原文给出了 GLM-5.3 的参数规模、开源状态和基准表现,读者可以据此评估是否迁移现有工作流。

8月27日周四
  1. Johann Rehberger / Embrace The Red(RSS)82

    实测攻破 Claude Code Opus 5 Auto Mode:提示词注入攻击成功率达 60-80%

    安全研究者 Johann Rehberger 发布针对 Claude Code Opus 5 Auto Mode 的提示词注入攻击链实测,在小样本下实现代码执行,攻击成功率达 60-80%,而 Anthropic 委托 Trajectory Labs 的 72 场景评测显示 Auto Mode 攻击成功率为 0.00%。

    推荐理由:作者以第一手实测展示 Claude Code Opus 5 Auto Mode 的提示词注入攻击链,可与官方 0.00% 评测结果对照阅读。

8月24日周一
  1. Meituan LongCat65

    美团 LongCat 官方宣布 LongCat-2.0 已上线 opencode 的 Go,邀请用户试用并反馈用其构建了什么。引用内容显示 LongCat-2.0 为 1.6T/48B 参数、支持 1M 上下文、完全开源。

    引用OpenCode@opencode

    LongCat-2.0 now available in Go 1.6T/48B · 1M context · fully open source

    推荐理由:LongCat 官方宣布模型接入 opencode,读者可以了解该开源模型在编码工具中的可用入口。

8月21日周五
  1. Together AI 研究与产品博客(RSS)69

    Together AI 实测 GLM-5.3 与 Claude Fable 5 在 DeepSWE 上的成本、编码与路由表现

    Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。

    推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。