跳到正文

#编码

今日 52 条
8月12日周三
8月4日周二
  1. Microsoft Research 博客(RSS)75

    Microsoft Research 开源 Orchard 智能体框架并发布三个领域模型

    Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。

    推荐理由:官方开源了环境服务和三条训练配方,小参数量模型在 SWE-bench Verified 等基准上的具体结果可直接对照复用。

8月2日周日
  1. Andrej Karpathy55

    Andrej Karpathy 给 Opus 5 一段《魔戒》开篇、1M token 预算(约 $10)并要求用 three.js 渲染,模型耗时约 2 小时写出 5500 行代码程序化渲染故事,效果粗糙但可运行。他认为这类任务体现 LLM 从“没人会花时间做”到“几乎免费就能做”的变化,并指出 LLM 无法高效原生感知视频或玩游戏,只能靠反复截图自查,多模态与游戏交互能力仍然欠缺。

7月31日周五
7月30日周四
7月27日周一
7月21日周二
7月20日周一
7月17日周五
  1. Google DeepMind:Blog(RSS)61

    Google DeepMind 发布网络安全模型 Gemini 3.5 Flash Cyber

    Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证并修复漏洞,将通过限access试点先面向政府和可信伙伴经 CodeMender 开放。

    推荐理由:以轻量模型多次调用替代单次大模型调用做漏洞挖掘,并用 Chrome 真实流水线等无污染基准展示对比结果,方法与数据都可参考。

7月16日周四
  1. Sierra:Blog(RSS)67

    Sierra 推出内部云智能体 Pinecone

    Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。

    推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。

7月15日周三
7月14日周二
7月10日周五
  1. Sierra:Blog(RSS)65

    Sierra 复盘全公司 AI 智能体化:从并行 agent 到统一 Pinecone 的经验

    Sierra 分享把全公司接入 AI 智能体的经验:工程团队用 git worktrees、Claude Code 和 Codex 并行跑 agent,部分任务产出达 5 倍,随后成立六人团队推进全员采用。

    推荐理由:Sierra 复盘了内部全员 Agent 化的落地过程,单一入口、上下文瓶颈和成果度量三处经验可迁移到其他团队。

7月6日周一
7月5日周日
7月3日周五
7月1日周三
6月30日周二
  1. Xiaomi MiMo62

    小米 MiMo 官方账号转发 Cline 的消息,称开源权重模型正在普及,更多开发者在基于 MiMo 构建。Cline 表示因看好 GLM-5.2,推出 $9.99/月订阅,提供 GLM-5.2 及 DeepSeek、Kimi、MiniMax、MiMo、Qwen 等开源权重模型 2-5x 折扣访问,并给出经 npm i -g cline 注册可享 $1.99 促销的活动入口,可在 Cline CLI 与 IDE 上使用。

    引用Cline@cline

    We’ve been impressed with GLM-5.2 and so are introducing a $9.99/month subscription to give you 2-5x discounted access to it and other open weight models like DeepSeek, Kimi, MiniMax, Mimo, Qwen. Use it on Cline CLI & IDE with $1.99 special promo if sign up via: npm i -g cline

6月27日周六
6月23日周二
6月22日周一
  1. Nathan Lambert:Interconnects(RSS)81

    Nathan Lambert:GLM-5.2 是开源智能体的台阶式跃迁

    Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。

    推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。

6月19日周五
6月17日周三
  1. Together AI 研究与产品博客(RSS)53

    Together AI 实测 Kimi K2.7 Code 与 Claude Fable 5 生成落地页,成本约低94%

    Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。

6月15日周一
6月14日周日
6月12日周五
6月11日周四
6月10日周三
  1. Andrej Karpathy76

    Anthropic 发布 Claude Fable 5,作者称其与 Mythos 为同一底层模型但增加了安全护栏,基准几乎全面 SOTA。他认为质变程度堪比去年 11 月的 Claude 4.5,尤其擅长长程难题求解,但护栏目前过于敏感;软件唾手可得令他的软件需求大增(Jevon 悖论)。

    引用Claude@claudeai

    Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowledge work, scientific research, and vision. The longer and more complex the task, the larger Fable 5’s lead over our other models.

    推荐理由:作者补充了基准之外的第一手使用感受,指出长难题求解能力跃升和安全护栏偏敏感,可作选型参考。

  2. Ethan Mollick:One Useful Thing(RSS)79

    Ethan Mollick 试用了首个 Mythos 级模型 Claude 5 Fable 后谈协作体验

    Ethan Mollick 分享了他提前试用首个面向公众发布的 Mythos 级模型 Claude 5 Fable 的体验,认为其明显超越此前所有模型,单个提示词即可连续工作最多十二小时执行多页规格。

    推荐理由:作者以亲历测试描述使用感受与局限,给出了可验证的工作时长、成本和黑盒化体验等一手细节。

6月5日周五
  1. Ethan Mollick:One Useful Thing(RSS)61

    Ethan Mollick 宣布新书《Co-Existence》10月20日出版,探讨与有时比你强的 AI 共处

    Ethan Mollick 宣布新书《Co-Existence》将于 10 月 20 日出版,主题是如何与有时但并非总是比你强的 AI 协作,现已开放预购。他自述每章草稿均亲自撰写,用 AI 做读者反馈和事实核查;新书网站用 Claude Code(Opus 4.8)几分钟建成,并专门为 AI 智能体提供版本,还用 OpenAI Codex 对多个模型做了 A/B 测试。

6月4日周四
6月3日周三
5月30日周六
  1. Steve Yegge:Medium(RSS)69

    Steve Yegge:技术面试正在消亡,campfire 模式将取而代之

    Steve Yegge 撰文称运行了约50年的技术面试流程正在走向消亡,AI 辅助简历、AI 作弊和岗位快速变化正让传统评估体系失效。他结合在 Amazon 担任 Bar Raiser 和 Google 招聘委员会的经历指出面试结果统计上很差,主张用实习、co-op 等临时雇佣以及他称为 campfire 的付费真实工作试用替代面试,并让候选人的工作成果形成可携带的记录。

5月29日周五
  1. Sierra:Blog(RSS)68

    Sierra 工程师复盘如何用 AI 智能体独自完成产品本地化

    Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体在不到四个月内基本独自完成 Agent Studio 本地化,而他在 Slack 参与的同类项目曾需 10 人团队耗时 9 到 12 个月支持 4 个语言。

    推荐理由:作者亲历两轮本地化项目,复盘单人用 AI 完成团队级工作的流程设计与坑,包含可直接迁移的工作流经验。