跳到正文

#编码

今日 54 条
9月30日周三
  1. Anthropic:Research(发表成果 · 网页)73

    Anthropic:Claude 优化 30 多个开源生物分子模型,平均加速约 4 倍

    Anthropic 发布研究,Claude 在不到四周内优化了超过 30 个用于结构预测、蛋白质设计、基因组学和蛋白质语言模型的开源模型,平均加速约 4 倍、输出完全一致时约 2 倍,并开源了全部优化代码。

    推荐理由:原文给出具体加速倍数、低内存模式和开源入口,读者可评估这些优化对自身生物分子建模工作流的实际收益。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    Nicholas Carlini 用 16 个并行 Claude 智能体写出可编译 Linux 内核的 C 编译器

    Anthropic 研究员 Nicholas Carlini 用 agent teams 方法让 16 个 Claude 实例并行工作,经近 2000 个 Claude Code 会话。

    推荐理由:作者亲历了用 16 个并行 Claude 智能体写 C 编译器的完整过程,沉淀了测试设计、并行任务锁和 GCC 对照等可复用的 harness 方法。

  3. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    Anthropic 工程复盘:Claude Code auto mode 如何用模型分类器替代手动权限审批

    Anthropic 详解 Claude Code 新模式 auto mode 的实现,用基于模型的双层防御替代手动权限审批:输入层提示词注入探针扫描工具输出,输出层运行在 Sonnet 4.6 上的 transcript 分类器在动作执行前评估风险,并以三级放行规则让项目内文件编辑免审。

  4. Tomer Tunguz 博客(VC 分析)65

    Tom Tunguz 解析 UC Berkeley 研究:harness 决定 AI 答案的成本与毛利

    Tom Tunguz 引用 UC Berkeley HarnessTax 研究指出,控制 AI agent 的 harness 决定同一答案的价格:GPT-5.6 Sol 在 Pi 上比在 Claude Code 上每完成一个任务成本低 71%($0.441 对 $1.540),42 组同模型 harness 对比中质量差异均无统计显著性。

    推荐理由:作者基于 UC Berkeley 研究数据解释 harness 如何决定同一模型的成本与毛利,比较框架可迁移到 AI 应用商业判断。

  5. Tomer Tunguz 博客(VC 分析)62

    Tomer Tunguz:专用判定模型让 if-then 分类成本降两个数量级且准确率翻倍

    Tomer Tunguz 撰文提出 AI 正在优化 if-then 判定这一编程原语:Jev(TypeSafe)和 SemIf(MIT 协议开源,配合 Jared Palmer 的 kev)只运行一次注意力计算即从少量输出 token 判定结果,成本比传统 AI 低约 99%。

    推荐理由:作者以自己 agent 的实测数据展示专用小型判定模型可同时大幅降本并提升分类准确率,方法有可迁移性。

  6. Tomer Tunguz 博客(VC 分析)64

    Tomer Tunguz:AI 时代软件工程转向系统设计与验证循环

    Theory Ventures 合伙人 Tomer Tunguz 撰文认为 AI 已把软件工程的重心从手写代码转向系统设计,核心是构建让 AI 验证自身输出的循环。

    推荐理由:作者结合 Artemis 与 Lauren Tan 的案例,把 AI 时代的软件工程归纳为基于 Meadows 三性质的验证循环设计,视角有可借鉴的分析框架。

  7. The Decoder:AI News(RSS)81

    OpenAI 发布 GPT-6.1 Sol,以五分之一成本接近 GPT-6.1 Astra

    OpenAI 发布 GPT-6.1 Sol,因安全问题推迟的旗舰 GPT-6.1 Astra 不按计划上线,Sol 作为更便宜的替代方案推出,OpenAI 称其在 agentic coding、计算机使用和办公任务上接近 Astra,成本约五分之一。

    推荐理由:原文汇总了 GPT-6.1 Sol 的定价与多项基准对比数据,读者可以据此判断它与 Astra、Claude 的成本性能权衡。

  8. Simon Willison 博客81

    Simon Willison 现场直播 OpenAI DevDay 2026 主题演讲:发布 Dots、GPT-6.1 Sol 与 Ultrafast

    OpenAI 在旧金山 Fort Mason 举行 DevDay 2026,作者在现场逐条记录主题演讲与分会场。会上发布个人智能体 Dots(由 GPT-6 Astra 驱动,Pro 和 Enterprise 用户当天可用)、ChatGPT Space 协作空间,以及约 Astra 智能水平但价格为其五分之一的新模型 GPT-6.1 Sol。

    推荐理由:作者以第一手现场笔记记录发布会全程,涵盖个人智能体 Dots、新模型和 Codex 更新,还附上现场演示翻车等细节。

  9. OpenAI:官网动态(RSS · 排除企业/客户案例)70

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,定位接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景,价格为其标准 API 输入和输出 token 价格的五分之一。

    推荐理由:原文点出 GPT-6.1 Sol 的定位与价格对比,读者可以据此判断它在编码等场景的成本取舍。

  10. Google Developers Blog(RSS)61

    Antigravity SDK 支持本地模型,首发接入 Gemma 4 26B A4B 与 LiteRT

    Google 宣布 Antigravity SDK 支持本地模型工作流,首发支持基于 Google AI Edge LiteRT 的 Gemma 4 26B A4B,可完全离线运行智能体辅助,建议机器配备超过 24GB VRAM 或统一内存。

    推荐理由:官方给出了本地智能体工作流的完整上手步骤和混合编排演示,含具体 token 与硬件数据,可直接照做复现。

  11. Google AI:DEV 作者专属(RSS)48

    AI 完成了工单,功能为什么还是错的?

    AI 智能体快速交付的 PR 往往只是忠实实现了工单里最自然的解读,而非团队真正达成一致的产品决策。文章以用户中断 onboarding 后是否恢复旧流程为例指出,验收标准只能验证已决定实现的内容,无法回答规则变更后用户该走哪条路径。作者建议在流程中引入可阻塞的决策记录,明确未决问题的负责人,避免代码看起来像已完成的功能。

  12. Google AI:DEV 作者专属(RSS)42

    代码智能体为何会判定“测试写错了,重写”:AI 生成测试的可验证性分析

    代码智能体在生成测试后常出现“The test was wrong. Rewriting.”的判定,作者在一次构建中遇到七次。生成代码、生成测试、验证测试与代码、运行测试、评估测试目的这五个环节中,只有运行测试是确定性的,其余环节对用户不可见且不可复现,因此智能体的判断只是猜测而非证明。作者认为出路是把任务拆得更小,让日志可读,可审查性正成为一项交付能力。

  13. IT之家(RSS)58

    蚂蚁百灵发布 Ling-3.1-flash 模型:约 560B 总参数、25B 激活参数

    蚂蚁百灵发布 Ling-3.1-flash 模型,总参数约 560B,每个 Token 激活约 25B 参数,上下文窗口上限为 1M。模型围绕通用智能体、搜索、日常办公和软件研发等任务优化,并在医疗、金融和材料科学研究等场景提升能力。模型开放为期两周的免费体验,期间服务长度为 256K;转为付费后计划开放 1M 上下文并同步开源。

  14. Qwen31

    Qwen3.8-27B 现已可通过 @nebiustf 使用。无论你是在构建智能体还是做深度研究,这个 27B 稠密模型都已为你的多步骤工作流准备就绪!🥳

    引用Nebius Token Factory@nebiustf

    Qwen3.8-27B is now live on Nebius Token Factory. A compact 27B dense model for coding, research, and agent workflows, with a focus on planning and completing tasks across multiple steps. Start building: https://tokenfactory.nebius.com/endpoints?modals=endpoint-details&model-id=Qwen/Qwen3.8-27B

  15. ginobefun46

    做得真好

    引用Tw93@HiTw93

    想给大伙随便聊聊如何给产品进行一次图标升级,有哪些需要注意的以及可以优化的点。 早上给 Mole 的图标进行了一次精细化的升级,之前使用的是系统的图标,对于简单的产品场景我感觉完全够用,不过细看会感觉缺少一点灵性的感觉。 经过调研,比较适合做 App 产品 Icon 的有 Remix Icon 和 Phosphor Icon这两个,之前写 Web 的时候用 Remix 很多,简单舒服,但是放到 App 上我感觉不是很好看,于是就换上了 Phosphor 这个,展示效果很有灵性,非常不错,差不多有 70% 左右,可以不修改直接使用,然后有 30% 的图标是我用 opus 5.5 来写SVG 自绘的,这样整体更加一致。 可能大伙直接看下面的对比图很难感觉到两者的区别,很多时候需要实际放到真实的产品里面去,我一般还会考虑到本身这个模块下一组图标的搭配感,有时候全部图标单个都好看,组合到一起就不好看的情况也有,好比一个人每一个五官单独出来都好看,但是放到一个脸上却不那么好看,这里建议就是图标的根更换你一定要放到实际的产品里面去看,放到一起去看,才会有比较好的效果。 其次,我一直想着,我们做的产品应该是有灵性的,有生命的那种感觉,而非直接 AICoding 不经任何你的思考出来的那种冷冰冰的编译产物,这个时候小细节比如icon会是给这个产品带来生命力的一个很好的切入点,比如大伙看 保持常亮我使用的是 一杯咖啡,这里会有一种 Caffeine 比喻,就是让你的电脑好像喝了咖啡一样睡不着的感觉,然后关于一般会用一个感叹号,但是我想着应该是 hello,所以就用的挥手的标志,诊断正常会有排查的那种标志,但是这里使用的是一个听诊器的标志,更像是给你的问题做一次医生检查,类似这样,很多时候,可以在产品里面加入不少你的小巧思,会让整体有趣很多。 最后,好看的设计几乎都离不开对齐、整齐、错落有致这些原则,如何在人眼看到的场景下让图标和内容以及上下模块看起来是整齐的、大小一致的,甚至是上下居中对齐的,都需要一个一个去看,去调整,包括字体和icon的对齐,以及字体里面中英文本身也没有垂直对齐应该如何优化,类似这样的,可以精雕细琢很久,非常有意思。 这种看似无用功,其实是我很喜欢做的事情,AI 可以给优秀编码、及格审美带来非常大的促进,人看着好像不要做啥了,只要动动嘴就好,反而我认为不是的,人在这里的作用更大了,AI 帮你节约的时间,刚好可以放到打磨产品上,让1%的用户有种用你产品的时候,时不时有一种秒懂、卧槽、变魔术的感觉,那就非常非常有价值和意思了,或许这也是我认为做独立产品有意思的地方。

  16. Tibo65

    Tibo 回应 community note 称其有误,澄清 primary dot 包含在订阅计划内且全天候可用。让 dot 直接工作不消耗任何用量,但让它创建 codex task 则按常规消耗用量。未来提升速度和带宽将是付费功能,基础功能始终包含在计划内。

    引用Tibo@thsottiaux

    Announcing dots. Dots work 24/7 for you, learn from your feedback, have their own computer, browser and can be connected to over 4k apps in our ecosystem. They’re powered by Astra our best model yet. Included in your Pro plan, without drawing down on any of your usage. You can even call a dot while it’s working. We’re getting you started with your primary dot today and soon you’ll be able to create entire teams of them.

    推荐理由:作者本人澄清了 dot 的计费方式,直接使用不消耗额度,可帮读者准确理解实际成本。

  17. Sherwin Wu56

    Sherwin Wu 转引 @OpenAIDevs 消息并评论:当模型推理基本即时后,期待看到人们接下来抱怨什么新瓶颈。其引用的内容称 Codex 中的 Ultrafast 是迄今最快的 Astra 构建方式,比 Astra Standard 快至 8 倍、比 Astra Fast 快至 4 倍。作者称这是一种 Divinely discontent(神圣的不满足)。

    引用OpenAI Developers@OpenAIDevs

    Ultrafast is our fastest way to build with Astra yet: in Codex, it runs up to 8x faster than Astra Standard and 4x faster than Astra Fast. Bring your ideas to life as fast as you can type them.

  18. Arena.ai78

    Arena 公布 Claude Sonnet 5.5 (High) 的实测结果,以 1699 分位列 Code Arena: WebDev 第 4,比 Sonnet 5 (High) 的 1540 分提升 159 分。

    引用Claude@claudeai

    Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.

    推荐理由:Arena 的实测榜单数据显示该模型以约 1/5 的成本进入 WebDev 前四,读者可据此权衡性价比选型。