Anthropic:Claude 优化 30 多个开源生物分子模型,平均加速约 4 倍
Anthropic 发布研究,Claude 在不到四周内优化了超过 30 个用于结构预测、蛋白质设计、基因组学和蛋白质语言模型的开源模型,平均加速约 4 倍、输出完全一致时约 2 倍,并开源了全部优化代码。
推荐理由:原文给出具体加速倍数、低内存模式和开源入口,读者可评估这些优化对自身生物分子建模工作流的实际收益。
Anthropic 发布研究,Claude 在不到四周内优化了超过 30 个用于结构预测、蛋白质设计、基因组学和蛋白质语言模型的开源模型,平均加速约 4 倍、输出完全一致时约 2 倍,并开源了全部优化代码。
推荐理由:原文给出具体加速倍数、低内存模式和开源入口,读者可评估这些优化对自身生物分子建模工作流的实际收益。
Anthropic 宣布 Claude Design 现可在任意 Claude 对话中使用,包括 Claude Code 和 Artifacts 标签页,Claude Tag 支持即将推出。
推荐理由:原文给出可用范围、连接器和设计系统管理等具体变化,读者可据此判断它对设计到交付流程的影响。
Anthropic 推出 Claude Code Enterprise,支持在终端、桌面、任意 IDE、Slack 或网页中用自然语言开发完整功能,包括写代码、建测试和开 PR。
Anthropic 的 Claude Code 是一款可在终端、IDE、Slack 和网页中使用的编码智能体,支持 macOS、Linux 和 Windows,能规划任务、编写代码、运行测试并打开 PR,可处理 bug 修复、代码库解读和持续数小时的重构迁移。
Anthropic 研究员 Nicholas Carlini 用 agent teams 方法让 16 个 Claude 实例并行工作,经近 2000 个 Claude Code 会话。
推荐理由:作者亲历了用 16 个并行 Claude 智能体写 C 编译器的完整过程,沉淀了测试设计、并行任务锁和 GCC 对照等可复用的 harness 方法。
Anthropic 工程团队发布研究,量化基础设施资源配置对智能体编码评测(如 Terminal-Bench 2.0 与 SWE-bench)分数的影响。
Anthropic Labs 的 Prithvi Rajasekaran 介绍受 GAN 启发的多智能体 harness,用 planner、generator、evaluator 三智能体架构让 Claude 在多小时自主会话中产出完整全栈应用,并给出四条前端设计评分标准。
Anthropic 详解 Claude Code 新模式 auto mode 的实现,用基于模型的双层防御替代手动权限审批:输入层提示词注入探针扫描工具输出,输出层运行在 Sonnet 4.6 上的 transcript 分类器在动作执行前评估风险,并以三级放行规则让项目内文件编辑免审。
Anthropic 说明过去一个月用户报告的 Claude 质量下降来自三个独立改动,影响 Claude Code、Claude Agent SDK 和 Claude Cowork,API 未受影响,三处均已修复(截至 4 月 20,v2.1.116)。
Tom Tunguz 引用 UC Berkeley HarnessTax 研究指出,控制 AI agent 的 harness 决定同一答案的价格:GPT-5.6 Sol 在 Pi 上比在 Claude Code 上每完成一个任务成本低 71%($0.441 对 $1.540),42 组同模型 harness 对比中质量差异均无统计显著性。
推荐理由:作者基于 UC Berkeley 研究数据解释 harness 如何决定同一模型的成本与毛利,比较框架可迁移到 AI 应用商业判断。
Tomer Tunguz 撰文提出 AI 正在优化 if-then 判定这一编程原语:Jev(TypeSafe)和 SemIf(MIT 协议开源,配合 Jared Palmer 的 kev)只运行一次注意力计算即从少量输出 token 判定结果,成本比传统 AI 低约 99%。
推荐理由:作者以自己 agent 的实测数据展示专用小型判定模型可同时大幅降本并提升分类准确率,方法有可迁移性。
Theory Ventures 合伙人 Tomer Tunguz 撰文认为 AI 已把软件工程的重心从手写代码转向系统设计,核心是构建让 AI 验证自身输出的循环。
推荐理由:作者结合 Artemis 与 Lauren Tan 的案例,把 AI 时代的软件工程归纳为基于 Meadows 三性质的验证循环设计,视角有可借鉴的分析框架。
OpenAI 发布 GPT-6.1 Sol,因安全问题推迟的旗舰 GPT-6.1 Astra 不按计划上线,Sol 作为更便宜的替代方案推出,OpenAI 称其在 agentic coding、计算机使用和办公任务上接近 Astra,成本约五分之一。
推荐理由:原文汇总了 GPT-6.1 Sol 的定价与多项基准对比数据,读者可以据此判断它与 Astra、Claude 的成本性能权衡。
OpenAI 在旧金山 DevDay 2026 上宣布扩展 Codex 和 API:Codex 新增可复用云环境、语音控制和仓库安全扫描(Codex Security Cloud),Codex CLI 重做并加入 /agents 视图,ChatGPT 桌面应用增加代码审查视图。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在 agentic coding、computer use 和专业工作上接近 GPT-6 Astra 的智能水平,价格为标准输入输出 token 价格的五分之一。
OpenAI 在 DevDay 上宣布 Codex 多项更新,核心是可复用、可配置的云开发环境,可从电脑、手机或云端访问,并支持团队共享预设设置和权限。
OpenAI 在旧金山 Fort Mason 举行 DevDay 2026,作者在现场逐条记录主题演讲与分会场。会上发布个人智能体 Dots(由 GPT-6 Astra 驱动,Pro 和 Enterprise 用户当天可用)、ChatGPT Space 协作空间,以及约 Astra 智能水平但价格为其五分之一的新模型 GPT-6.1 Sol。
推荐理由:作者以第一手现场笔记记录发布会全程,涵盖个人智能体 Dots、新模型和 Codex 更新,还附上现场演示翻车等细节。
OpenAI 发布 GPT-6.1 Sol,定位接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景,价格为其标准 API 输入和输出 token 价格的五分之一。
推荐理由:原文点出 GPT-6.1 Sol 的定位与价格对比,读者可以据此判断它在编码等场景的成本取舍。
Latent Space AINews 汇总 OpenAI DevDay 2026 发布内容,包括常驻 Agent 产品 dots(由 GPT-6 Astra 驱动。
推荐理由:汇总了 OpenAI DevDay 的模型、Agent 与定价变化,并补充独立评测数字,方便对照官方口径看待实际表现。
Google 发布 autofinetune 项目,将 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和基于 GRPO 的强化学习),使用 Tunix、Gemma 和 Cloud TPU,并由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google 宣布 Antigravity SDK 支持本地模型工作流,首发支持基于 Google AI Edge LiteRT 的 Gemma 4 26B A4B,可完全离线运行智能体辅助,建议机器配备超过 24GB VRAM 或统一内存。
推荐理由:官方给出了本地智能体工作流的完整上手步骤和混合编排演示,含具体 token 与硬件数据,可直接照做复现。
GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载。
推荐理由:原文给出与 GPT-6 Astra 的任务成本对比和 Bedrock 安全控制细节,读者可据此评估在自有工作流中采用的成本收益。
AI 智能体快速交付的 PR 往往只是忠实实现了工单里最自然的解读,而非团队真正达成一致的产品决策。文章以用户中断 onboarding 后是否恢复旧流程为例指出,验收标准只能验证已决定实现的内容,无法回答规则变更后用户该走哪条路径。作者建议在流程中引入可阻塞的决策记录,明确未决问题的负责人,避免代码看起来像已完成的功能。
代码智能体在生成测试后常出现“The test was wrong. Rewriting.”的判定,作者在一次构建中遇到七次。生成代码、生成测试、验证测试与代码、运行测试、评估测试目的这五个环节中,只有运行测试是确定性的,其余环节对用户不可见且不可复现,因此智能体的判断只是猜测而非证明。作者认为出路是把任务拆得更小,让日志可读,可审查性正成为一项交付能力。
作者在 OpenAI 于 DevDay 2026 发布 always-on agent「Dots」后,用 TypeScript 实现一个迷你版教学模型:事件唤醒、background/assigned 两种模式、allow/ask/deny 规则、按用户隔离的记忆和 Activity 时间线。
蚂蚁百灵发布 Ling-3.1-flash 模型,总参数约 560B,每个 Token 激活约 25B 参数,上下文窗口上限为 1M。模型围绕通用智能体、搜索、日常办公和软件研发等任务优化,并在医疗、金融和材料科学研究等场景提升能力。模型开放为期两周的免费体验,期间服务长度为 256K;转为付费后计划开放 1M 上下文并同步开源。
Qwen3.8-27B 现已可通过 @nebiustf 使用。无论你是在构建智能体还是做深度研究,这个 27B 稠密模型都已为你的多步骤工作流准备就绪!🥳
Qwen3.8-27B is now live on Nebius Token Factory. A compact 27B dense model for coding, research, and agent workflows, with a focus on planning and completing tasks across multiple steps. Start building: https://tokenfactory.nebius.com/endpoints?modals=endpoint-details&model-id=Qwen/Qwen3.8-27B
想给大伙随便聊聊如何给产品进行一次图标升级,有哪些需要注意的以及可以优化的点。 早上给 Mole 的图标进行了一次精细化的升级,之前使用的是系统的图标,对于简单的产品场景我感觉完全够用,不过细看会感觉缺少一点灵性的感觉。 经过调研,比较适合做 App 产品 Icon 的有 Remix Icon 和 Phosphor Icon这两个,之前写 Web 的时候用 Remix 很多,简单舒服,但是放到 App 上我感觉不是很好看,于是就换上了 Phosphor 这个,展示效果很有灵性,非常不错,差不多有 70% 左右,可以不修改直接使用,然后有 30% 的图标是我用 opus 5.5 来写SVG 自绘的,这样整体更加一致。 可能大伙直接看下面的对比图很难感觉到两者的区别,很多时候需要实际放到真实的产品里面去,我一般还会考虑到本身这个模块下一组图标的搭配感,有时候全部图标单个都好看,组合到一起就不好看的情况也有,好比一个人每一个五官单独出来都好看,但是放到一个脸上却不那么好看,这里建议就是图标的根更换你一定要放到实际的产品里面去看,放到一起去看,才会有比较好的效果。 其次,我一直想着,我们做的产品应该是有灵性的,有生命的那种感觉,而非直接 AICoding 不经任何你的思考出来的那种冷冰冰的编译产物,这个时候小细节比如icon会是给这个产品带来生命力的一个很好的切入点,比如大伙看 保持常亮我使用的是 一杯咖啡,这里会有一种 Caffeine 比喻,就是让你的电脑好像喝了咖啡一样睡不着的感觉,然后关于一般会用一个感叹号,但是我想着应该是 hello,所以就用的挥手的标志,诊断正常会有排查的那种标志,但是这里使用的是一个听诊器的标志,更像是给你的问题做一次医生检查,类似这样,很多时候,可以在产品里面加入不少你的小巧思,会让整体有趣很多。 最后,好看的设计几乎都离不开对齐、整齐、错落有致这些原则,如何在人眼看到的场景下让图标和内容以及上下模块看起来是整齐的、大小一致的,甚至是上下居中对齐的,都需要一个一个去看,去调整,包括字体和icon的对齐,以及字体里面中英文本身也没有垂直对齐应该如何优化,类似这样的,可以精雕细琢很久,非常有意思。 这种看似无用功,其实是我很喜欢做的事情,AI 可以给优秀编码、及格审美带来非常大的促进,人看着好像不要做啥了,只要动动嘴就好,反而我认为不是的,人在这里的作用更大了,AI 帮你节约的时间,刚好可以放到打磨产品上,让1%的用户有种用你产品的时候,时不时有一种秒懂、卧槽、变魔术的感觉,那就非常非常有价值和意思了,或许这也是我认为做独立产品有意思的地方。
Announcing dots. Dots work 24/7 for you, learn from your feedback, have their own computer, browser and can be connected to over 4k apps in our ecosystem. They’re powered by Astra our best model yet. Included in your Pro plan, without drawing down on any of your usage. You can even call a dot while it’s working. We’re getting you started with your primary dot today and soon you’ll be able to create entire teams of them.
推荐理由:作者本人澄清了 dot 的计费方式,直接使用不消耗额度,可帮读者准确理解实际成本。
准备好来一场 DevDay 支线任务了吗? 10 个开发者挑战。 5 个 Codex Micro 等你来拿。 完成任意 5 个支线任务,每完成一个即可获得 1 张抽奖券。 48 小时。随时随地参与 🌎
企业团队现在可以在 Codex 中原生使用 GLM-5.3 Flash 和 Kimi K3 等开放模型,相关消费可计入其对 OpenAI 的承诺额度。作者 Tibo 转发该消息并表示认同开放路线。
Enterprise teams can now use open models like GLM-5.3 Flash and Kimi K3 natively in Codex and count spend against their OpenAI commit.
NVIDIA 开源了基于 TensorRT 的 C++ AI 模型参考实现集合 TensorRT Model Connect,目标是让 NVIDIA 推理栈的性能更易获取。项目围绕编码智能体设计,采用并行工作、模型族隔离、可逆变更与 GPU 验证等实践。
Ultrafast is our fastest way to build with Astra yet: in Codex, it runs up to 8x faster than Astra Standard and 4x faster than Astra Fast. Bring your ideas to life as fast as you can type them.
OpenAI 宣布 Codex CLI 迎来一次大更新,面向依赖命令行的开发者。新版本提供全屏界面、更好的可读性,并支持在终端内管理并行工作。
Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.
推荐理由:Arena 的实测榜单数据显示该模型以约 1/5 的成本进入 WebDev 前四,读者可据此权衡性价比选型。
OpenAI 推出 Codex cloud environments,关闭笔记本后智能体仍可继续工作。环境可复用,仓库、依赖、脚本和设置已预先就位,减少配置、加快启动。
推荐理由:原文说明 Codex 云环境的可复用特性,读者可以据此判断关闭笔记本后让智能体继续运行的用法。