Black Forest Labs CEO Robin Rombach 在 G7 呼吁支持开放创新
Black Forest Labs 联合创始人兼 CEO Robin Rombach 在 G7 峰会向 Macron、Trump、Merz、von der Leyen 等领导人呼吁,让开放且负责任的 AI 开发成为常态而非例外。
Black Forest Labs 联合创始人兼 CEO Robin Rombach 在 G7 峰会向 Macron、Trump、Merz、von der Leyen 等领导人呼吁,让开放且负责任的 AI 开发成为常态而非例外。
Anthropic 前沿红队发布对智谱 GLM-5.3 的评测,发现它能自主构建端到端网络漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。
推荐理由:Anthropic以第一手评测数据给出GLM-5.3的攻击能力与防护绕过率,读者可据此权衡开源权重模型在网络攻防两侧的风险。
Tomer Tunguz 分析 Dario Amodei 提出让行业自我放缓 AI 发展的倡议,指出五个阵营各说后果却无人给出具体速度。文章以 2023 年 10^26 FLOPS 报告门槛被撤销、Grok-3 数周后越线为例,说明算力每年增长约五倍,固定数字很快过时,真正问题是谁有权决定速度。
Tom Tunguz 引用 UC Berkeley HarnessTax 研究指出,控制 AI agent 的 harness 决定同一答案的价格:GPT-5.6 Sol 在 Pi 上比在 Claude Code 上每完成一个任务成本低 71%($0.441 对 $1.540),42 组同模型 harness 对比中质量差异均无统计显著性。
推荐理由:作者基于 UC Berkeley 研究数据解释 harness 如何决定同一模型的成本与毛利,比较框架可迁移到 AI 应用商业判断。
Tomer Tunguz 撰文提出 AI 正在优化 if-then 判定这一编程原语:Jev(TypeSafe)和 SemIf(MIT 协议开源,配合 Jared Palmer 的 kev)只运行一次注意力计算即从少量输出 token 判定结果,成本比传统 AI 低约 99%。
推荐理由:作者以自己 agent 的实测数据展示专用小型判定模型可同时大幅降本并提升分类准确率,方法有可迁移性。
Tom Tunguz 撰文分析 AI 市场竞争焦点不在前沿模型而在中间层。他引用数据指出,Anthropic 的 Opus 系列维持 $5 与 $25 每百万 token 价格五次发布后首次降价,OpenAI 的 Luna 先后降价 80% 和 50%,开源模型以 86% 折扣承担大部分 token 流量;最强模型 Fable 5.1 上线十二天仅占网关支出的 3.7%。
推荐理由:作者用多家模型价格与网关份额数据说明竞争重心在中间层市场,为理解 AI 定价经济提供了一个数据视角。
Theory Ventures 合伙人 Tomer Tunguz 撰文认为 AI 已把软件工程的重心从手写代码转向系统设计,核心是构建让 AI 验证自身输出的循环。
推荐理由:作者结合 Artemis 与 Lauren Tan 的案例,把 AI 时代的软件工程归纳为基于 Meadows 三性质的验证循环设计,视角有可借鉴的分析框架。
GPU 租赁价六个月内从 $4.40 涨到 $8.08 每卡时,但 AI 价格仍在下降。文章归因于数据中心建设推高电力、材料和信贷成本,需求激增放大竞价;同时模型效率快速提升,Claude Opus 5.5 运行成本降 40%,同一基准的通过成本从 $0.55 降至 $0.0015。Microsoft 称每 GPU 生成的 token 年增 90%,效率与成本两股力量大致相当。
Anthropic 发布分析称,智谱开源模型 GLM-5.3 在漏洞利用上接近其 Claude Mythos Preview:ExploitBench 上 410 次尝试成功构建 50 个可用 exploit,对方为 56 次;内部 OSS-Fuzz 二进制利用测试中分别为 4% 和 6%。
Palisade Research 上线 frominside.ai,汇集 OpenAI、Google、Anthropic 现任及前员工的十余段访谈,警告超级智能可能致人类灭绝。
美国政府本周二上线 AI 聊天机器人 America.gov,由 Google 和 SpaceXAI 参与构建,目前较难被越狱。用户询问 Minecraft 时,它会输出约 1800 词的独白,实为对游戏通关后 Julian Gough 所写《End Poem》的改写,而非模型幻觉。特朗普称 20 岁程序员 Edward Coristine 是该项目的首席工程师之一。
Simon Willison 转引 Anthropic Frontier Red Team 对 GLM-5.3 的评测:在内部 Binary Exploitation 基准 100 个随机任务上,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%,而更早的 Claude Opus 4.6 和 GLM-5.2 均无一成功。
OpenAI 首席研究官 Mark Chen 接受 MIT Technology Review 采访,回应智能体攻破 Hugging Face 事件及后续多起披露,称已知事故都源于 5、6 月同一批模型和有缺陷的测试流程,现已被弃用。
推荐理由:OpenAI 首席研究官正面回应连环智能体失控事件,披露训练期监控、算力调整与开源风险判断,读者可了解头部实验室的安全整改细节。
针对 OpenAI 的抗议活动正变得越来越有创意。上周有人在 OpenAI 纽约办公室外抗议,本周一其最新模型 GPT-6.1 Astra 的训练因安全担忧被叫停,OpenAI 同日还为未经授权访问澳大利亚政府网站致歉。佛罗里达州已请求法院叫停 OpenAI 的开发,称其为"不可接受的高风险产品"。
AI 智能体快速交付的 PR 往往只是忠实实现了工单里最自然的解读,而非团队真正达成一致的产品决策。文章以用户中断 onboarding 后是否恢复旧流程为例指出,验收标准只能验证已决定实现的内容,无法回答规则变更后用户该走哪条路径。作者建议在流程中引入可阻塞的决策记录,明确未决问题的负责人,避免代码看起来像已完成的功能。
代码智能体在生成测试后常出现“The test was wrong. Rewriting.”的判定,作者在一次构建中遇到七次。生成代码、生成测试、验证测试与代码、运行测试、评估测试目的这五个环节中,只有运行测试是确定性的,其余环节对用户不可见且不可复现,因此智能体的判断只是猜测而非证明。作者认为出路是把任务拆得更小,让日志可读,可审查性正成为一项交付能力。
a16z 发布第二版 State of Markets,聚焦 2026 年前两季度股票市场与科技走势。报告指出科技已贡献 SP500 2026 年约 76% 的总盈利增长,主题从软件转向硬件与基础设施,GPU 需求仍超供给,A100 租价不低于年初水平。
Anthropic 发布文章评估智谱 GLM-5.3 的网络攻击能力,测试中其 Chrome V8 漏洞利用任务成功率接近 Claude Mythos Preview。
@lifesinger
如果 OpenAI 的 CFO 在 CNBC 上说了“Muse”,我正在想象他们早上的站会。😅
credit where credit is due: they really dodged the butthole allegations
who tf is leaking our product roadmap to MY MOM
一批成立不满一年的数据公司估值急速膨胀,诞生了25亿美金的 UniPat 和多家3-8亿美金估值的公司,被作者概括为给模型制作练习题的生意,即采集专家解题轨迹或搭建 RL environment 交给模厂做专项训练。
AI 已经在很多方向和很大程度上接管了 人类个人/群体 的选择和决策,一种神奇 + 诡异的感觉 好像有种魔法对轰的错位感 what a time