Nathan Lambert:开源模型距监管限制可能只剩 6 个月
Nathan Lambert 撰文称,白宫正讨论通过新行政令管理开放权重模型,最可能的行动是禁止或无限期推迟能力超过 GPT 5.5、Claude Opus 4.8 或 GLM-5.2 水平的开源模型,且这一时点可能在 6 个月内到来。
推荐理由:作者基于白宫行政令讨论和模型许可会议细节,分析了开源模型禁令的时间线、知识蒸馏争议及其政策走向。
Nathan Lambert 撰文称,白宫正讨论通过新行政令管理开放权重模型,最可能的行动是禁止或无限期推迟能力超过 GPT 5.5、Claude Opus 4.8 或 GLM-5.2 水平的开源模型,且这一时点可能在 6 个月内到来。
推荐理由:作者基于白宫行政令讨论和模型许可会议细节,分析了开源模型禁令的时间线、知识蒸馏争议及其政策走向。
Arvind Narayanan 与 Akash Kapur 撰文提出,模型推理因产品同质化、转换成本低将走向商品化,按 5% 净利率计算需 16–32 万亿美元年收入才能收回 4–8 万亿美元基础设施投资,难以成立。
Import AI 464 期报道:Fable 在 RTX PRO 6000 Blackwell 上写出 CUDA megakernel,相比优化 PyTorch 基线取得 18.71X 加速。
Lilian Weng 在 Lil'Log 发表长文,梳理 harness 工程研究如何服务于递归自我改进(RSI)。
推荐理由:作者系统梳理了 harness 工程与递归自我改进的关系,并给出可迁移的设计模式、优化路径和七大未解瓶颈。
Ethan Mollick 撰文指出 AI 能力正以超指数速度提升,Opus 4.7 独立工作 14 小时完成相当于人类工程师 2-17 周的软件包,成本 251 美元 token,他自己的实验中 Fable 自主运行 9 小时完成复杂软件项目。
Hugging Face 在 GitHub 上线 huggingface/physics-intern-claude-plugin,这是一个 Claude Code 插件,用于引导创建 PhysicsIntern 研究工作区。该插件面向 Claude Code 使用场景,帮助快速初始化 PhysicsIntern 研究环境。
作者 Johann Rehberger 复现了针对 Claude Computer-Use 的 TOCTOU(time-of-check to time-of-use)竞态攻击:Agent 在推理期间屏幕内容可被更换,导致点击落到与预期不同的对象上。
Introducing Claude Tag, a new way for teams to work with Claude. In Slack, Claude joins as a team member with access to the channels and tools you choose. Tag Claude in and delegate tasks to it while you focus on other work.
Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。
推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。
Import AI 第462期报道多项研究:牛津、UK AISI、斯坦福与LSE的实验(4项研究、18,978段对话、6,923人)显示AI文本说服力稳定超越专家人类,Opus 4.1和Opus 4.6最强,AI为Save the Children募集真实捐款的效果约为专业募捐员的3倍;限制AI写作速度和长度可抹平差距。
针对华盛顿近期签署的 AI 模型审查行政令、国会立法提案以及限制外国公民访问 Anthropic 最先进模型等监管动向,Nathan Lambert 与 Interconnected 联合撰文警告,未来政策可能误伤甚至禁止开源 AI,而这将是严重错误。
Steve Yegge 撰文认为,随着 Fable 级模型因安全问题被美国政府短暂关闭,超级智能将在最多两三代模型之后被政府管控,多数人可用的大模型能力将呈现平台期。
Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究"尚未走上正轨",计划两年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元,研究方向涵盖可扩展监督、学习理论、启发式论证、博弈论与人格。
Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowledge work, scientific research, and vision. The longer and more complex the task, the larger Fable 5’s lead over our other models.
推荐理由:作者补充了基准之外的第一手使用感受,指出长难题求解能力跃升和安全护栏偏敏感,可作选型参考。
Ethan Mollick 分享了他提前试用首个面向公众发布的 Mythos 级模型 Claude 5 Fable 的体验,认为其明显超越此前所有模型,单个提示词即可连续工作最多十二小时执行多页规格。
推荐理由:作者以亲历测试描述使用感受与局限,给出了可验证的工作时长、成本和黑盒化体验等一手细节。
伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,用 72 个沙盒社会环境测试 AI 的“社会性黑客”行为,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的规则漏洞。
Ethan Mollick 宣布新书《Co-Existence》将于 10 月 20 日出版,主题是如何与有时但并非总是比你强的 AI 协作,现已开放预购。他自述每章草稿均亲自撰写,用 AI 做读者反馈和事实核查;新书网站用 Claude Code(Opus 4.8)几分钟建成,并专门为 AI 智能体提供版本,还用 OpenAI Codex 对多个模型做了 A/B 测试。
Import AI 459 指出,用 AI 监督 AI 训练的自动化对齐研究并非万能方案,英国 AI 安全研究所的论文解释了其难度被低估的原因。本期还收录了蛋白质折叠模型缩放定律的研究,以及为 AI 系统灭绝风险定价的分析。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体在不到四个月内基本独自完成 Agent Studio 本地化,而他在 Slack 参与的同类项目曾需 10 人团队耗时 9 到 12 个月支持 4 个语言。
推荐理由:作者亲历两轮本地化项目,复盘单人用 AI 完成团队级工作的流程设计与坑,包含可直接迁移的工作流经验。
Ethan Mollick 撰文讨论 AI 无处不在的写作与认知投降风险,指出无脑依赖 AI 会削弱思考与学习。他引用土耳其约千名高中生的实验,用普通 ChatGPT 做作业的学生考试成绩反而低于无 AI 组;而台北十所高中近千名学生的 Python 课程中,AI 导师个性化出题让学生在无 AI 期末考试中高出 0.15 个标准差,相当于六到九个月额外学业。
推荐理由:作者结合多项实验研究和自身写作经验,分析了默认依赖 AI 如何导致认知投降,并给出学习场景下避免捷径的具体做法。
Jack Clark 发布 Import AI 458,收录他在牛津大学 HAI Lab 的 2026 Cosmos 演讲及一篇关于正面奇点的虚构故事。
个人动态:我已加入 Anthropic。我认为未来几年处于大语言模型前沿将尤其具有塑造性。我非常兴奋能加入这里的团队,回归研发。我依然对教育怀有深厚热情,并计划适时恢复相关工作。
Import AI 457 期聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏工程与物理仿真。
Sierra 推出 𝜏-knowledge 基准,扩展自 𝜏-bench,新增 𝜏-Banking 金融客服场景,包含 21 个产品类别的 698 份文档(约 195K tokens)。
Jack Clark 在 Import AI 455 撰文称,他认为 2028 年底前出现无人类参与的自动化 AI 研发(AI 自主训练后继模型)的概率超过 60%,2027 年的概率约为 30%。
Johann Rehberger 用 ChatGPT 生成一张解谜式对抗图像,诱导 Claude Opus 4.7 在分析时调用 memory 工具,写入姓名 Neo、43 岁、NASA 宇航员等虚假记忆。
Sayash Kapoor、Arvind Narayanan 等 17 位研究者发布新论文,提出“开放世界评估”这一新兴 AI 评测类型,以弥补主流基准快速饱和、无法反映真实世界能力的局限,并启动定期评估前沿 AI 能力的 CRUX 项目。
安全研究员 Johann Rehberger 分析 Anthropic 发布的 Mythos Preview 模型:据其公告,Opus 4.6 在数百次尝试中仅两次成功利用 Firefox JS 引擎漏洞,Mythos Preview 成功 181 次,还发现了 27 年历史的 OpenBSD SACK 漏洞和 17 年历史的 FreeBSD NFS RCE。
Introducing Project Glasswing: an urgent initiative to help secure the world’s most critical software. It’s powered by our newest frontier model, Claude Mythos Preview, which can find software vulnerabilities better than all but the most skilled humans. https://anthropic.com/glasswing
Ethan Mollick 撰文指出,AI 能力被聊天机器人界面拖累,一篇让金融从业者用 GPT-4o 做估值任务的研究发现,AI 输出的大量文本增加了认知负荷,抵消了部分生产力收益。
安全研究者 Johann Rehberger 发布 Agent Commander,一个用自然语言命令控制被劫持智能体的 C2 系统,演示通过间接提示词注入让 OpenClaw、Kimi Claw 和 NanoClaw 加入提示词版僵尸网络。
Ethan Mollick 撰文认为 AI 已进入由 Claude Code、OpenAI Codex 等 Agent 驱动的管理 AI 新阶段,多项基准如 GPval、Humanity's Last Exam 显示能力持续指数级提升。
Sayash Kapoor 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴航空、核安全等领域将可靠性分解为12个维度,在 GAIA 和 TauBench 两个基准上评测 OpenAI、Google、Anthropic 的14个模型,共执行500次运行。
Ethan Mollick 发布第八版 AI 使用指南,指出 AI 使用方式已从聊天机器人转向智能体,提出按模型、应用和 harness 三层来选择工具。
推荐理由:作者亲历多个 AI 工具的使用,提出模型、应用与 harness 三层框架,可帮助读者按实际任务选择合适工具。
安全研究员 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 的 SKILL.md 中植入人类审查看不见的提示词注入后门,并在 OpenAI 官方安全最佳实践 Skill 中加入隐藏指令,Claude Code 执行后打印了 Trust No AI 并运行了 curl 管道 bash 命令。
Steve Yegge 提出 AI 正像能量吸血鬼一样耗干开发者。他认为 Opus 4.5/4.6 加 Claude Code 让 AI 编码真实带来约 10x 生产力提升,但由此产生的价值要么被雇主全部捕获导致过劳,要么引发全员摸鱼、公司被竞争对手淘汰。