Steve Yegge 提出平坦曲线社会:前沿模型将被锁控,AI 素养成新工艺
Steve Yegge 撰文认为,随着 Fable 级模型因安全问题被美国政府短暂关闭,超级智能将在最多两三代模型之后被政府管控,多数人可用的大模型能力将呈现平台期。
Steve Yegge 撰文认为,随着 Fable 级模型因安全问题被美国政府短暂关闭,超级智能将在最多两三代模型之后被政府管控,多数人可用的大模型能力将呈现平台期。
@scaling01 i actually filmed and edited the video myself 😅 also implemented the 3d visualization technical deep dive, it all runs in a browser in realtime!
Arvind Narayanan 撰文认为现有证据足以否定 AI 达到某能力阈值就会引发大规模裁员的叙事。
推荐理由:作者用裁员数据和 decide-execute-deliver 框架解释为何 AI 未取代软件工程师,提供了可迁移的分析视角。
伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,用 72 个沙盒社会环境测试 AI 的“社会性黑客”行为,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的规则漏洞。
Ethan Mollick 宣布新书《Co-Existence》将于 10 月 20 日出版,主题是如何与有时但并非总是比你强的 AI 协作,现已开放预购。他自述每章草稿均亲自撰写,用 AI 做读者反馈和事实核查;新书网站用 Claude Code(Opus 4.8)几分钟建成,并专门为 AI 智能体提供版本,还用 OpenAI Codex 对多个模型做了 A/B 测试。
Google DeepMind AGI 经济学总监 Alex Imas 与 Epoch 经济学负责人 Phil Trammell 在 Dwarkesh Patel 播客中讨论 AGI 时代的经济学问题。Imas 认为,人类参与本身构成价值来源的"关系型部门"仍将稀缺,因为人类天然稀缺。两人还探讨了如何对 AI 财富征税与再分配、发展中国家如何参与 AI 供应链收益,以及资本份额是否会上升。
Sierra 复盘其 2024 年 12 月提出的结果定价(outcome-based pricing)理念,指出自那以来 S&P 500 上涨约 30%,而代表 SaaS 指数的 WCLD 下跌约 15%,市场正在消化企业软件从团队生产力工具转向交付结果的 AI 智能体。
Import AI 459 指出,用 AI 监督 AI 训练的自动化对齐研究并非万能方案,英国 AI 安全研究所的论文解释了其难度被低估的原因。本期还收录了蛋白质折叠模型缩放定律的研究,以及为 AI 系统灭绝风险定价的分析。
Steve Yegge 撰文称运行了约50年的技术面试流程正在走向消亡,AI 辅助简历、AI 作弊和岗位快速变化正让传统评估体系失效。他结合在 Amazon 担任 Bar Raiser 和 Google 招聘委员会的经历指出面试结果统计上很差,主张用实习、co-op 等临时雇佣以及他称为 campfire 的付费真实工作试用替代面试,并让候选人的工作成果形成可携带的记录。
Ethan Mollick 撰文讨论 AI 无处不在的写作与认知投降风险,指出无脑依赖 AI 会削弱思考与学习。他引用土耳其约千名高中生的实验,用普通 ChatGPT 做作业的学生考试成绩反而低于无 AI 组;而台北十所高中近千名学生的 Python 课程中,AI 导师个性化出题让学生在无 AI 期末考试中高出 0.15 个标准差,相当于六到九个月额外学业。
推荐理由:作者结合多项实验研究和自身写作经验,分析了默认依赖 AI 如何导致认知投降,并给出学习场景下避免捷径的具体做法。
Jack Clark 发布 Import AI 458,收录他在牛津大学 HAI Lab 的 2026 Cosmos 演讲及一篇关于正面奇点的虚构故事。
针对 Derek Thompson 主张 AI 的涌现能力使其区别于以往技术、需政府以限制企业发布等"非常规"手段应对,AINT 一文提出反驳:非常规干预具有预防性、波及非直接责任方、绕开常规治理程序三大特征,门槛应更高。文章主张以分布式韧性建设替代依赖单一卡点的 AI 不扩散方案,并指出联邦政府僵化使非常规干预看似更有吸引力。
个人动态:我已加入 Anthropic。我认为未来几年处于大语言模型前沿将尤其具有塑造性。我非常兴奋能加入这里的团队,回归研发。我依然对教育怀有深厚热情,并计划适时恢复相关工作。
Dwarkesh Patel 指出,把智能定义为"跨领域达成目标的能力"实际上等同于把智能等同于权力,按此定义斯大林将是史上最智能的人。他认为当前 AI 通过训练在编程等具体经济任务上变强,与获取权力并非强相关,现实中的权力更多来自权威与信任带来的大规模协作,而非个体谋略。他判断未来是自动化公司以正常资本主义方式胜过其他竞争者,而非单一 AI 在智力上碾压所有人。
Google Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关矛盾文献,将想法转化为可检验假设并按可行性与风险收益排序。
说到最爱的滤波器…… 最初的出现,大多是偶然 @TacoCohen:我记得那时候,一次成功的实验就是能产出很酷的滤波器
I remember the days when a successful experiment was one that produced cool filters
Institute for Law & AI 提出“激进可选性”监管思路,主张政府短期避免过度监管,同时提前建设信息收集、举报人保护、评估与人才等制度工具,以应对 AI 可能带来的剧烈冲击。Meta 与 KAIST 的论文提出 Neural Computer,试图用神经网络在学习到的运行时状态中统一计算、内存与 I/O。
Jack Clark 在 Import AI 455 撰文称,他认为 2028 年底前出现无人类参与的自动化 AI 研发(AI 自主训练后继模型)的概率超过 60%,2027 年的概率约为 30%。
you can outsource your thinking but you cannot outsource your understanding
Ethan Mollick 拿到 GPT-5.5 早期访问权并实测后认为它是一次明显进步。编码任务中只有 GPT-5.5 Pro 生成了真正演化的海港小镇模拟。
推荐理由:作者以一手实测展示 GPT-5.5 在编码、图像生成和完整研究流程上的进步,同时指出长篇写作等短板仍在。
Sam Altman 发文称前夜凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他公开家庭照片希望劝阻下次袭击。文章阐述他对 AI 的信念,包括 AI 需民主化、权力不应过度集中于少数 AI 实验室、需要全社会层面的安全应对;回顾在 OpenAI 十年中的失误与对与 Elon 诉讼前拒绝其单方控制权的坚持,并称业内戏剧化冲突源于'看见 AGI 后无法忽视'的掌控欲,呼吁降降温、在民主程序内辩论。
Ethan Mollick 撰文认为 AI 已进入由 Claude Code、OpenAI Codex 等 Agent 驱动的管理 AI 新阶段,多项基准如 GPval、Humanity's Last Exam 显示能力持续指数级提升。
Jeremy Howard 与 Luke Versweyveld 撰文论证 OpenAI 与 Department of War 合同中的"all lawful purposes"在美国合同法下指履约时的法律而非签署时的法律。
推荐理由:作者从合同法教义出发逐条拆解条款含义,指出 OpenAI 想要的签署时法律标准并未被合同语言锁定,观点有判例支撑。
这篇发表于 Lawfare 研究论文系列的长文提出核心观点:先进 AI 默认不会帮消费者以更低成本实现法律结果。作者指出三大瓶颈,包括 UPL 等监管壁垒、诉讼与交易中的对抗性军备竞赛,以及法官和律师等人类参与的速度上限,并以数字化未能降低 discovery 成本为历史类比。文章最后梳理了职业监管改革、裁判方式改革和律师角色演变等改革建议,说明法律行业的制度回应将决定 AI 的影响方向。
Steve Yegge 提出 AI 正像能量吸血鬼一样耗干开发者。他认为 Opus 4.5/4.6 加 Claude Code 让 AI 编码真实带来约 10x 生产力提升,但由此产生的价值要么被雇主全部捕获导致过劳,要么引发全员摸鱼、公司被竞争对手淘汰。
Steve Yegge 撰文分析 Anthropic 内部运作方式,称过去四个月与近 40 名员工深谈后,判断其正处在以全员高透明、即时协作和即兴式探索为特征的黄金时代。
Arvind Narayanan 在其基于 YouTube 视频的长文中指出,Moravec 悖论(对人类难的任务对 AI 容易,反之亦然)从未被实证检验,它更像是 AI 研究社区对值得关注问题的选择效应,其进化论解释也可疑。
Ethan Mollick 在宾夕法尼亚大学实验课上让几乎没有编程经验的 EMBA 学生用 Claude Code、Google Antigravity 及 ChatGPT、Claude、Gemini 四天内从零做出创业原型,成果远超以往一学期的学生水平。
推荐理由:作者基于四天创业课实测提出委托公式和管理技能框架,读者可以据此判断哪些任务适合交给 AI。
Sebastian Raschka 发布 2025 年 LLM 年度回顾,认为这一年由 RLVR 与 GRPO 驱动的推理模型主导,DeepSeek R1 展示了强化学习可培养推理行为且后训练成本远低于预期(约 500 万美元量级,另有在 V3 基础上训练 R1 约 $294,000 的估计)。
我提出的一个观点没有被传达出来: - 扩展当前的东西会持续带来改进。特别是,它不会停滞。 - 但某个重要的东西会继续缺失。
here are the most important points from today's ilya sutskever podcast: - superintelligence in 5-20 years - current scaling will stall hard; we're back to real research - superintelligence = super-fast continual learner, not finished oracle - models generalize 100x worse than humans, the biggest AGI blocker - need completely new ML paradigm (i have ideas, can't share rn) - AI impact will hit hard, but only after economic diffusion - breakthroughs historically needed almost no compute - SSI has enough focused research compute to win - current RL already eats more compute than pre-training
Ethan Mollick 撰文指出,MMLU-Pro 等公开基准存在数据污染、题目含义不明和无法度量写作、商业判断等能力的问题,但仍共同反映底层能力的上升趋势。他建议个人用自设的 vibes 测试了解模型风格,组织则应参考 OpenAI 的 GDPval 方法,用真实任务、多次重复和专家盲评来系统评估模型在自己业务上的表现,并通过 GuacaDrone 等案例观察不同模型在模糊判断上的稳定差异。