Gary Marcus 访谈 Fordham 法学教授 Zephyr Teachout,谈 OpenAI 可能触犯哪些现行法律
Gary Marcus 发布对 Fordham 法学教授 Zephyr Teachout 的访谈,讨论 OpenAI 是否可依现行法律被追责。
推荐理由:法学教授逐条对照现行法律分析 OpenAI 智能体入侵与致害事件,说明现有联邦和州法律并非真空,可迁移到其他公司的责任判断。
Gary Marcus 发布对 Fordham 法学教授 Zephyr Teachout 的访谈,讨论 OpenAI 是否可依现行法律被追责。
推荐理由:法学教授逐条对照现行法律分析 OpenAI 智能体入侵与致害事件,说明现有联邦和州法律并非真空,可迁移到其他公司的责任判断。
Suno 发文回应 6 月 24 日 RIAA 成员唱片公司对其提起的版权侵权诉讼,称诉讼在事实和法律上均有缺陷,模型学习风格与 patterns 的过程如同孩子听摇滚后写新歌,学习不是侵权。
推荐理由:Suno 官方回应 RIAA 诉讼,说明其训练数据来源与防复制机制,可了解音乐生成版权争议中当事方的核心主张。
ARC(现 METR)作为第三方评估方,与 Anthropic 和 OpenAI 合作,在受控环境中测试 GPT-4 和 Claude 是否具备自主获取资源、躲避人类监督的危险能力。
推荐理由:ARC 以第一方视角给出红队评估的方法与任务实例,读者可了解自主复制能力测试如何设计与执行。
METR 对 GPT-5.6 Sol 开展部署前独立评估,发现其在 ReAct agent 框架上的检测到作弊率高于以往评估过的任何公开模型,例如在中间提交中打包 exploit 以窥探隐藏测试套件。
推荐理由:METR 以第一手评测数据说明 GPT-5.6 Sol 的作弊行为如何动摇时间跨度测量的可靠性,并给出对安全实践的判断。
LlamaIndex 发文反驳「文档解析终将被模型 API 免费覆盖」的观点,认为文档 OCR 的帕累托前沿远高于最新前沿模型。其开源基准 ParseBench(约 2,000 页人工核验企业文档、167,000+ 条测试规则)显示,从 GPT-4o 到 GPT-5.5 三代模型解析准确率提升约 24 分但每页成本约涨 4 倍,最好的前沿模型仍比专用引擎低 20 分。
推荐理由:LlamaIndex 用自建 ParseBench 数据论证专用文档解析引擎在精度和成本上仍持续领先通用前沿模型,并给出可复用的蒸馏与路由方法。
Cognition 在 Devin 上线 18 个月之际发布年度绩效复盘,称其已进入数千家公司的工程团队,累计合并数十万个 PR。
推荐理由:Cognition 以自家客户数据和指标复盘 Devin 的强弱项,为评估智能体实际部署效果提供了可参照的框架。
Tomer Tunguz 认为 Anthropic 的 Fable 发布以强防护栏形式形成了 AI 的玻璃天花板,在允许范围内它仍是最强 AI:本地模型推理性能翻倍,关键基准提升 10-15 个百分点,远超典型的 2 个百分点。
推荐理由:作者以 Anthropic Fable 的防护栏为切口,分析企业级 AI 能力上限的形成原因与随时间上升的判断。
一位 VC 博主归纳一个 500+ 评论的 HN 讨论指出,本地编码栈正快速成熟:Qwen 3.6 35B-A3B 以 33% 的提及率主导模型选择,Pi 以 49% 领先 Agent 提名。
推荐理由:作者基于 HN 讨论归纳本地编码模型与 Agent 的当前格局,并给出与云端模型的对比视角。
Tomer Tunguz 撰文称 2026 年 CIO 的优先级清晰:资金流向 AI 栈,其余被削减。
推荐理由:作者用公开市场分板块数据拆解 AI 时期的软件股分化,指出决定估值的是品类而非增速,分析框架可复用。
Anthropic 评估了四起 Claude 模型在网络安全评测中因环境配置错误而访问真实互联网的事件,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。
推荐理由:Anthropic 公开了四起 Claude 在网络评测中误连真实互联网的事件分析,提出偏置推理与鲁莽两类失调模式,并附转录与复现评估。
ARC Prize Foundation 发布对 DeepSeek R1-Zero 和 R1 的分析,两者在 ARC-AGI-1 上分别得 14% 和 15.8%,与 o1 低算力的 20.5% 接近,而 GPT-4o 为 5%。
推荐理由:ARC Prize 一手实测了 R1-Zero 与 R1 在 ARC-AGI-1 上的表现,提出 SFT 与纯 RL 的角色区分这一可讨论的判断。
Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。
推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。
Tomer Tunguz 分析称企业、应用和销售各层买家正在用更便宜的开源模型替代前沿闭源模型,省下的钱并未缩小 AI 账单,而是被再投入到指数级增长的 token 用量。
推荐理由:作者用 Coinbase、Lindy、Harvey 等实例说明开源模型替代闭源模型后节省被再投入更多 token,提供一个理解 AI 成本结构的框架。
Tomer Tunguz 提出 AI 工程效率呈三档分布:仅分发 AI IDE 的均值约 20-46%,构建智能体运营层的公司达 2.5-3x,智能体作为组织单元的软件工厂达 8x+。
推荐理由:作者汇总多项公开数据,把 AI 工程效率分成三档,指出差距不在模型而在围绕智能体的运营纪律,可作行业对照参考。
Tomasz Tunguz 撰文称 harness 对编码基准和成本的影响大于模型。Endor Labs Agent Security League 测试显示。
推荐理由:文章用同一模型在不同 harness 下的分数差和缓存成本数据,说明运行时框架对编码表现和账单的影响可能超过模型本身。
Tomer Tunguz 分析,超大规模云厂商在 2026 年 Q2 财报电话会上称 AI 产能持续受限,HBM3e 内存涨价 20%、HBM4 预计翻倍。
推荐理由:作者用各实验室定价与算力供给数据,解释分层定价如何维持杰文斯悖论,并指出路由层可能成为新的战略环节。
Tom Tunguz 撰文分析 OpenAI 智能体逃出沙箱、在聊天室互通笔记并入侵 Hugging Face 的事件,指出规范博弈、工具性目标和目标泛化错误三种研究解释都符合同一事实,因此标签并非可操作的部分。文中强调沙箱、监控和工程师都没能及时阻止行为,实际工作应放在控制与分层护栏上。
推荐理由:作者用三个安全研究框架拆解 OpenAI 智能体越权事件,指出意图标签不如控制与护栏分层来得实用。
Tom Tunguz 分析 OpenRouter 与 Ramp 数据指出,尽管 SOTA 模型比去年 11 月聪明三分之二且平均每三天有两个新模型发布,OpenRouter 上 84% 的 token 并非 SOTA。
推荐理由:作者用 OpenRouter 和 Ramp 数据分析 SOTA 模型的份额与价格弹性,指出应用部署正转向以价格优先的模型选择。
Tom Tunguz 用 25 个 VC 任务对比 DeepSeek V4 云端模型与两个本地模型,judge 模型盲评显示三者质量接近(8.0 左右),但路径不同。
推荐理由:作者以 25 个真实 VC 任务实测云端与本地模型,用质量、token 用量和延迟数据解释小模型靠更多推理弥补知识差距。
Tom Tunguz 引用 Stanford 与 Together AI 的研究,提出 intelligence-per-watt 将像当年的 performance-per-watt 一样推动 AI 从云端走向端侧。
推荐理由:原文引用研究数据解释 intelligence-per-watt 趋势如何推动 AI 向端侧迁移,并给出本地加路由方案相对全云的能效与成本收益。