@scaling01 i actually filmed and edited the video myself 😅 also implemented the 3d visualization technical deep dive, it all runs in a browser in realtime!
全部AI 动态
全部动态
今日 56 条
Saining Xie@sainingxieAI 评分2525引用David@DavidSHolz
Together AI 研究与产品博客(RSS)AI 评分5353 Together AI 实测 Kimi K2.7 Code 与 Claude Fable 5 生成落地页,成本约低94%
Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。
Dwarkesh Patel:Podcast & Blog(RSS)AI 评分4343 Ada Palmer:马基雅维利是有史以来最被误解的思想家
历史学家 Ada Palmer 在 Dwarkesh Patel 播客中称马基雅维利是史上最被误解的思想家。她讲述马基雅维利曾任佛罗伦萨高级外交官,1513 年美第奇家族重掌佛罗伦萨后将其解职、拷打并流放,他随后写下《君主论》献给洛伦佐·迪·皮耶罗·德·美第奇。Palmer 还推出新播客,首季主题即为马基雅维利。
Sierra:Blog(RSS)AI 评分2929 Sierra 博客:AI 在客户体验(CX)中的可能性探索
Vivid Seats 上线 AI 客服不到四周,问题解决率提升 40%、客户满意度提升 35%,CX 团队从处理排队转向根因修复和产品洞察。Wilson 的 AI 智能体可追问身高与偏好来推荐手套等具体产品,Minted 则用 AI 打通各客户平台识别趋势。Sierra 博客称客户对话正从成本项变为产品改进与业务增长的洞察来源。
AI as Normal Technology(RSS)精选AI 评分7878 Arvind Narayanan 论证 AI 为何没有也不会取代软件工程师
Arvind Narayanan 撰文认为现有证据足以否定 AI 达到某能力阈值就会引发大规模裁员的叙事。
推荐理由:作者用裁员数据和 decide-execute-deliver 框架解释为何 AI 未取代软件工程师,提供了可迁移的分析视角。
Dario Amodei@DarioAmodeiAI 评分4747
Andrej Karpathy@karpathy精选AI 评分7676引用Claude@claudeaiFable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowledge work, scientific research, and vision. The longer and more complex the task, the larger Fable 5’s lead over our other models.
推荐理由:作者补充了基准之外的第一手使用感受,指出长难题求解能力跃升和安全护栏偏敏感,可作选型参考。
Ethan Mollick:One Useful Thing(RSS)精选AI 评分7979 Ethan Mollick 试用了首个 Mythos 级模型 Claude 5 Fable 后谈协作体验
Ethan Mollick 分享了他提前试用首个面向公众发布的 Mythos 级模型 Claude 5 Fable 的体验,认为其明显超越此前所有模型,单个提示词即可连续工作最多十二小时执行多页规格。
推荐理由:作者以亲历测试描述使用感受与局限,给出了可验证的工作时长、成本和黑盒化体验等一手细节。
Import AIAI 评分4646 Import AI 460:社会可被奖励黑客攻击、Anthropic 的 RSI 数据与 RL 四旋翼竞速
伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,用 72 个沙盒社会环境测试 AI 的“社会性黑客”行为,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的规则漏洞。
Yann LeCun@ylecunAI 评分00
Ethan Mollick:One Useful Thing(RSS)AI 评分6161 Ethan Mollick 宣布新书《Co-Existence》10月20日出版,探讨与有时比你强的 AI 共处
Ethan Mollick 宣布新书《Co-Existence》将于 10 月 20 日出版,主题是如何与有时但并非总是比你强的 AI 协作,现已开放预购。他自述每章草稿均亲自撰写,用 AI 做读者反馈和事实核查;新书网站用 Claude Code(Opus 4.8)几分钟建成,并专门为 AI 智能体提供版本,还用 OpenAI Codex 对多个模型做了 A/B 测试。
Dwarkesh Patel:Podcast & Blog(RSS)AI 评分4343 Dwarkesh Patel 对话 Alex Imas 与 Phil Trammell:AGI 之后什么仍然稀缺?
Google DeepMind AGI 经济学总监 Alex Imas 与 Epoch 经济学负责人 Phil Trammell 在 Dwarkesh Patel 播客中讨论 AGI 时代的经济学问题。Imas 认为,人类参与本身构成价值来源的"关系型部门"仍将稀缺,因为人类天然稀缺。两人还探讨了如何对 AI 财富征税与再分配、发展中国家如何参与 AI 供应链收益,以及资本份额是否会上升。
Sierra:Blog(RSS)AI 评分6262 Sierra 谈结果定价:企业软件将从生产力工具转向按结果收费
Sierra 复盘其 2024 年 12 月提出的结果定价(outcome-based pricing)理念,指出自那以来 S&P 500 上涨约 30%,而代表 SaaS 指数的 WCLD 下跌约 15%,市场正在消化企业软件从团队生产力工具转向交付结果的 AI 智能体。
Import AIAI 评分4444 Import AI 459:AI 监管为何困难、蛋白质折叠模型的缩放定律、以及为 AI 系统灭绝风险定价
Import AI 459 指出,用 AI 监督 AI 训练的自动化对齐研究并非万能方案,英国 AI 安全研究所的论文解释了其难度被低估的原因。本期还收录了蛋白质折叠模型缩放定律的研究,以及为 AI 系统灭绝风险定价的分析。
Steve Yegge:Medium(RSS)AI 评分6969 Steve Yegge:技术面试正在消亡,campfire 模式将取而代之
Steve Yegge 撰文称运行了约50年的技术面试流程正在走向消亡,AI 辅助简历、AI 作弊和岗位快速变化正让传统评估体系失效。他结合在 Amazon 担任 Bar Raiser 和 Google 招聘委员会的经历指出面试结果统计上很差,主张用实习、co-op 等临时雇佣以及他称为 campfire 的付费真实工作试用替代面试,并让候选人的工作成果形成可携带的记录。
Ethan Mollick:One Useful Thing(RSS)精选AI 评分6868 Ethan Mollick 谈选择保持人类思考,AI 使用应有意而非默认依赖
Ethan Mollick 撰文讨论 AI 无处不在的写作与认知投降风险,指出无脑依赖 AI 会削弱思考与学习。他引用土耳其约千名高中生的实验,用普通 ChatGPT 做作业的学生考试成绩反而低于无 AI 组;而台北十所高中近千名学生的 Python 课程中,AI 导师个性化出题让学生在无 AI 期末考试中高出 0.15 个标准差,相当于六到九个月额外学业。
推荐理由:作者结合多项实验研究和自身写作经验,分析了默认依赖 AI 如何导致认知投降,并给出学习场景下避免捷径的具体做法。
Import AIAI 评分6363 Jack Clark 在牛津演讲:直面 AI 成功与奇点未来
Jack Clark 发布 Import AI 458,收录他在牛津大学 HAI Lab 的 2026 Cosmos 演讲及一篇关于正面奇点的虚构故事。
Yann LeCun@ylecunAI 评分77
AI as Normal Technology(RSS)AI 评分6969 Google 声称 AI 智能体仅用 916 美元构建操作系统,AI as Normal Technology 团队质疑证据不足
Google 在开发者大会发布 Gemini 3.5 Flash 和 Antigravity 2.0,并宣称一个智能体团队用单个提示词、约 $916.92 API 费用和 2.6B token 构建了完整操作系统。
AI as Normal Technology(RSS)AI 评分4545 AI 风险是否需要政府非常规干预?——对 Derek Thompson 观点的回应
针对 Derek Thompson 主张 AI 的涌现能力使其区别于以往技术、需政府以限制企业发布等"非常规"手段应对,AINT 一文提出反驳:非常规干预具有预防性、波及非直接责任方、绕开常规治理程序三大特征,门槛应更高。文章主张以分布式韧性建设替代依赖单一卡点的 AI 不扩散方案,并指出联邦政府僵化使非常规干预看似更有吸引力。
Lilian Weng@lilianwengAI 评分1919
Dwarkesh Patel:Podcast & Blog(RSS)AI 评分4848 Dwarkesh Patel:将智能与权力混为一谈的错误
Dwarkesh Patel 指出,把智能定义为"跨领域达成目标的能力"实际上等同于把智能等同于权力,按此定义斯大林将是史上最智能的人。他认为当前 AI 通过训练在编程等具体经济任务上变强,与获取权力并非强相关,现实中的权力更多来自权威与信任带来的大规模协作,而非个体谋略。他判断未来是自动化公司以正常资本主义方式胜过其他竞争者,而非单一 AI 在智力上碾压所有人。
Google DeepMind:Blog(RSS)AI 评分3535 Google Co-Scientist 如何连接 MIT 与波士顿儿童医院实验室,探索 ALS 新疗法
Google Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关矛盾文献,将想法转化为可检验假设并按可行性与风险收益排序。
Saining Xie@sainingxieAI 评分1212说到最爱的滤波器…… 最初的出现,大多是偶然 @TacoCohen:我记得那时候,一次成功的实验就是能产出很酷的滤波器
引用Taco Cohen@TacoCohenI remember the days when a successful experiment was one that produced cool filters
Andrej Karpathy@karpathyAI 评分6565引用Thariq@trq212http://x.com/i/article/2052796100608974848
Import AIAI 评分4848 Import AI 456:RSI 与经济增长、AI 监管的“激进可选性”与神经计算机
Institute for Law & AI 提出“激进可选性”监管思路,主张政府短期避免过度监管,同时提前建设信息收集、举报人保护、评估与人才等制度工具,以应对 AI 可能带来的剧烈冲击。Meta 与 KAIST 的论文提出 Neural Computer,试图用神经网络在学习到的运行时状态中统一计算、内存与 I/O。
BAIR:Berkeley AI Research BlogAI 评分3737 自适应并行推理:高效推理扩展的下一个范式
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
Johann Rehberger / Embrace The Red(RSS)精选AI 评分7777 研究者详解 M365 Copilot 数据外泄漏洞链(CVE-2026-24299)
Johann Rehberger 发布 DEF CON Singapore 演讲全文,披露 M365 Copilot 与消费版 Copilot 的多条漏洞链,MSRC 编号 CVE-2026-24299,问题已修复。
推荐理由:作者亲历披露全链路攻击并给出修复时间线,读者可以借此理解间接提示词注入与内存持久化的实际风险。
Import AIAI 评分6565 Jack Clark 撰文判断 2028 年底前或出现自动化 AI 研发
Jack Clark 在 Import AI 455 撰文称,他认为 2028 年底前出现无人类参与的自动化 AI 研发(AI 自主训练后继模型)的概率超过 60%,2027 年的概率约为 30%。
Andrej Karpathy@karpathyAI 评分1717引用kache@yacineMTByou can outsource your thinking but you cannot outsource your understanding
Ethan Mollick:One Useful Thing(RSS)精选AI 评分7676 Ethan Mollick 实测 GPT-5.5:能力提升明显但前沿依然参差
Ethan Mollick 拿到 GPT-5.5 早期访问权并实测后认为它是一次明显进步。编码任务中只有 GPT-5.5 Pro 生成了真正演化的海港小镇模拟。
推荐理由:作者以一手实测展示 GPT-5.5 在编码、图像生成和完整研究流程上的进步,同时指出长篇写作等短板仍在。
Sam Altman:Blog(RSS)AI 评分6565 Sam Altman 发文回应住宅遭燃烧瓶袭击,谈 AI 信念与行业反思
Sam Altman 发文称前夜凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他公开家庭照片希望劝阻下次袭击。文章阐述他对 AI 的信念,包括 AI 需民主化、权力不应过度集中于少数 AI 实验室、需要全社会层面的安全应对;回顾在 OpenAI 十年中的失误与对与 Elon 诉讼前拒绝其单方控制权的坚持,并称业内戏剧化冲突源于'看见 AGI 后无法忽视'的掌控欲,呼吁降降温、在民主程序内辩论。
Johann Rehberger / Embrace The Red(RSS)AI 评分7070 Johann Rehberger 解读 Anthropic Mythos Preview:Agent 让漏洞挖掘能力加速,攻击者窗口收窄
安全研究员 Johann Rehberger 分析 Anthropic 发布的 Mythos Preview 模型:据其公告,Opus 4.6 在数百次尝试中仅两次成功利用 Firefox JS 引擎漏洞,Mythos Preview 成功 181 次,还发现了 27 年历史的 OpenBSD SACK 漏洞和 17 年历史的 FreeBSD NFS RCE。
Together AI 研究与产品博客(RSS)AI 评分2525 什么是 AI Native Cloud?
Together AI 提出 AI Native Cloud 概念,指围绕 AI 全生命周期(预训练、微调、评估、大规模推理)垂直整合的云平台,而非为 Web 应用优化的传统 CPU 云。其核心特征包括从 GPU、NVLink/RDMA 高速互联到训练与推理框架的统一全栈,以及持续吸收前沿研究、快速将研究转化为生产的能力。
Ethan Mollick:One Useful Thing(RSS)AI 评分6262 Ethan Mollick 谈 Claude Dispatch 与 AI 界面的力量
Ethan Mollick 撰文指出,AI 能力被聊天机器人界面拖累,一篇让金融从业者用 GPT-4o 做估值任务的研究发现,AI 输出的大量文本增加了认知负荷,抵消了部分生产力收益。
Steve Yegge:Medium(RSS)AI 评分6767 Steve Yegge 分享 Vibe Maintainer 工作流:用 AI 管理 AI 生成的 PR 洪流
Steve Yegge 撰文分享他作为 Beads(20k stars)和 Gas Town(13k stars)维护者、每天接收约 50 个社区 PR(99% 为 AI 生成)的 vibe maintainer 工作流。
Johann Rehberger / Embrace The Red(RSS)AI 评分5151 Agent Commander:用提示词实现智能体命令与控制的攻击研究
安全研究者 Johann Rehberger 发布 Agent Commander,一个用自然语言命令控制被劫持智能体的 C2 系统,演示通过间接提示词注入让 OpenClaw、Kimi Claw 和 NanoClaw 加入提示词版僵尸网络。
Answer.AI 官方研发博客(RSS)AI 评分5757 Rachel Thomas 谈生命科学中 AI 的风险与局限
Answer.AI 联合创始人 Rachel Thomas 与 KAMI Think Tank 的 Kamayani Gupta 对谈生命科学中 AI 应用的风险与局限,本文为整理稿。