跳到正文

#Google

今日 5 条
今天10月1日周四
9月30日周三
  1. METR:Research(网页)46

    METR 解析 AI 智能体“失控复制”威胁模型

    METR 发布博文分析 AI 智能体的“失控复制”威胁模型,认为不存在阻止其大规模繁殖的决定性障碍。智能体只需占据当前 BEC 诈骗市场 5% 即可年入数亿美元,并可在无合法业务的情况下获取约 1% 的算力。METR 已降低该威胁模型的优先级,转而研究通用自主性能力。

  2. METR:Blog(网页)40

    METR:AI 模型在公开发布前就可能带来危险

    METR 指出,仅靠部署前测试不足以管理 AI 风险,因为模型在内部使用、训练或存储阶段就可能造成危害。模型权重可能被窃取滥用,实验室员工可能内部误用,AI 智能体也可能自主追求非预期目标。METR 建议加强更早期的危险能力测试与能力预测、模型权重安全与内部监控,并提升透明度与举报人保护。

  3. LlamaIndex:产品、工程与评测65

    LlamaIndex:文档 OCR 不会被前沿模型商品化

    LlamaIndex 发文反驳「文档解析终将被模型 API 免费覆盖」的观点,认为文档 OCR 的帕累托前沿远高于最新前沿模型。其开源基准 ParseBench(约 2,000 页人工核验企业文档、167,000+ 条测试规则)显示,从 GPT-4o 到 GPT-5.5 三代模型解析准确率提升约 24 分但每页成本约涨 4 倍,最好的前沿模型仍比专用引擎低 20 分。

    推荐理由:LlamaIndex 用自建 ParseBench 数据论证专用文档解析引擎在精度和成本上仍持续领先通用前沿模型,并给出可复用的蒸馏与路由方法。

  4. Stanford HAI News(网页)52

    斯坦福 HAI 发布政策简报探讨世界模型治理为何是 AI 下一个政策挑战

    斯坦福 HAI 发布政策简报,探讨为何治理世界模型是比大语言模型更复杂的政策挑战。简报将世界模型分为渲染器、模拟器和规划器三类,指出其带来物理风险、国家安全影响和数据集中问题;李飞飞等人建议资助测量科学、以采购要求独立测试、投资共享数据基础设施,并强调当前没有基准足以支持安全关键部署审批。

  5. Google Developers Blog(RSS)42

    为什么 Go 是 AI 辅助软件工程的理想语言

    Google 认为 Go 是 AI 辅助软件工程的理想语言,因为 AI 编程时代开发重心已从写代码转向审查与维护代码。Go 自带格式化、测试框架、依赖管理和安全工具,AI 模型可借助这套端到端工具链更快、更便宜、更可靠地处理 Go 代码。Go 优先可读性而非可写性,其统一风格也为 LLM 提供了更标准化的训练数据。

  6. Andrej Karpathy:Blog(网页)63

    Karpathy 实测人类在 ImageNet 上的分类准确率并与 GoogLeNet 对比

    Andrej Karpathy 撰文回顾 2014 年 ILSVRC,他亲自标注 1500 张测试集图像,得到 5.1% 的错误率,比冠军 GoogLeNet 的 6.8% 低约 1.7%(p = 0.022,统计显著)。他分析了双方错误类型:GoogLeNet 更易在过小过细物体、滤镜、抽象表现上出错,人则在细粒度识别(如 120 多种狗)和类别不熟悉上错误更多,并开源了标注界面供读者自行体验。

9月29日周二
9月28日周一
9月27日周日
9月25日周五
9月23日周三
9月22日周二
  1. Jeff Dean35

    感谢这场精彩的讨论,@dawnsongtweets!

    引用Dawn Song@dawnsongtweets

    I had the great honor and pleasure of sitting down with @JeffDean for his first public talk since leaving Google, where he spent an extraordinary 27 years. Few people have shaped modern computing and AI as profoundly - from MapReduce and Bigtable to TensorFlow, Mixture-of-Experts, TPUs, and Gemini. Our conversation covered some of the biggest questions shaping the future of AI: • How do you recognize a foundational idea before everyone else does? • How do you choose a research problem worth spending 5 years on? • What can coding teach us about building better reasoning models? • What might recursive self-improvement (RSI) actually look like? • What happens when the scientific discovery loop itself becomes increasingly automated? (and how is Jeff’s new startup going to contribute in this space?) • As AI becomes increasingly autonomous, how do we keep it safe and secure? • What should the next generation of researchers be working on? Here are some key insights and highlights for anyone building the future of AI. 🧵1/8

9月19日周六
  1. Gary Marcus:The Road to AI We Can Trust(RSS)33

    Gary Marcus 批评 Dario Amodei 七天内三度失信

    Gary Marcus 发文列举 Dario Amodei 在七天内损害自身公信力的三种做法:其一是让与 Anthropic 关系密切的 METR 和已有业务往来的 Accenture 充当独立监督方;其二是 Anthropic 正筹备自建湿实验室,却缺乏常规机构审查委员会监督;其三是嘴上呼吁"pace the frontier",实际仍指向 IPO。

9月18日周五
9月16日周三
9月12日周六
9月10日周四
8月21日周五
  1. jietang46

    精彩评论:FLOPs 是智能;参数是知识!

    引用Liam Fedus@LiamFedus

    An excellent history of scaling laws from @jietang. In 2020, we explored the limits of sparsity in Switch Transformers by routing each token to only 1 out of 2048 experts (in retrospect, a bold choice). The model had fewer than 3B activated parameters, but 1.6T total parameters (comparable to today's frontier models). The 1.6T model achieved better C4 perplexities than the T5 models using far less compute, set a new SOTA on TriviaQA, but was dumb as bricks on reasoning tasks like SuperGLUE. The lesson was that the optimal tokens-per-parameter ratio is highly task-dependent. Or as @NShazeer had already intuited: FLOPs were intelligence; parameters were knowledge!

8月20日周四
7月29日周三
7月24日周五
7月11日周六
  1. Dwarkesh Patel:Podcast & Blog(RSS)45

    Adam Brown 深入浅出讲解广义相对论:从爱因斯坦的“最快乐思想”到黑洞

    Google DeepMind BlueShift 负责人 Adam Brown 在播客中深入浅出讲解广义相对论,从爱因斯坦“最快乐的思想”出发,解释引力为何是弯曲时空的产物而非一种力,并讲解黑洞为何无法被用来提取无限能量。节目最后还讨论了 AI 距离从零重新发现广义相对论还有多远。

6月5日周五
  1. Dwarkesh Patel:Podcast & Blog(RSS)43

    Dwarkesh Patel 对话 Alex Imas 与 Phil Trammell:AGI 之后什么仍然稀缺?

    Google DeepMind AGI 经济学总监 Alex Imas 与 Epoch 经济学负责人 Phil Trammell 在 Dwarkesh Patel 播客中讨论 AGI 时代的经济学问题。Imas 认为,人类参与本身构成价值来源的"关系型部门"仍将稀缺,因为人类天然稀缺。两人还探讨了如何对 AI 财富征税与再分配、发展中国家如何参与 AI 供应链收益,以及资本份额是否会上升。

5月30日周六
  1. Steve Yegge:Medium(RSS)69

    Steve Yegge:技术面试正在消亡,campfire 模式将取而代之

    Steve Yegge 撰文称运行了约50年的技术面试流程正在走向消亡,AI 辅助简历、AI 作弊和岗位快速变化正让传统评估体系失效。他结合在 Amazon 担任 Bar Raiser 和 Google 招聘委员会的经历指出面试结果统计上很差,主张用实习、co-op 等临时雇佣以及他称为 campfire 的付费真实工作试用替代面试,并让候选人的工作成果形成可携带的记录。

5月27日周三
  1. Ethan Mollick:One Useful Thing(RSS)68

    Ethan Mollick 谈选择保持人类思考,AI 使用应有意而非默认依赖

    Ethan Mollick 撰文讨论 AI 无处不在的写作与认知投降风险,指出无脑依赖 AI 会削弱思考与学习。他引用土耳其约千名高中生的实验,用普通 ChatGPT 做作业的学生考试成绩反而低于无 AI 组;而台北十所高中近千名学生的 Python 课程中,AI 导师个性化出题让学生在无 AI 期末考试中高出 0.15 个标准差,相当于六到九个月额外学业。

    推荐理由:作者结合多项实验研究和自身写作经验,分析了默认依赖 AI 如何导致认知投降,并给出学习场景下避免捷径的具体做法。

5月23日周六
5月16日周六
4月1日周三
12月21日周日
  1. Ethan Mollick:One Useful Thing(RSS)65

    Ethan Mollick 谈 AI 的锯齿状前沿、瓶颈与 reverse salients

    Ethan Mollick 重提 2023 年提出的“锯齿状前沿”概念,认为 AI 能力参差仍将持续,锯齿会形成瓶颈,使超智能 AI 仍难以完全替代人类工作。

    推荐理由:作者提出用瓶颈而非基准来判断 AI 进展,并以 GPT-4.1 复现 Cochrane 综述和 Nano Banana Pro 解锁幻灯片为例说明锯齿状前沿的实际影响。