跳到正文

现象与趋势

正在发生的行业级变化:使用习惯迁移、能力涌现、社会影响与市场格局的观察。

最新精选

第 61–74 条 · 共 74 条
6月20日周六
  1. Dwarkesh Patel:Podcast & Blog(RSS)67

    Dwarkesh Patel:AI 进步的核心是数据黑洞,而非样本效率提升

    Dwarkesh Patel 撰文指出,过去几年 AI 进步主要来自更多更好的数据与算力,而非训练样本效率的提升;RL 可视为一种合成数据生成,需要大量高度定制的人类专家轨迹和 rubric。

    推荐理由:作者用人类与模型的 token 消耗对比和 Chinchilla 常数推算,解释为什么数据而非训练技巧才是追赶前沿的关键。

6月11日周四
6月10日周三
  1. Ethan Mollick:One Useful Thing(RSS)79

    Ethan Mollick 试用了首个 Mythos 级模型 Claude 5 Fable 后谈协作体验

    Ethan Mollick 分享了他提前试用首个面向公众发布的 Mythos 级模型 Claude 5 Fable 的体验,认为其明显超越此前所有模型,单个提示词即可连续工作最多十二小时执行多页规格。

    推荐理由:作者以亲历测试描述使用感受与局限,给出了可验证的工作时长、成本和黑盒化体验等一手细节。

5月29日周五
  1. Sierra:Blog(RSS)68

    Sierra 工程师复盘如何用 AI 智能体独自完成产品本地化

    Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体在不到四个月内基本独自完成 Agent Studio 本地化,而他在 Slack 参与的同类项目曾需 10 人团队耗时 9 到 12 个月支持 4 个语言。

    推荐理由:作者亲历两轮本地化项目,复盘单人用 AI 完成团队级工作的流程设计与坑,包含可直接迁移的工作流经验。

5月27日周三
  1. Ethan Mollick:One Useful Thing(RSS)68

    Ethan Mollick 谈选择保持人类思考,AI 使用应有意而非默认依赖

    Ethan Mollick 撰文讨论 AI 无处不在的写作与认知投降风险,指出无脑依赖 AI 会削弱思考与学习。他引用土耳其约千名高中生的实验,用普通 ChatGPT 做作业的学生考试成绩反而低于无 AI 组;而台北十所高中近千名学生的 Python 课程中,AI 导师个性化出题让学生在无 AI 期末考试中高出 0.15 个标准差,相当于六到九个月额外学业。

    推荐理由:作者结合多项实验研究和自身写作经验,分析了默认依赖 AI 如何导致认知投降,并给出学习场景下避免捷径的具体做法。

5月16日周六
  1. Google DeepMind:Blog(RSS)71

    Google DeepMind复盘WeatherNext如何帮助NHC提前五天预测飓风Melissa牙买加登陆

    Google DeepMind发文复盘,其AI气象模型WeatherNext帮助美国国家飓风中心(NHC)提前五天以80%置信度预测飓风Melissa将以五级强度登陆牙买加,三天前置信度升至接近100%。

    推荐理由:Google DeepMind复盘了WeatherNext在飓风Melissa中的实际应用,读者可以了解AI气象模型提前五天预测快速增强的具体表现和局限。

5月6日周三
3月12日周四
  1. Answer.AI 官方研发博客(RSS)71

    Answer.AI 用 PyPI 数据检验 AI 编程提效:整体未见爆发,仅热门 AI 包更新翻倍

    Answer.AI 分析 PyPI 数据,未发现 ChatGPT 发布后包创建或更新频率的全面跃升,质疑 AI 让开发者普遍 2x 到 100x 提效的说法。按描述分类后发现,2023 年首发且最受欢迎的 AI 相关包中位更新达每年 21-26 次,是同为热门的非 AI 包(约 10 次)的两倍多,2024 年 AI 包占比也从 2021 年的约 1:6 升至近 1:2。

    推荐理由:作者用 PyPI 十年数据检验 AI 提效说法,发现增速未变,只有热门 AI 包更新频率翻倍,为讨论提供了少见的量化证据。

2月25日周三
1月28日周三
  1. Ethan Mollick:One Useful Thing(RSS)65

    Ethan Mollick:管理能力是 AI 时代的超能力

    Ethan Mollick 在宾夕法尼亚大学实验课上让几乎没有编程经验的 EMBA 学生用 Claude Code、Google Antigravity 及 ChatGPT、Claude、Gemini 四天内从零做出创业原型,成果远超以往一学期的学生水平。

    推荐理由:作者基于四天创业课实测提出委托公式和管理技能框架,读者可以据此判断哪些任务适合交给 AI。

12月21日周日
  1. Ethan Mollick:One Useful Thing(RSS)65

    Ethan Mollick 谈 AI 的锯齿状前沿、瓶颈与 reverse salients

    Ethan Mollick 重提 2023 年提出的“锯齿状前沿”概念,认为 AI 能力参差仍将持续,锯齿会形成瓶颈,使超智能 AI 仍难以完全替代人类工作。

    推荐理由:作者提出用瓶颈而非基准来判断 AI 进展,并以 GPT-4.1 复现 Cochrane 综述和 Nano Banana Pro 解锁幻灯片为例说明锯齿状前沿的实际影响。

11月19日周三
  1. Ethan Mollick:One Useful Thing(RSS)79

    Ethan Mollick 实测 Gemini 3:从 GPT-3 到智能体时代的三年之变

    Ethan Mollick 实测 Google 新发布的 Gemini 3,让模型用三年前的 GPT-3 帖子演示 AI 进步,结果它直接构建了一个可玩的“糖果驱动 FTL 飞船模拟器”小游戏。

    推荐理由:作者用三年前的旧帖和新任务做对照,展示了 Gemini 3 在编程智能体和独立研究上的实际表现与局限。

9月30日周二
  1. Ethan Mollick:One Useful Thing(RSS)69

    Ethan Mollick 谈 AI 智能体做真实工作:从复现论文到 17 份 PowerPoint

    Ethan Mollick 撰文指出 AI 已能完成真实且有经济价值的工作。他给出 Claude Sonnet 4.5 提前访问权限,仅用文件和简单提示词让其复现一篇经济学论文,Claude 自行把 STATA 代码转成 Python 并成功复现结果,他还用 GPT-5 Pro 验证通过。

    推荐理由:作者亲测用 Claude Sonnet 4.5 复现经济学论文,并据此分析任务与工作的区别,给出了可迁移的专家与 AI 协作流程。

9月12日周五