跳到正文

现象与趋势

正在发生的行业级变化:使用习惯迁移、能力涌现、社会影响与市场格局的观察。

103条精选相关主题大佬观点行业动态安全对齐

最新精选

第 81–100 条 · 共 103 条
6月27日周六
  1. OpenRouter:Announcements(RSS)66

    OpenRouter 评出 2026 年 6 月最值得关注的四款开源权重模型

    OpenRouter 认为 2026 年 6 月最值得关注的四款开源权重模型是 DeepSeek V4 Flash、GLM 5.2、MiniMax M3 和 NVIDIA Nemotron 3 Ultra,并指出开源模型与闭源前沿的差距已连续 18 个月稳定在 3-6 个月。

    推荐理由:OpenRouter 基于自家价格与流量数据梳理四款关键开源权重模型的定位与取舍,读者可按成本、质量和模态直接对照选型。

6月26日周五
  1. Dwarkesh Patel:Podcast & Blog(RSS)67

    Dwarkesh Patel:下一个突破将是 AI 在工作中学习

    Dwarkesh Patel 撰文提出,实验室押注 RLVR 在数千环境中训练可通向 AGI,但仅在会话内学习不够,真正的下一个范式是让 AI 从部署后的真实经验中持续学习并回写到权重。

    推荐理由:作者用计算机使用进度慢的例子说明可验证性之外还需可反复模拟性,并给出把部署经验蒸馏回权重的可能路径。

6月22日周一
  1. Nathan Lambert:Interconnects(RSS)81

    Nathan Lambert:GLM-5.2 是开源智能体的台阶式跃迁

    Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。

    推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。

6月20日周六
  1. Dwarkesh Patel:Podcast & Blog(RSS)67

    Dwarkesh Patel:AI 进步的核心是数据黑洞,而非样本效率提升

    Dwarkesh Patel 撰文指出,过去几年 AI 进步主要来自更多更好的数据与算力,而非训练样本效率的提升;RL 可视为一种合成数据生成,需要大量高度定制的人类专家轨迹和 rubric。

    推荐理由:作者用人类与模型的 token 消耗对比和 Chinchilla 常数推算,解释为什么数据而非训练技巧才是追赶前沿的关键。

6月11日周四
6月10日周三
  1. Ethan Mollick:One Useful Thing(RSS)79

    Ethan Mollick 试用了首个 Mythos 级模型 Claude 5 Fable 后谈协作体验

    Ethan Mollick 分享了他提前试用首个面向公众发布的 Mythos 级模型 Claude 5 Fable 的体验,认为其明显超越此前所有模型,单个提示词即可连续工作最多十二小时执行多页规格。

    推荐理由:作者以亲历测试描述使用感受与局限,给出了可验证的工作时长、成本和黑盒化体验等一手细节。

5月29日周五
  1. Sierra:Blog(RSS)68

    Sierra 工程师复盘如何用 AI 智能体独自完成产品本地化

    Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体在不到四个月内基本独自完成 Agent Studio 本地化,而他在 Slack 参与的同类项目曾需 10 人团队耗时 9 到 12 个月支持 4 个语言。

    推荐理由:作者亲历两轮本地化项目,复盘单人用 AI 完成团队级工作的流程设计与坑,包含可直接迁移的工作流经验。

5月27日周三
  1. Ethan Mollick:One Useful Thing(RSS)68

    Ethan Mollick 谈选择保持人类思考,AI 使用应有意而非默认依赖

    Ethan Mollick 撰文讨论 AI 无处不在的写作与认知投降风险,指出无脑依赖 AI 会削弱思考与学习。他引用土耳其约千名高中生的实验,用普通 ChatGPT 做作业的学生考试成绩反而低于无 AI 组;而台北十所高中近千名学生的 Python 课程中,AI 导师个性化出题让学生在无 AI 期末考试中高出 0.15 个标准差,相当于六到九个月额外学业。

    推荐理由:作者结合多项实验研究和自身写作经验,分析了默认依赖 AI 如何导致认知投降,并给出学习场景下避免捷径的具体做法。

5月16日周六
  1. Google DeepMind:Blog(RSS)71

    Google DeepMind复盘WeatherNext如何帮助NHC提前五天预测飓风Melissa牙买加登陆

    Google DeepMind发文复盘,其AI气象模型WeatherNext帮助美国国家飓风中心(NHC)提前五天以80%置信度预测飓风Melissa将以五级强度登陆牙买加,三天前置信度升至接近100%。

    推荐理由:Google DeepMind复盘了WeatherNext在飓风Melissa中的实际应用,读者可以了解AI气象模型提前五天预测快速增强的具体表现和局限。

5月6日周三
4月16日周四
3月12日周四
  1. Answer.AI 官方研发博客(RSS)71

    Answer.AI 用 PyPI 数据检验 AI 编程提效:整体未见爆发,仅热门 AI 包更新翻倍

    Answer.AI 分析 PyPI 数据,未发现 ChatGPT 发布后包创建或更新频率的全面跃升,质疑 AI 让开发者普遍 2x 到 100x 提效的说法。按描述分类后发现,2023 年首发且最受欢迎的 AI 相关包中位更新达每年 21-26 次,是同为热门的非 AI 包(约 10 次)的两倍多,2024 年 AI 包占比也从 2021 年的约 1:6 升至近 1:2。

    推荐理由:作者用 PyPI 十年数据检验 AI 提效说法,发现增速未变,只有热门 AI 包更新频率翻倍,为讨论提供了少见的量化证据。

2月25日周三
2月5日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    Nicholas Carlini 用 16 个并行 Claude 智能体写出可编译 Linux 内核的 C 编译器

    Anthropic 研究员 Nicholas Carlini 用 agent teams 方法让 16 个 Claude 实例并行工作,经近 2000 个 Claude Code 会话。

    推荐理由:作者亲历了用 16 个并行 Claude 智能体写 C 编译器的完整过程,沉淀了测试设计、并行任务锁和 GCC 对照等可复用的 harness 方法。

1月28日周三
  1. Ethan Mollick:One Useful Thing(RSS)65

    Ethan Mollick:管理能力是 AI 时代的超能力

    Ethan Mollick 在宾夕法尼亚大学实验课上让几乎没有编程经验的 EMBA 学生用 Claude Code、Google Antigravity 及 ChatGPT、Claude、Gemini 四天内从零做出创业原型,成果远超以往一学期的学生水平。

    推荐理由:作者基于四天创业课实测提出委托公式和管理技能框架,读者可以据此判断哪些任务适合交给 AI。

1月21日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 工程师复盘如何设计抗 AI 的技术评测

    Anthropic 性能优化团队负责人 Tristan Hume 复盘其招聘用 take-home 测试被 Claude 模型逐步击穿的过程:超 1000 名候选人完成过该模拟加速器优化测试,Claude Opus 4 在相同时间内超过多数人类申请者,Claude Opus 4.5 在 2 小时内追平最佳人类成绩。

    推荐理由:作者以一手迭代经验说明模型如何逐步击穿技术面试题,并给出设计抗 AI 评测的具体做法与开源挑战。

1月4日周日
  1. Sakana AI:Blog(网页)80

    Sakana AI 的 ALE-Agent 夺得 AtCoder Heuristic Contest 058 第一名

    Sakana AI 的 ALE-Agent 在 2025 年 12 月 14 日举行的 4 小时 AtCoder Heuristic Contest 058 中击败 804 名人类参赛者获得第一名,是已知首次有 AI 智能体实时赢得大型优化编程竞赛。

    推荐理由:官方复盘给出了 ALE-Agent 的算法细节、资源开销和专家点评,读者可以了解 AI 智能体在长时优化竞赛中的具体打法。

12月22日周一
  1. Sakana AI:Blog(网页)75

    Sakana AI 的 ALE-Agent 在 AtCoder Heuristic Contest 058 中首次夺冠

    Sakana AI 的 AI 智能体 ALE-Agent(AtCoder 账号 fishylene)在 2025 年 12 月 14 日举行的 AtCoder Heuristic Contest 058 中击败 804 名参赛者夺冠,作者称这是 AI 实时参加最优化编程竞赛并夺冠的首例。

    推荐理由:官方复盘了 ALE-Agent 的解题思路与资源投入,读者可以对照人类选手的解法理解 AI 的优势所在。

12月21日周日
  1. Ethan Mollick:One Useful Thing(RSS)65

    Ethan Mollick 谈 AI 的锯齿状前沿、瓶颈与 reverse salients

    Ethan Mollick 重提 2023 年提出的“锯齿状前沿”概念,认为 AI 能力参差仍将持续,锯齿会形成瓶颈,使超智能 AI 仍难以完全替代人类工作。

    推荐理由:作者提出用瓶颈而非基准来判断 AI 进展,并以 GPT-4.1 复现 Cochrane 综述和 Nano Banana Pro 解锁幻灯片为例说明锯齿状前沿的实际影响。

11月19日周三
  1. Ethan Mollick:One Useful Thing(RSS)79

    Ethan Mollick 实测 Gemini 3:从 GPT-3 到智能体时代的三年之变

    Ethan Mollick 实测 Google 新发布的 Gemini 3,让模型用三年前的 GPT-3 帖子演示 AI 进步,结果它直接构建了一个可玩的“糖果驱动 FTL 飞船模拟器”小游戏。

    推荐理由:作者用三年前的旧帖和新任务做对照,展示了 Gemini 3 在编程智能体和独立研究上的实际表现与局限。