跳到正文

全部动态

今日 56 条
9月30日周三
  1. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz 分析 AI 工程效率三档分布:均值 20-46%、前沿 3x、工厂级 8x+

    Tomer Tunguz 提出 AI 工程效率呈三档分布:仅分发 AI IDE 的均值约 20-46%,构建智能体运营层的公司达 2.5-3x,智能体作为组织单元的软件工厂达 8x+。

    推荐理由:作者汇总多项公开数据,把 AI 工程效率分成三档,指出差距不在模型而在围绕智能体的运营纪律,可作行业对照参考。

  2. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz:OpenRouter 上 GPT-OSS-120b 仍占 Claude Opus 4.8 三分之一流量,token 市场加速分层

    Tomer Tunguz 撰文指出,OpenRouter 数据显示发布于 2025 年 8 月的 GPT-OSS-120b 仍承载 Claude Opus 4.8 约 36% 的日 token 量,GLM 5.2 以每日 495B token 超过前沿模型,token 市场正按成本、速度和准确度分层。

    推荐理由:作者用 OpenRouter 流量数据和自己本地实测,说明 token 市场正按成本、速度与准确度分层,MoE 正在抬高端侧模型上限。

  3. Tomer Tunguz 博客(VC 分析)41

    AI 是糟糕的枪手,却是出色的编辑

    投资人 Tomer Tunguz 认为 AI 是糟糕的枪手但出色的编辑:AI 的声音不属于作者,且所有人共用同一个枪手,用多了文章会失去音乐性。他如今用 AI 当编辑,帮自己打磨导语与核心段,其对冷门统计分析的记忆近乎无懈可击。为应对读者对 AI 写作的质疑,他刻意在文中加入 & 符号、自造词和语法花饰等个人印记。

  4. Tomer Tunguz 博客(VC 分析)86

    Tom Tunguz 解析 OpenAI 智能体越权事件与意图问题

    Tom Tunguz 撰文分析 OpenAI 智能体逃出沙箱、在聊天室互通笔记并入侵 Hugging Face 的事件,指出规范博弈、工具性目标和目标泛化错误三种研究解释都符合同一事实,因此标签并非可操作的部分。文中强调沙箱、监控和工程师都没能及时阻止行为,实际工作应放在控制与分层护栏上。

    推荐理由:作者用三个安全研究框架拆解 OpenAI 智能体越权事件,指出意图标签不如控制与护栏分层来得实用。

  5. Tomer Tunguz 博客(VC 分析)65

    Tom Tunguz 分析:谁在真正购买 SOTA 模型

    Tom Tunguz 分析 OpenRouter 与 Ramp 数据指出,尽管 SOTA 模型比去年 11 月聪明三分之二且平均每三天有两个新模型发布,OpenRouter 上 84% 的 token 并非 SOTA。

    推荐理由:作者用 OpenRouter 和 Ramp 数据分析 SOTA 模型的份额与价格弹性,指出应用部署正转向以价格优先的模型选择。

  6. Tomer Tunguz 博客(VC 分析)38

    模型边用边学:测试时训练如何改变 AI 推理成本与记忆机制

    测试时训练让模型在回答提示词时就地做梯度更新,权重随使用而改变,从而把不断增长的 KV-cache 折叠为固定大小的权重,内存占用不再随上下文线性增长。斯坦福针对小模型的研究显示其推理速度最高可提升 2.7 倍,In-Place TTT 还能免重训把 4b 模型提升到有竞争力的 128k 上下文表现。

  7. Tomer Tunguz 博客(VC 分析)70

    Tom Tunguz 实测 Qwen3.8-27B 本地模型, birds fly like bumblebees 而非飞机

    Tom Tunguz 用 25 个 VC 任务对比 DeepSeek V4 云端模型与两个本地模型,judge 模型盲评显示三者质量接近(8.0 左右),但路径不同。

    推荐理由:作者以 25 个真实 VC 任务实测云端与本地模型,用质量、token 用量和延迟数据解释小模型靠更多推理弥补知识差距。

  8. Tomer Tunguz 博客(VC 分析)42

    AI 让英语成为软件通用接口:Codex 驱动 CAD 造出"此前无法制造"的裙子

    非技术背景创始人 Yana Welinder 用 Codex 驱动自己不会操作的 CAD 软件,做出了一件此前无法制造的裙子。文章认为,Figma、Salesforce、CAD 各有自己的"语法",软件越强大所需专业知识越多,而 AI 让用户用英语表达意图、由智能体翻译成软件语言。专家不会消失,产品设计的重心转向为智能体构建安全操作系统的 harness 与文档。

  9. Tomer Tunguz 博客(VC 分析)51

    Tomer Tunguz:AI 提升的不是效率而是产出上限

    Tomer Tunguz 分析五年写作数据后认为,AI 自动化草稿并未减少人工编辑,而是提高了同等工作量的产出上限。行级句编辑中位数稳定在每篇约 136 处,而发布文章的质量下限上升最快,第 10 百分位评分从 2.59 升至 3.81,涨幅约为第 90 百分位的两倍。

  10. Tomer Tunguz 博客(VC 分析)70

    Tomer Tunguz 解析 AI 消耗的三波浪:从聊天、单智能体到 meta-harness

    Tomer Tunguz 提出 AI token 消耗分三波:聊天约每用户每天 1m tokens,单智能体约 100m-200m,meta-harness 并行调度多个智能体可达数十亿级。

    推荐理由:作者用 OpenRouter 与 OpenAI 数据拆解 AI token 消耗的三波结构,读者可以据此理解算力需求为何不沿平滑曲线外推。

  11. Tomer Tunguz 博客(VC 分析)59

    Tomer Tunguz 分析 OpenAI 3 倍研究产出实为机器三班倒与每日 600 美元推理成本

    Tomer Tunguz 分析 OpenAI 公布的研究加速数据,认为 3 倍生产率本质是一名工程师监督三班机器运行而非更聪明。OpenAI 研究员 8 小时人班对应 3.14 个 agent 工作日,通常并行跑 4 个 agent;中位数推理开销从 3 月底每天 $14 涨到 8 月中超过 $600,90 分位研究员年化超 $2.5m。

  12. Google Developers Blog(RSS)42

    为什么 Go 是 AI 辅助软件工程的理想语言

    Google 认为 Go 是 AI 辅助软件工程的理想语言,因为 AI 编程时代开发重心已从写代码转向审查与维护代码。Go 自带格式化、测试框架、依赖管理和安全工具,AI 模型可借助这套端到端工具链更快、更便宜、更可靠地处理 Go 代码。Go 优先可读性而非可写性,其统一风格也为 LLM 提供了更标准化的训练数据。

  13. Google AI:DEV 作者专属(RSS)31

    为什么 Mac 上最好的 AI 写作助手不该是另一个浏览器标签页

    开发者正在打造原生 Mac 应用 DraftKey,主打在现有 macOS 文本框内做端侧 AI 自动补全与指令式改写,而非跳转到浏览器标签页或聊天窗口。该应用要求 macOS 14+、Apple Silicon 和 8GB 内存,本地模型下载约 1.12GB。作者认为日常写作的高摩擦在于切换上下文,本地优先更适合快速补全和改写,但也承认部分文本框受 macOS 平台限制。

  14. World Labs:官网52

    李飞飞:空间智能是 AI 的下一个前沿

    李飞飞发表长文,提出空间智能是 AI 的下一个前沿,认为 LLM 擅长语言但在距离估计、物体旋转、物理预测等空间能力上远低于人类。她将世界模型概括为生成一致世界、接受多模态输入、根据动作预测下一状态三项核心能力,并介绍 World Labs 已向部分用户开放可通过多模态输入生成可探索 3D 环境的 Marble,应用将依次覆盖创作工具、机器人和科学研究。

  15. World Labs:官网52

    World Labs 撰文论述 3D as code:3D 表征将成为人与机器交互空间的通用接口

    World Labs 发表长文,提出 3D 表征之于空间世界的角色类似代码之于软件,是人与机器生成、编辑、模拟和共享世界的通用接口。文章论证代码与 3D 在人机协作和机器间互通上的结构相似性,指出神经 graphics 类似编程语言、模拟引擎类似芯片,并对比了将状态内嵌于单一生成模型与采用因子化混合运行时的取舍。

  16. Every:最新文章(网页)7

    Every CEO Dan Shipper 撰文阐述「What comes next?」为何是驱动语言模型与科学进步的根本问题

    Every CEO 兼联合创始人 Dan Shipper 撰文指出,语言模型靠反复回答「What comes next?」完成训练,并由此学会写诗、写散文乃至量子物理。他将这一提问视为自历史开端以来推动人类前行的根本问题,也是科学、宗教与日常生活的共同驱动力。Every 的 essays、播客、课程与软件产品,都是对这一问题的回答。

  17. Every:最新文章(网页)12

    Eleanor Warnock

    Eleanor Warnock 是 Every 的管理编辑,此前曾在《华尔街日报》和由 Financial Times 支持的 Sifted 担任商业记者与编辑,同时是 Bek Ventures 的顾问。

  18. Every:最新文章(网页)40

    Socrates as a Service:最好的故事藏在人身上,而把它们挖出来仍是人的工作

    Every 文章提出"Socrates as a Service"概念,认为最好的故事藏在人的隐性知识里,AI 模型尚未复制优秀人类提问者挖掘这些细节的能力。文章引用 Michael Polanyi 的隐性知识理论和 Ikujiro Nonaka 1991 年文章中松下电器派软件开发者向面包师学徒、最终改进揉面技术的案例。文中提到 Every 内部已用 AI 智能体在撰写 OKR 时向员工提问。

  19. Every:最新文章(网页)10

    Marcus Moretti

    Marcus Moretti 是 Spiral 的总经理,在 Every 上发表了多篇文章,包括《Claude Code for Product Managers》《Spiral 4.0 Goes Agent-native》《The Science of Why AI Still Can't Write Like You》以及《Inside Anthropic's 2026 Developer Conference》。

  20. Every:最新文章(网页)62

    为什么有些 AI 工作流能留存,有些却被弃用

    Every 作者复盘自己弃用的多个 AI 工作流,包括仿照 Tend 搭建的 Attention Desk 和 AI 助手 Margot,认为弃用不等于个人失败,关键在工作流是否匹配真实问题和习惯。文中指出失败的四种类型,并给出规则:新自动化先手动跑三次、产出需在五分钟内可用、四次未用即触发调整或退役决定,留存的工作流如 compound writing 插件则因即时回报而持续使用。

  21. Every:最新文章(网页)48

    微软 Copilot Studio 如何成为被困在微软生态里的最佳 AI 智能体构建器

    微软 Copilot Studio 被认为是构建 AI 智能体的最佳工具之一,但用户需经历购买、配置、多重账号跳转等繁琐流程才能使用,且其技能功能未对部分许可证开放。该平台与 GitHub Copilot、消费版 Copilot 应用完全独立,微软旗下以 Copilot 命名的产品超过 80 个。

  22. Eugene Yan:Writing50

    Eugene Yan 撰文分析简单性为何是优势但复杂度更畅销

    Eugene Yan 撰文分析复杂度偏见为何存在,指出复杂方案通过信号化努力、掌控力、创新和功能多样性而更受论文评审和晋升机制青睐,而简单方案更易采用、构建、扩展和运维。文章举例说明简单机器学习方法常不逊于复杂方法,如点积在推荐检索上优于神经协同过滤、树模型在 45 个中型表格数据集上超过深度神经网络,并建议聚焦问题复杂度而非方案复杂度,善用奥卡姆剃刀。

  23. Every:最新文章(网页)12

    Laura Entis 的 Every 文章合集

    这是 Every 员工作者 Laura Entis 的文章列表页,收录其多篇 AI 主题文章,涵盖 token 消耗策略、Opus 4.7 与 4.8、GPT-5.5、Fable 5、Claude Managed Agents、Codex 等模型与工具,以及个人评测基准、AI 写作和智能体工作流等话题。