#编码
#编码
今日 7 条
Rohan Paul@rohanpaul_aiAI 评分5858
ginobefun@hongming731AI 评分3636BestBlogs 10-01 早报精讲 Gemini 4 Argon,其长程推理已用于代码迁移、内存优化与安全防御,并通过 Fairwind 向受信任的网络防御者逐步开放。
引用ginobefun@hongming731https://x.com/i/article/2105450924286353408
dex@dexhorthyAI 评分3939引用Sureffi@Sureffi"a spec that is sufficiently detailed to generate code with a reliable degree of quality is roughly the same length and detail as the code itself" ^^ 100% don't believe in that. You should care about the code at the level of abstraction @dexhorthy is describing here. But no way in hell you can't compress it way smaller than the code itself would be (40:1 based on my measurements for a 30k LOC codebase). An LLM holds the priors for pretty much every single convention there is. Along with the cultures from Linus Torvalds to corporate Java. Two things - Understanding the model's priors for your choice of language/framework(s). - You holding those same priors. First screenshot is benchmark results from a few days ago. Second is what the 40:1 compression looks like. YMMW with typescript or python slop.
Pragmatic Engineer(RSS)AI 评分5454 Pragmatic Engineer 播客对话 Cockroach Labs CTO Peter Mattis:分布式数据库与 AI 时代的工程实践
Pragmatic Engineer 发布与 Cockroach Labs 联合创始人兼 CTO Peter Mattis 的访谈。Mattis 是 GIMP 原始创作者,曾参与 Gmail 和 Google 分布式存储。
Peter Steinberger 🦞@steipeteAI 评分1818CI 和 GitHub 之间正激烈争夺谁更拖我后腿。是时候重新思考我们的工作方式了。(不过我还是爱 GitHub 的,也完全理解他们的难处!)
jason@jxnlcoAI 评分99
lauren@potetoAI 评分2424引用Matt Pocock@mattpocockukSuper excited to be interviewing @poteto, live, in ~48 hours on YouTube. We'll be nerding out about skills, high-velocity software factories, and learning SOTA techniques for shipping with agents. This Friday - 9AM PT. Don't miss it! https://youtube.com/live/MN9dGgmLyso
METR:Notes(网页)AI 评分1717 METR:面向更安全评估的基础逐动作监控器实现与评估
METR 研究人员 Reilly Haskins、Rif A. Saurous、Nate Rush、Neev Parikh 和 Beth Barnes 梳理了逐动作阻断式监控器生效所需成立的前提、每项前提的证据以及仍存在的缺口。该工作聚焦更安全评估场景下的监控器实现与评估。
METR:Notes(网页)AI 评分6262 METR 分析:基于 Anthropic 代码产出 8 倍增长推算研究员提效可能超过 2 倍
METR 研究员 Thomas Kwa 分析称,Anthropic 报告 2026 年 Q2 贡献者日均合并代码量为 2021-2024 期的 8 倍,在标准经济建模假设下,仅编码智能体带来的研究员提效就大于 2 倍,中心估计约 2.5 倍。
Epoch AI:研究、数据与评测AI 评分2525 Epoch AI 研究:GPT-6 Astra 数学基准领先,软件工程仍落后 Claude Fable 5.1
OpenAI 的 GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,领先 Claude Fable 5.1 的 164 分和 GPT-5.6 Sol 的 162 分,其 Math-ECI 达 170 创下新纪录。但在软件工程基准上,GPT-6 Astra 的 SWE-ECI 为 164,仍落后于 Fable 5.1 的 167。
Cognition 模型 / Devin 博客(网页)精选AI 评分6767 Cognition 发布 Devin 2025 年度绩效复盘:上线 18 个月的真实部署经验
Cognition 在 Devin 上线 18 个月之际发布年度绩效复盘,称其已进入数千家公司的工程团队,累计合并数十万个 PR。
推荐理由:Cognition 以自家客户数据和指标复盘 Devin 的强弱项,为评估智能体实际部署效果提供了可参照的框架。
Augment Code 博客(网页)AI 评分4444 Augment Code:AI 原生转型的四个阶段,从智能体采纳到智能体编排
Augment Code 提出 AI 原生转型分四个阶段:约 70% 组织仍停留在第一阶段(将智能体接入日常工作流),不到 10% 让智能体自主拥有工作,几乎无人达到第四阶段全智能体编排。在软件开发生命周期六个环节中,代码生成、验证、构建失败诊断三个环节已由智能体主导,代码审查中低风险改动可自动批准。某企业客户开发者每周因代码审查阻塞的时间占比从 30% 降至 10% 以下。
Augment Code 博客(网页)AI 评分4646 Augment Code:单模型工程时代已经结束
Augment Code 本月在 Claude 和 GPT-5 之外新增 Gemini 3.1 Pro,成为其第三个可选模型,并称单模型工程时代已经结束。过去十三个月里领先模型三次易主,GPT-5.4 的每条消息价格比此前所用模型便宜约 2.6 倍。其做法是把模型、harness(Context Engine)与编排层(Intent)解耦,切换模型只需改一个设置而非迁移。
Augment Code 博客(网页)AI 评分5656 DX CTO Justin Reock 谈 AI 转型是系统性问题
DX CTO Justin Reock 在 We Built What 节目中称 AI 转型的关键在系统而非个人:DX 对 500 家公司的纵向研究显示 PR velocity 中位提升 7.5%、均值 13%、最高 70%。
Augment Code 博客(网页)AI 评分4545 Augment Code 调研 219 位工程负责人:48% 代码已由 AI 生成,仅 19 家更新了岗位定义
Augment Code 调研 219 位工程负责人发现,其团队 48% 的代码已由 AI 生成,55% 担心团队失去对代码库的共同理解,63% 表示工程师向管理者提出技能相关性担忧,在 201-1000 人团队中该比例升至 89%。
Tomer Tunguz 博客(VC 分析)精选AI 评分6161 Tom Tunguz 分析 HN 讨论:Qwen 3.6 35B-A3B 与 Pi 领跑本地编码栈
一位 VC 博主归纳一个 500+ 评论的 HN 讨论指出,本地编码栈正快速成熟:Qwen 3.6 35B-A3B 以 33% 的提及率主导模型选择,Pi 以 49% 领先 Agent 提名。
推荐理由:作者基于 HN 讨论归纳本地编码模型与 Agent 的当前格局,并给出与云端模型的对比视角。
Tomer Tunguz 博客(VC 分析)精选AI 评分6060 Tomasz Tunguz:AI 模型的用户留存介于社交网络与手游之间
Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。
推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。
Tomer Tunguz 博客(VC 分析)精选AI 评分6363 Tomer Tunguz 分析 AI 工程效率三档分布:均值 20-46%、前沿 3x、工厂级 8x+
Tomer Tunguz 提出 AI 工程效率呈三档分布:仅分发 AI IDE 的均值约 20-46%,构建智能体运营层的公司达 2.5-3x,智能体作为组织单元的软件工厂达 8x+。
推荐理由:作者汇总多项公开数据,把 AI 工程效率分成三档,指出差距不在模型而在围绕智能体的运营纪律,可作行业对照参考。
Tomer Tunguz 博客(VC 分析)精选AI 评分6666 Tomasz Tunguz:Agent harness 对编码成绩与成本的影响超过模型本身
Tomasz Tunguz 撰文称 harness 对编码基准和成本的影响大于模型。Endor Labs Agent Security League 测试显示。
推荐理由:文章用同一模型在不同 harness 下的分数差和缓存成本数据,说明运行时框架对编码表现和账单的影响可能超过模型本身。
Tomer Tunguz 博客(VC 分析)AI 评分4141 AI 是糟糕的枪手,却是出色的编辑
投资人 Tomer Tunguz 认为 AI 是糟糕的枪手但出色的编辑:AI 的声音不属于作者,且所有人共用同一个枪手,用多了文章会失去音乐性。他如今用 AI 当编辑,帮自己打磨导语与核心段,其对冷门统计分析的记忆近乎无懈可击。为应对读者对 AI 写作的质疑,他刻意在文中加入 & 符号、自造词和语法花饰等个人印记。
Tomer Tunguz 博客(VC 分析)AI 评分3838 模型边用边学:测试时训练如何改变 AI 推理成本与记忆机制
测试时训练让模型在回答提示词时就地做梯度更新,权重随使用而改变,从而把不断增长的 KV-cache 折叠为固定大小的权重,内存占用不再随上下文线性增长。斯坦福针对小模型的研究显示其推理速度最高可提升 2.7 倍,In-Place TTT 还能免重训把 4b 模型提升到有竞争力的 128k 上下文表现。
Tomer Tunguz 博客(VC 分析)AI 评分5151 Tomer Tunguz:AI 提升的不是效率而是产出上限
Tomer Tunguz 分析五年写作数据后认为,AI 自动化草稿并未减少人工编辑,而是提高了同等工作量的产出上限。行级句编辑中位数稳定在每篇约 136 处,而发布文章的质量下限上升最快,第 10 百分位评分从 2.59 升至 3.81,涨幅约为第 90 百分位的两倍。
Google Developers Blog(RSS)AI 评分4242 为什么 Go 是 AI 辅助软件工程的理想语言
Google 认为 Go 是 AI 辅助软件工程的理想语言,因为 AI 编程时代开发重心已从写代码转向审查与维护代码。Go 自带格式化、测试框架、依赖管理和安全工具,AI 模型可借助这套端到端工具链更快、更便宜、更可靠地处理 Go 代码。Go 优先可读性而非可写性,其统一风格也为 LLM 提供了更标准化的训练数据。
Every:最新文章(网页)AI 评分4848 五位专业作家谈如何使用 AI:有人靠它理清思路,有人坚持自己动笔
Every 采访了五位专业作家,包括 Every CEO Dan Shipper、设计师 Maggie Appleton 和《纽约时报》前记者 Kevin Roose,讲述他们在写作中让 AI 介入的环节与坚持自己完成的部分。
Every:最新文章(网页)AI 评分2323 Every 发布《写作新规则》专题:探讨写作者与模型如何共同创造意义
Every 上线《写作新规则》专题,探讨写作者与 AI 模型如何共同创造意义。专题收录多篇文章,包括 Mike Taylor 的写作工作流、五位职业写作者使用 AI 的访谈,以及针对 Claude Sonnet 4.5 写作与编辑能力的五项测试。
Every:最新文章(网页)AI 评分1212 Laura Entis 的 Every 文章合集
这是 Every 员工作者 Laura Entis 的文章列表页,收录其多篇 AI 主题文章,涵盖 token 消耗策略、Opus 4.7 与 4.8、GPT-5.5、Fable 5、Claude Managed Agents、Codex 等模型与工具,以及个人评测基准、AI 写作和智能体工作流等话题。
Every:最新文章(网页)AI 评分1010 Every 文章列表:Claude Agent、GPT-5、Codex 与 Claude Code 等主题汇总
Every 网站文章列表页汇总了多篇 AI 主题文章,涵盖 Claude 的 Agent 能力、Claude Skills 入门、GPT-5 发布后的走向、OpenAI Codex 成为 Claude Code 竞品、Super Sonnet 4、Claude Code 占据领先位置,以及 OpenAI Atlas、MCP 等话题。
Every:最新文章(网页)AI 评分6060 Every 团队实测 Opus 5.5、GPT-6 Sol 与 Grok 4.7
Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。
Eugene Yan:WritingAI 评分4040 AI Engineer Summit 2023 参会反思:LLM 系统落地的评测与成本难题
首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。
Berkeley RDI:Blog(AI 安全与评测)AI 评分5454 Berkeley RDI等机构提出软件开发自主性三级框架,展望编码不再是瓶颈后的软件工程
UC Berkeley、MIT、Microsoft、Cursor等机构的研究者发布立场论文《Towards Autonomous Software Development》,提出软件开发自主性三级框架:Level I代码自主、Level II流水线自主、Level III需求自主。
Fireworks AI(网页)AI 评分5959 Fireworks AI 分析:前沿不是单个模型,而是路由器
Fireworks AI 基于 DeepSWE v1.1 的 113 个任务分析称,按任务选模型的 oracle 路由在 18 个模型上可达 97.6% 通过率、每任务 $1.88,比最佳单模型 GPT-6 Astra(74.1%、$6.52)高 23 分且成本不到三分之一;仅用开源权重模型也能达 90.3%、$1.45。
Trail of Bits:AI安全研究精选AI 评分7070 Trail of Bits 批评 1Password 的 AI 补丁基准有误导性,并发布两个补丁验证 Agent 技能
Trail of Bits 发文批评 1Password 2026 年 8 月 6 日报告的 26% 干净修复率有误导性,指出其样本被挑选为复杂修复、22% 数据使用故意指示错误修复的提示词、36% 试验禁止编译测试,并披露评分规则与人工审查的分歧。
推荐理由:作者用自有的 Patch the Planet 合并率和开发者首次修复失败率作对照,说明该基准在样本、指令和评分上的问题。
Tomer Tunguz 博客(VC 分析)精选AI 评分6565 Tom Tunguz 解析 UC Berkeley 研究:harness 决定 AI 答案的成本与毛利
Tom Tunguz 引用 UC Berkeley HarnessTax 研究指出,控制 AI agent 的 harness 决定同一答案的价格:GPT-5.6 Sol 在 Pi 上比在 Claude Code 上每完成一个任务成本低 71%($0.441 对 $1.540),42 组同模型 harness 对比中质量差异均无统计显著性。
推荐理由:作者基于 UC Berkeley 研究数据解释 harness 如何决定同一模型的成本与毛利,比较框架可迁移到 AI 应用商业判断。
Tomer Tunguz 博客(VC 分析)精选AI 评分6262 Tomer Tunguz:专用判定模型让 if-then 分类成本降两个数量级且准确率翻倍
Tomer Tunguz 撰文提出 AI 正在优化 if-then 判定这一编程原语:Jev(TypeSafe)和 SemIf(MIT 协议开源,配合 Jared Palmer 的 kev)只运行一次注意力计算即从少量输出 token 判定结果,成本比传统 AI 低约 99%。
推荐理由:作者以自己 agent 的实测数据展示专用小型判定模型可同时大幅降本并提升分类准确率,方法有可迁移性。
Tomer Tunguz 博客(VC 分析)精选AI 评分6464 Tomer Tunguz:AI 时代软件工程转向系统设计与验证循环
Theory Ventures 合伙人 Tomer Tunguz 撰文认为 AI 已把软件工程的重心从手写代码转向系统设计,核心是构建让 AI 验证自身输出的循环。
推荐理由:作者结合 Artemis 与 Lauren Tan 的案例,把 AI 时代的软件工程归纳为基于 Meadows 三性质的验证循环设计,视角有可借鉴的分析框架。
Google AI:DEV 作者专属(RSS)AI 评分4848 AI 完成了工单,功能为什么还是错的?
AI 智能体快速交付的 PR 往往只是忠实实现了工单里最自然的解读,而非团队真正达成一致的产品决策。文章以用户中断 onboarding 后是否恢复旧流程为例指出,验收标准只能验证已决定实现的内容,无法回答规则变更后用户该走哪条路径。作者建议在流程中引入可阻塞的决策记录,明确未决问题的负责人,避免代码看起来像已完成的功能。
Google AI:DEV 作者专属(RSS)AI 评分4242 代码智能体为何会判定“测试写错了,重写”:AI 生成测试的可验证性分析
代码智能体在生成测试后常出现“The test was wrong. Rewriting.”的判定,作者在一次构建中遇到七次。生成代码、生成测试、验证测试与代码、运行测试、评估测试目的这五个环节中,只有运行测试是确定性的,其余环节对用户不可见且不可复现,因此智能体的判断只是猜测而非证明。作者认为出路是把任务拆得更小,让日志可读,可审查性正成为一项交付能力。
Rohan Paul@rohanpaul_aiAI 评分4949
Replit ⠕@ReplitAI 评分3434
Sherwin Wu@sherwinwuAI 评分5656引用OpenAI Developers@OpenAIDevsUltrafast is our fastest way to build with Astra yet: in Codex, it runs up to 8x faster than Astra Standard and 4x faster than Astra Fast. Bring your ideas to life as fast as you can type them.