跳到正文

#编码

今日 52 条
9月30日周三
  1. Google Developers Blog(RSS)42

    为什么 Go 是 AI 辅助软件工程的理想语言

    Google 认为 Go 是 AI 辅助软件工程的理想语言,因为 AI 编程时代开发重心已从写代码转向审查与维护代码。Go 自带格式化、测试框架、依赖管理和安全工具,AI 模型可借助这套端到端工具链更快、更便宜、更可靠地处理 Go 代码。Go 优先可读性而非可写性,其统一风格也为 LLM 提供了更标准化的训练数据。

  2. Every:最新文章(网页)39

    用 Codex 的成本组建工程团队:AI 如何搭建 Thesis 网站、年入 400 万美元的外星伴侣应用,以及为何 harness engineering 的未来是做得更少

    Every 的 Monologue 开发者 Naveen Naidu 用 Codex 构建了一支定制智能体团队,涵盖各领域工程师、客服和增长策略智能体,负责维护 Monologue 网站与应用。每个智能体都是一个 Codex 项目,配有自定义 AGENTS.md 文件、技能、文件夹、记忆和代码库,使其成为专才。近期客服智能体将一条用户好评转交给网站工程师智能体,后者把推荐语加到了网站上。

  3. Every:最新文章(网页)38

    Claude Code 如何让产品经理独自运营一款完整产品

    Spiral 总经理 Marcus Moretti 用 Claude Code 独自承担代码、客服、营销和产品管理,除路线图外所有 PRD 和工单均由 Claude 撰写,原本分散在 10 个应用中的事务性工作被收进单一对话线程。他通过 compound engineering 的 /ce:strategy 技能生成产品战略文档,并将路线图作为 GitHub 项目 README 管理工单。

  4. Baseten Base Labs:模型研究18

    Nomic Embed Code

    Nomic Embed Code 的示例响应显示,其返回的 embedding 向量为单元素数组,model 字段标注为 thenlper/gte-base,usage 中 prompt_tokens 与 total_tokens 均为 512。

  5. Every:最新文章(网页)47

    如何打磨 AI 智能体构建的软件:复合工程的最后一步

    在复合工程流程中,打磨(Polish)是最后一步:亲自使用应用,把感觉不对的地方告诉 AI 智能体,直到满意为止。作者用 /ce-polish 命令检出分支、后台启动开发服务器并在编辑器中打开应用,通过 Monologue 语音反馈让智能体调整 Cora 邮件卡片的动画与布局密度。这一环节之所以重要,是因为智能体无法判断什么才算“好”,最终的人类判断仍不可替代。

  6. Every:最新文章(网页)12

    Laura Entis 的 Every 文章合集

    这是 Every 员工作者 Laura Entis 的文章列表页,收录其多篇 AI 主题文章,涵盖 token 消耗策略、Opus 4.7 与 4.8、GPT-5.5、Fable 5、Claude Managed Agents、Codex 等模型与工具,以及个人评测基准、AI 写作和智能体工作流等话题。

  7. Every:最新文章(网页)60

    Every 团队实测 Opus 5.5、GPT-6 Sol 与 Grok 4.7

    Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。

  8. Eugene Yan:Writing40

    AI Engineer Summit 2023 参会反思:LLM 系统落地的评测与成本难题

    首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。

  9. HuggingFace Daily Papers(社区热门论文)44

    Marathoner:超长时程自主智能体模型

    研究者提出自主智能体模型 Marathoner,通过后训练流程赋予基座模型超长时程执行能力,在 5 个超长时程任务基准上稳定超越基座模型,甚至超过强闭源模型。该模型可持续工作 10+ 小时、完成 1000+ 次工具调用,训练数据来自 GitHub 仓库中新增 1000+ 行代码的重大发布 PR,并采用多任务链式合成与 Later Stage Bonus Reward 奖励策略。

  10. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    Anthropic 发布 Claude Code 智能体编码最佳实践指南

    Anthropic 发布 Claude Code 智能体编码最佳实践指南,指出上下文窗口是最需要管理的资源,性能会随上下文填满而下降。指南覆盖给 Claude 提供可运行的验证标准、先探索再规划再编码、编写精简 CLAUDE.md、配置权限与 hooks、用子代理隔离调查、用 /clear 和 /rewind 管理会话,以及并行会话、非交互模式和对抗式审查等规模化用法。

    推荐理由:Anthropic 官方系统梳理 Claude Code 使用模式,围绕上下文管理与验证闭环给出可直接套用的实践方法。

  11. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 为 Claude Code 推出沙箱功能并开源沙箱运行时

    Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。

    推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。

  12. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 工程师复盘如何设计抗 AI 的技术评测

    Anthropic 性能优化团队负责人 Tristan Hume 复盘其招聘用 take-home 测试被 Claude 模型逐步击穿的过程:超 1000 名候选人完成过该模拟加速器优化测试,Claude Opus 4 在相同时间内超过多数人类申请者,Claude Opus 4.5 在 2 小时内追平最佳人类成绩。

    推荐理由:作者以一手迭代经验说明模型如何逐步击穿技术面试题,并给出设计抗 AI 评测的具体做法与开源挑战。

  13. arXiv:cs.AI(全量分类)40

    StateTape:面向长程编程智能体的动作条件证据生命周期建模

    针对长程编程智能体上下文随观察不断增长的问题,论文提出 StateTape 框架,将仓库建模为符号级代码图,用 tape 标记每次写入改动的符号,把过时判断从文本推断变为对写入的观察。该方法配合小型 manager 模型处理写入日志无法确定的部分,并给出理论分析与 TraceBench 基准。在六个编程智能体和三个编辑密集型基准上,StateTape 均取得更高解决率且计算开销很小。