Anthropic 发布 Claude Security 公测,用 Claude Mythos 5.1 扫描代码漏洞
Anthropic 推出 Claude Security,面向 Claude Enterprise 开放公测,用 Claude Mythos 5.1 扫描代码库,对发现结果做对抗性验证并给出建议补丁,所有补丁需人工审核批准。
Anthropic 推出 Claude Security,面向 Claude Enterprise 开放公测,用 Claude Mythos 5.1 扫描代码库,对发现结果做对抗性验证并给出建议补丁,所有补丁需人工审核批准。
Google 认为 Go 是 AI 辅助软件工程的理想语言,因为 AI 编程时代开发重心已从写代码转向审查与维护代码。Go 自带格式化、测试框架、依赖管理和安全工具,AI 模型可借助这套端到端工具链更快、更便宜、更可靠地处理 Go 代码。Go 优先可读性而非可写性,其统一风格也为 LLM 提供了更标准化的训练数据。
针对 AI 编程智能体,端到端基准(如 Terminal-Bench、DeepSWE)只能给出综合分数,无法解释涨跌原因,行为评估则断言具体可观测动作,如提示词不明确时是否反问、改构建文件前是否跑本地校验。
作者发布开源 Rust 工具库 TeaQL Tool,将 52 个常用工具封装在统一的 T::xxx() 门面之后,覆盖 ID、时间、JSON、哈希、HTTP 等操作,底层复用 uuid、chrono、serde_、reqwest 等成熟 crate。
作者发布开源包 @teaql/ai-sdk,把显式声明的业务能力白名单转换成原生 Vercel AI SDK 工具,替代让模型直接生成 SQL 的通用做法。
Every 公布订阅定价:月付 $30,年付 $288(合 $24/月),All Access 年付 $625,含 OpenAI、Anthropic、Cursor、Notion、Google 等提供的 $9,000+ 额度与折扣。
Every 的 Monologue 开发者 Naveen Naidu 用 Codex 构建了一支定制智能体团队,涵盖各领域工程师、客服和增长策略智能体,负责维护 Monologue 网站与应用。每个智能体都是一个 Codex 项目,配有自定义 AGENTS.md 文件、技能、文件夹、记忆和代码库,使其成为专才。近期客服智能体将一条用户好评转交给网站工程师智能体,后者把推荐语加到了网站上。
Every 员工 Katie Parrott 用两年时间教 AI 模仿自己的写作方式,并将这套方法发展为 Compound Writing——一套把 AI 当作写作伙伴的系统,还做成了开源插件,教其他写作者按她的方式思考、起草和编辑。她最初是在 2023 年被裁员后,靠每月 20 美元的 ChatGPT 订阅起步。
Z.AI 发布 GLM-5.3,定位智能体工程,与 GLM-5.2 使用相同的 744B-A40B MoE 底座,全部能力提升来自在更多样真实任务环境(完整代码库、文档、测试工具、多步工作流)上的规模化后训练。
Every 采访了五位专业作家,包括 Every CEO Dan Shipper、设计师 Maggie Appleton 和《纽约时报》前记者 Kevin Roose,讲述他们在写作中让 AI 介入的环节与坚持自己完成的部分。
Every 上线《写作新规则》专题,探讨写作者与 AI 模型如何共同创造意义。专题收录多篇文章,包括 Mike Taylor 的写作工作流、五位职业写作者使用 AI 的访谈,以及针对 Claude Sonnet 4.5 写作与编辑能力的五项测试。
Baseten 上线 DeepSeek V4 Pro 0813,一个 1.7T 参数的前沿开放权重模型。它可与较小的 V4 Flash 0731 搭配用于 coding agent,由 Pro 驱动主 agent、Flash 运行子 agent,使整个编码栈跑在开放权重模型上。
Spiral 总经理 Marcus Moretti 用 Claude Code 独自承担代码、客服、营销和产品管理,除路线图外所有 PRD 和工单均由 Claude 撰写,原本分散在 10 个应用中的事务性工作被收进单一对话线程。他通过 compound engineering 的 /ce:strategy 技能生成产品战略文档,并将路线图作为 GitHub 项目 README 管理工单。
Nomic Embed Code 的示例响应显示,其返回的 embedding 向量为单元素数组,model 字段标注为 thenlper/gte-base,usage 中 prompt_tokens 与 total_tokens 均为 512。
Every 的 Cora 负责人 Kieran Klaassen 把 compound engineering 循环从 Brainstorm→work→review→compound 扩展为 Ideate→brainstorm→plan→work→review→polish→compound→repeat 八步。
在复合工程流程中,打磨(Polish)是最后一步:亲自使用应用,把感觉不对的地方告诉 AI 智能体,直到满意为止。作者用 /ce-polish 命令检出分支、后台启动开发服务器并在编辑器中打开应用,通过 Monologue 语音反馈让智能体调整 Cora 邮件卡片的动画与布局密度。这一环节之所以重要,是因为智能体无法判断什么才算“好”,最终的人类判断仍不可替代。
Every 发布一篇 Codex 知识工作进阶指南,讲解如何把 Codex 用于邮件、写作、研究、规划和报告。文章面向非工程师,涵盖设置、工作流和使用原则。
Eugene Yan 通过阅读 requests、scikit-learn、pytorch、fastai 等广泛使用的 Python 库,总结了一些不常见的 Python 用法。
Every 发布 Compound Engineering 技能包(当前版本 v3.30.1),通过 brainstorm、plan、work、simplify、review、compound 六步循环让编码智能体把学到的经验写入 docs/solutions/,供后续任务复用。
这是 Every 员工作者 Laura Entis 的文章列表页,收录其多篇 AI 主题文章,涵盖 token 消耗策略、Opus 4.7 与 4.8、GPT-5.5、Fable 5、Claude Managed Agents、Codex 等模型与工具,以及个人评测基准、AI 写作和智能体工作流等话题。
Every 网站文章列表页汇总了多篇 AI 主题文章,涵盖 Claude 的 Agent 能力、Claude Skills 入门、GPT-5 发布后的走向、OpenAI Codex 成为 Claude Code 竞品、Super Sonnet 4、Claude Code 占据领先位置,以及 OpenAI Atlas、MCP 等话题。
Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。
Eugene Yan 发布 Obsidian-Copilot 原型,给定章节标题时通过 RAG 起草段落,并能对每日日记做一周复盘与下周规划,代码开源于 GitHub。
首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。
Eugene Yan 发表长文,系统讲解如何生成和使用合成数据进行预训练、指令微调与偏好微调。文章将方法分为从更强模型蒸馏(如 Unnatural Instructions。
Eugene Yan 撰文总结任务特定的 LLM 评测方法,指出通用评测常与实际应用表现相关性弱。文章给出分类用 recall、precision、ROC-AUC。
作者用 FastAPI、FastHTML、Next.js 和 SvelteKit 分别构建了同一个名为 "Look at Your Data" 的 CSV 增删改查应用,以比较各框架的开发体验。
Eugene Yan 发布 AI Reading Club(AiReadingClub.com)的构建复盘,核心是 AI 阅读伴侣 Dewey,支持理解所选上下文、答疑、生成测验、回顾全书进度、书内查找和回看历史讨论。
研究者提出自主智能体模型 Marathoner,通过后训练流程赋予基座模型超长时程执行能力,在 5 个超长时程任务基准上稳定超越基座模型,甚至超过强闭源模型。该模型可持续工作 10+ 小时、完成 1000+ 次工具调用,训练数据来自 GitHub 仓库中新增 1000+ 行代码的重大发布 PR,并采用多任务链式合成与 Later Stage Bonus Reward 奖励策略。
ROSS 通过选择性监督从自生成 rollout 中再学习,保留完整历史轨迹作为上下文,仅对选定的模型生成续写施加损失。在 Qwen3.6-35B-A3B 上,ROSS 将六基准 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。
Cloudflare 介绍内部 AI 工具 CryptoLabe,用于发现代码库中的密码学使用并规划后量子(PQ)迁移,目标 2029 年实现全面 PQ 就绪。
LEGO-Anything 是一个 Image-to-Code 框架,让编码智能体迭代编写并执行 Blender 代码、检查场景与渲染结果并修订程序,把单图重建的 3D 场景表示为可检查、可编辑、可查询的场景程序。
Anthropic 的升级版 Claude 3.5 Sonnet 在 SWE-bench Verified 上取得 49%,超过此前 SOTA 的 45%,模型本身未变而成绩来自围绕模型的 agent 脚手架。
Anthropic 发布 Claude Code 智能体编码最佳实践指南,指出上下文窗口是最需要管理的资源,性能会随上下文填满而下降。指南覆盖给 Claude 提供可运行的验证标准、先探索再规划再编码、编写精简 CLAUDE.md、配置权限与 hooks、用子代理隔离调查、用 /clear 和 /rewind 管理会话,以及并行会话、非交互模式和对抗式审查等规模化用法。
推荐理由:Anthropic 官方系统梳理 Claude Code 使用模式,围绕上下文管理与验证闭环给出可直接套用的实践方法。
Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。
推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。
Anthropic 工程博客介绍如何让 Claude Agent SDK 上的 Agent 在多个上下文窗口间持续取得进展。
Anthropic 性能优化团队负责人 Tristan Hume 复盘其招聘用 take-home 测试被 Claude 模型逐步击穿的过程:超 1000 名候选人完成过该模拟加速器优化测试,Claude Opus 4 在相同时间内超过多数人类申请者,Claude Opus 4.5 在 2 小时内追平最佳人类成绩。
推荐理由:作者以一手迭代经验说明模型如何逐步击穿技术面试题,并给出设计抗 AI 评测的具体做法与开源挑战。
微软提出 AI SW Factory,覆盖 Targeting、Coding、Reviewing、Ops 全软件开发生命周期,通过微调模型权重和更新 World Model 实现自我改进。在微软数十个代码仓库的规模化部署中,工程效率达到智能体编码的 3 倍,token 效率最高提升 22 倍。
针对长程编程智能体上下文随观察不断增长的问题,论文提出 StateTape 框架,将仓库建模为符号级代码图,用 tape 标记每次写入改动的符号,把过时判断从文本推断变为对写入的观察。该方法配合小型 manager 模型处理写入日志无法确定的部分,并给出理论分析与 TraceBench 基准。在六个编程智能体和三个编辑密集型基准上,StateTape 均取得更高解决率且计算开销很小。
ROSS 通过保留完整历史轨迹作为上下文、仅对选定的模型生成续写施加损失,让自生成 rollout 中的可复用行为经验通过离线 SFT 继续产生收益,无需额外策略 rollout。