Every 文章列表:Claude Agent、GPT-5、Codex 与 Claude Code 等主题汇总
Every 网站文章列表页汇总了多篇 AI 主题文章,涵盖 Claude 的 Agent 能力、Claude Skills 入门、GPT-5 发布后的走向、OpenAI Codex 成为 Claude Code 竞品、Super Sonnet 4、Claude Code 占据领先位置,以及 OpenAI Atlas、MCP 等话题。
Every 网站文章列表页汇总了多篇 AI 主题文章,涵盖 Claude 的 Agent 能力、Claude Skills 入门、GPT-5 发布后的走向、OpenAI Codex 成为 Claude Code 竞品、Super Sonnet 4、Claude Code 占据领先位置,以及 OpenAI Atlas、MCP 等话题。
Eugene Yan 提出以点击为主、对话为辅的 LLM 交互方式,并搭建了一个图书推荐原型:先点击感兴趣的书、按“氛围”关键词筛选,再向 LLM 图书管理员提问。系统用近似最近邻在物品嵌入向量上召回相似书,经 LTR 模型或启发式排序,氛围关键词为预缓存而非 LLM 动态抽取;后端用 FastAPI、Jinja 与流式 API 降低等待。
Eugene Yan 发布 2023 年度回顾,全年写下 20 篇文章、做了 5 个原型和 2 场演讲,其中 LLM 实验与 LLM patterns 两篇获得超 2 万阅读。他借助 GPT-4 辅助职业反思,并因内部原型 Dewey 表现良好而将工作重心转向 GenAI 计划,同时与朋友创办了 LM 论文俱乐部。
Eugene Yan 撰文总结任务特定的 LLM 评测方法,指出通用评测常与实际应用表现相关性弱。文章给出分类用 recall、precision、ROC-AUC。
Eugene Yan 用 Vapi 语音 API 搭配 claude-3-sonnet 搭建了一个可通话的 AI 教练 Tara,用于散步时倾诉焦虑、梳理情绪和演练困难对话。
Eugene Yan 发布 AI Reading Club(AiReadingClub.com)的构建复盘,核心是 AI 阅读伴侣 Dewey,支持理解所选上下文、答疑、生成测验、回顾全书进度、书内查找和回看历史讨论。
Eugene Yan 发布 news-agents 项目,基于 Amazon Q CLI 和 MCP 生成每日新闻摘要。主智能体将 Hacker News、WSJ、TechCrunch、AI News、Wired 六个 RSS 源分成三组,在独立 tmux 窗格中生成三个子智能体并行处理并分类汇总,最终合并为 main-summary.md。
NVIDIA 在 8 月举办本地 AI 博客专题,联合 Perplexity、MiniMax、DeepSeek、Poolside AI 等伙伴推进可在本地运行的开源模型与智能体。
研究者提出自主智能体模型 Marathoner,通过后训练流程赋予基座模型超长时程执行能力,在 5 个超长时程任务基准上稳定超越基座模型,甚至超过强闭源模型。该模型可持续工作 10+ 小时、完成 1000+ 次工具调用,训练数据来自 GitHub 仓库中新增 1000+ 行代码的重大发布 PR,并采用多任务链式合成与 Later Stage Bonus Reward 奖励策略。
HybridCUA 提出让计算机使用智能体(CUA)同时编排 GUI 与 CLI 的混合范式,并构建了含 5K 混合轨迹与 3K 可验证 RLVR 任务的 HybridCUA-8K 数据集。
研究提出智能体主动性的内容维度:水平主动性追求当前上下文已隐含但用户未明说的信息,垂直主动性追求只有早期证据才能揭示的需求。基于基准自身分解构建的“需求图”可在无模型评判的情况下对两种主动性及停止时机打分。所提 Q&D 方法在三个多跳问答基准的留出集上,同等检索开销下两种主动性均优于同模型提示版本,并在其中两个基准上超过参数量大 15 倍的提示模型。
APM-Bench 将真实流式交互重构为多会话生活轨迹,包含 549 个会话、104 条轨迹和 2,719 个候选问题,覆盖客观题与开放题。评测显示现有方法难以同时兼顾可靠的长期召回、低开销与有效的主动协助,存在明显的效用—延迟—存储权衡。该基准还测试模型能否识别证据不足的情况。
研究团队提出 VoxPolyMem,一个面向多方语音对话的交互感知多模态记忆框架,结合增量说话人识别与交互记忆、事实记忆、参与者画像三层记忆结构,并将检索建模为智能体顺序决策。
Cloudflare 发布全新 CLI 工具 cf(开放 beta,npm i -g cf),将命令覆盖从 Wrangler 的约 280 个操作扩展到超过 3000 个 API 操作,基于 Forge 从 OpenAPI schema 生成。
美团 LongCat 团队发布 LongCat-DeepResearch 深度研究系统,将增强版 LongCat 模型与多智能体工作流结合,通过规划与调查分离、分节并行撰写与全局审阅来生成有证据支撑的报告。
Cloudflare 发布 Threat Signals,面向所有账户免费开放,用智能体技能把用户选择的开源安全报告自动摘要、打标签、提取和规范化 IOC,并以 Threat Event 形式存入账户私有威胁情报数据集,可直接用于 WAF 策略。
Cloudflare 提出覆盖发现风险、治理访问、运行时防护、调查响应四阶段的自适应应用安全框架,把代码、流量与威胁情报连成持续系统。新能力包括用 LLM 对自家 WAF 做渗透测试、向所有客户开放威胁情报,以及自动部署正向安全的新功能。其依据是 7 月 AI 智能体在不到 13 小时内从 Hugging Face worker 拿到多个集群管理员权限的事件。
研究者提出异步 LLM 框架,让用户或智能体自身定义具有重叠内存状态的推理协程,从而把 LLM 从"读取—思考—回复"的串行循环推广为可适应多种并发类型的通用异步智能体。实验显示 Qwen 3.x 模型无需任务特定训练,即可完成流式视频理解、电子游戏和监控等异步任务。
Cloudflare 介绍内部 AI 工具 CryptoLabe,用于发现代码库中的密码学使用并规划后量子(PQ)迁移,目标 2029 年实现全面 PQ 就绪。
研究者发布 EngiWorld 基准,围绕完整设计闭环构建 1301 个专家任务,覆盖 CAD、CAE、CAM、BIM、EDA 和 3D 可视化 6 个工程领域、26 个专业软件平台,并提供 GUI 与 CLI 接口。
Cloudflare 发布面向 Agent 沙箱优化的 Containers 更新,推出 durable_object 调度策略,支持运行时选择镜像和实例类型,并公测文件系统快照。
针对 LLM 智能体在扁平语料中反复重新发现文档关系、遗漏互补证据且消耗大量 token 的问题,研究者提出 CorpusMap——围绕文档中反复出现的实体构建导航层,将每个实体表示为 Entity Page 并链接所有提及它的文档,形成可遍历的实体-文档图。
LEGO-Anything 是一个 Image-to-Code 框架,让编码智能体迭代编写并执行 Blender 代码、检查场景与渲染结果并修订程序,把单图重建的 3D 场景表示为可检查、可编辑、可查询的场景程序。
Anthropic 基于与数十个团队合作的经验发布构建高效 Agent 的工程指南,主张用简单、可组合的模式而非复杂框架,并区分了工作流与 Agent 两类系统。文章给出增强 LLM 这一基础构件,以及提示链、路由、并行化、编排者-工作者、评估者-优化者五种工作流模式,并建议仅在简单方案失效时增加复杂度;附录还讲解了工具提示词工程与 Agent-计算机接口(ACI)设计实践。
推荐理由:Anthropic 基于大量客户实践总结了构建智能体的可组合模式与工具设计方法,开发者可直接对照自己的场景选用。
Anthropic 的升级版 Claude 3.5 Sonnet 在 SWE-bench Verified 上取得 49%,超过此前 SOTA 的 45%,模型本身未变而成绩来自围绕模型的 agent 脚手架。
Anthropic 发布工程指南,介绍给 Claude 增加 "think" 工具的方法,让模型在长链工具调用和策略密集场景中停下来做结构化思考。在 τ-bench 航空域,think 工具加优化提示词的 pass^1 达 0.570,比基线 0.370 相对提升 54%;零售域仅加工具即达 0.812(基线 0.783)。
Anthropic 发布 Claude Code 智能体编码最佳实践指南,指出上下文窗口是最需要管理的资源,性能会随上下文填满而下降。指南覆盖给 Claude 提供可运行的验证标准、先探索再规划再编码、编写精简 CLAUDE.md、配置权限与 hooks、用子代理隔离调查、用 /clear 和 /rewind 管理会话,以及并行会话、非交互模式和对抗式审查等规模化用法。
推荐理由:Anthropic 官方系统梳理 Claude Code 使用模式,围绕上下文管理与验证闭环给出可直接套用的实践方法。
论文提出 Omni-IO Skills,一个即插即用的 Agent Harness,通过分层 Skills、标准化多模态执行接口、依赖感知编排和持久化 Asset Registry,让现有 Agent 无需改动推理核心即可原生处理多模态任务。
Anthropic 工程团队发布长文,复盘 Claude Research 多智能体研究系统从原型到生产的构建过程。系统采用 orchestrator-worker 架构,内部评估中 Claude Opus 4 主导加 Claude Sonnet 4 子代理的组合比单代理 Claude Opus 4 高出 90.2%,但多智能体消耗约 15 倍于普通对话的 token。
Anthropic 发布工程文章,讲解如何为 MCP 和 LLM 智能体编写高效工具,包括构建原型、运行评测、用 Claude Code 自动分析转录并改进工具的流程。
Anthropic 应用 AI 团队发文阐述上下文工程,定义为在 LLM 推理过程中筛选和维护最优 token 集合的策略,将其视为提示工程的自然演进。文章指出所有模型都存在 context rot 现象,上下文应被当作边际收益递减的有限资源。
推荐理由:Anthropic 提出上下文工程是提示工程的演进,并给出压缩、结构化笔记、子智能体三种应对长任务的具体方法,可直接迁移到智能体开发。
Anthropic 发布 Agent Skills 工程解析,说明 Skills 是包含 SKILL.md 的目录,通过渐进式披露分三级加载指令、脚本和资源,可附 Python 脚本作为可执行工具。Skills 已支持 Claude.ai、Claude Code、Claude Agent SDK 和开发者平台,文末给出编写、评估与安全审计建议,并提示恶意 Skills 可能引入漏洞或数据外泄风险。
Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。
推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。
Anthropic 发布工程文章,提出让 Agent 通过代码执行方式与 MCP 服务器交互,以解决工具定义和中间结果占用过多上下文的问题。示例场景中 token 消耗从 150,000 降至 2,000,节省 98.7%。文章还介绍了渐进式工具发现、在执行环境中过滤数据、PII 令牌化保护隐私、状态持久化与可复用 Skills 等收益,并提示需要沙箱、资源限制等安全基础设施作为权衡。
Anthropic 在 Claude 开发者平台发布三项 beta 功能:Tool Search Tool 按需发现工具、Programmatic Tool Calling 用代码编排工具调用、Tool Use Examples 在工具定义中提供示例。
推荐理由:官方给出了三项工具调用新功能的机制说明和内部测试数字,读者可以据此评估大工具库场景下的上下文与准确性权衡。
Anthropic 工程博客介绍如何让 Claude Agent SDK 上的 Agent 在多个上下文窗口间持续取得进展。
Anthropic 工程博客发布长文,系统讲解如何为 AI Agent 构建可靠的自动化评测。文章定义了任务、试验、grader、transcript、评测框架等核心概念,对比代码型、模型型和人工三类评测器的优劣,分别给出编码、对话、研究和计算机使用四类 Agent 的评测方法,并解释 pass@k 与 pass^k 两种指标在非确定性下的差异。
SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统仅凭过往任务积累的运行经验持续适配未来未见任务。它通过 S-Harness 将近期运行经验快速外化为可更新的显式安全知识,并用 GuardVPO 在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强基线,不安全结果率降低 10.05%,任务成功率提升 12.15%。
研究者提出自适应长上下文提示词注入 AdaLCPI,将攻击目标拆成不完整碎片嵌入智能体工具检索到的外部内容,并用重建线索诱导智能体自行拼接,再借助 OpenEvolve 结合分级评分与目标智能体的自然语言执行反馈迭代优化碎片和线索。实验显示其宏平均 ASR 达 61.4%,高于 Trojan Hippo 式的 32.8% 和 AgentVigil 的 30.0%。
针对 LLM 多智能体系统 41%-87% 的失败率,研究者提出 MAADBench——首个可刷新的 MAS 异常检测基准,通过约 10^37 任务空间的采样耦合生成任务缓解任务泄漏,并支持在可配置 LLM 骨干下刷新轨迹生成、自动提供免成本确定性的步骤级标签。