跳到正文

#教程/实践

今日 45 条
9月30日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)79

    Anthropic 工程指南:构建高效 Agent 的简单可组合模式

    Anthropic 基于与数十个团队合作的经验发布构建高效 Agent 的工程指南,主张用简单、可组合的模式而非复杂框架,并区分了工作流与 Agent 两类系统。文章给出增强 LLM 这一基础构件,以及提示链、路由、并行化、编排者-工作者、评估者-优化者五种工作流模式,并建议仅在简单方案失效时增加复杂度;附录还讲解了工具提示词工程与 Agent-计算机接口(ACI)设计实践。

    推荐理由:Anthropic 基于大量客户实践总结了构建智能体的可组合模式与工具设计方法,开发者可直接对照自己的场景选用。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    Anthropic 工程博客详解 Claude 的 think 工具如何提升复杂工具调用表现

    Anthropic 发布工程指南,介绍给 Claude 增加 "think" 工具的方法,让模型在长链工具调用和策略密集场景中停下来做结构化思考。在 τ-bench 航空域,think 工具加优化提示词的 pass^1 达 0.570,比基线 0.370 相对提升 54%;零售域仅加工具即达 0.812(基线 0.783)。

  3. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    Anthropic 发布 Claude Code 智能体编码最佳实践指南

    Anthropic 发布 Claude Code 智能体编码最佳实践指南,指出上下文窗口是最需要管理的资源,性能会随上下文填满而下降。指南覆盖给 Claude 提供可运行的验证标准、先探索再规划再编码、编写精简 CLAUDE.md、配置权限与 hooks、用子代理隔离调查、用 /clear 和 /rewind 管理会话,以及并行会话、非交互模式和对抗式审查等规模化用法。

    推荐理由:Anthropic 官方系统梳理 Claude Code 使用模式,围绕上下文管理与验证闭环给出可直接套用的实践方法。

  4. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)61

    Anthropic 工程博客详解 Claude Research 多智能体系统的构建经验

    Anthropic 工程团队发布长文,复盘 Claude Research 多智能体研究系统从原型到生产的构建过程。系统采用 orchestrator-worker 架构,内部评估中 Claude Opus 4 主导加 Claude Sonnet 4 子代理的组合比单代理 Claude Opus 4 高出 90.2%,但多智能体消耗约 15 倍于普通对话的 token。

  5. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 工程博客详解 AI 智能体的有效上下文工程方法

    Anthropic 应用 AI 团队发文阐述上下文工程,定义为在 LLM 推理过程中筛选和维护最优 token 集合的策略,将其视为提示工程的自然演进。文章指出所有模型都存在 context rot 现象,上下文应被当作边际收益递减的有限资源。

    推荐理由:Anthropic 提出上下文工程是提示工程的演进,并给出压缩、结构化笔记、子智能体三种应对长任务的具体方法,可直接迁移到智能体开发。

  6. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    Anthropic 详解 Agent Skills:用文件夹式的渐进式披露为 Claude 装载领域能力

    Anthropic 发布 Agent Skills 工程解析,说明 Skills 是包含 SKILL.md 的目录,通过渐进式披露分三级加载指令、脚本和资源,可附 Python 脚本作为可执行工具。Skills 已支持 Claude.ai、Claude Code、Claude Agent SDK 和开发者平台,文末给出编写、评估与安全审计建议,并提示恶意 Skills 可能引入漏洞或数据外泄风险。

  7. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)69

    Anthropic 工程博客:用代码执行提升 MCP Agent 的上下文效率

    Anthropic 发布工程文章,提出让 Agent 通过代码执行方式与 MCP 服务器交互,以解决工具定义和中间结果占用过多上下文的问题。示例场景中 token 消耗从 150,000 降至 2,000,节省 98.7%。文章还介绍了渐进式工具发现、在执行环境中过滤数据、PII 令牌化保护隐私、状态持久化与可复用 Skills 等收益,并提示需要沙箱、资源限制等安全基础设施作为权衡。

  8. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    Anthropic 工程博客详解 AI Agent 评测:评测器类型、任务设计与从零到一的建设路线

    Anthropic 工程博客发布长文,系统讲解如何为 AI Agent 构建可靠的自动化评测。文章定义了任务、试验、grader、transcript、评测框架等核心概念,对比代码型、模型型和人工三类评测器的优劣,分别给出编码、对话、研究和计算机使用四类 Agent 的评测方法,并解释 pass@k 与 pass^k 两种指标在非确定性下的差异。

  9. Suno:Blog(网页)25

    Suno 官方指南:如何完善创作者个人资料,让音乐被更多人发现

    Suno 发布创作者指南,建议完善个人资料以提升音乐被发现和推荐的机会。资料需包含名称、头像、简介和至少一首已发布歌曲,才可被搜索并获得 Suno 推荐;还可添加最多 5 个曲风标签及 Spotify、TikTok、Instagram、SoundCloud 等外部链接。完整资料有助于将一次性听众转化为长期粉丝。

  10. Suno:Blog(网页)25

    Suno 解析:压缩器到底在做什么?

    Suno 发布科普文章,解释压缩器如何通过降低音频最响部分并配合补偿增益提升整体电平,从而压缩动态范围。Suno Studio 的压缩器插件提供阈值、压缩比、启动与释放等参数,并配有实时动态曲线表。Studio 是浏览器端 DAW,已内置包括压缩在内的一整套音频效果,随 Suno Premier 订阅免费提供。

  11. Suno:Blog(网页)36

    Suno Studio 使用 EQ 的三个必学技巧

    Suno Studio 发布 EQ 使用指南,给出三条入门技巧:混音以耳朵为准而非只看曲线;先衰减再提升,例如人声可在 400Hz 处先减 6dB 并用约 80Hz 高通滤除低频;EQ 尽量放在效果链首位。Suno Studio 自 2025 年上线起即支持每轨 EQ,最新版本中 EQ 已作为音频效果与压缩、混响、延迟并列,可手动添加、自制预设并跨轨道和项目复制分享。

  12. LMSYS:Blog(Chatbot Arena 团队)75

    SGLang SSD Expert Pack 让 DeepSeek-V4-Flash 和 Kimi-K3 跑在消费级硬件上

    LMSYS 的 SGLang 团队发布 SSD Expert Pack 路径,把装不进 VRAM 和内存的 MoE 路由专家放在 NVMe SSD 上,只加载 router 选中的专家,用 Expert Pack 布局、direct I/O、pinned 缓冲和 GPU 缓存把 SSD 容量变成可用的存储层。

    推荐理由:原文给出在单张消费级 GPU 上运行超大 MoE 模型的完整方案和实测数据,读者可以评估这条 SSD 专家卸载路径是否适合自己的本地部署。

  13. Andrej Karpathy:Blog(网页)62

    Andrej Karpathy 发布博士生涯生存指南,复盘读博各阶段经验

    Andrej Karpathy 在博士结束后发布长文回顾,总结读博是否值得、如何申请、如何选学校和导师、怎样培养选题品味,并以自己在 Fei-Fei Li 指导下转向图像与语言结合方向作为案例。文中还给出论文写作、代码开源、做报告和参加会议的具体建议,如通过审稿学习差论文、提前两周设内部截止日期、重视会议走廊交流等。

  14. Andrej Karpathy:Blog(网页)66

    Andrej Karpathy 详解训练神经网络的六步方法

    Andrej Karpathy 撰文提出训练神经网络的系统流程,指出神经网络训练是易泄露的抽象且会静默失败,配置错误往往不报错只是效果变差。流程分六步:深入检查数据、搭建端到端训练评估骨架并建立简单基线、过拟合、正则化、调参、最后压榨性能,并给出固定随机种子、验证初始损失、过拟合单个 batch、Adam 配 3e-4 学习率、优先随机搜索等具体技巧。

  15. Andrej Karpathy:Blog(网页)80

    Karpathy 发布 microgpt:200 行纯 Python 实现完整 GPT 训练与推理

    Andrej Karpathy 发布艺术项目 microgpt,一个 200 行、零依赖的纯 Python 单文件,包含数据集、tokenizer、autograd 引擎、GPT-2 风格架构、Adam 优化器和训练与推理循环。

    推荐理由:Karpathy 用 200 行无依赖纯 Python 完整实现 GPT 训练与推理,并逐段讲解,是理解大语言模型算法本质的入门材料。

  16. Eugene Yan:Writing68

    Eugene Yan 详解长上下文问答系统评测:指标、数据集与六个基准

    Eugene Yan 发布长文讲解如何评测长上下文问答系统,提出忠实性与有用性两个正交维度,并介绍证据位置、多跳推理、幻觉等长文本特有挑战。文章覆盖 NarrativeQA、NovelQA、QASPER、L-Eval、HELMET、Loong 六个基准,指出传统 n-gram 指标与人工判断相关性差、应改用 LLM 评估者,且 RAG 在证据分散于多文档的 Loong 任务上反而降低表现。