跳到正文

#教程/实践

今日 38 条
9月30日周三
  1. Augment Code 博客(网页)52

    Augment Code 构建 Verifier 智能体自动验证 Agent 代码的端到端表现

    Augment Code 内部构建了 Verifier 智能体,在每个 PR 上自动部署变更到隔离环境、端到端验证并附带日志、API 响应和截图发回 PR 评论。该智能体运行在其 Cosmos 云智能体平台上,依靠仓库中可组合的 SKILL.md 技能库决定验证哪些界面,且只提交证据不做通过与否的结论;文中记录了一例 CI 全绿但实际 /chat-stream 路径未生效的真实发现。

  2. Anthropic:The Institute(旗舰研究长文 · 网页)23

    Anthropic 如何为 Claude 各产品构建隔离与管控机制

    Anthropic 分享了为 claude.ai、Claude Code 和 Cowork 构建隔离管控(containment)机制的工程经验,核心问题是如何在智能体能力增强、潜在影响范围扩大的同时限制其爆炸半径。相关文章还涉及 Claude Code 自动模式、长时运行智能体的 harness 设计,以及 Claude Opus 4.6 在 BrowseComp 中的评测意识等议题。

  3. Google Developers Blog(RSS)66

    Google 发布在 Raspberry Pi 5 上用 LiteRT 部署 Gemma 的端侧 AI 指南

    Google 介绍如何在 Raspberry Pi 5 上用 LiteRT 和 Gemma 模型实现完全离线的实时端侧 AI,并以 Reachy Mini 机器人演示目标检测、语音识别、推理和语音合成的完整本地流水线。

    推荐理由:原文给出 Gemma 各型号在 Raspberry Pi 5 上的实测数据和完整部署流程,读者可以据此选择合适的端侧模型并复现本地推理。

  4. Google Developers Blog(RSS)62

    Google 用 ADK 构建零信任 AI Agent 的三层安全实践

    Google 开源了基于 ADK 和 Gemini 的客服退款 Agent 示例,演示提示词注入可导致超额退款、密钥泄露等风险。文章提出三层零信任防护:用 Cloud KMS 硬件签名保证写入不可抵赖,用 gVisor 沙箱零网络出口隔离动态生成代码,用确定性语义网关加 CI/CD 回归测试校验输入输出;完整代码见 zero-trust-agents 仓库。

    推荐理由:文章用开源示例和代码讲解三层零信任防护的具体做法,读者可以直接在本地复现攻击与防御流程。

  5. Google Developers Blog(RSS)41

    如何用深度学习和 Keras 解码宇宙信号

    Google 开发者倡导者 Yufeng Guo 撰文介绍深度学习在天体粒子物理中的应用,这类研究依赖覆盖数千平方公里的巨型观测站,如面积 3000 km²、含 1500 多个探测站的 Pierre Auger Observatory。探测器以纳秒级分辨率记录波形,形成类似图像的数据结构,天然适合深度学习处理,可用于提升仪器灵敏度、发现隐藏模式和搜索信号异常。

  6. Google Developers Blog(RSS)67

    Google 复盘 AI Agents Challenge 最强提交背后的 4 种工程模式

    Google 复盘其 AI Agents Challenge 获奖提交,归纳出四种反复出现的工程模式:双向 MCP(智能体既是自身工具的客户端也是可供其他智能体调用的 MCP 服务器)、基于事件总线的并行并发、回退模型必须通过与主模型相同的验证函数,以及在昂贵模型调用前做分层路由。

    推荐理由:Google 从获奖提交的真实代码里提炼四种智能体工程模式,双向 MCP、事件驱动并发、同标准回退和分层路由都给出可直接借鉴的做法。

  7. Every:最新文章(网页)39

    用 Codex 的成本组建工程团队:AI 如何搭建 Thesis 网站、年入 400 万美元的外星伴侣应用,以及为何 harness engineering 的未来是做得更少

    Every 的 Monologue 开发者 Naveen Naidu 用 Codex 构建了一支定制智能体团队,涵盖各领域工程师、客服和增长策略智能体,负责维护 Monologue 网站与应用。每个智能体都是一个 Codex 项目,配有自定义 AGENTS.md 文件、技能、文件夹、记忆和代码库,使其成为专才。近期客服智能体将一条用户好评转交给网站工程师智能体,后者把推荐语加到了网站上。

  8. Every:最新文章(网页)38

    Claude Code 如何让产品经理独自运营一款完整产品

    Spiral 总经理 Marcus Moretti 用 Claude Code 独自承担代码、客服、营销和产品管理,除路线图外所有 PRD 和工单均由 Claude 撰写,原本分散在 10 个应用中的事务性工作被收进单一对话线程。他通过 compound engineering 的 /ce:strategy 技能生成产品战略文档,并将路线图作为 GitHub 项目 README 管理工单。

  9. Baseten Base Labs:模型研究55

    Baseten 介绍 Google 300M 参数嵌入模型 EmbeddingGemma 及其调用示例

    EmbeddingGemma 是 Google 基于 Gemma3 架构的 3 亿参数文本嵌入模型,在 MTEB 基准上为不到 5 亿参数的嵌入模型中质量最高,支持 100 多种语言、输入最长 2k token。页面给出使用 baseten_performance_client 的完整代码示例,包括各任务的 prompt 前缀和通过 PerformanceClient 调用生成嵌入的方法。

  10. Every:最新文章(网页)47

    如何打磨 AI 智能体构建的软件:复合工程的最后一步

    在复合工程流程中,打磨(Polish)是最后一步:亲自使用应用,把感觉不对的地方告诉 AI 智能体,直到满意为止。作者用 /ce-polish 命令检出分支、后台启动开发服务器并在编辑器中打开应用,通过 Monologue 语音反馈让智能体调整 Cora 邮件卡片的动画与布局密度。这一环节之所以重要,是因为智能体无法判断什么才算“好”,最终的人类判断仍不可替代。

  11. Baseten Base Labs:模型研究26

    Qwen3 8B Reranker 重排序模型

    Baseten Base Labs 发布 Qwen3 8B Reranker,用于对查询与文档做相关性判定,输出只能是 "yes" 或 "no"。示例通过 baseten_performance_client 的 PerformanceClient 调用 classify 接口,支持 truncate、batch_size 与 max_concurrent_requests 参数配置。

  12. Baseten Base Labs:模型研究37

    SDXL Lightning:4 步生成 1024x1024 图像的 Stable Diffusion XL 变体

    SDXL Lightning 是 Stable Diffusion XL 的变体,仅需 4 个 UNet 步骤即可生成 1024x1024 像素图像,实现接近实时的图像生成。模型接收单个 prompt 输入,返回图像的 base64 字符串,该实现采用 4 步 UNet checkpoint 以平衡速度与质量。用户可自行部署 2 步版本以获得更快速度,或 8 步版本以获得更高质量。

  13. Every:最新文章(网页)62

    如何为自己创建个人 AI 基准测试以选出适合工作的模型

    Every 评测负责人介绍如何为自己的工作搭建个人 AI 基准测试,指出 MMLU-Pro 等常用基准衡量不了模型能否帮到你自己的工作。作者以写文案、建仪表盘和做幻灯片为例,说明个人基准分三个层次,可帮助判断何时在 Astra 与 Fable 之间切换,以及能否用 Luna 或 Haiku 等更便宜的模型省钱。

  14. Baseten Base Labs:模型研究35

    Baseten 上线 Wan 2.2 T2V 文生视频 API

    Baseten 提供 Wan 2.2 T2V 文生视频 API,通过 POST 请求传入提示词即可生成视频,返回 base64 编码结果。支持 720x1280、1280x720、480x832、832x480、704x1280、1280x704、1024x704、704x1024 八种分辨率,可设置 sampling_steps、guide_scale 与 seed 参数。

  15. Eugene Yan:Writing45

    自编码器与扩散模型:简要对比

    自编码器与扩散模型在学习范式上相似:都以数据为输入并重建输出,都在过程中学习数据的低维流形,架构上都使用瓶颈层,U-Net 可视为带残差连接的自编码器。关键区别在于扩散模型以时间步 t 为条件输入,使单一模型和单组参数即可处理不同噪声水平,从而先由高 t 的噪声生成模糊图像、再在低 t 时逐步锐化;当前扩散模型还以图像描述等文本为条件,支持按文本提示词生成图像。

  16. Eugene Yan:Writing41

    依赖团队无法帮忙时该怎么办:Eugene Yan 的协作经验

    当依赖团队不愿或无法帮忙时,Eugene Yan 建议先理解对方的约束与优先级,而非直接升级或写长篇 JIRA 工单。若对方接受代码贡献成本更高,可推动其建立 away team work 机制,如 office hours、自助文档和代码评审流程。也可将当前协作框定为投资:对方指导你这次改动,你未来可指导自己团队,减少后续支持成本。

  17. Eugene Yan:Writing40

    高效技术团队的运作机制:EOWD、月度学习会、季度回顾与 WBR

    Eugene Yan 总结了技术团队及跨团队协作的四类机制:每周结束简报(EOWD)让 4-6 人团队各用约 10 分钟分享进展并收集反馈,月度学习会以 30-45 分钟分享加 Q&A 把个人专长扩展到团队,季度回顾对齐中长期优先级并明确停止事项,每周业务回顾(WBR)则通过输入指标与输出指标梳理业务全貌。

  18. Every:最新文章(网页)55

    Every 撰文解读如何用好 Jev 分类模型

    Every 发布文章解读 TypeSafe 于 9 月 15 日推出的 Jev,一个对文本和结构化数据做分类而非生成的模型。文章说明 Jev 快速、低成本、可大规模处理日常判断类任务(如邮件是否紧急、段落是否像 AI 写的),并给出上手方法;编辑的演示展示其从语音和手势推断用户意图,已超 100 万次观看。