跳到正文

全部动态

今日 46 条
9月30日周三
  1. Baseten 工程博客(网页)13

    Baseten 解读 Compound AI:用多模型组合替代单体大模型

    Baseten 工程博客提出 Compound AI 系统,主张用多个专用模型组合替代庞大的全能单体模型,以获得更快、更便宜的推理。该系统让模型之间直接互相调用,减少网络开销、额外延迟和出网成本,并让每个步骤独立使用自动扩缩容的 GPU。文中列举的典型场景包括 AI 电话呼叫、AI 智能体和 RAG 流水线。

  2. Trail of Bits:AI安全研究74

    Trail of Bits 实测技能扫描器:ClawHub、skills.sh 与 Cisco 扫描均可被绕过

    Trail of Bits 发布研究称,公共技能市场正被窃取凭据、外传数据、劫持智能体的恶意技能淹没,而现有扫描器难以拦截。

    推荐理由:Trail of Bits 用四个自研恶意技能实测并绕过多家技能扫描器,读者可以从中了解静态扫描在供应链攻击面前的结构性局限。

  3. Trail of Bits:AI安全研究48

    Trail of Bits 的 Mewt 变异测试引擎新增 DAML 支持

    Trail of Bits 为其开源变异测试引擎 Mewt 新增 DAML 语言支持,可解析 DAML 代码、生成多类变异体并跑现有测试套件统计存活数量。Mewt 还加入两个针对 DAML 授权原语的变异:controller 参与方替换(CPS)与移除(CPR),瞄准 controller 子句拼写错误、参与方缺失等授权类 bug。

  4. Trail of Bits:AI安全研究72

    Trail of Bits 分享用 Codex 的 /goal 挖掘开源漏洞的三个技巧

    Trail of Bits 在与 OpenAI 合作的 Patch the Planet 项目中,用 Codex 的 /goal 对 Rust、curl、zlib 等代码库挖洞,找到了 Rust 1.98 已修复的 soundness 漏洞和误编译、11 处变体命中,以及 Keycloak SAML 的两个潜在高危提权漏洞。

    推荐理由:原文来自亲历团队,给出了 /goal 挖漏洞的三条可迁移技巧和 Rust 变体分析流水线,读者可以照此改进自己的 Agent 审计流程。

  5. Anthropic:The Institute(旗舰研究长文 · 网页)23

    Anthropic 如何为 Claude 各产品构建隔离与管控机制

    Anthropic 分享了为 claude.ai、Claude Code 和 Cowork 构建隔离管控(containment)机制的工程经验,核心问题是如何在智能体能力增强、潜在影响范围扩大的同时限制其爆炸半径。相关文章还涉及 Claude Code 自动模式、长时运行智能体的 harness 设计,以及 Claude Opus 4.6 在 BrowseComp 中的评测意识等议题。

  6. Tomer Tunguz 博客(VC 分析)51

    AI 智能体应该活多久?Tomer Tunguz 主张日常助手 24 小时重置

    Tomer Tunguz 分析长会话智能体的问题:对话轮次堆积导致注意力退化,临时指令变成永久残留,长期读写权限还会被恶意邮件投毒劫持日程。他提出日常协调者只活 24 小时,任务委派给仅存活约 30 秒的单一用途子智能体,午夜由离线摘要器把持久偏好写入 preferences.md 后清空对话,并附上两个系统提示词示例。

  7. Google Developers Blog(RSS)66

    Google 发布在 Raspberry Pi 5 上用 LiteRT 部署 Gemma 的端侧 AI 指南

    Google 介绍如何在 Raspberry Pi 5 上用 LiteRT 和 Gemma 模型实现完全离线的实时端侧 AI,并以 Reachy Mini 机器人演示目标检测、语音识别、推理和语音合成的完整本地流水线。

    推荐理由:原文给出 Gemma 各型号在 Raspberry Pi 5 上的实测数据和完整部署流程,读者可以据此选择合适的端侧模型并复现本地推理。

  8. Google Developers Blog(RSS)62

    Google 用 ADK 构建零信任 AI Agent 的三层安全实践

    Google 开源了基于 ADK 和 Gemini 的客服退款 Agent 示例,演示提示词注入可导致超额退款、密钥泄露等风险。文章提出三层零信任防护:用 Cloud KMS 硬件签名保证写入不可抵赖,用 gVisor 沙箱零网络出口隔离动态生成代码,用确定性语义网关加 CI/CD 回归测试校验输入输出;完整代码见 zero-trust-agents 仓库。

    推荐理由:文章用开源示例和代码讲解三层零信任防护的具体做法,读者可以直接在本地复现攻击与防御流程。

  9. Google Developers Blog(RSS)41

    如何用深度学习和 Keras 解码宇宙信号

    Google 开发者倡导者 Yufeng Guo 撰文介绍深度学习在天体粒子物理中的应用,这类研究依赖覆盖数千平方公里的巨型观测站,如面积 3000 km²、含 1500 多个探测站的 Pierre Auger Observatory。探测器以纳秒级分辨率记录波形,形成类似图像的数据结构,天然适合深度学习处理,可用于提升仪器灵敏度、发现隐藏模式和搜索信号异常。

  10. Google Developers Blog(RSS)67

    Google 复盘 AI Agents Challenge 最强提交背后的 4 种工程模式

    Google 复盘其 AI Agents Challenge 获奖提交,归纳出四种反复出现的工程模式:双向 MCP(智能体既是自身工具的客户端也是可供其他智能体调用的 MCP 服务器)、基于事件总线的并行并发、回退模型必须通过与主模型相同的验证函数,以及在昂贵模型调用前做分层路由。

    推荐理由:Google 从获奖提交的真实代码里提炼四种智能体工程模式,双向 MCP、事件驱动并发、同标准回退和分层路由都给出可直接借鉴的做法。

  11. Every:最新文章(网页)39

    用 Codex 的成本组建工程团队:AI 如何搭建 Thesis 网站、年入 400 万美元的外星伴侣应用,以及为何 harness engineering 的未来是做得更少

    Every 的 Monologue 开发者 Naveen Naidu 用 Codex 构建了一支定制智能体团队,涵盖各领域工程师、客服和增长策略智能体,负责维护 Monologue 网站与应用。每个智能体都是一个 Codex 项目,配有自定义 AGENTS.md 文件、技能、文件夹、记忆和代码库,使其成为专才。近期客服智能体将一条用户好评转交给网站工程师智能体,后者把推荐语加到了网站上。

  12. Every:最新文章(网页)38

    Claude Code 如何让产品经理独自运营一款完整产品

    Spiral 总经理 Marcus Moretti 用 Claude Code 独自承担代码、客服、营销和产品管理,除路线图外所有 PRD 和工单均由 Claude 撰写,原本分散在 10 个应用中的事务性工作被收进单一对话线程。他通过 compound engineering 的 /ce:strategy 技能生成产品战略文档,并将路线图作为 GitHub 项目 README 管理工单。

  13. Every:最新文章(网页)47

    如何打磨 AI 智能体构建的软件:复合工程的最后一步

    在复合工程流程中,打磨(Polish)是最后一步:亲自使用应用,把感觉不对的地方告诉 AI 智能体,直到满意为止。作者用 /ce-polish 命令检出分支、后台启动开发服务器并在编辑器中打开应用,通过 Monologue 语音反馈让智能体调整 Cora 邮件卡片的动画与布局密度。这一环节之所以重要,是因为智能体无法判断什么才算“好”,最终的人类判断仍不可替代。

  14. Baseten Base Labs:模型研究26

    Qwen3 8B Reranker 重排序模型

    Baseten Base Labs 发布 Qwen3 8B Reranker,用于对查询与文档做相关性判定,输出只能是 "yes" 或 "no"。示例通过 baseten_performance_client 的 PerformanceClient 调用 classify 接口,支持 truncate、batch_size 与 max_concurrent_requests 参数配置。

  15. Baseten Base Labs:模型研究37

    SDXL Lightning:4 步生成 1024x1024 图像的 Stable Diffusion XL 变体

    SDXL Lightning 是 Stable Diffusion XL 的变体,仅需 4 个 UNet 步骤即可生成 1024x1024 像素图像,实现接近实时的图像生成。模型接收单个 prompt 输入,返回图像的 base64 字符串,该实现采用 4 步 UNet checkpoint 以平衡速度与质量。用户可自行部署 2 步版本以获得更快速度,或 8 步版本以获得更高质量。

  16. Every:最新文章(网页)62

    如何为自己创建个人 AI 基准测试以选出适合工作的模型

    Every 评测负责人介绍如何为自己的工作搭建个人 AI 基准测试,指出 MMLU-Pro 等常用基准衡量不了模型能否帮到你自己的工作。作者以写文案、建仪表盘和做幻灯片为例,说明个人基准分三个层次,可帮助判断何时在 Astra 与 Fable 之间切换,以及能否用 Luna 或 Haiku 等更便宜的模型省钱。