Eugene Yan:三步构建产品级 LLM 评估(Product Evals)
Eugene Yan 撰文总结构建产品 evals 的三个步骤:标注小数据集、对齐 LLM 评估器、运行评估 harness。
Eugene Yan 撰文总结构建产品 evals 的三个步骤:标注小数据集、对齐 LLM 评估器、运行评估 harness。
Eugene Yan 分享与 AI 高效协作的工作流与复利方法,提出五条原则:提供良好上下文、把品味编码为配置、让验证变得简单、委托更大任务、闭合反馈循环。具体做法包括用 INDEX.md 注解组织上下文、将 CLAUDE.md 当作入职文档、把每周任务沉淀为 skill 并通过会话记录迭代、用 hooks 和 evals 左移验证、用 tmux 并行 3-6 个会话并挖掘过往会话记录更新配置。
NVIDIA 为 ROS 2 Lyrical 贡献了 CUDA buffer backend,配合 rosidl::Buffer 抽象,让 ROS 2 节点在满足同主机、同 CUDA 设备、同 Linux 用户及受支持 RMW 实现等条件时以零拷贝方式交换 GPU 常驻数据,否则自动回退 CPU 路径。
NVIDIA 用机密计算(CC)在 Blackwell GPU 上跑生产级 LLM 推理,TensorRT LLM 通过 CC 感知优化把吞吐保留在基线的 96.1%–98.2%,平均 TPOT 开销仅 1.2%–4.3%。测试基于单台 DGX B200(8 张 B200)、DeepSeek-R1-0528-NVFP4、32K 输入/1K 输出、TP=8,并发 1–16。
Cursor 工程师 Vicent Martí 撰文介绍其 Git 存储系统 Continuity:以 S3 中兼容对象存储的预写日志(WAL)作为唯一事实来源,本地副本为 NVMe 上的普通 Git 仓库,通过 S3 CAS 与 UDP gossip 实现乐观复制,无需路由表和共识选举,所有 push 线性化且完全持久化前不确认。
Cursor 团队发布文章,介绍过去几个月为提升长时间智能体运行的 token 效率所做的 harness 改动,整体将用户 token 成本降低 7% 且智能体质量未下降。
推荐理由:Cursor 团队逐项拆解了降低智能体 token 成本的 harness 改动,给出系统提示精简、动态工具加载与缓存断点等可借鉴的做法。
Trail of Bits 在审计 Miden zkVM 前,用智能体在六个月内从零构建了 MASM 的 LSP 服务器、反编译器、静态分析引擎和 Lean 形式化模型。
推荐理由:作者复盘如何让智能体在审计前自建 LSP、反编译器、静态分析和 Lean 形式化模型,方法可迁移到其他安全审计场景。
Augment Code 解决方案架构负责人用其智能体编排平台 Cosmos 生成企业试点健康视图,无需新建数据管道或仪表盘项目。Cosmos 会查询产品使用数据、校正 session lineage、拉取 Salesforce 交易状态,并对照客户通话记录核验结论,输出每个试点的采用度、技术进展、风险与整体健康评估,每个数字都可追溯到实时数据源。
Augment Code 今年早些时候从零重构了 Auggie CLI 的 harness,在 SWE-bench Pro(731 实例,opus4.7)上 Auggie v2 通过率与 Claude Code 相当的情况下,单任务成本 $1.27 对 $2.70,便宜 53%,平均耗时 330s 对 409s。
Augment Code 的两人 Cosmos Advisor 团队用 Cosmos 构建了 Feedback Triager 智能体,把每周产品反馈从约 5 条增至 30+ 条的压力接了过来。
Anthropic Labs 的 Prithvi Rajasekaran 介绍受 GAN 启发的多智能体 harness,用 planner、generator、evaluator 三智能体架构让 Claude 在多小时自主会话中产出完整全栈应用,并给出四条前端设计评分标准。
Anthropic 发布 Claude Managed Agents 并发布工程复盘,将智能体虚拟化为 session、harness、sandbox 三个可独立替换的接口,把 harness 移出容器以避免宠物式服务器。
Anthropic 说明过去一个月用户报告的 Claude 质量下降来自三个独立改动,影响 Claude Code、Claude Agent SDK 和 Claude Cowork,API 未受影响,三处均已修复(截至 4 月 20,v2.1.116)。
Anthropic 工程团队复盘为 claude.ai、Claude Code 和 Claude Cowork 三款智能体产品构建遏制(containment)架构的经验,核心思路是先在环境层用沙箱、VM 和出口控制设定硬边界,再在模型层引导行为。
推荐理由:Anthropic 自述三大产品的隔离架构与真实事故,给出了环境层优先、匹配用户监督能力、警惕自研组件等可复用原则。
Google 发布 autofinetune 项目,将 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和基于 GRPO 的强化学习),使用 Tunix、Gemma 和 Cloud TPU,并由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google Developers Blog 发布零信任 Agent 系列第二篇,讲解如何将 Customer Support & Returns Agent 的安全检查从构建时移到 Gemini Enterprise Agent Platform 的运行时治理层。
Google 团队在 MaxText(JAX/XLA)中从零复现 Ai2 的 Olmo 3 7B,在 Google Cloud TPU 上完成 stage-1 预训练(约5.93T token。
针对 RAG 在跨数百份合同的聚合问题上失效,该方案改用结构化抽取:AI 抽取智能体(Claude Sonnet 系列)从每份合同 PDF 提取 8 个关键字段并附置信度,验证智能体(Claude Haiku)独立复核,签名检测分歧由 Amazon Textract 用计算机视觉裁定,结果存入 Amazon Aurora PostgreSQL。
AWS 发文拆解 Amazon Quick 各组件的提示词写法:Quick Research 需明确目标、受众与关注范围,并自行拆解子问题、限定数据源(Quick Index。
Amazon Quick 的提示词工程基础指南指出,提示词结构直接决定其 AI 功能输出的准确性与可靠性。文章给出清晰具体、提供业务上下文、用示例代替描述等核心原则,并介绍 CRISPE 框架,用于跨 Quick 各组件构建复杂提示词。这是两部分系列的第一篇,第二篇将覆盖 Research、Flows、Sight、Chat Agents 和 Action Integrations 的组件专属技巧。
【AI 倾向测试】这个只有六道二选一题目的问卷好有意思 https://pages.yqiao.me/six-questions-of-ai/
作者发布教程,讲解如何用 n8n、OpenAI、Gmail 和 Google Sheets 自动化邮件线索跟进,覆盖检测新线索邮件、提取信息、用 OpenAI 打分分级线索、生成个性化回复、自动发送、存入 Google Sheets 以及对合格线索创建跟进任务。
作者在 OpenAI 于 DevDay 2026 发布 always-on agent「Dots」后,用 TypeScript 实现一个迷你版教学模型:事件唤醒、background/assigned 两种模式、allow/ask/deny 规则、按用户隔离的记忆和 Activity 时间线。
今天推荐一个功能很丰富的 DSH 上下文管理插件 dsh-context: https://github.com/bowenliang123/dsh-context
从 DeepSeek 官方 API 处统计的数据来看,约有 60% 的 DeepSeek Harness 用户使用了至少一个第三方插件。第三方插件是 DeepSeek Harness 用户体验中最具特色且不可缺少的一部分。DeepSeek Harness 团队将持续支持第三方插件生态的繁荣发展,并推动插件 API 趋于稳定,在将来减少和尽量避免破坏性更新。 接下来的几天我个人将每天推荐一个优质的 DSH 第三方插件,欢迎 DSH 插件作者在本 thread 下自荐。我会结合插件质量及后台实际统计到的插件使用量择优推荐。 DeepSeek Harness 团队祝大家中秋快乐阖家幸福! (注:在用户使用官方 API 及模型时,DSH 会向官方 API 上报实际使用的插件包名和版本。此类上报不额外消耗 tokens。)
想给大伙随便聊聊如何给产品进行一次图标升级,有哪些需要注意的以及可以优化的点。 早上给 Mole 的图标进行了一次精细化的升级,之前使用的是系统的图标,对于简单的产品场景我感觉完全够用,不过细看会感觉缺少一点灵性的感觉。 经过调研,比较适合做 App 产品 Icon 的有 Remix Icon 和 Phosphor Icon这两个,之前写 Web 的时候用 Remix 很多,简单舒服,但是放到 App 上我感觉不是很好看,于是就换上了 Phosphor 这个,展示效果很有灵性,非常不错,差不多有 70% 左右,可以不修改直接使用,然后有 30% 的图标是我用 opus 5.5 来写SVG 自绘的,这样整体更加一致。 可能大伙直接看下面的对比图很难感觉到两者的区别,很多时候需要实际放到真实的产品里面去,我一般还会考虑到本身这个模块下一组图标的搭配感,有时候全部图标单个都好看,组合到一起就不好看的情况也有,好比一个人每一个五官单独出来都好看,但是放到一个脸上却不那么好看,这里建议就是图标的根更换你一定要放到实际的产品里面去看,放到一起去看,才会有比较好的效果。 其次,我一直想着,我们做的产品应该是有灵性的,有生命的那种感觉,而非直接 AICoding 不经任何你的思考出来的那种冷冰冰的编译产物,这个时候小细节比如icon会是给这个产品带来生命力的一个很好的切入点,比如大伙看 保持常亮我使用的是 一杯咖啡,这里会有一种 Caffeine 比喻,就是让你的电脑好像喝了咖啡一样睡不着的感觉,然后关于一般会用一个感叹号,但是我想着应该是 hello,所以就用的挥手的标志,诊断正常会有排查的那种标志,但是这里使用的是一个听诊器的标志,更像是给你的问题做一次医生检查,类似这样,很多时候,可以在产品里面加入不少你的小巧思,会让整体有趣很多。 最后,好看的设计几乎都离不开对齐、整齐、错落有致这些原则,如何在人眼看到的场景下让图标和内容以及上下模块看起来是整齐的、大小一致的,甚至是上下居中对齐的,都需要一个一个去看,去调整,包括字体和icon的对齐,以及字体里面中英文本身也没有垂直对齐应该如何优化,类似这样的,可以精雕细琢很久,非常有意思。 这种看似无用功,其实是我很喜欢做的事情,AI 可以给优秀编码、及格审美带来非常大的促进,人看着好像不要做啥了,只要动动嘴就好,反而我认为不是的,人在这里的作用更大了,AI 帮你节约的时间,刚好可以放到打磨产品上,让1%的用户有种用你产品的时候,时不时有一种秒懂、卧槽、变魔术的感觉,那就非常非常有价值和意思了,或许这也是我认为做独立产品有意思的地方。
看到 Tripo 驱动这条疯狂的自动化流水线(Astra -> Tripo -> Blender -> Unity),1 小时构建出可玩地图:无价。 干得漂亮,@luccacerf!
So I've upgraded my chatgpt plan to $500 and asked to Astra Ultra Fast to create this map with blender and tripo assets and then make it playable on my new game. Guess what? It took away in 1h 50% of my week usage plan, but yeah, created 26 assets and a new make for realm rivals. Idk what to feel. Astra Ultra Fast -> Tripo -> Blender MCP -> Unity CLI
NVIDIA 开源了基于 TensorRT 的 C++ AI 模型参考实现集合 TensorRT Model Connect,目标是让 NVIDIA 推理栈的性能更易获取。项目围绕编码智能体设计,采用并行工作、模型族隔离、可逆变更与 GPU 验证等实践。
Sebastian Raschka 发表长文,从词袋模型、RNN、CNN 到 BERT 与 GPT 梳理文本分类技术史,并解读 TypeSafe AI 新发布的 Jev 模型。
推荐理由:作者基于自己的 IMDb 实测对比 Jev 与 ModernBERT 等方案,梳理了文本分类技术史,帮助读者判断何时微调、何时直接用 Jev。
Lauren Tan 分享了其最近使用最多的提示词:要求模型用自己的话复述它所理解的用户目标和要解决的问题,用于检验模型对需求的理解是否一致。
vLLM 官方博客发布分离式推理(disaggregated serving)实战指南,讲解如何将 prefill 与 decode 拆分为独立实例、把 tokenization 和解析移到无 GPU 的 /render 与 /derender 前端。
推荐理由:指南围绕 Sonnet 5.5 与 Opus 5.5 的选型、迁移调参和 Claude Code 使用给出实操建议,便于开发者上手。
Databricks 介绍其内部新模型发布流程:通过 Unity Gateway 让全体员工首日获得 Opus 5.5、GPT-6 Sol 和 GPT-Luna 的实验性访问,并用四类按用户预算控制成本。
推荐理由:Databricks 以自身一万多名员工的实际 rollout 数据为例,给出一套可复用的新模型评估与推广方法,含具体成本对比。
Databricks 发布 Genie One 企业推广 playbook,主张从单一团队、单一问题集起步,先建语义层再逐步扩面。落地分四部分:Genie One 面向业务用户提供带引用来源的问答,Genie Agents 处理合同分析等特定领域任务,Genie Ontology 映射业务术语与指标,Unity Catalog 负责权限、脱敏与审计。
现在基本上不可能让人直接"给你看他们的提示词"了,因为一切都关乎引用、技能和示例 我经常让我的智能体先看我做的另外 3 个 repo,上网搜索参考资料,调用其他 AI API 等等。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并用 Gradio 应用验证。