LMSYS 团队发布 Infer-forge 方法论:围绕 SGLang 的 Harness、Loop 与 Graph 工程
LMSYS 团队(2026年8月28日)发布 Infer-forge 构建方法论,这是一套围绕 SGLang 独立开发的内部智能体工程系统,包含 MonoRepo 共享工作区、Harness 执行底座、Task Loop 与 Task Graph 三层累积结构,目前未开源。
LMSYS 团队(2026年8月28日)发布 Infer-forge 构建方法论,这是一套围绕 SGLang 独立开发的内部智能体工程系统,包含 MonoRepo 共享工作区、Harness 执行底座、Task Loop 与 Task Graph 三层累积结构,目前未开源。
LMSYS 的 SGLang 团队发布 SSD Expert Pack 路径,把装不进 VRAM 和内存的 MoE 路由专家放在 NVMe SSD 上,只加载 router 选中的专家,用 Expert Pack 布局、direct I/O、pinned 缓冲和 GPU 缓存把 SSD 容量变成可用的存储层。
推荐理由:原文给出在单张消费级 GPU 上运行超大 MoE 模型的完整方案和实测数据,读者可以评估这条 SSD 专家卸载路径是否适合自己的本地部署。
SGLang、Qwen 和 NVIDIA 团队在 SGLang 中实现了 NVFP4 KV cache,将 K/V 以 4 位 NVFP4 格式存储并在 decode 阶段于注意力 kernel 内即时反量化到 FP8。
SGLang 团队介绍用 /v1/score 接口为 JEV 类决策模型做标签打分,调用方通过 label_token_ids 显式指定标签,无需依赖生成结果的 top-k logprobs。
Baseten 的部署(deployment)是模型在平台上运行的一个版本,拥有独立 API endpoint,每次 baseten model push 都会创建一个部署,同一模型可同时运行多个部署以便在不影响生产流量的情况下测试新版本。
Andrej Karpathy 在博士结束后发布长文回顾,总结读博是否值得、如何申请、如何选学校和导师、怎样培养选题品味,并以自己在 Fei-Fei Li 指导下转向图像与语言结合方向作为案例。文中还给出论文写作、代码开源、做报告和参加会议的具体建议,如通过审稿学习差论文、提前两周设内部截止日期、重视会议走廊交流等。
Andrej Karpathy 撰文提出训练神经网络的系统流程,指出神经网络训练是易泄露的抽象且会静默失败,配置错误往往不报错只是效果变差。流程分六步:深入检查数据、搭建端到端训练评估骨架并建立简单基线、过拟合、正则化、调参、最后压榨性能,并给出固定随机种子、验证初始损失、过拟合单个 batch、Adam 配 3e-4 学习率、优先随机搜索等具体技巧。
Andrej Karpathy 复现 Yann LeCun 等 1989 年的《Backpropagation Applied to Handwritten Zip Code Recognition》,认为这是最早的端到端反向传播神经网络实际应用,代码开源在 karpathy/lecun1989-repro。
Andrej Karpathy 发布艺术项目 microgpt,一个 200 行、零依赖的纯 Python 单文件,包含数据集、tokenizer、autograd 引擎、GPT-2 风格架构、Adam 优化器和训练与推理循环。
推荐理由:Karpathy 用 200 行无依赖纯 Python 完整实现 GPT 训练与推理,并逐段讲解,是理解大语言模型算法本质的入门材料。
Eugene Yan 发布长文讲解如何评测长上下文问答系统,提出忠实性与有用性两个正交维度,并介绍证据位置、多跳推理、幻觉等长文本特有挑战。文章覆盖 NarrativeQA、NovelQA、QASPER、L-Eval、HELMET、Loong 六个基准,指出传统 n-gram 指标与人工判断相关性差、应改用 LLM 评估者,且 RAG 在证据分散于多文档的 Loong 任务上反而降低表现。
Eugene Yan 用 RQ-VAE 把 Amazon Reviews 2023 游戏品类的 66k 商品编码为语义 ID,再微调 Qwen3-8B,构建一个无需检索、单一模型即可同时理解自然语言和商品 ID 的推荐混合模型。
Eugene Yan 撰文总结构建产品 evals 的三个步骤:标注小数据集、对齐 LLM 评估器、运行评估 harness。
Eugene Yan 分享与 AI 高效协作的工作流与复利方法,提出五条原则:提供良好上下文、把品味编码为配置、让验证变得简单、委托更大任务、闭合反馈循环。具体做法包括用 INDEX.md 注解组织上下文、将 CLAUDE.md 当作入职文档、把每周任务沉淀为 skill 并通过会话记录迭代、用 hooks 和 evals 左移验证、用 tmux 并行 3-6 个会话并挖掘过往会话记录更新配置。
NVIDIA 为 ROS 2 Lyrical 贡献了 CUDA buffer backend,配合 rosidl::Buffer 抽象,让 ROS 2 节点在满足同主机、同 CUDA 设备、同 Linux 用户及受支持 RMW 实现等条件时以零拷贝方式交换 GPU 常驻数据,否则自动回退 CPU 路径。
NVIDIA 用机密计算(CC)在 Blackwell GPU 上跑生产级 LLM 推理,TensorRT LLM 通过 CC 感知优化把吞吐保留在基线的 96.1%–98.2%,平均 TPOT 开销仅 1.2%–4.3%。测试基于单台 DGX B200(8 张 B200)、DeepSeek-R1-0528-NVFP4、32K 输入/1K 输出、TP=8,并发 1–16。
Cursor 工程师 Vicent Martí 撰文介绍其 Git 存储系统 Continuity:以 S3 中兼容对象存储的预写日志(WAL)作为唯一事实来源,本地副本为 NVMe 上的普通 Git 仓库,通过 S3 CAS 与 UDP gossip 实现乐观复制,无需路由表和共识选举,所有 push 线性化且完全持久化前不确认。
Cursor 团队发布文章,介绍过去几个月为提升长时间智能体运行的 token 效率所做的 harness 改动,整体将用户 token 成本降低 7% 且智能体质量未下降。
推荐理由:Cursor 团队逐项拆解了降低智能体 token 成本的 harness 改动,给出系统提示精简、动态工具加载与缓存断点等可借鉴的做法。
Trail of Bits 发现 Lean 的 String.Pos.Raw.extract 在超大位置提取单字节切片时,逻辑定义返回空字符串而编译后的原生代码返回整个原字符串,利用这一分歧可在 Lean 4.33.1 中构造出通过检查的费马大定理'证明'。
Trail of Bits 在审计 Miden zkVM 前,用智能体在六个月内从零构建了 MASM 的 LSP 服务器、反编译器、静态分析引擎和 Lean 形式化模型。
推荐理由:作者复盘如何让智能体在审计前自建 LSP、反编译器、静态分析和 Lean 形式化模型,方法可迁移到其他安全审计场景。
Augment Code 解决方案架构负责人用其智能体编排平台 Cosmos 生成企业试点健康视图,无需新建数据管道或仪表盘项目。Cosmos 会查询产品使用数据、校正 session lineage、拉取 Salesforce 交易状态,并对照客户通话记录核验结论,输出每个试点的采用度、技术进展、风险与整体健康评估,每个数字都可追溯到实时数据源。
Augment Code 的两人 Cosmos Advisor 团队用 Cosmos 构建了 Feedback Triager 智能体,把每周产品反馈从约 5 条增至 30+ 条的压力接了过来。
Augment Code 官方复盘其软件工厂搭建过程:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台陆续部署 PR Author、Deep Reviewer、Verifier、Incident Investigator 等专用智能体,覆盖需求、工单、PR、生产四个环节,量化分析覆盖 17,200 个已合并 PR。
推荐理由:官方复盘给出九个月内部数据与逐月部署节点,读者可以据此了解团队级智能体工厂的搭建路径与取舍。
Anthropic 研究员 Nicholas Carlini 用 agent teams 方法让 16 个 Claude 实例并行工作,经近 2000 个 Claude Code 会话。
推荐理由:作者亲历了用 16 个并行 Claude 智能体写 C 编译器的完整过程,沉淀了测试设计、并行任务锁和 GCC 对照等可复用的 harness 方法。
Anthropic Labs 的 Prithvi Rajasekaran 介绍受 GAN 启发的多智能体 harness,用 planner、generator、evaluator 三智能体架构让 Claude 在多小时自主会话中产出完整全栈应用,并给出四条前端设计评分标准。
Anthropic 详解 Claude Code 新模式 auto mode 的实现,用基于模型的双层防御替代手动权限审批:输入层提示词注入探针扫描工具输出,输出层运行在 Sonnet 4.6 上的 transcript 分类器在动作执行前评估风险,并以三级放行规则让项目内文件编辑免审。
Anthropic 发布 Claude Managed Agents 并发布工程复盘,将智能体虚拟化为 session、harness、sandbox 三个可独立替换的接口,把 harness 移出容器以避免宠物式服务器。
Anthropic 工程团队复盘为 claude.ai、Claude Code 和 Claude Cowork 三款智能体产品构建遏制(containment)架构的经验,核心思路是先在环境层用沙箱、VM 和出口控制设定硬边界,再在模型层引导行为。
推荐理由:Anthropic 自述三大产品的隔离架构与真实事故,给出了环境层优先、匹配用户监督能力、警惕自研组件等可复用原则。
Google 发布 autofinetune 项目,将 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和基于 GRPO 的强化学习),使用 Tunix、Gemma 和 Cloud TPU,并由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google Developers Blog 发布零信任 Agent 系列第二篇,讲解如何将 Customer Support & Returns Agent 的安全检查从构建时移到 Gemini Enterprise Agent Platform 的运行时治理层。
Google 团队在 MaxText(JAX/XLA)中从零复现 Ai2 的 Olmo 3 7B,在 Google Cloud TPU 上完成 stage-1 预训练(约5.93T token。
针对 RAG 在跨数百份合同的聚合问题上失效,该方案改用结构化抽取:AI 抽取智能体(Claude Sonnet 系列)从每份合同 PDF 提取 8 个关键字段并附置信度,验证智能体(Claude Haiku)独立复核,签名检测分歧由 Amazon Textract 用计算机视觉裁定,结果存入 Amazon Aurora PostgreSQL。
AWS 发文拆解 Amazon Quick 各组件的提示词写法:Quick Research 需明确目标、受众与关注范围,并自行拆解子问题、限定数据源(Quick Index。
Amazon Quick 的提示词工程基础指南指出,提示词结构直接决定其 AI 功能输出的准确性与可靠性。文章给出清晰具体、提供业务上下文、用示例代替描述等核心原则,并介绍 CRISPE 框架,用于跨 Quick 各组件构建复杂提示词。这是两部分系列的第一篇,第二篇将覆盖 Research、Flows、Sight、Chat Agents 和 Action Integrations 的组件专属技巧。
【AI 倾向测试】这个只有六道二选一题目的问卷好有意思 https://pages.yqiao.me/six-questions-of-ai/
作者发布教程,讲解如何用 n8n、OpenAI、Gmail 和 Google Sheets 自动化邮件线索跟进,覆盖检测新线索邮件、提取信息、用 OpenAI 打分分级线索、生成个性化回复、自动发送、存入 Google Sheets 以及对合格线索创建跟进任务。
作者在 OpenAI 于 DevDay 2026 发布 always-on agent「Dots」后,用 TypeScript 实现一个迷你版教学模型:事件唤醒、background/assigned 两种模式、allow/ask/deny 规则、按用户隔离的记忆和 Activity 时间线。
今天推荐一个功能很丰富的 DSH 上下文管理插件 dsh-context: https://github.com/bowenliang123/dsh-context
从 DeepSeek 官方 API 处统计的数据来看,约有 60% 的 DeepSeek Harness 用户使用了至少一个第三方插件。第三方插件是 DeepSeek Harness 用户体验中最具特色且不可缺少的一部分。DeepSeek Harness 团队将持续支持第三方插件生态的繁荣发展,并推动插件 API 趋于稳定,在将来减少和尽量避免破坏性更新。 接下来的几天我个人将每天推荐一个优质的 DSH 第三方插件,欢迎 DSH 插件作者在本 thread 下自荐。我会结合插件质量及后台实际统计到的插件使用量择优推荐。 DeepSeek Harness 团队祝大家中秋快乐阖家幸福! (注:在用户使用官方 API 及模型时,DSH 会向官方 API 上报实际使用的插件包名和版本。此类上报不额外消耗 tokens。)
想给大伙随便聊聊如何给产品进行一次图标升级,有哪些需要注意的以及可以优化的点。 早上给 Mole 的图标进行了一次精细化的升级,之前使用的是系统的图标,对于简单的产品场景我感觉完全够用,不过细看会感觉缺少一点灵性的感觉。 经过调研,比较适合做 App 产品 Icon 的有 Remix Icon 和 Phosphor Icon这两个,之前写 Web 的时候用 Remix 很多,简单舒服,但是放到 App 上我感觉不是很好看,于是就换上了 Phosphor 这个,展示效果很有灵性,非常不错,差不多有 70% 左右,可以不修改直接使用,然后有 30% 的图标是我用 opus 5.5 来写SVG 自绘的,这样整体更加一致。 可能大伙直接看下面的对比图很难感觉到两者的区别,很多时候需要实际放到真实的产品里面去,我一般还会考虑到本身这个模块下一组图标的搭配感,有时候全部图标单个都好看,组合到一起就不好看的情况也有,好比一个人每一个五官单独出来都好看,但是放到一个脸上却不那么好看,这里建议就是图标的根更换你一定要放到实际的产品里面去看,放到一起去看,才会有比较好的效果。 其次,我一直想着,我们做的产品应该是有灵性的,有生命的那种感觉,而非直接 AICoding 不经任何你的思考出来的那种冷冰冰的编译产物,这个时候小细节比如icon会是给这个产品带来生命力的一个很好的切入点,比如大伙看 保持常亮我使用的是 一杯咖啡,这里会有一种 Caffeine 比喻,就是让你的电脑好像喝了咖啡一样睡不着的感觉,然后关于一般会用一个感叹号,但是我想着应该是 hello,所以就用的挥手的标志,诊断正常会有排查的那种标志,但是这里使用的是一个听诊器的标志,更像是给你的问题做一次医生检查,类似这样,很多时候,可以在产品里面加入不少你的小巧思,会让整体有趣很多。 最后,好看的设计几乎都离不开对齐、整齐、错落有致这些原则,如何在人眼看到的场景下让图标和内容以及上下模块看起来是整齐的、大小一致的,甚至是上下居中对齐的,都需要一个一个去看,去调整,包括字体和icon的对齐,以及字体里面中英文本身也没有垂直对齐应该如何优化,类似这样的,可以精雕细琢很久,非常有意思。 这种看似无用功,其实是我很喜欢做的事情,AI 可以给优秀编码、及格审美带来非常大的促进,人看着好像不要做啥了,只要动动嘴就好,反而我认为不是的,人在这里的作用更大了,AI 帮你节约的时间,刚好可以放到打磨产品上,让1%的用户有种用你产品的时候,时不时有一种秒懂、卧槽、变魔术的感觉,那就非常非常有价值和意思了,或许这也是我认为做独立产品有意思的地方。
看到 Tripo 驱动这条疯狂的自动化流水线(Astra -> Tripo -> Blender -> Unity),1 小时构建出可玩地图:无价。 干得漂亮,@luccacerf!
So I've upgraded my chatgpt plan to $500 and asked to Astra Ultra Fast to create this map with blender and tripo assets and then make it playable on my new game. Guess what? It took away in 1h 50% of my week usage plan, but yeah, created 26 assets and a new make for realm rivals. Idk what to feel. Astra Ultra Fast -> Tripo -> Blender MCP -> Unity CLI