开发者环境揭秘:一台 HP Z440 服务器上的自建私有云与智能体基础设施
一位开发者用 Intel Xeon E5-2683 v4、32GB ECC DDR4 和 NVIDIA Quadro M2000 4GB 的 HP Z440 服务器搭建开发环境,把多数服务以容器形式运行,视作小型私有云。
一位开发者用 Intel Xeon E5-2683 v4、32GB ECC DDR4 和 NVIDIA Quadro M2000 4GB 的 HP Z440 服务器搭建开发环境,把多数服务以容器形式运行,视作小型私有云。
作者发布开源工具 Promptline(MIT,Windows 10/11,macOS 开发中),把反复手打的提示词命名为可复用词汇,通过 Ctrl+Alt+V 热键把选中提示词连同剪贴板内容粘贴到 Claude Code、Codex、Cursor 等窗口。
一位工程师复盘十个月为 Claude Code 逐步搭建 hooks、门禁和守护框架的经历,核心结论是“仪表会撒谎”,提示词只是请求,真正有效的是代码边界。
推荐理由:作者用十个月的真实失败数据说明提示词为何挡不住模型,并给出可复用的 Claude Code hooks 种子。
NVIDIA NeMo Relay 可追踪 AI 智能体执行框架(agent harness)的行为,揭示智能体在完成任务时走过的低效路径。失败的搜索会触发另一次搜索,被截断的文件读取会导致命令重复获取相同内容,这些多余步骤虽被正确答案掩盖,却增加延迟并消耗 token。
Anthropic 公开其可解释性研究基础设施 Garçon,用于在超出单节点规模的大模型上做机制可解释性实验。用户可通过 `python -m garcon.launch` 启动服务器并连接模型,借助 probe points 与 probe 函数在任意层读取、修改或消融内部激活,并支持前向与反向传播。服务器按连接保存数据,空闲 1 小时后自动关闭。
Anthropic 开源 PySvelte,用于在 Python 中调用 Svelte 组件构建神经网络可解释性可视化。该库让 src/ 下的 Svelte 组件自动暴露为 pysvelte.Hello() 等 Python 接口,支持 NumPy 数组传入、Jupyter/Colab 内联显示及 .publish() 发布到 GCS/S3/AZ 并分享至 Slack。
Anthropic 的 Transformer Circuits 团队发布了一组练习,用于理解神经网络如何在参数层面实现算法,作为其逆向工程 Transformer 数学框架的补充材料。练习要求手动写出注意力头的 W_Q、W_K、W_V、W_out 权重矩阵,涵盖虚拟注意力头、归纳头(指针算术版与前一 token K-Composition 版)等实现,并附有解答。
欧洲一家大型银行的 DevOps 工程师 Mark 借助开源平台 TensorZero 构建变更日志自动化系统,接入 GitLab merge request 与 CI/CD 流程,并用 Ollama 实现全自托管部署,数据不出内网。系统利用内置的动态上下文学习(DICL),将工程师对 AI 生成日志的修改自动用于优化后续推理,无需微调或标注数据集。
TensorZero 团队测试了 MIPRO 自动化提示词优化方法在从命名实体识别(CoNLL++)、多跳检索(HoVer)到文本游戏导航(BabyAI)和智能体工具调用客服(τ-bench)等任务上的表现,探究其随任务复杂度提升的效果变化。MIPRO 通过贝叶斯优化器搜索指令与少样本示例,无需梯度或细粒度标签,团队用约 200 行代码重实现独立版本,指令生成使用 OpenAI 的 o1 模型。
TensorZero 团队将自研开源网关部署为 Cursor 与 LLM 提供商之间的自托管代理,成功观察并替换 Cursor 的模型调用。
推荐理由:作者以第一手实验给出自建代理查看 Cursor 提示词的完整路径,还分享了系统提示词和模型分层等可复核的细节。
Suno 产品经理 Katelynn Kyker 发文呼吁创作者把作品从私人曲库中发布出来,让平台上数百万听众听到。文章给出三个理由:触达数百万听众、通过真实听众反馈了解作品共鸣点、开放作品供社区 remix 并激发他人。作者强调发布不必等到作品完美,早期且持续发布的创作者成长最快。
Prime Intellect 发布文章,梳理全球分布式训练的前沿方法,以应对开源社区难以匹敌闭源厂商大规模 H100 集群的困境。
Prime Intellect 发布 prime-rl 0.6.0,可在 28 个 H200 节点上以最高 131k 序列长度、sub-5 分钟 step 时间和 256 rollouts 批大小训练 GLM-5 等万亿参数 MoE 模型执行 SWE 任务。
METR 发布了一套针对 AI 智能体的能力激发(capability elicitation)评估指南,目标是在测试集上得到能代表模型完整能力的分数,而非直接使用未经增强的模型。
SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构,将视觉语言模型(VLM)的视觉编码与语言处理拆分为三层,使编码器服务器可独立横向扩展。
SGLang 推出高度优化的流水线并行(PP)实现,结合分块流水线并行、异步 P2P 通信与动态分块机制,专攻超长上下文推理。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1,分块预填充设为 12K 时预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高 30.5%,TTFT 最多降低 67.9%,强扩展效率 82.8%。
Novita AI 发布基于 SGLang 部署 GLM4-MoE 模型的端到端推理优化方案,TTFT 最高降低 65%,agentic coding 负载下 TPOT 提升 22%,结果在 H200 集群 TP8、FP8 配置下验证。
SGLang RL 团队联合 InfiXAI、蚂蚁 Asystem & AQ Infra、slime、RadixArk 团队,在 slime 框架上落地了 INT4 QAT 端到端流程,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性与稳定性。
千问 C 端基础设施工程团队与 AMD AI 框架团队基于 SGLang,在 AMD Instinct MI300X 系列 GPU 上对 Qwen3-235B 与 Qwen3-VL-235B 完成极致延迟优化。
SGLang-Diffusion 团队公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE 与多请求服务稳定性。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。
NVIDIA 与 SGLang 团队公布在 GB300 NVL72 上优化 DeepSeek R1-NVFP4 长上下文推理的进展,128K/8K 场景下 SGLang 达到 226.2 TPS/GPU,较 GB200 提升 1.53 倍。
SGLang 框架集成 Elastic EP,通过解耦专家与 GPU 的固定映射实现部分故障容错,DeepSeek V3.2 在 32 GPU、256 冗余专家配置下服务中断控制在 10 秒内,较完整重启的 2-3 分钟减少 90%。该方案静态性能与标准 DeepEP 持平,系统吞吐 3560.21 tokens/sec,由 Mooncake EP 提供容错通信层支持。
LMSYS 团队提出 HiSparse 分层内存系统,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,8×H200 部署下 256 并发请求吞吐达基线 3 倍以上,长上下文场景最高提升 5 倍。目前支持 DeepSeek-V3.2 与 GLM-5.1 等采用 DSA 的模型,属实验性功能。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,作为传统 NCCL broadcast 的补充,兼容所有主流开源模型。
AMD 与 SGLang 团队联合发布博客,展示基于 SGLang 和 MoRI 通信库的 DeepSeek-R1 分离式推理在 AMD Instinct MI355X 上实现有竞争力的 TCO,结果由 SemiAnalysis 的 InferenceX 基准平台验证。
Intel 与 SGLang 团队通过 Dynamo 和 SGLang 为视觉语言模型(VLM)实现异构 Encode-Prefill-Decode(EPD)分离,将视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案在 QPS 1-2 负载下带来约 1.2x-1.3x 的 P99 TTFT 和请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求智能体 RL 中每一轮的总 token 序列(prompt + response)必须是下一轮 prompt token 序列的逐位完美前缀,以保证训练与推理一致。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms,降幅 53%。
SGLang 为 DeepEP MoE 推理引入 Waterfill 和 LPLB 两项调度期负载均衡特性。
SGLang 团队发布博客,介绍将开发流程编码为可执行 skills 的初步探索,覆盖 CUDA 崩溃调试、基准测试、profiling、扩散模型接入和生产事故分诊。
SGLang 团队为 GLM-5.2 NVFP4 检查点优化推理,在 8xB300(bs=1)上实现超过 500 TPS,两周内完成。默认开启的 Spec V2 重叠调度带来 11% 端到端 TPS 提升,IndexShare MTP 让草稿步成本在长上下文下最多降低约 1.9 倍。
SGLang 提出基于 Scheme 的量化架构重构(issue #15194),将量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式与硬件后端可独立演进。
Miles 团队在 Miles 中实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8,以及面向 MoE 专家的 per-token NVFP4,覆盖 checkpoint 转换、Megatron 训练、SGLang rollout 与实时权重更新。
SGL-Diffusion 团队用 SRT 替换 HF 后端,将 AR 阶段从扩散 worker 中解耦为独立服务,使 AR 可单独配置 TP、DiT 保留 SP。
腾讯混元 AI Infra 与 SGLang 团队宣布,HPC-Ops 的 Attention、Router GEMM 和 MoE 算子已合入 SGLang 主分支。
SGLang 发布 Unified Radix Cache,用单一 token 基数树统一 full attention KV、滑动窗口 KV 与 Mamba 循环状态的复用边界,替代此前的缓存类矩阵。
SGLang 团队详解其 CUDA Graph 重构,将支持拆分为 runner/backend 两层,使不同捕获策略可跨执行路径复用。
LMSYS 博客给出 1.6 万亿参数 MoE 模型 DeepSeek-V4-Pro 在 H20 GPU 上的服务优化方案,单节点 H20-141GB 在 batch size 1 下达到 271 output tokens/s,与 B300 的 383.7 tokens/s 相比解码性能差距缩小至 1.42×。