跳到正文

全部动态

今日 679 条
9月30日周三
  1. LMSYS:Blog(Chatbot Arena 团队)45

    SGLang 流水线并行(PP)实现:面向百万级 Token 上下文与超长序列推理

    SGLang 推出高度优化的流水线并行(PP)实现,结合分块流水线并行、异步 P2P 通信与动态分块机制,专攻超长上下文推理。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1,分块预填充设为 12K 时预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高 30.5%,TTFT 最多降低 67.9%,强扩展效率 82.8%。

  2. METR:Research(网页)66

    METR 将重新设计开发者生产力实验,因 AI 选择效应致新数据不可靠

    METR 宣布重新设计其开发者生产力实验,认为 2025 年 8 月启动的二次研究中因开发者拒绝无 AI 工作而出现选择效应,使数据无法可靠反映 AI 工具的生产力影响。

    推荐理由:原文解释了为何 AI 更广泛采用带来的选择效应使其实验结果不可靠,并给出初步数据与后续研究设计思路。

  3. LMSYS:Blog(Chatbot Arena 团队)63

    SGLang-Diffusion 发布两个月:速度较初版提升至 2.5 倍,新增 ComfyUI 集成与 LoRA 支持

    LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。

    推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。

  4. METR:Research(网页)70

    METR 发布前沿 AI 风险试点评估报告,Anthropic、Google、Meta 和 OpenAI 参与

    METR 自 2026 年 2 月起开展试点评估,测试前沿 AI 开发商内部使用的 Agent 的错位风险,Anthropic、Google、Meta 和 OpenAI 参与。

    推荐理由:报告给出多家前沿实验室参与的真实评估结果,读者可以据此了解当前模型在开放式任务和红队测试中的实际能力边界。

  5. METR:Notes(网页)68

    METR 分析 LLM 是否加速了漏洞、数学与算法发现

    METR 研究人员检视漏洞、数学和算法发现的公开时间序列,判断 LLM 是否加速了整体发现率。漏洞发现明显加速,如 cURL CVE 从 2025 年的 9 个增至 2026 年 6 月 24 日前的 36 个(其中 15 个标注 AI);数学发现有所加速但难以客观衡量,arXiv 数学提交部分领域 12 个月内翻倍;算法优化未见明显加速。

    推荐理由:原文汇总多个公开时间序列,比较 AI 对不同领域发现速度的影响,提供了可核查的数据和方法。

  6. LMSYS:Blog(Chatbot Arena 团队)44

    SGLang 集成 Elastic EP:为 DeepSeek MoE 部署实现部分故障容错

    SGLang 框架集成 Elastic EP,通过解耦专家与 GPU 的固定映射实现部分故障容错,DeepSeek V3.2 在 32 GPU、256 冗余专家配置下服务中断控制在 10 秒内,较完整重启的 2-3 分钟减少 90%。该方案静态性能与标准 DeepEP 持平,系统吞吐 3560.21 tokens/sec,由 Mooncake EP 提供容错通信层支持。

  7. LMSYS:Blog(Chatbot Arena 团队)46

    HiSparse:用分层内存为稀疏注意力提速,GLM-5.1-FP8 长上下文吞吐最高提升 5 倍

    LMSYS 团队提出 HiSparse 分层内存系统,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,8×H200 部署下 256 并发请求吞吐达基线 3 倍以上,长上下文场景最高提升 5 倍。目前支持 DeepSeek-V3.2 与 GLM-5.1 等采用 DSA 的模型,属实验性功能。

  8. LMSYS:Blog(Chatbot Arena 团队)68

    SGLang 与 Miles 发布对 DeepSeek-V4 的 Day-0 推理与 RL 训练支持

    LMSYS 的 SGLang 与 Miles 团队宣布对 DeepSeek-V4(1.6T Pro、284B Flash)提供 Day-0 推理和 RL 训练支持,是首个在发布日同时服务与训练该模型的开源栈。

    推荐理由:LMSYS 团队详述了为 DeepSeek-V4 混合稀疏注意力等新架构所做的推理与 RL 训练优化,附基准数据。

  9. LMSYS:Blog(Chatbot Arena 团队)72

    SGLang 和 Miles 实现 NVIDIA Nemotron 3 Ultra Day-0 支持

    SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。

    推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。

  10. LMSYS:Blog(Chatbot Arena 团队)26

    LMSYS 公布 2026 博士奖学金首位获得者 Will Lin

    LMSYS 宣布 2026 博士奖学金首位获得者为 Will Lin,表彰其对开源 AI 基础设施的持续贡献,奖学金最高 5 万美元用于学费。Will Lin 是 UC San Diego 六年级博士生,主导开源扩散生成框架 FastVideo,该项目已获 3.7k+ GitHub stars,并被 NVIDIA Dynamo 集成为后端。