跳到正文

#部署/工程

今日 34 条
9月30日周三
  1. LMSYS:Blog(Chatbot Arena 团队)65

    SGLang 与 Miles 为 Thinking Machines Lab 的 Inkling 提供Day-0支持

    SGLang 团队与 Thinking Machines Lab 合作,为 975B 参数、1M 上下文的多模态模型 Inkling 提供Day-0推理与 RL 支持,并为 Modal 训练的 DFlash 草稿模型提供投机解码。

    推荐理由:原文出自 SGLang 团队,给出针对 Inkling 新架构的具体优化手段和实测吞吐数字,读者可评估其对自建推理或 RL 流程的参考价值。

  2. LMSYS:Blog(Chatbot Arena 团队)71

    SGLang 与 Miles 为 Kimi K3 提供 Day-0 推理与 RL 训练支持

    SGLang 团队与 Miles 宣布在发布当天支持 Moonshot AI 的 Kimi K3,覆盖 SGLang 推理和 Miles RL 训练。K3 是首个 3 万亿参数级的开源模型,2.8T 参数、1M token 上下文,采用 69 层 KDA 线性注意力加 24 层 MLA 的混合架构及 LatentMoE 和 Attention Residuals。

    推荐理由:K3 的混合架构打破了多数推理框架的既有假设,文中给出的内存管理、投机解码与并行方案对同类服务栈有直接参考价值。

  3. LMSYS:Blog(Chatbot Arena 团队)67

    SGLang 为 Meta 30B 多模态模型 Muse Glimmer 提供 Day-0 支持

    SGLang 团队与 Meta Superintelligence Labs 合作,为 30B 参数多模态稠密模型 Muse Glimmer 提供 Day-0 支持,面向本地硬件上的智能体工作流推理。

    推荐理由:原文给出 Muse Glimmer 在 SGLang 上的多硬件部署方案和分平台实测数据,读者可据此评估本地智能体推理的可行配置。

  4. LMSYS:Blog(Chatbot Arena 团队)63

    SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持

    SGLang 团队宣布与 Qwen、阿里百炼、NVIDIA 和 AMD 合作,在 SGLang 和 Miles 中于发布当日支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B。

    推荐理由:原文给出 Qwen3.8 混合注意力架构的推理支撑细节和实测性能数字,读者可据此评估新模型在自建推理栈上的部署可行性。

  5. LlamaIndex:产品、工程与评测36

    如何从 PDF 中提取表格:用 LlamaParse 大规模构建结构化、可验证的数据

    LlamaParse 面向 PDF 表格提取,解决 PDF 只存字符坐标、不存行列结构的问题,需从空间布局推断行列关系。文章指出扁平文本提取、模板规则系统和单纯 OCR 都会在生产文档上失效,因为无边框表格、跨页表头、合并单元格、嵌套表格和扫描件会破坏简单假设。

  6. LlamaIndex:产品、工程与评测34

    收入验证 API 如何自动化大规模文档收入核查

    收入验证 API 通过数据采集、验证与决策支持三步流程,将工资单、税表、银行流水等文档转为结构化收入记录。文章对比了 payroll API(Argyle、Pinwheel)、开放银行数据、人工审核与文档提取 API(LlamaParse)四类方案,指出 payroll API 对自雇、零工及小雇主覆盖不足,文档提取可覆盖任意收入类型但需下游结构化逻辑,混合方案覆盖更广但集成更复杂。

  7. Liquid AI 模型与工程博客(网页)30

    Liquid AI 发布五套 LFM 本地部署方案演示

    Liquid AI 展示五套基于 LFM 的可运行系统,每套将微调后的 Liquid 模型部署在手机、边缘 GPU 或用户自控 VPC 中,支持断网运行。模型覆盖文本、视觉与音频,量化与推理引擎按目标硬件联合选型并在用户实际硬件上做性能剖析。训练在单张 GPU 上数小时完成,并以留出集评分。