跳到正文

#教程/实践

今日 6 条
今天10月1日周四
  1. Databricks:Blog(RSS)40

    Lakebase Postgres 成本优化实用指南

    Databricks 的 Lakebase Postgres 通过存储与计算分离架构实现成本优化:分支共享底层存储、自动扩缩容支持 scale to zero(数百毫秒恢复),关闭后按基线容量 25% 折扣计费。同步 Lakehouse 数据时建议只同步应用所需的活跃子集(如 60 天滚动窗口),并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式。

  2. NVIDIA AI33

    你的智能体得到了正确答案。它花了多少功夫才走到那一步? 我们与 @NousResearch/@Teknium 合作,带来一篇 NVIDIA NeMo Relay 的实操演练,为 Hermes Agent 收集追踪数据。运行两个示例场景,跟随智能体的调用与重试,并在 Arize Phoenix 中查看完整追踪。 博客还探讨了 Nous 如何利用追踪和任务结果,在重复运行中评估修复效果。 TechBlog: https://nvda.ws/47tKxjQ 📽️ 来自我们自家的 @Picomoorhead:

9月30日周三
  1. TensorZero:实验与工程博客32

    某大型银行如何用 LLM 与 TensorZero 自动化代码变更日志

    欧洲一家大型银行的 DevOps 工程师 Mark 借助开源平台 TensorZero 构建变更日志自动化系统,接入 GitLab merge request 与 CI/CD 流程,并用 Ollama 实现全自托管部署,数据不出内网。系统利用内置的动态上下文学习(DICL),将工程师对 AI 生成日志的修改自动用于优化后续推理,无需微调或标注数据集。

  2. TensorZero:实验与工程博客42

    从 NER 到智能体:自动化提示词工程能否扩展到复杂任务?

    TensorZero 团队测试了 MIPRO 自动化提示词优化方法在从命名实体识别(CoNLL++)、多跳检索(HoVer)到文本游戏导航(BabyAI)和智能体工具调用客服(τ-bench)等任务上的表现,探究其随任务复杂度提升的效果变化。MIPRO 通过贝叶斯优化器搜索指令与少样本示例,无需梯度或细粒度标签,团队用约 200 行代码重实现独立版本,指令生成使用 OpenAI 的 o1 模型。

  3. Suno:Blog(网页)55

    Suno 发布 Voices 使用指南,给出 6 条提升音色质量建议

    Suno 官方发布 Voices 功能的 6 条使用建议,帮助用户获得更高质量的声音效果。建议包括在安静环境录音、录音前练习、不必追求完美、尽量录制更长参考音频(至少一分钟)、根据曲风匹配声音,并尝试不同曲风。Voices 现已在 Web、iOS 和 Android 上线,可免费试用,付费方案提供更多功能。

  4. Suno:Blog(网页)17

    Suno 呼吁创作者发布作品:为什么该按下发布键

    Suno 产品经理 Katelynn Kyker 发文呼吁创作者把作品从私人曲库中发布出来,让平台上数百万听众听到。文章给出三个理由:触达数百万听众、通过真实听众反馈了解作品共鸣点、开放作品供社区 remix 并激发他人。作者强调发布不必等到作品完美,早期且持续发布的创作者成长最快。

  5. LMSYS:Blog(Chatbot Arena 团队)45

    SGLang 流水线并行(PP)实现:面向百万级 Token 上下文与超长序列推理

    SGLang 推出高度优化的流水线并行(PP)实现,结合分块流水线并行、异步 P2P 通信与动态分块机制,专攻超长上下文推理。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1,分块预填充设为 12K 时预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高 30.5%,TTFT 最多降低 67.9%,强扩展效率 82.8%。

  6. LMSYS:Blog(Chatbot Arena 团队)44

    SGLang 集成 Elastic EP:为 DeepSeek MoE 部署实现部分故障容错

    SGLang 框架集成 Elastic EP,通过解耦专家与 GPU 的固定映射实现部分故障容错,DeepSeek V3.2 在 32 GPU、256 冗余专家配置下服务中断控制在 10 秒内,较完整重启的 2-3 分钟减少 90%。该方案静态性能与标准 DeepEP 持平,系统吞吐 3560.21 tokens/sec,由 Mooncake EP 提供容错通信层支持。

  7. LMSYS:Blog(Chatbot Arena 团队)46

    HiSparse:用分层内存为稀疏注意力提速,GLM-5.1-FP8 长上下文吞吐最高提升 5 倍

    LMSYS 团队提出 HiSparse 分层内存系统,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,8×H200 部署下 256 并发请求吞吐达基线 3 倍以上,长上下文场景最高提升 5 倍。目前支持 DeepSeek-V3.2 与 GLM-5.1 等采用 DSA 的模型,属实验性功能。

  8. LMSYS:Blog(Chatbot Arena 团队)71

    SGLang 与 Miles 为 Kimi K3 提供 Day-0 推理与 RL 训练支持

    SGLang 团队与 Miles 宣布在发布当天支持 Moonshot AI 的 Kimi K3,覆盖 SGLang 推理和 Miles RL 训练。K3 是首个 3 万亿参数级的开源模型,2.8T 参数、1M token 上下文,采用 69 层 KDA 线性注意力加 24 层 MLA 的混合架构及 LatentMoE 和 Attention Residuals。

    推荐理由:K3 的混合架构打破了多数推理框架的既有假设,文中给出的内存管理、投机解码与并行方案对同类服务栈有直接参考价值。