DeepSeek 开源 EPBL:专家并行负载均衡器
DeepSeek 在 GitHub 发布新仓库 EPLB(Expert Parallelism Load Balancer),用于专家并行场景下的负载均衡。该工具面向 MoE 架构中专家并行带来的负载不均问题,目前仓库仅提供项目名称与简介,具体功能与用法尚未披露。
DeepSeek 在 GitHub 发布新仓库 EPLB(Expert Parallelism Load Balancer),用于专家并行场景下的负载均衡。该工具面向 MoE 架构中专家并行带来的负载不均问题,目前仓库仅提供项目名称与简介,具体功能与用法尚未披露。
DeepSeek 在 GitHub 发布 FlashMLA 仓库,提供高效的 Multi-head Latent Attention(MLA)内核,地址为 https://github.com/deepseek-ai/FlashMLA。本次材料仅含仓库简介,未提供更多性能或使用细节。
DeepSeek 在 GitHub 发布新仓库 deepseek-ai/open-infra-index,定位为经过生产验证的 AI 基础设施工具集合,用于高效 AGI 开发和社区驱动的创新。
DeepSeek 在 GitHub 开源 DeepEP,一个高效的 expert-parallel(专家并行)通信库,仓库地址为 https://github.com/deepseek-ai/DeepEP。
DeepSeek 在 GitHub 开源了 GPU BLAS 内核库 DeepGEMM,主打简洁与高效。该库以 clean and efficient 为设计目标,面向 GPU 上的 BLAS 运算场景。
安全研究人员 Johann Rehberger 演示,通过在文档中嵌入提示注入并配合延迟工具调用,可诱导 Gemini Advanced 把虚假信息写入用户长期记忆。
Answer.AI 发布开源库 MonsterUI,在 FastHTML 之上提供预样式组件和智能默认值,让开发者用纯 Python 构建现代网页 UI,无需手写 CSS 或维护类名字符串。
Lilian Weng 发布长文综述大型 Transformer 模型推理优化的主要方法,指出 KV cache 内存占用和注意力随序列长度二次增长的推理瓶颈。文章覆盖知识蒸馏、量化(PTQ/QAT、LLM.int8()、GPTQ、SmoothQuant)、结构化剪枝与 N:M 稀疏、MoE 路由改进以及高效注意力架构等方向,并给出 DistilBERT 等具体效果数据。
Lilian Weng 在博客中系统讲解在多 GPU 上训练超大模型的方法,覆盖数据并行、模型并行、流水线并行、张量并行和 MoE 等并行范式。文章结合 GPipe、PipeDream、Megatron-LM、GShard、Switch Transformer 等工作分析流水线气泡、门控路由设计,并介绍激活重计算、混合精度训练和 ZeRO 等节省显存的方法。