Prime Intellect 发布 SYNTHETIC-2:行星尺度流水线并行推理生成开源推理数据集
Prime Intellect 发布 SYNTHETIC-2,一个基于 DeepSeek-R1-0528 的开源推理数据集,配合全球分布的流水线并行推理运行,支持从消费级 GPU 到 NVIDIA 和 AMD 集群的异构算力贡献。
Prime Intellect 发布 SYNTHETIC-2,一个基于 DeepSeek-R1-0528 的开源推理数据集,配合全球分布的流水线并行推理运行,支持从消费级 GPU 到 NVIDIA 和 AMD 集群的异构算力贡献。
Fireworks AI 用 CyberGym 测评 DeepSeek V4 Pro 0813、Kimi K3、GPT-5.5 和 Claude Opus 4.8,V4 Pro 在 840 个对抗性安全任务中零拒绝、全部产生原生工具调用,进入验证率 97.3%。
Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。
推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。
Fireworks 上线 DeepSeek-V4.1-Flash,在 DeepSWE 上以 74.34% 的 Pass@1 达到 GPT-6 Astra 水平,每任务成本 $0.43,约为 Astra 的 1/15。
推荐理由:原文给出 DeepSWE、Terminal-Bench 2.1 和 HLE 的具体成本与准确率数据,可帮助开发者评估智能体编码工作流的模型选型。
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 家族首个实验性多模态模型,在 DeepSeek-V4-Flash 架构上加入视觉模块并继续训练以获得视觉理解能力。
Baseten Base Labs 模型研究页面展示了 DeepSeek V3.1(模型标识 deepseek-ai/DeepSeek-V3-1-0819)的一次文本补全调用,输入 14 个 prompt token,输出 226 个 completion token,共 240 token,内容为 FizzBuzz 编程题解答,finish_reason 为 stop。
Baseten Base Labs 模型研究页面出现名为 DeepSeek V4 Pro 的条目,但正文仅有一段 chat.completion 格式的 API 返回示例,model 字段为空,未披露任何模型参数、benchmark 分数或可用性信息。
Baseten 上线 DeepSeek V4 Pro 0813,一个 1.7T 参数的前沿开放权重模型。它可与较小的 V4 Flash 0731 搭配用于 coding agent,由 Pro 驱动主 agent、Flash 运行子 agent,使整个编码栈跑在开放权重模型上。
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,prefill 激活 8B、解码激活 16B,支持 1M token 上下文,采用 Causal Encoder-Decoder 架构与 Compressed Sparse Attention 2。
DeepSeek 在 GitHub 开源 DeepGEMM-Ascend,一个面向华为昇腾 NPU 的简洁高效矩阵乘法算子库。该仓库定位为 Ascend NPU 上的 GEMM 内核实现,延续 DeepGEMM 的轻量高效路线。
推荐理由:上线方直接给出参数结构、上下文窗口、KV cache 对比和许可证信息,读者可据此评估实际部署选型。
DeepSeek 在 GitHub 新仓库 deepseek-ai/DeepSelect 中开源了 DeepSelect,提供面向 DeepSeek Sparse Attention(DSA)的 TopK kernel 以及采样器(Samplers)。仓库目前仅给出这一功能定位,未披露参数规模、性能数据或具体可用方式。
DeepSeek 在 GitHub 新建仓库 DeepJIT,定位为面向 xPU 内核 JIT 编译的轻量级库。该仓库目前仅给出这一句功能描述,未披露支持的硬件型号、API 细节或开源许可等信息。
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。
本期开源模型汇总收录多批新发布,包括 Thinking Machines 首个模型 Inkling(975B-A41B 多模态 MoE,另有 276B-A12B 版)。
DeepSeek 在 GitHub 发布 DeepSpec,一个用于训练和评测投机解码(speculative decoding)算法的全栈代码库。该仓库同时覆盖算法训练与效果评测两个环节,面向投机解码这一推理加速方向提供完整实现。
我们将把折扣永久化!🎉 尽情用 DeepSeek-V4-Pro 构建,让你的创新想法成为现实!🚀
The DeepSeek-V4-Pro discount has been extended until May 31, 2026, 15:59 UTC!
DeepSeek 在 GitHub 新建仓库 TileKernels,这是一个用 TileLang 编写的内核(kernel)库。仓库目前仅给出这一句说明,未披露支持的算子范围、性能数据或开源许可等细节。
Sebastian Raschka 按时间顺序梳理 2026 年 1-2 月的十个主要开源权重模型发布,包括 Arcee Trinity Large 400B。
推荐理由:作者以架构对比视角梳理近两个月主要开源权重模型发布,读者可以借此看清各家的注意力机制和效率设计选择。
Sebastian Raschka 在 Ahead of AI 发表长文,解读 DeepSeek V3.2 相比 V3/R1 的主要变化。
DeepSeek 在 GitHub 发布 LPLB,一个基于线性规划、面向 MoE 模型的专家并行负载均衡器,目前处于早期研究阶段。该仓库未披露参数规模、性能数据或具体可用形式。
DeepSeek 在 GitHub 开源 DeepSeek-OCR 仓库(https://github.com/deepseek-ai/DeepSeek-OCR),核心思路为 Contexts Optical Compression(上下文光学压缩)。
DeepSeek 在 GitHub 发布新仓库 EPLB(Expert Parallelism Load Balancer),用于专家并行场景下的负载均衡。该工具面向 MoE 架构中专家并行带来的负载不均问题,目前仓库仅提供项目名称与简介,具体功能与用法尚未披露。
DeepSeek 在 GitHub 新建 profile-data 仓库,用于分析 V3/R1 的计算通信重叠。该仓库聚焦计算与通信过程的 overlap 分析,目前仅给出这一句说明,未披露具体方法、数据或工具细节。
DeepSeek 在 GitHub 开源了轻量数据处理框架 smallpond,构建于 DuckDB 和 3FS 之上。该框架定位为轻量级数据处理方案,目前仓库未披露更多参数与性能细节。
DeepSeek 在 GitHub 发布 FlashMLA 仓库,提供高效的 Multi-head Latent Attention(MLA)内核,地址为 https://github.com/deepseek-ai/FlashMLA。本次材料仅含仓库简介,未提供更多性能或使用细节。
DeepSeek 在 GitHub 开源 DeepEP,一个高效的 expert-parallel(专家并行)通信库,仓库地址为 https://github.com/deepseek-ai/DeepEP。
DeepSeek 在 GitHub 开源了 GPU BLAS 内核库 DeepGEMM,主打简洁与高效。该库以 clean and efficient 为设计目标,面向 GPU 上的 BLAS 运算场景。
deepseek-ai 在 GitHub 发布新仓库 DeepSeek-R1,链接为 https://github.com/deepseek-ai/DeepSeek-R1。仓库正文无更多描述信息。
DeepSeek 在 GitHub 发布 DeepSeek-V3 模型仓库 deepseek-ai/DeepSeek-V3,仓库正文未提供更多细节。