DeepSeek V4 Pro 0813 对比 Claude Fable 5:DeepSWE 上的成本、编码与路由实测
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。
vLLM 在 PR #47808 中引入 DSpark 置信度调度验证(enable_adaptive_verification),让引擎逐步决定验证多少 draft token,而非按部署固定 num_speculative_tokens。
推荐理由:原文给出 Harness 的插件化架构设计和 MIT 开源仓库入口,开发者可据此评估是否接入自己的 Agent 开发流程。
DeepSeek 在 GitHub 新建 deepseek-harness 仓库,核心理念是"一切皆插件"。该仓库以插件化架构组织功能,具体能力与可用性尚未在现有信息中披露。
本期开源模型汇总收录多批新发布,包括 Thinking Machines 首个模型 Inkling(975B-A41B 多模态 MoE,另有 276B-A12B 版)。
vLLM 推出实验性外部插件 vLLM AFD Plugin,将 MoE 模型中的 Attention 与 FFN 拆分为可独立部署和扩缩的服务,同时保留 vLLM 原有请求生命周期与 OpenAI 兼容接口。
Nathan Lambert 与 Florian Brand 在季度开源模型总结播客中讨论 Kimi K3 发布后的开源模型格局,称 Kimi K3 在研究类任务上超出预期,但 API 拥堵导致响应明显慢于 GPT。
推荐理由:Lambert 结合上手实测与行业一手观察,拆解开源模型与闭源前沿的差距、蒸馏争议和安全依赖问题,判断较有信息量。
Import AI 465 期综述多项 AI 动态。英国 AI Security Institute 分析显示,GLM-5.2 和 DeepSeek V4-Pro 在 70 项网络能力评测上接近比其早 4 到 7 个月发布的闭源前沿模型,差距较 2025 年的 6 到 10 个月收窄,但在长程网络任务上差距更大。
Sebastian Raschka 撰文讲解推理模型如何支持多档推理力度(reasoning effort)设置。
We’ve been impressed with GLM-5.2 and so are introducing a $9.99/month subscription to give you 2-5x discounted access to it and other open weight models like DeepSeek, Kimi, MiniMax, Mimo, Qwen. Use it on Cline CLI & IDE with $1.99 special promo if sign up via: npm i -g cline
DeepSeek 在 GitHub 发布 DeepSpec,一个用于训练和评测投机解码(speculative decoding)算法的全栈代码库。该仓库同时覆盖算法训练与效果评测两个环节,面向投机解码这一推理加速方向提供完整实现。
DeepSeek 在 GitHub 新建仓库 clangd-ascend,为昇腾(Ascend)平台提供基于 clangd 的代码检查与代码补全能力。该仓库定位为 Clangd for Ascend,用于 Code Lint 与 Code Completion。
我们将把折扣永久化!🎉 尽情用 DeepSeek-V4-Pro 构建,让你的创新想法成为现实!🚀
The DeepSeek-V4-Pro discount has been extended until May 31, 2026, 15:59 UTC!
Sebastian Raschka 梳理 2026 年 4 至 5 月主要开源权重 LLM 的架构变化,核心主题是长上下文效率。
Together AI 发文解析 DeepSeek-V4 的服务化挑战,认为其核心变化是在 token 轴压缩 KV cache 的混合注意力设计(CSA、HCA、SWA),使模型支持 1M token 上下文窗口。
推荐理由:原文基于 Together 在 HGX B200 上的实际 bring-up,给出 KV cache 布局和缓存策略如何决定 DeepSeek-V4 长上下文吞吐的具体经验。
DeepSeek-V4-Pro 折扣已延长至 2026 年 5 月 31 日 15:59 UTC!
🔥DeepSeek-V4-Pro API is 75% OFF until May 5th, 2026, 15:59 (UTC Time)! Don't miss out on this massive discount. 🛠️Integration Updates: 🔹Claude Code: Set model to deepseek-v4-pro[1m] to unlock 1M context! 🔹OpenCode: Update to v1.14.24+ 🔹OpenClaw: Update to v2026.4.24+ Check the latest official API docs for full details: https://api-docs.deepseek.com/quick_start/pricing
Together AI 宣布 DeepSeek-V4 Pro 上线,提供 Serverless Inference(512K 上下文)与 Dedicated 部署(完整 1M 上下文、预留容量)。
推荐理由:原文给出部署形态、定价与基准数字,读者可以据此评估在 512K 上下文上运行 DeepSeek-V4 Pro 的实际成本与路径。
推荐理由:官方公布 API 缓存命中输入价格降至原价十分之一,并给出各型号具体单价,可据此估算构建成本变化。
Together AI 提出分布感知推测解码(DAS),在 RL 后训练中最高减少 50% 的 rollout 时间且不改变模型输出。DAS 由自适应后缀树草稿器和长度感知调度两部分组成,前者无需梯度更新即可持续适配策略变化,后者通过跨 GPU 负载均衡与 GPU 内推测预算分配削减长尾请求。
DeepSeek 在 GitHub 新建仓库 TileKernels,这是一个用 TileLang 编写的内核(kernel)库。仓库目前仅给出这一句说明,未披露支持的算子范围、性能数据或开源许可等细节。
Sebastian Raschka 按时间顺序梳理 2026 年 1-2 月的十个主要开源权重模型发布,包括 Arcee Trinity Large 400B。
推荐理由:作者以架构对比视角梳理近两个月主要开源权重模型发布,读者可以借此看清各家的注意力机制和效率设计选择。
DeepSeek 在 GitHub 新仓库 Engram 中提出「条件记忆」——通过可扩展查找为大型语言模型开辟稀疏性的新维度。该工作将记忆与稀疏激活结合,作为独立于 MoE 的稀疏轴。
Sebastian Raschka 发布 2025 年 LLM 年度回顾,认为这一年由 RLVR 与 GRPO 驱动的推理模型主导,DeepSeek R1 展示了强化学习可培养推理行为且后训练成本远低于预期(约 500 万美元量级,另有在 V3 基础上训练 R1 约 $294,000 的估计)。
Sebastian Raschka 在 Ahead of AI 发表长文,解读 DeepSeek V3.2 相比 V3/R1 的主要变化。
DeepSeek 在 GitHub 发布 LPLB,一个基于线性规划、面向 MoE 模型的专家并行负载均衡器,目前处于早期研究阶段。该仓库未披露参数规模、性能数据或具体可用形式。
Sebastian Raschka 系统介绍当前标准自回归 Transformer LLM 之外的四类替代方向:线性注意力混合、文本扩散模型、代码世界模型和小型递归 Transformer。
DeepSeek 在 GitHub 开源 DeepSeek-OCR 仓库(https://github.com/deepseek-ai/DeepSeek-OCR),核心思路为 Contexts Optical Compression(上下文光学压缩)。
Lilian Weng 发布长文《Why We Think》,综述测试时计算与思维链推理的研究进展。文章覆盖并行采样与顺序修订等解码方法、DeepSeek-R1 等强化学习训练范式、CoT 忠实性与 reward hacking 风险,以及测试时计算与预训练缩放的互换边界。
DeepSeek 在 GitHub 开源 3FS,一个高性能分布式文件系统,专为应对 AI 训练和推理工作负载的挑战而设计。
DeepSeek 在 GitHub 开源双向流水线并行算法 DualPipe,用于 DeepSeek V3/R1 训练中的计算与通信重叠。该算法通过双向流水线调度实现计算与通信的 overlap,仓库路径为 deepseek-ai/DualPipe。
DeepSeek 在 GitHub 发布新仓库 EPLB(Expert Parallelism Load Balancer),用于专家并行场景下的负载均衡。该工具面向 MoE 架构中专家并行带来的负载不均问题,目前仓库仅提供项目名称与简介,具体功能与用法尚未披露。
DeepSeek 在 GitHub 新建 profile-data 仓库,用于分析 V3/R1 的计算通信重叠。该仓库聚焦计算与通信过程的 overlap 分析,目前仅给出这一句说明,未披露具体方法、数据或工具细节。
DeepSeek 在 GitHub 开源了轻量数据处理框架 smallpond,构建于 DuckDB 和 3FS 之上。该框架定位为轻量级数据处理方案,目前仓库未披露更多参数与性能细节。
DeepSeek 在 GitHub 发布 FlashMLA 仓库,提供高效的 Multi-head Latent Attention(MLA)内核,地址为 https://github.com/deepseek-ai/FlashMLA。本次材料仅含仓库简介,未提供更多性能或使用细节。
DeepSeek 在 GitHub 发布新仓库 deepseek-ai/open-infra-index,定位为经过生产验证的 AI 基础设施工具集合,用于高效 AGI 开发和社区驱动的创新。
DeepSeek 在 GitHub 开源 DeepEP,一个高效的 expert-parallel(专家并行)通信库,仓库地址为 https://github.com/deepseek-ai/DeepEP。
DeepSeek 在 GitHub 开源了 GPU BLAS 内核库 DeepGEMM,主打简洁与高效。该库以 clean and efficient 为设计目标,面向 GPU 上的 BLAS 运算场景。
deepseek-ai 在 GitHub 发布新仓库 DeepSeek-R1,链接为 https://github.com/deepseek-ai/DeepSeek-R1。仓库正文无更多描述信息。
DeepSeek 在 GitHub 发布 DeepSeek-V3 模型仓库 deepseek-ai/DeepSeek-V3,仓库正文未提供更多细节。