推荐理由:上线方直接给出参数结构、上下文窗口、KV cache 对比和许可证信息,读者可据此评估实际部署选型。
#DeepSeek
#DeepSeek
今日 0 条
SiliconFlow@SiliconFlowAI精选AI 评分7070
vLLM 官方博客(RSS)精选AI 评分6565 vLLM 联合 AgentX 优化真实智能体推理服务,成本较 Opus 5 API 最多低 106×
vLLM 团队发布针对智能体负载的全栈优化方案,覆盖 KV 缓存管理、并行策略与 P/D 分离配比,并在 SemiAnalysis AgentX 公开基准上验证。
推荐理由:原文给出 vLLM 针对 AgentX 基准的全栈优化路径与可复现结果,读者可以借此理解智能体负载的服务优化思路。
DeepSeek@deepseek_aiAI 评分6363
Together AI 研究与产品博客(RSS)精选AI 评分7171 DeepSeek V4 Pro 0813 对比 Claude Fable 5:DeepSWE 上的成本、编码与路由实测
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。
vLLM 官方博客(RSS)AI 评分4343 vLLM 推出 DSpark 自适应验证:按置信度调度投机解码预算
vLLM 在 PR #47808 中引入 DSpark 置信度调度验证(enable_adaptive_verification),让引擎逐步决定验证多少 draft token,而非按部署固定 num_speculative_tokens。
DeepSeek@deepseek_ai精选AI 评分7373推荐理由:原文给出 Harness 的插件化架构设计和 MIT 开源仓库入口,开发者可据此评估是否接入自己的 Agent 开发流程。
vLLM 官方博客(RSS)AI 评分4242 vLLM 发布 AFD 插件:为 MoE 推理拆分 Attention 与 FFN
vLLM 推出实验性外部插件 vLLM AFD Plugin,将 MoE 模型中的 Attention 与 FFN 拆分为可独立部署和扩缩的服务,同时保留 vLLM 原有请求生命周期与 OpenAI 兼容接口。
DeepSeek@deepseek_aiAI 评分4545我们将把折扣永久化!🎉 尽情用 DeepSeek-V4-Pro 构建,让你的创新想法成为现实!🚀
引用DeepSeek@deepseek_aiThe DeepSeek-V4-Pro discount has been extended until May 31, 2026, 15:59 UTC!
Together AI 研究与产品博客(RSS)精选AI 评分6868 Together AI 解析 DeepSeek-V4 服务化:百万 token 上下文为何是推理系统工程问题
Together AI 发文解析 DeepSeek-V4 的服务化挑战,认为其核心变化是在 token 轴压缩 KV cache 的混合注意力设计(CSA、HCA、SWA),使模型支持 1M token 上下文窗口。
推荐理由:原文基于 Together 在 HGX B200 上的实际 bring-up,给出 KV cache 布局和缓存策略如何决定 DeepSeek-V4 长上下文吞吐的具体经验。
DeepSeek@deepseek_aiAI 评分3636DeepSeek-V4-Pro 折扣已延长至 2026 年 5 月 31 日 15:59 UTC!
引用DeepSeek@deepseek_ai🔥DeepSeek-V4-Pro API is 75% OFF until May 5th, 2026, 15:59 (UTC Time)! Don't miss out on this massive discount. 🛠️Integration Updates: 🔹Claude Code: Set model to deepseek-v4-pro[1m] to unlock 1M context! 🔹OpenCode: Update to v1.14.24+ 🔹OpenClaw: Update to v2026.4.24+ Check the latest official API docs for full details: https://api-docs.deepseek.com/quick_start/pricing
Together AI 研究与产品博客(RSS)精选AI 评分7474 DeepSeek-V4 Pro 上线 Together AI,Serverless 支持 512K 上下文
Together AI 宣布 DeepSeek-V4 Pro 上线,提供 Serverless Inference(512K 上下文)与 Dedicated 部署(完整 1M 上下文、预留容量)。
推荐理由:原文给出部署形态、定价与基准数字,读者可以据此评估在 512K 上下文上运行 DeepSeek-V4 Pro 的实际成本与路径。
DeepSeek@deepseek_ai精选AI 评分6666推荐理由:官方公布 API 缓存命中输入价格降至原价十分之一,并给出各型号具体单价,可据此估算构建成本变化。
Together AI 研究与产品博客(RSS)AI 评分4545 Together AI 用分布感知推测解码将 RL rollout 加速最高 50%
Together AI 提出分布感知推测解码(DAS),在 RL 后训练中最高减少 50% 的 rollout 时间且不改变模型输出。DAS 由自适应后缀树草稿器和长度感知调度两部分组成,前者无需梯度更新即可持续适配策略变化,后者通过跨 GPU 负载均衡与 GPU 内推测预算分配削减长尾请求。