跳到正文

#DeepSeek

今日 4 条
8月17日周一
8月14日周五
8月13日周四
8月2日周日
7月31日周五
7月23日周四
7月22日周三
  1. Nathan Lambert:Interconnects(RSS)63

    Nathan Lambert 播客复盘 Kimi K3 与开源模型生态,反驳蒸馏争议

    Nathan Lambert 与 Florian Brand 在季度开源模型总结播客中讨论 Kimi K3 发布后的开源模型格局,称 Kimi K3 在研究类任务上超出预期,但 API 拥堵导致响应明显慢于 GPT。

    推荐理由:Lambert 结合上手实测与行业一手观察,拆解开源模型与闭源前沿的差距、蒸馏争议和安全依赖问题,判断较有信息量。

7月20日周一
7月18日周六
6月30日周二
  1. Xiaomi MiMo62

    小米 MiMo 官方账号转发 Cline 的消息,称开源权重模型正在普及,更多开发者在基于 MiMo 构建。Cline 表示因看好 GLM-5.2,推出 $9.99/月订阅,提供 GLM-5.2 及 DeepSeek、Kimi、MiniMax、MiMo、Qwen 等开源权重模型 2-5x 折扣访问,并给出经 npm i -g cline 注册可享 $1.99 促销的活动入口,可在 Cline CLI 与 IDE 上使用。

    引用Cline@cline

    We’ve been impressed with GLM-5.2 and so are introducing a $9.99/month subscription to give you 2-5x discounted access to it and other open weight models like DeepSeek, Kimi, MiniMax, Mimo, Qwen. Use it on Cline CLI & IDE with $1.99 special promo if sign up via: npm i -g cline

6月26日周五
5月28日周四
5月23日周六
5月16日周六
5月11日周一
  1. Together AI 研究与产品博客(RSS)68

    Together AI 解析 DeepSeek-V4 服务化:百万 token 上下文为何是推理系统工程问题

    Together AI 发文解析 DeepSeek-V4 的服务化挑战,认为其核心变化是在 token 轴压缩 KV cache 的混合注意力设计(CSA、HCA、SWA),使模型支持 1M token 上下文窗口。

    推荐理由:原文基于 Together 在 HGX B200 上的实际 bring-up,给出 KV cache 布局和缓存策略如何决定 DeepSeek-V4 长上下文吞吐的具体经验。

4月29日周三
  1. DeepSeek36

    DeepSeek-V4-Pro 折扣已延长至 2026 年 5 月 31 日 15:59 UTC!

    引用DeepSeek@deepseek_ai

    🔥DeepSeek-V4-Pro API is 75% OFF until May 5th, 2026, 15:59 (UTC Time)! Don't miss out on this massive discount. 🛠️Integration Updates: 🔹Claude Code: Set model to deepseek-v4-pro[1m] to unlock 1M context! 🔹OpenCode: Update to v1.14.24+ 🔹OpenClaw: Update to v2026.4.24+ Check the latest official API docs for full details: https://api-docs.deepseek.com/quick_start/pricing

4月27日周一
  1. DeepSeek66

    DeepSeek 宣布即刻起整个 API 系列的输入缓存命中价格降至原价的 1/10。图中显示 DeepSeek-V4-Pro 缓存命中输入价为 $0.003625,DeepSeek-V4-Flash 为 $0.0028;DeepSeek-V4-Pro 75% 折扣促销持续至 2026 年 5 月 5 日 15:59(UTC)。

    推荐理由:官方公布 API 缓存命中输入价格降至原价十分之一,并给出各型号具体单价,可据此估算构建成本变化。

4月24日周五
  1. Together AI 研究与产品博客(RSS)45

    Together AI 用分布感知推测解码将 RL rollout 加速最高 50%

    Together AI 提出分布感知推测解码(DAS),在 RL 后训练中最高减少 50% 的 rollout 时间且不改变模型输出。DAS 由自适应后缀树草稿器和长度感知调度两部分组成,前者无需梯度更新即可持续适配策略变化,后者通过跨 GPU 负载均衡与 GPU 内推测预算分配削减长尾请求。

4月22日周三
2月25日周三
1月12日周一
12月30日周二
12月3日周三
11月19日周三
11月4日周二
10月17日周五
5月1日周四
2月27日周四
2月26日周三
2月24日周一
2月21日周五
2月17日周一
2月13日周四
1月20日周一
12月26日周四