跳到正文

#模型发布

今日 9 条
8月27日周四
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)65

    阿里发布 Qwen3.8-Flash-Next 权重,预览 Qwen4 架构

    阿里巴巴发布 Qwen3.8-Flash-Next 模型权重,作为即将到来的 Qwen4 架构的预览,供开发者实验和评估。该模型是多模态混合专家(MoE)模型,主模型 125B 参数,附加 51B N-gram embeddings,每 token 激活 6B 参数;原生上下文窗口 262,144 token,可扩展至 1M token。

8月26日周三
8月25日周二
  1. Hugging Face:Blog(RSS)66

    IBM 发布 Granite 4.2 推理模型系列并详解构建过程

    IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense 版本,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文扩展到 512K),经 SFT 和多阶段 GRPO 强化学习训练,8B 和 30B 额外经历 SWE、终端、搜索三类真实环境 agentic RL。

    推荐理由:官方完整披露了从预训练、SFT 到多阶段 GRPO 强化学习的训练细节,读者可以据此了解推理模型的完整构建流程。

8月24日周一
  1. Meituan LongCat65

    美团 LongCat 官方宣布 LongCat-2.0 已上线 opencode 的 Go,邀请用户试用并反馈用其构建了什么。引用内容显示 LongCat-2.0 为 1.6T/48B 参数、支持 1M 上下文、完全开源。

    引用OpenCode@opencode

    LongCat-2.0 now available in Go 1.6T/48B · 1M context · fully open source

    推荐理由:LongCat 官方宣布模型接入 opencode,读者可以了解该开源模型在编码工具中的可用入口。

8月22日周六
8月21日周五
  1. Hugging Face:Blog(RSS)66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。

    推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。

8月19日周三
8月14日周五
8月12日周三
  1. Google DeepMind:Blog(RSS)68

    Google DeepMind 发布手语转文本模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布大规模多语言手语转文本模型 SL2T,为 Gboard 和 Pixel 11 的 Live Transcribe 带来手语转文字听写,首先支持 ASL 转英语,后续将扩展更多语言和设备。

    推荐理由:原文解释了手语翻译的两类核心难题和 SL2T 的技术取舍,并给出基准分数与隐私设计,读者可了解可用手语 AI 的实现路径。

  2. vLLM 官方博客(RSS)70

    vLLM 宣布 Day-0 支持 Qwen3.8-2.4T-A95B

    vLLM 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是 Qwen 家族首个以开放权重发布的 Qwen-Max 级模型,基于 Qwen 3.5 架构开箱即用。

    推荐理由:原文给出 Qwen3.8-2.4T-A95B 的架构细节、多精度权重和部署要求,读者可据此评估自建推理的成本与硬件门槛。

8月11日周二
  1. Kimi.ai37

    Kimi K3 现已在 @databricks 上线!

    引用Databricks@databricks

    Moonshot AI's latest open-weight model, Kimi K3, is now available on Databricks through Unity AI Gateway. @Kimi_Moonshot Run Kimi K3 where your data already lives - governed, secure, and ready for custom AI apps and agents built with the data in your Lakehouse. Unity AI Gateway lets you deploy Kimi K3 with enterprise-grade access controls. Govern every call, monitor performance, and scale securely across your AI apps. Test Kimi K3 alongside other frontier models without changing your application code. The open-weight frontier just arrived on Databricks. Try it today. https://www.databricks.com/blog/kimi-k3-moonshot-ai-now-available-databricks-through-unity-ai-gateway

8月10日周一
8月4日周二
  1. Mistral AI:News(网页)62

    Mistral 发布 3B 开源多模态安全分类器 Shieldstral,Apache 2.0 开放权重

    Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重训即可适配文本与图像审核。它以 Apache 2.0 协议开放权重,在文本安全上匹敌最大 7 倍于其体积的开放审核模型,可在单张 16GB NVIDIA GPU 上运行,并输出经校准的连续安全分数。

    推荐理由:原文说明了将审核策略写成自然语言问题即可在推理时切换的机制,读者可据此评估它替代固定分类审核模型的可行性。

  2. Microsoft Research 博客(RSS)75

    Microsoft Research 开源 Orchard 智能体框架并发布三个领域模型

    Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。

    推荐理由:官方开源了环境服务和三条训练配方,小参数量模型在 SWE-bench Verified 等基准上的具体结果可直接对照复用。

7月31日周五
  1. Mira Murati64

    Thinking Machines 发布 Inkling-Small,性能与 Inkling 相当而体积仅为其四分之一,总参数 276B、激活参数 12B,完整权重已开放。可在 Tinker 上微调,或在 Tinker Playground 以文本、图像和音频方式与它对话。

    引用Thinking Machines@thinkymachines

    Today, we are releasing Inkling-Small. Inkling-Small achieves comparable performance to Inkling at a quarter of its size. It features 276B total parameters, 12B active. We are making the full weights available. https://thinkingmachines.ai/news/inkling-small/ Fine-tune it on Tinker today, or chat with it in text, image, and audio on Tinker Playground.

7月30日周四
  1. Google DeepMind:Blog(RSS)69

    Google DeepMind 发布 Gemini Robotics ER 2,强化视频理解、任务编排与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,面向机器人的具身推理模型,支持视频理解、任务进度跟踪、工具编排与多机器人协作,并可将执行交给下层 VLA 模型。

    推荐理由:官方发布给出进度分类、moment finding 等具体数字和公开 API 入口,读者可以据此评估其机器人编排与视频理解能力。

7月28日周二
7月27日周一
7月25日周六
  1. Midjourney:Updates(RSS)47

    Midjourney 发布 V8.2 图像模型

    Midjourney 推出 V8.2 图像模型,本次更新聚焦美学、图像质量与个性化。官方称图像将更具创意、大胆、精致、前卫和新颖,低质量图像的随机情况应会大幅减少。V8.2 的个性化档案拥有更大且更优的图像池,能更好理解用户个人品味,尤其适合在个人档案下积累了大量评分的用户。

7月21日周二
7月17日周五
  1. Google DeepMind:Blog(RSS)61

    Google DeepMind 发布网络安全模型 Gemini 3.5 Flash Cyber

    Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证并修复漏洞,将通过限access试点先面向政府和可信伙伴经 CodeMender 开放。

    推荐理由:以轻量模型多次调用替代单次大模型调用做漏洞挖掘,并用 Chrome 真实流水线等无污染基准展示对比结果,方法与数据都可参考。

7月16日周四
  1. Mira Murati72

    Mira Murati 宣布 Thinking Machines 的首个模型 Inkling,从零训练且权重开放。Inkling 可跨文本、图像和音频模态高效推理,官方放出全部权重,今天起可在 Tinker 上微调,并可在 Inkling Playground 体验。

    引用Thinking Machines@thinkymachines

    Today, we are introducing Inkling. Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available. https://thinkingmachines.ai/news/introducing-inkling/ Available today for fine-tuning on Tinker. Play with it in the Inkling Playground. 🧵

    推荐理由:Thinking Machines 发布首个模型 Inkling,开放全部权重并支持 Tinker 微调,可关注其跨模态推理的落地方式。

7月15日周三
  1. Hugging Face:Blog(RSS)81

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 上发布开源多模态模型 Inkling,共 975B 总参数、41B 激活参数,支持 1M 上下文,原生接收图像、文本和音频输入,训练数据为 45 万亿 token,并同时发布 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:文章给出了 Inkling 的架构细节、各档位 VRAM 需求和多条部署路径,便于读者评估在自己的硬件上运行哪种变体。

7月8日周三
7月2日周四
7月1日周三
6月30日周二
6月23日周二
6月11日周四
  1. Midjourney:Updates(RSS)58

    Midjourney 将默认模型从 V7 切换为 V8.1

    Midjourney 宣布经过测试和反馈后,默认模型已从 V7 更新为 V8.1。V8.1 更聪明、更连贯,更好地遵循详细提示词并渲染文字;开启 HD 模式后图像尺寸为 V7 的两倍、分辨率 4 倍,SD 模式 4 秒、HD 模式 12 秒出图。风格参考、个性化与美学在 V7 与 V8.1 间保持一致;V7 的 omni-reference 仍可使用,V8.0 alpha 将在两周后弃用。

  2. Google DeepMind:Blog(RSS)76

    Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 文本生成最高提速 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,基于文本扩散方法,在专用 GPU 上实现最高 4 倍的文本生成提速。该模型为 26B 总参数的 MoE,推理时仅激活 3.8B 参数,量化后可装入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens 每秒,RTX 5090 上超过 700 tokens 每秒。

    推荐理由:官方给出具体吞吐数字、显存占用和质量取舍,读者可据此判断它适不适合本地交互式工作流。

6月10日周三
  1. vLLM 官方博客(RSS)75

    vLLM 原生支持 Google DeepMind 26B 扩散语言模型 DiffusionGemma

    Google DeepMind 与 vLLM 团队合作,将 26B 参数、基于 Gemma4 的离散扩散语言模型 DiffusionGemma 接入 vLLM,这是 vLLM 首个原生支持的 dLLM。

    推荐理由:原文详解了扩散语言模型的解码机制和 vLLM 的 ModelState 接入方案,并给出 H200 上的吞吐数据,对推理工程实践有直接参考价值。

6月9日周二
  1. Google DeepMind:Blog(RSS)77

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型,可在 16GB 内存笔记本本地运行

    Google DeepMind 发布 Gemma 4 12B,定位于在笔记本上本地运行的智能体多模态模型,性能接近其 26B MoE 模型而内存占用不到一半。

    推荐理由:官方介绍了无编码器统一架构和 16GB 内存本机运行等细节,适合关注端侧多模态部署的开发者参考。