跳到正文

#模型发布

今日 43 条
6月10日周三
  1. vLLM 官方博客(RSS)75

    vLLM 原生支持 Google DeepMind 26B 扩散语言模型 DiffusionGemma

    Google DeepMind 与 vLLM 团队合作,将 26B 参数、基于 Gemma4 的离散扩散语言模型 DiffusionGemma 接入 vLLM,这是 vLLM 首个原生支持的 dLLM。

    推荐理由:原文详解了扩散语言模型的解码机制和 vLLM 的 ModelState 接入方案,并给出 H200 上的吞吐数据,对推理工程实践有直接参考价值。

  2. Andrej Karpathy76

    Anthropic 发布 Claude Fable 5,作者称其与 Mythos 为同一底层模型但增加了安全护栏,基准几乎全面 SOTA。他认为质变程度堪比去年 11 月的 Claude 4.5,尤其擅长长程难题求解,但护栏目前过于敏感;软件唾手可得令他的软件需求大增(Jevon 悖论)。

    引用Claude@claudeai

    Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowledge work, scientific research, and vision. The longer and more complex the task, the larger Fable 5’s lead over our other models.

    推荐理由:作者补充了基准之外的第一手使用感受,指出长难题求解能力跃升和安全护栏偏敏感,可作选型参考。

6月9日周二
  1. Google DeepMind:Blog(RSS)77

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型,可在 16GB 内存笔记本本地运行

    Google DeepMind 发布 Gemma 4 12B,定位于在笔记本上本地运行的智能体多模态模型,性能接近其 26B MoE 模型而内存占用不到一半。

    推荐理由:官方介绍了无编码器统一架构和 16GB 内存本机运行等细节,适合关注端侧多模态部署的开发者参考。

6月4日周四
  1. vLLM 官方博客(RSS)67

    NVIDIA Nemotron 3 Ultra 在 vLLM 获 Day-0 支持

    NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。

    推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。

5月23日周六
5月22日周五
  1. Saining Xie45

    来看看 Jas 主导的 RAEv2。通过大量实验,我们发现了一些非常有趣的行为,说明为什么强大的表征编码器对像素解码器至关重要。 剧透:关键不在于爬 FID 的坡;像 ep@fid-k/fdr^k 这样的新指标表明,还有更多值得探索的空间!

    引用Jaskirat Singh@1jaskiratsingh

    In Oct last year, Representation Autoencoders provided an elegant solution to unified tokenization for understanding and generation. Today we make them a bit more simple. a bit more general. Result: >10x faster convergence, better reconstruction, better generation. And yes we test them on T2I and world models :) Introducing RAEv2

5月21日周四
5月18日周一
  1. Google DeepMind:Blog(RSS)80

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式编辑视频

    Google DeepMind 发布 Gemini 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成高质量视频,并支持通过自然语言多轮编辑视频、保持角色和场景一致。

    推荐理由:原文介绍了 Gemini Omni Flash 的多模态输入、对话式视频编辑能力和开放范围,读者可以判断它对视频创作流程的影响。

5月16日周六
  1. Google DeepMind:Blog(RSS)85

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 已在 Gemini 应用、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。

    推荐理由:官方发布稿给出了具体基准成绩、速度倍数和开放渠道,读者可以据此评估 3.5 Flash 在智能体和编码场景的可用性。

5月12日周二
  1. Lilian Weng39

    过去几个月,我们经历了许多乐趣(和压力😅),在训练运行日志中产出了 12 个版本(以及许多子版本)和 137 页内容。 事实证明,人与人之间的协作对于改善人机协作很重要。😊

    引用Thinking Machines@thinkymachines

    People talk, listen, watch, think, and collaborate at the same time, in real time. We've designed an AI that works with people the same way. We share our approach, early results, and a quick look at our model in action. https://thinkingmachines.ai/blog/interaction-models

5月11日周一
5月7日周四
4月29日周三
4月28日周二
  1. Fuli Luo65

    小米 MiMo 团队开源两款模型:MiMo-V2.5-Pro(Code Agent,总参数 1T)和 MiMo-V2.5(多模态 Agent,总参数 310B)。采用 MIT 许可证,支持商用部署、继续训练和微调,两款模型均支持 1M token 上下文窗口;官方称 MiMo-V2.5-Pro 在开源模型中 GDPVal-AA 和 ClawEval 排名第一。开发者还可申请 100T 免费 token(http://100t.xiaomimimo.com),权重在 Hugging Face 提供。

    引用Xiaomi MiMo@XiaomiMiMo

    Xiaomi MiMo-V2.5 is now officially open-sourced! MIT License, supporting commercial deployment, continued training, and fine-tuning - no additional authorization required. Two models, both supporting a 1M-token context window : • MiMo-V2.5-Pro: built for complex agent and coding tasks, ranking No.1 among open-source models on GDPVal-AA and ClawEval • MiMo-V2.5: a native omni-modal model with strong agent capabilities A model's value isn't measured by rankings alone — it's measured by the problems it solves. Let's build with MiMo now! 🤗 Weights: https://huggingface.co/collections/XiaomiMiMo/mimo-v25 📄 Blog: https://mimo.xiaomi.com/index#blog

4月23日周四
4月17日周五
4月13日周一
4月3日周五
  1. Google DeepMind:Blog(RSS)86

    Google DeepMind 发布 Gemma 4 开源模型,含 E2B、E4B、26B MoE 和 31B 四个尺寸

    Google DeepMind 发布 Gemma 4 开源模型,主打高级推理与智能体工作流,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸。

    推荐理由:官方给出四个尺寸、榜单排名、上下文长度和开放许可等具体信息,读者可以据此判断选型与部署空间。

3月30日周一
3月26日周四
3月25日周三
3月24日周二
  1. Mistral AI:News(网页)66

    Mistral AI 发布首个语音合成模型 Voxtral TTS

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。

    推荐理由:官方给出与 ElevenLabs 的对比数据、延迟指标和开源入口,读者可以据此评估它对语音智能体工作流的适配度。

3月20日周五
3月17日周二
  1. Mistral AI:News(网页)70

    Mistral 发布开源模型 Mistral Small 4,统一推理、多模态与编码能力

    Mistral 发布 Mistral Small 4,首个将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的开源版本,采用 Apache 2.0 许可证。

    推荐理由:官方发布文给出完整架构参数、性能对比和部署门槛,可以了解这款统一推理与多模态的开源模型是否适配自己的场景。

  2. Mistral AI:News(网页)61

    Mistral 发布开源 Lean 4 证明代码智能体 Leanstral

    Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,同时在 Mistral Vibe 中以 agent 模式提供,并通过免费 API 端点 labs-leanstral-2603 开放。

    推荐理由:原文给出 FLTEval 分数和与 Claude 系列的成本对比,读者可据此评估它在形式化证明工程中的性价比。

3月11日周三
3月4日周三
2月13日周五
  1. 通义 QwenAudio:原创语音项目55

    QwenLM 开源 WebWorld 网页世界模型

    QwenLM 在 GitHub 开源 WebWorld,一个大规模网页世界模型,用于在模拟浏览器环境中训练 web agent。该方式可避开真实网页带来的延迟和安全问题。原文仅提供简要介绍,更多细节见 https://github.com/QwenLM/WebWorld。

2月12日周四
2月11日周三
2月9日周一
  1. Baichuan AI49

    📊 SOTA 全面领先: HealthBench 65.1 / Hard 44.4 🥇 幻觉率 3.5%(低于 ChatGPT)🛡️✨ ScanBench 全站第一:74.9 / 72.1 / 74.4 🏆

    引用Baichuan AI@BaichuanAI

    Baichuan-M3 Technical Report is live. 🚀 Report:https://arxiv.org/abs/2602.06570 Models: https://hf.co/collections/baichuan-inc/baichuan-m3 Try: https://ying.ai Built for clinical decision support, not trivia QA, optimized on the real outpatient workflow: Inquiry → Lab Testing → Diagnosis 🧑⚕️→🔬→🧾

2月6日周五
  1. 美团 LongCat:HuggingFace 新模型55

    美团开源 LongCat-Flash-Lite:68.5B 参数 MoE 模型,主打 N-gram 嵌入与推理效率

    美团发布 LongCat-Flash-Lite,非思考型 68.5B 参数 MoE 模型,激活参数约 3B,支持 256k 上下文,权重以 MIT 协议开源在 HuggingFace。模型集成 N-gram 嵌入表提升性能与推理速度,官方评测显示其 SWE-Bench 达 54.40,agentic 与编码能力在同规模模型中具竞争力,并给出 transformers 与 SGLang 部署方案。

2月5日周四
2月3日周二