跳到正文

#模型发布

今日 9 条
9月30日周三
  1. NVIDIA AI58

    NVIDIA 发布 Kumo Tabular,一个面向表格数据的基础模型家族,据称在准确率与推理时间的权衡上建立了新的 Pareto 前沿。模型以开放方式发布,提供开放权重、开源软件及允许商用的宽松许可,权重托管在 HuggingFace(huggingface.co/nvidia/Kumo-Tabular),代码见 GitHub(github.com/NVIDIA/structured-data-models)。

    引用Jure Leskovec@jure

    I’m very excited to share @nvidia Kumo Tabular, a new family of foundation models for tabular data. Kumo Tabular establishes the new Pareto frontier across the entire accuracy–inference-time tradeoff. Just as importantly, we are releasing it openly: open weights, open-source software, and a permissive license for commercial use. HuggingFace: https://huggingface.co/nvidia/Kumo-Tabular GitHub: https://github.com/NVIDIA/structured-data-models

9月29日周二
9月28日周一
  1. Hugging Face:Blog(RSS)71

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时给出两种尺寸、跨 GUI 与 MCP 的统一接口和公开轨迹,读者可据此比较开源智能体与闭源前沿的成本差距。

  2. MiniMax (official)44

    MiniMax-M3.1 Flash Preview 现已在 Token Plan 上线! 更快、更轻,专为运行高并发、低延迟负载的团队打造,现可在你现有的 Token Plan 订阅下使用,无需额外设置。 立即试用:https://platform.minimax.io/subscribe/token-plan

    引用MiniMax_Agent@MiniMaxAgent

    MiniMax's latest text model, M3.1-Flash-Preview, debuts today on MiniMax Code. Built for everyday development, it's fast, reliable, and ready for real work, from quick bug fixes to full features.

9月26日周六
9月25日周五
  1. Google DeepMind:Blog(RSS)66

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型结合,让对话 AI 具备动态视觉形象,支持精准唇形同步、自然表情和流畅轮次切换。

    推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级数字人交互的落地边界。

9月24日周四
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)39

    NVIDIA 推出 NV-Reason-CT Open 3D CT VLM,面向放射科医生链式推理

    NVIDIA 发布 NV-Reason-CT Open,这是一个面向 3D CT 体积影像的开放视觉语言模型,支持放射科医生的链式推理(Chain-of-Thought)。现有前沿通用模型在体积影像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力,而 3D CT 是临床信息最丰富、数据最密集的模态之一,此前一直未被现代 VLM 充分覆盖。

9月23日周三
  1. Google DeepMind:Blog(RSS)71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型给出语音克隆、逐行导演与多语言覆盖的具体能力,可据此判断语音生成工作流的变化。

9月22日周二
9月21日周一
9月17日周四
9月16日周三
  1. 蚂蚁 inclusionAI:HuggingFace 新模型62

    蚂蚁 inclusionAI 开源 Realtime-Venus 9B 全双工音视频交互系统

    蚂蚁 inclusionAI 发布 Realtime-Venus,一个支持主动音视频交互、异步委托和可打断全双工对话的开源系统,包含 Realtime-Venus-Omni 和 Realtime-Venus-Audio 两个 9B 检查点。

    推荐理由:模型卡给出了 Realtime-Venus 的架构组成、全双工与异步委托能力及完整用法,读者可以据此评估它在实时音视频交互场景的可用性。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)34

    Dense 与 MoE 模型对比:活跃参数、吞吐量与选型时机

    NVIDIA 技术博客对比 Dense 与 MoE 两种模型架构,说明参数组织方式对性能的影响。以 Nemotron 3.5 Lightning 为例,该模型总参数 30B,但每个 token 仅激活 3B 参数,依靠 MoE 架构按 token 选择部分参数,从而在保留大模型容量的同时降低单次计算量。文章围绕活跃参数、吞吐量与选型时机展开分析。

9月15日周二
  1. MiniMax (official)36

    H3 越来越快了。⚡️ @sgl_project + VDN-H3 现在让 MiniMax H3 在 8× B200 上突破 2 倍实时去噪——预热后端到端 9.0s 生成 14.4s 的 768p 视频,未测得质量下降。 开放模型通过开放生态持续进化。🚀

    引用SGLang@sgl_project

    SGLang-Diffusion with VDN-H3 now generates 14.4s of 768p video in just 9.0s 🚀 On 8× B200, 8 step denoising takes just 6.9s, reaching over 2× real time. The 9.0s figure covers the full generation request after warmup. No measured quality regression versus dense 50-step H3 across 103 test prompts. 🧵

9月14日周一