#模型发布
#模型发布
今日 43 条
🚨 AI News | TestingCatalog@testingcatalogAI 评分5454
dex@dexhorthyAI 评分2020你们发布模型的速度比我跑基准测试还快,但这里是 SCB 在 Sol 6、Opus 5.5 等模型上的最新待定结果(5.5 Max 还在慢慢跑)
Ant Ling@AntLingAGIAI 评分4444
xAI:News(网页)精选AI 评分6262 xAI 发布 Grok Imagine API,主打高质量低延迟视频生成与编辑
xAI 发布 Grok Imagine API,一套覆盖视频生成与视频编辑的统一 API 套件,称其为迄今最强的音视频生成模型。
推荐理由:官方宣布 Grok Imagine API 上线,附 Artificial Analysis 文生视频排名第一及延迟对比,可据此评估其在视频生成工作流中的位置。
xAI:News(网页)精选AI 评分6464 xAI 发布 grok-voice-think-fast-1.0 旗舰语音模型并开放 API
xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,可通过 API 使用。该模型面向客服、销售等复杂多步骤语音工作流,原生支持 25+ 种语言,在 τ-voice Bench 排行榜上排名第一。后台推理不影响响应延迟。该模型已为 Starlink 提供电话客服与销售:销售转化率 20%,客服自主解决率 70%,单个智能体使用 28 个工具。
推荐理由:官方给出了基准成绩、多语言支持和 Starlink 实际运营数据,可帮助读者评估这款语音模型在真实客服场景的可用性。
xAI:News(网页)精选AI 评分6262 xAI 发布编码模型 grok-build-0.1,API 公测上线
xAI 将编码模型 grok-build-0.1 以公开测试形式上线 xAI API,该模型专为智能体编码任务训练,支持 Web 开发、调试和 MCP,也是驱动 Grok Build 的同一模型。
推荐理由:xAI 官方公告给出了 grok-build-0.1 的定位、速度、定价和适配工具,读者可据此评估是否接入自己的编码工作流。
xAI:News(网页)AI 评分3030 Composer 2.5 上线 Grok Build,可通过 /models 菜单选用
Composer 2.5 已在 Grok Build 中上线,用户输入 /model 后可在菜单中选择该模型。xAI 称其为一款快速、SOTA 的模型,擅长长时间运行任务与遵循复杂指令。
xAI:News(网页)AI 评分4949 xAI 发布 Grok Imagine 1.5 Preview 图生视频模型,上线 xAI API
xAI 最新图生视频模型 grok-imagine-video-1.5-preview 已通过 xAI API 开放预览。该模型可将单张静态图像转为流畅的电影感视频,支持最高 720p 分辨率,用户用自然语言提示词即可控制镜头运动、节奏与声音设计,并能保持原图的细节与光照。模型还支持逐帧生成并串联成更长场景,可用几行 Python 代码调用。
xAI:News(网页)精选AI 评分6666 xAI 发布 Grok Imagine Video 1.5 图生视频模型并开放 API
xAI 发布 Grok Imagine Video 1.5,已在 Imagine API 正式可用(模型名 grok-imagine-video-1.5),并在 grok.com/imagine 和 iOS、Android 应用推出 Video 1.5 Fast。
推荐理由:xAI 官方说明升级点和速度数据,还给出 API 模型名与并发代理等入口,适合评估图生视频工作流。
xAI:News(网页)精选AI 评分7878 xAI 发布 Grok 4.5,主打编码、智能体任务与知识工作
xAI 于 7 月 16 日发布 Grok 4.5,定位为其最强模型,面向编码、智能体任务和知识工作,与 Cursor 联合训练。
推荐理由:官方发布页给出了基准分数、定价、token 效率和免费入口等具体数据,读者可据此与其他模型比较并选择使用场景。
xAI:News(网页)精选AI 评分6464 xAI 将 Grok 4.5 推向 iOS、Android、网页和 X 平台
xAI 宣布其最强模型 Grok 4.5 当日起在 grok.com、X 以及 iOS 和 Android 应用上可用。官方称该模型更准确理解提问、能跟踪更长对话并更快给出答案,可完成制作电子表格、把大纲转为幻灯片和图表、撰写文稿、提炼长 PDF 要点等任务,并通过 Microsoft 365 插件在 Word、Excel、PowerPoint 和 Outlook 中直接使用。
推荐理由:xAI 官方说明 Grok 4.5 的能力改进和全平台可用范围,读者可据此评估在日常问答和知识工作中的使用方式。
xAI:News(网页)精选AI 评分6868 xAI 发布 Grok Voice Think Fast 2.0 语音模型
xAI 发布 Grok Voice Think Fast 2.0,称其在 Artificial Analysis 语音到语音质量指数达 82.9%,高于上代 75.7% 及对比模型;出声延迟 0.70s,转录准确率较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5–2.0×,推理 token 效率为上代 0.4×。
推荐理由:原文给出 Artificial Analysis 对比数据和价格迁移细节,读者可据此评估它在语音智能体场景的替换成本。
xAI:News(网页)精选AI 评分7878 xAI 发布 Grok 4.6,聚焦长程智能体与视觉交互任务
xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点提升长程智能体和交互视觉类任务能力,在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平(61 分)。
推荐理由:官方公告给出了各基准对比数字、API 定价和开放入口,读者可据此评估 Grok 4.6 在智能体编码上的位置。
xAI:News(网页)AI 评分5454 Grok 4.6 上线 GitHub Copilot
xAI 宣布最新编程模型 Grok 4.6 在 GitHub Copilot 上线,覆盖云 agent、Copilot CLI 和 VS Code IDE,用户在模型选择器中选 "Grok 4.6" 即可使用,部分企业和商业用户需在 Copilot 设置中启用。该模型也可通过 SpaceXAI 控制台使用,价格为每百万输入 token $2、每百万输出 token $6。
OpenRouter@OpenRouterAI 评分2222Suno:Blog(网页)精选AI 评分7676 Suno 发布 v3 音乐模型
Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。
推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。
Sarvam AI(网页)AI 评分5252 Sarvam AI 发布开源混合推理模型 Sarvam-M,基于 Mistral Small 24B 强化印度语言能力
Sarvam AI 发布开源模型 Sarvam-M,基于 24B 的 Apache 2.0 模型 Mistral Small,经 SFT 和 RLVR 后训练而成,支持 think 与 non-think 两种模式。
Sarvam AI(网页)AI 评分4444 Sarvam AI 开源 Sarvam-Translate:支持 22 种印度语言翻译
Sarvam AI 与 AI4Bharat 合作发布开源权重模型 Sarvam-Translate,基于 Gemma3-4B-IT 微调,支持 22 种印度语言,其中 15 种支持结构化长文本翻译。
Sarvam AI(网页)AI 评分4646 Sarvam Audio:超越转录的语音识别
Sarvam AI 发布 Sarvam Audio,这是 30 亿参数语言模型 Sarvam 3B 的音频扩展,支持五种转录格式并实现最长 60 分钟音频的说话人分离识别。
Sarvam AI(网页)AI 评分5050 Sarvam AI 发布 3B 状态空间视觉语言模型 Sarvam Vision
Sarvam AI 于 2026 年 2 月 5 日发布 Sarvam Vision,一个面向文档智能的 3B 参数状态空间视觉语言模型,支持图像描述、场景文字识别、图表解读和复杂表格解析,覆盖英语和全部 22 种官方印度语言。
Sarvam AI(网页)AI 评分5757 Sarvam AI 发布 Bulbul V3 文本转语音模型,覆盖 11 种印度语言
Sarvam AI 发布面向印度语言的文本转语音模型 Bulbul V3,提供 35+ 专业配音师录制的声音、低延迟流式输出和语音克隆支持。
Suno:Blog(网页)精选AI 评分6464 Suno 发布 v4.5 音乐模型,曲风更准、人声更丰富、歌曲最长 8 分钟
Suno 发布最新音乐模型 v4.5,带来更动态的音乐、更准的曲风与曲风混搭、更丰富的人声表现。新功能包括提示词增强助手、Covers 与 Personas 组合使用,歌曲长度可达 8 分钟,生成速度和音频质量均有提升。
推荐理由:官方列出了 v4.5 在曲风、人声、提示词理解和生成速度上的具体改进,适合关注 AI 音乐生成的读者了解能力变化。
Sarvam AI(网页)AI 评分5050 Sarvam AI 发布 Saaras V3 语音识别模型,支持 23 种语言流式转写
Sarvam AI 发布 Saaras V3 语音识别模型,原生支持流式低延迟解码,覆盖 22 种官方印度语言和英语。在 IndicVoices 基准上 WER 约 19%,优于 Saaras V2.5(约 22%),并在低资源语言上保持一致精度;训练使用超 100 万小时多语言音频。
Sarvam AI(网页)AI 评分4949 Sarvam AI 发布 Sarvam Edge,将语音识别与合成模型搬上端侧
Sarvam AI 发布 Sarvam Edge,推动语音识别、语音合成与多语言翻译模型在设备端本地推理。其端侧语音识别模型参数 74M、FP16 占用约 294MB,支持 10 种印度语言,在 Snapdragon 8 Gen 3 上实时因子约 0.12(RTFx 8.5),首 token 延迟低于 300 毫秒。语音合成同样以单一模型支持 10 种语言和 8 个多语言说话人,无需联网。
Sakana AI:Blog(网页)AI 评分5959 Sakana AI 发布 Fugu Max 与 Fugu Ultra v2 编排模型
Sakana AI 发布 Fugu Max 和 Fugu Ultra v2 两个编排架构版本,通过 OpenAI 兼容 API 即日可用,已有用户改一行参数即可升级。
Prime Intellect(网页)精选AI 评分6565 Prime Intellect 发布 INTELLECT-1:首次全球分布式训练 10B 参数模型
Prime Intellect 启动 INTELLECT-1,称其为首个全球分布式训练的 10B 参数模型,基于 Llama-3 架构,使用超过 6 万亿 token 的数据混合(55% Fineweb-Edu、20% DLCM、20% Stack v2、5% OpenWebMath),并邀请任何人贡献算力。
推荐理由:原文给出INTELLECT-1的训练规模、数据配比和通信优化细节,读者可据此了解全球分布式训练10B模型的可行路径。
Prime Intellect(网页)精选AI 评分6767 Prime Intellect 发布全球分布式协作训练的 10B 模型 INTELLECT-1
Prime Intellect 发布 INTELLECT-1,一个在五大国家、三大洲用最多 112 张 H100 协作训练的 10B 参数语言模型,训练 1T tokens 历时 42 天,基于 Llama-3 架构。
推荐理由:原文给出分布式训练的关键数字与方法细节,读者可以了解社区协作训练大模型的可行路径。
Prime Intellect(网页)AI 评分4949 METAGENE-1:7B 宏基因组基础模型发布,用于大流行监测
USC、Prime Intellect 与 Nucleic Acid Observatory 联合发布 METAGENE-1,一个 7B 参数自回归 Transformer 宏基因组基础模型,在超过 1.5T 碱基对的废水 DNA/RNA 序列上预训练。该模型采用 512-token 上下文窗口,在病原体检测与宏基因组嵌入基准上达到 SOTA,并开源模型权重与论文。
Prime Intellect(网页)AI 评分6060 Prime Intellect 发布 INTELLECT-2:首个全球分布式强化学习训练的 32B 推理模型
Prime Intellect 发布 INTELLECT-2,以 QwQ-32B 为基座,用 GRPO 和可验证奖励进行全球首个 32B 参数的无许可分布式强化学习训练,任何人可贡献异构算力。
Prime Intellect(网页)精选AI 评分6666 Prime Intellect 发布 INTELLECT-2:首个通过全球分布式强化学习训练的 32B 模型
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,在异步、异构的分布式算力网络上训练,性能较 QwQ-32B 在数学与编码基准上有提升。
推荐理由:官方发布首个通过全球分布式强化学习训练的 32B 推理模型,并开源训练框架、代码和数据,适合关注开源分布式训练路线的读者。
Prime Intellect(网页)精选AI 评分7171 Prime Intellect 发布 106B MoE 模型 INTELLECT-3 并开源完整训练配方
Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM 4.5 Air 基座上经过 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平,超越许多更大的前沿模型,如 AIME24 90.8 分、AIME25 88.0 分、GPQA-Diamond 74.4 分。
推荐理由:原文同时放出模型权重、训练框架和全部环境,读者可以看到大规模 RL 后训练的完整可复用配方。
MiniMax:Blog(网页)精选AI 评分7575 MiniMax 发布 M2.5 模型,SWE-Bench Verified 达 80.2%
MiniMax 发布 MiniMax-M2.5,在 SWE-Bench Verified 得分 80.2%、Multi-SWE-Bench 51.3%、BrowseComp 76.3%,完成 SWE-Bench Verified 评测比 M2.1 快 37%,与 Claude Opus 4.6 的 22.9 分钟持平。
推荐理由:官方公布了 M2.5 在编码、搜索和办公场景的成绩与价格细节,读者可以据此比较它与同类模型的性价比。
MiniMax:Blog(网页)精选AI 评分7272 MiniMax 发布 M2.7:SWE-Pro 得分 56.22%,展示模型自进化工作流
MiniMax 发布 M2.7 模型,已在 MiniMax Agent 和 API 平台全面可用。该模型在 SWE-Pro 得分 56.22%(接近 Opus 4.6),VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高,MM Claw 准确率 62.7%。
推荐理由:官方给出了各基准的具体分数和自进化工作流细节,读者可以据此与同档模型做直接比较。
LMSYS:Blog(Chatbot Arena 团队)AI 评分5151 NVIDIA 发布 Nemotron 3 Super,SGLang 提供 Day-0 推理支持
NVIDIA 宣布 Nemotron 3 Super 发布,SGLang 于 Day-0 提供支持。
LMSYS:Blog(Chatbot Arena 团队)精选AI 评分7272 SGLang 和 Miles 实现 NVIDIA Nemotron 3 Ultra Day-0 支持
SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。
推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。
LMSYS:Blog(Chatbot Arena 团队)AI 评分4747 Z Lab、Modal 与 SGLang 联合发布 DFlash 与 Spec V2 推测解码方案
Z Lab、Modal 与 SGLang 联合发布 DFlash 推测解码模型及 SGLang 新默认 Spec V2 引擎,为 Qwen 3.5 397B-A17B 提供更低延迟的 LLM 推理服务。
LMSYS:Blog(Chatbot Arena 团队)AI 评分3939 Miles 新增 OPD 支持:Qwen3.5-35B-A3B 自蒸馏实验验证
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并新增稀疏的逐位置候选 token 打分流程,避免 O(R²K) 的密集 payload。
Liquid AI 模型与工程博客(网页)AI 评分3636 Liquid AI 在 Hugging Face 上线 LFM2.5 系列 WebGPU 与 CPU 演示 Space
Liquid AI 在 Hugging Face Spaces 上线一批 LFM2.5 演示,包括可在浏览器用 WebGPU 本地运行的 LFM2.5-VL-3B 和端侧 LFM2.5 研究智能体。另有英语拼写检查、多语言 PII 检测、掩码扩散与策略检查等 Space,基于 LFM2.5 或 LFM2.5 Encoder 在 CPU 上运行。
Liquid AI 模型与工程博客(网页)AI 评分6060 Liquid AI 发布 LFM2.5 端侧模型家族
Liquid AI 发布 LFM2.5 模型家族,主打端侧 AI 部署与设备上 Agentic AI,预训练从 10T 扩展到 28T tokens,并通过强化学习扩展后训练流程。
Liquid AI 模型与工程博客(网页)AI 评分6060 Liquid AI 发布首批 Liquid Foundation Models(LFM)系列模型
Liquid AI 发布第一代 Liquid Foundation Models(LFM),包括 1.3B、3.1B 密集模型和 40.3B MoE 模型(推理激活 12B 参数)。