全部AI 动态
全部动态
今日 46 条
Runway@runwaymlAI 评分3636
Artificial Analysis@ArtificialAnlysAI 评分5252
🚨 AI News | TestingCatalog@testingcatalogAI 评分5454
dex@dexhorthyAI 评分2020你们发布模型的速度比我跑基准测试还快,但这里是 SCB 在 Sol 6、Opus 5.5 等模型上的最新待定结果(5.5 Max 还在慢慢跑)
Arena.ai@arenaAI 评分5959Ideogram 4.5 进入 Image Edit Arena 前 20,总分 1351 分,排名第 18。
引用Ideogram@ideogram_aiIntroducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.
Ant Ling@AntLingAGIAI 评分4444
xAI:News(网页)精选AI 评分6464 xAI 发布 grok-voice-think-fast-1.0 旗舰语音模型并开放 API
xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,可通过 API 使用。该模型面向客服、销售等复杂多步骤语音工作流,原生支持 25+ 种语言,在 τ-voice Bench 排行榜上排名第一。后台推理不影响响应延迟。该模型已为 Starlink 提供电话客服与销售:销售转化率 20%,客服自主解决率 70%,单个智能体使用 28 个工具。
推荐理由:官方给出了基准成绩、多语言支持和 Starlink 实际运营数据,可帮助读者评估这款语音模型在真实客服场景的可用性。
xAI:News(网页)精选AI 评分6262 xAI 发布编码模型 grok-build-0.1,API 公测上线
xAI 将编码模型 grok-build-0.1 以公开测试形式上线 xAI API,该模型专为智能体编码任务训练,支持 Web 开发、调试和 MCP,也是驱动 Grok Build 的同一模型。
推荐理由:xAI 官方公告给出了 grok-build-0.1 的定位、速度、定价和适配工具,读者可据此评估是否接入自己的编码工作流。
xAI:News(网页)AI 评分3030 Composer 2.5 上线 Grok Build,可通过 /models 菜单选用
Composer 2.5 已在 Grok Build 中上线,用户输入 /model 后可在菜单中选择该模型。xAI 称其为一款快速、SOTA 的模型,擅长长时间运行任务与遵循复杂指令。
xAI:News(网页)AI 评分4949 xAI 发布 Grok Imagine 1.5 Preview 图生视频模型,上线 xAI API
xAI 最新图生视频模型 grok-imagine-video-1.5-preview 已通过 xAI API 开放预览。该模型可将单张静态图像转为流畅的电影感视频,支持最高 720p 分辨率,用户用自然语言提示词即可控制镜头运动、节奏与声音设计,并能保持原图的细节与光照。模型还支持逐帧生成并串联成更长场景,可用几行 Python 代码调用。
xAI:News(网页)精选AI 评分7878 xAI 发布 Grok 4.5,主打编码、智能体任务与知识工作
xAI 于 7 月 16 日发布 Grok 4.5,定位为其最强模型,面向编码、智能体任务和知识工作,与 Cursor 联合训练。
推荐理由:官方发布页给出了基准分数、定价、token 效率和免费入口等具体数据,读者可据此与其他模型比较并选择使用场景。
xAI:News(网页)精选AI 评分6464 xAI 将 Grok 4.5 推向 iOS、Android、网页和 X 平台
xAI 宣布其最强模型 Grok 4.5 当日起在 grok.com、X 以及 iOS 和 Android 应用上可用。官方称该模型更准确理解提问、能跟踪更长对话并更快给出答案,可完成制作电子表格、把大纲转为幻灯片和图表、撰写文稿、提炼长 PDF 要点等任务,并通过 Microsoft 365 插件在 Word、Excel、PowerPoint 和 Outlook 中直接使用。
推荐理由:xAI 官方说明 Grok 4.5 的能力改进和全平台可用范围,读者可据此评估在日常问答和知识工作中的使用方式。
xAI:News(网页)精选AI 评分6868 xAI 发布 Grok Voice Think Fast 2.0 语音模型
xAI 发布 Grok Voice Think Fast 2.0,称其在 Artificial Analysis 语音到语音质量指数达 82.9%,高于上代 75.7% 及对比模型;出声延迟 0.70s,转录准确率较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5–2.0×,推理 token 效率为上代 0.4×。
推荐理由:原文给出 Artificial Analysis 对比数据和价格迁移细节,读者可据此评估它在语音智能体场景的替换成本。
xAI:News(网页)精选AI 评分7878 xAI 发布 Grok 4.6,聚焦长程智能体与视觉交互任务
xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点提升长程智能体和交互视觉类任务能力,在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平(61 分)。
推荐理由:官方公告给出了各基准对比数字、API 定价和开放入口,读者可据此评估 Grok 4.6 在智能体编码上的位置。
xAI:News(网页)AI 评分4343 LatchBio 独立评测:Grok 4.6 生物安全监测与对抗性生物任务表现超越所有前沿模型
LatchBio 对 Grok 4.6 的独立评测显示,其在 BioSecBench-Refusal 上拒绝伪装危险任务的表现优于所有受测前沿模型,是唯一在红队拒绝率(59.2%)与常规任务完成率(64.8%)两项指标上均超过 50% 的系统,跨不同 agent harness 平均得分 62.1%。
OpenRouter@OpenRouterAI 评分2222
Arena.ai@arenaAI 评分6262引用Claude@claudeaiIntroducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.
Sarvam AI(网页)AI 评分5252 Sarvam AI 发布开源混合推理模型 Sarvam-M,基于 Mistral Small 24B 强化印度语言能力
Sarvam AI 发布开源模型 Sarvam-M,基于 24B 的 Apache 2.0 模型 Mistral Small,经 SFT 和 RLVR 后训练而成,支持 think 与 non-think 两种模式。
Sarvam AI(网页)AI 评分4444 Sarvam AI 开源 Sarvam-Translate:支持 22 种印度语言翻译
Sarvam AI 与 AI4Bharat 合作发布开源权重模型 Sarvam-Translate,基于 Gemma3-4B-IT 微调,支持 22 种印度语言,其中 15 种支持结构化长文本翻译。
Sarvam AI(网页)AI 评分4646 Sarvam Audio:超越转录的语音识别
Sarvam AI 发布 Sarvam Audio,这是 30 亿参数语言模型 Sarvam 3B 的音频扩展,支持五种转录格式并实现最长 60 分钟音频的说话人分离识别。
Sarvam AI(网页)AI 评分5050 Sarvam AI 发布 3B 状态空间视觉语言模型 Sarvam Vision
Sarvam AI 于 2026 年 2 月 5 日发布 Sarvam Vision,一个面向文档智能的 3B 参数状态空间视觉语言模型,支持图像描述、场景文字识别、图表解读和复杂表格解析,覆盖英语和全部 22 种官方印度语言。
Sarvam AI(网页)AI 评分5757 Sarvam AI 发布 Bulbul V3 文本转语音模型,覆盖 11 种印度语言
Sarvam AI 发布面向印度语言的文本转语音模型 Bulbul V3,提供 35+ 专业配音师录制的声音、低延迟流式输出和语音克隆支持。
Sarvam AI(网页)AI 评分5050 Sarvam AI 发布 Saaras V3 语音识别模型,支持 23 种语言流式转写
Sarvam AI 发布 Saaras V3 语音识别模型,原生支持流式低延迟解码,覆盖 22 种官方印度语言和英语。在 IndicVoices 基准上 WER 约 19%,优于 Saaras V2.5(约 22%),并在低资源语言上保持一致精度;训练使用超 100 万小时多语言音频。
Sarvam AI(网页)AI 评分4949 Sarvam AI 发布 Sarvam Edge,将语音识别与合成模型搬上端侧
Sarvam AI 发布 Sarvam Edge,推动语音识别、语音合成与多语言翻译模型在设备端本地推理。其端侧语音识别模型参数 74M、FP16 占用约 294MB,支持 10 种印度语言,在 Snapdragon 8 Gen 3 上实时因子约 0.12(RTFx 8.5),首 token 延迟低于 300 毫秒。语音合成同样以单一模型支持 10 种语言和 8 个多语言说话人,无需联网。
Suno:Blog(网页)精选AI 评分6060 Suno 发布 v5.5,推出 Voices、Custom models 和 My Taste
Suno 发布 v5.5 模型,同时推出 Voices、Custom models 和 My Taste 三项个性化功能。
推荐理由:原文给出 Voices 的验证与隐私细节和两项新个性化功能,读者可以判断这些能力如何改变自己的创作流程。
Prime Intellect(网页)精选AI 评分6565 Prime Intellect 发布 INTELLECT-1:首次全球分布式训练 10B 参数模型
Prime Intellect 启动 INTELLECT-1,称其为首个全球分布式训练的 10B 参数模型,基于 Llama-3 架构,使用超过 6 万亿 token 的数据混合(55% Fineweb-Edu、20% DLCM、20% Stack v2、5% OpenWebMath),并邀请任何人贡献算力。
推荐理由:原文给出INTELLECT-1的训练规模、数据配比和通信优化细节,读者可据此了解全球分布式训练10B模型的可行路径。
Prime Intellect(网页)精选AI 评分6767 Prime Intellect 发布全球分布式协作训练的 10B 模型 INTELLECT-1
Prime Intellect 发布 INTELLECT-1,一个在五大国家、三大洲用最多 112 张 H100 协作训练的 10B 参数语言模型,训练 1T tokens 历时 42 天,基于 Llama-3 架构。
推荐理由:原文给出分布式训练的关键数字与方法细节,读者可以了解社区协作训练大模型的可行路径。
Prime Intellect(网页)AI 评分4949 METAGENE-1:7B 宏基因组基础模型发布,用于大流行监测
USC、Prime Intellect 与 Nucleic Acid Observatory 联合发布 METAGENE-1,一个 7B 参数自回归 Transformer 宏基因组基础模型,在超过 1.5T 碱基对的废水 DNA/RNA 序列上预训练。该模型采用 512-token 上下文窗口,在病原体检测与宏基因组嵌入基准上达到 SOTA,并开源模型权重与论文。
Prime Intellect(网页)AI 评分6060 Prime Intellect 发布 INTELLECT-2:首个全球分布式强化学习训练的 32B 推理模型
Prime Intellect 发布 INTELLECT-2,以 QwQ-32B 为基座,用 GRPO 和可验证奖励进行全球首个 32B 参数的无许可分布式强化学习训练,任何人可贡献异构算力。
Prime Intellect(网页)精选AI 评分6666 Prime Intellect 发布 INTELLECT-2:首个通过全球分布式强化学习训练的 32B 模型
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,在异步、异构的分布式算力网络上训练,性能较 QwQ-32B 在数学与编码基准上有提升。
推荐理由:官方发布首个通过全球分布式强化学习训练的 32B 推理模型,并开源训练框架、代码和数据,适合关注开源分布式训练路线的读者。
Prime Intellect(网页)AI 评分5353 Prime Intellect 发布 SYNTHETIC-2:行星尺度流水线并行推理生成开源推理数据集
Prime Intellect 发布 SYNTHETIC-2,一个基于 DeepSeek-R1-0528 的开源推理数据集,配合全球分布的流水线并行推理运行,支持从消费级 GPU 到 NVIDIA 和 AMD 集群的异构算力贡献。
Prime Intellect(网页)精选AI 评分7171 Prime Intellect 发布 106B MoE 模型 INTELLECT-3 并开源完整训练配方
Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM 4.5 Air 基座上经过 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平,超越许多更大的前沿模型,如 AIME24 90.8 分、AIME25 88.0 分、GPQA-Diamond 74.4 分。
推荐理由:原文同时放出模型权重、训练框架和全部环境,读者可以看到大规模 RL 后训练的完整可复用配方。
Prime Intellect(网页)AI 评分5757 Prime Intellect 整合 23 个任务集,提供约 365,000 个 SWE、终端与搜索智能体 RL 环境
Prime Intellect 发布 research-environments,为 23 个开源智能体任务集提供统一 taskset API,涵盖约 198,000 个软件工程任务、约 28,600 个终端任务和约 137,600 个搜索任务,总计约 365,000 个环境,配套约 135,000 个预构建任务镜像。
MiniMax:Blog(网页)精选AI 评分7575 MiniMax 发布 M2.5 模型,SWE-Bench Verified 达 80.2%
MiniMax 发布 MiniMax-M2.5,在 SWE-Bench Verified 得分 80.2%、Multi-SWE-Bench 51.3%、BrowseComp 76.3%,完成 SWE-Bench Verified 评测比 M2.1 快 37%,与 Claude Opus 4.6 的 22.9 分钟持平。
推荐理由:官方公布了 M2.5 在编码、搜索和办公场景的成绩与价格细节,读者可以据此比较它与同类模型的性价比。
MiniMax:Blog(网页)精选AI 评分7272 MiniMax 发布 M2.7:SWE-Pro 得分 56.22%,展示模型自进化工作流
MiniMax 发布 M2.7 模型,已在 MiniMax Agent 和 API 平台全面可用。该模型在 SWE-Pro 得分 56.22%(接近 Opus 4.6),VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高,MM Claw 准确率 62.7%。
推荐理由:官方给出了各基准的具体分数和自进化工作流细节,读者可以据此与同档模型做直接比较。
METR:Research(网页)精选AI 评分7878 METR 发布 OpenAI o3 与 o4-mini 初步评估报告
METR 对 OpenAI o3 和 o4-mini 进行了发布前三周的初步自主能力评估。在更新版 HCAST 上,o3 和 o4-mini 的 50% 时间视界约为 1.5 小时和 1.25 小时,分别约为 Claude 3.7 Sonnet 的 1.8 倍和 1.5 倍,是已测公开模型中的最高点估计。
推荐理由:METR 用 HCAST 和 RE-Bench 给出 o3 与 o4-mini 的自主能力数据,并披露 o3 的 reward hacking 案例,为安全评估提供了具体证据。
LMSYS:Blog(Chatbot Arena 团队)AI 评分5959 LMSYS SpecForge 团队联合 Ant、Meituan 等发布 SpecBundle Phase 1 及 SpecForge v0.2
LMSYS SpecForge 团队与 Ant、Meituan、Nex-AGI、EigenAI 合作发布 SpecBundle Phase 1,为 Llama。
LMSYS:Blog(Chatbot Arena 团队)精选AI 评分7272 SGLang 和 Miles 实现 NVIDIA Nemotron 3 Ultra Day-0 支持
SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。
推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。
LMSYS:Blog(Chatbot Arena 团队)AI 评分4747 Z Lab、Modal 与 SGLang 联合发布 DFlash 与 Spec V2 推测解码方案
Z Lab、Modal 与 SGLang 联合发布 DFlash 推测解码模型及 SGLang 新默认 Spec V2 引擎,为 Qwen 3.5 397B-A17B 提供更低延迟的 LLM 推理服务。
LMSYS:Blog(Chatbot Arena 团队)AI 评分3939 Miles 新增 OPD 支持:Qwen3.5-35B-A3B 自蒸馏实验验证
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并新增稀疏的逐位置候选 token 打分流程,避免 O(R²K) 的密集 payload。