跳到正文

全部动态

今日 46 条
今天10月1日周四
9月30日周三
  1. xAI:News(网页)64

    xAI 发布 grok-voice-think-fast-1.0 旗舰语音模型并开放 API

    xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,可通过 API 使用。该模型面向客服、销售等复杂多步骤语音工作流,原生支持 25+ 种语言,在 τ-voice Bench 排行榜上排名第一。后台推理不影响响应延迟。该模型已为 Starlink 提供电话客服与销售:销售转化率 20%,客服自主解决率 70%,单个智能体使用 28 个工具。

    推荐理由:官方给出了基准成绩、多语言支持和 Starlink 实际运营数据,可帮助读者评估这款语音模型在真实客服场景的可用性。

  2. xAI:News(网页)62

    xAI 发布编码模型 grok-build-0.1,API 公测上线

    xAI 将编码模型 grok-build-0.1 以公开测试形式上线 xAI API,该模型专为智能体编码任务训练,支持 Web 开发、调试和 MCP,也是驱动 Grok Build 的同一模型。

    推荐理由:xAI 官方公告给出了 grok-build-0.1 的定位、速度、定价和适配工具,读者可据此评估是否接入自己的编码工作流。

  3. xAI:News(网页)49

    xAI 发布 Grok Imagine 1.5 Preview 图生视频模型,上线 xAI API

    xAI 最新图生视频模型 grok-imagine-video-1.5-preview 已通过 xAI API 开放预览。该模型可将单张静态图像转为流畅的电影感视频,支持最高 720p 分辨率,用户用自然语言提示词即可控制镜头运动、节奏与声音设计,并能保持原图的细节与光照。模型还支持逐帧生成并串联成更长场景,可用几行 Python 代码调用。

  4. xAI:News(网页)64

    xAI 将 Grok 4.5 推向 iOS、Android、网页和 X 平台

    xAI 宣布其最强模型 Grok 4.5 当日起在 grok.com、X 以及 iOS 和 Android 应用上可用。官方称该模型更准确理解提问、能跟踪更长对话并更快给出答案,可完成制作电子表格、把大纲转为幻灯片和图表、撰写文稿、提炼长 PDF 要点等任务,并通过 Microsoft 365 插件在 Word、Excel、PowerPoint 和 Outlook 中直接使用。

    推荐理由:xAI 官方说明 Grok 4.5 的能力改进和全平台可用范围,读者可据此评估在日常问答和知识工作中的使用方式。

  5. xAI:News(网页)68

    xAI 发布 Grok Voice Think Fast 2.0 语音模型

    xAI 发布 Grok Voice Think Fast 2.0,称其在 Artificial Analysis 语音到语音质量指数达 82.9%,高于上代 75.7% 及对比模型;出声延迟 0.70s,转录准确率较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5–2.0×,推理 token 效率为上代 0.4×。

    推荐理由:原文给出 Artificial Analysis 对比数据和价格迁移细节,读者可据此评估它在语音智能体场景的替换成本。

  6. Arena.ai62

    Arena 宣布 Claude Sonnet 5.5 (High) 可在 Direct Mode 中测试,限时 48 小时,至 10 月 2 日早 8 点(PT)结束,之后将继续在 Battle 和 Agent Mode 提供。引用的 @claudeai 内容称该模型是 Claude 5.5 家族第二款,比 Sonnet 5 快 30% 以上,多数工作成本降低最多 30%。

    引用Claude@claudeai

    Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.

  7. Sarvam AI(网页)49

    Sarvam AI 发布 Sarvam Edge,将语音识别与合成模型搬上端侧

    Sarvam AI 发布 Sarvam Edge,推动语音识别、语音合成与多语言翻译模型在设备端本地推理。其端侧语音识别模型参数 74M、FP16 占用约 294MB,支持 10 种印度语言,在 Snapdragon 8 Gen 3 上实时因子约 0.12(RTFx 8.5),首 token 延迟低于 300 毫秒。语音合成同样以单一模型支持 10 种语言和 8 个多语言说话人,无需联网。

  8. Prime Intellect(网页)65

    Prime Intellect 发布 INTELLECT-1:首次全球分布式训练 10B 参数模型

    Prime Intellect 启动 INTELLECT-1,称其为首个全球分布式训练的 10B 参数模型,基于 Llama-3 架构,使用超过 6 万亿 token 的数据混合(55% Fineweb-Edu、20% DLCM、20% Stack v2、5% OpenWebMath),并邀请任何人贡献算力。

    推荐理由:原文给出INTELLECT-1的训练规模、数据配比和通信优化细节,读者可据此了解全球分布式训练10B模型的可行路径。

  9. Prime Intellect(网页)66

    Prime Intellect 发布 INTELLECT-2:首个通过全球分布式强化学习训练的 32B 模型

    Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,在异步、异构的分布式算力网络上训练,性能较 QwQ-32B 在数学与编码基准上有提升。

    推荐理由:官方发布首个通过全球分布式强化学习训练的 32B 推理模型,并开源训练框架、代码和数据,适合关注开源分布式训练路线的读者。

  10. Prime Intellect(网页)71

    Prime Intellect 发布 106B MoE 模型 INTELLECT-3 并开源完整训练配方

    Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM 4.5 Air 基座上经过 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平,超越许多更大的前沿模型,如 AIME24 90.8 分、AIME25 88.0 分、GPQA-Diamond 74.4 分。

    推荐理由:原文同时放出模型权重、训练框架和全部环境,读者可以看到大规模 RL 后训练的完整可复用配方。

  11. MiniMax:Blog(网页)75

    MiniMax 发布 M2.5 模型,SWE-Bench Verified 达 80.2%

    MiniMax 发布 MiniMax-M2.5,在 SWE-Bench Verified 得分 80.2%、Multi-SWE-Bench 51.3%、BrowseComp 76.3%,完成 SWE-Bench Verified 评测比 M2.1 快 37%,与 Claude Opus 4.6 的 22.9 分钟持平。

    推荐理由:官方公布了 M2.5 在编码、搜索和办公场景的成绩与价格细节,读者可以据此比较它与同类模型的性价比。

  12. MiniMax:Blog(网页)72

    MiniMax 发布 M2.7:SWE-Pro 得分 56.22%,展示模型自进化工作流

    MiniMax 发布 M2.7 模型,已在 MiniMax Agent 和 API 平台全面可用。该模型在 SWE-Pro 得分 56.22%(接近 Opus 4.6),VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高,MM Claw 准确率 62.7%。

    推荐理由:官方给出了各基准的具体分数和自进化工作流细节,读者可以据此与同档模型做直接比较。

  13. METR:Research(网页)78

    METR 发布 OpenAI o3 与 o4-mini 初步评估报告

    METR 对 OpenAI o3 和 o4-mini 进行了发布前三周的初步自主能力评估。在更新版 HCAST 上,o3 和 o4-mini 的 50% 时间视界约为 1.5 小时和 1.25 小时,分别约为 Claude 3.7 Sonnet 的 1.8 倍和 1.5 倍,是已测公开模型中的最高点估计。

    推荐理由:METR 用 HCAST 和 RE-Bench 给出 o3 与 o4-mini 的自主能力数据,并披露 o3 的 reward hacking 案例,为安全评估提供了具体证据。

  14. LMSYS:Blog(Chatbot Arena 团队)72

    SGLang 和 Miles 实现 NVIDIA Nemotron 3 Ultra Day-0 支持

    SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。

    推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。