跳到正文

#模型发布

今日 9 条
9月30日周三
  1. Baseten Base Labs:模型研究22

    Qwen3.5 122B-A10B

    Qwen3.5 122B-A10B 是出现在 Baseten Base Labs 模型研究页面中的模型标识。相关页面仅展示了一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183,未披露该模型的参数规模、上下文长度或可用性等具体信息。

  2. Baseten Base Labs:模型研究28

    DeepSeek V3.1 模型输出示例

    Baseten Base Labs 模型研究页面展示了 DeepSeek V3.1(模型标识 deepseek-ai/DeepSeek-V3-1-0819)的一次文本补全调用,输入 14 个 prompt token,输出 226 个 completion token,共 240 token,内容为 FizzBuzz 编程题解答,finish_reason 为 stop。

  3. Baseten Base Labs:模型研究6

    DeepSeek V4 Pro

    Baseten Base Labs 模型研究页面出现名为 DeepSeek V4 Pro 的条目,但正文仅有一段 chat.completion 格式的 API 返回示例,model 字段为空,未披露任何模型参数、benchmark 分数或可用性信息。

  4. Baseten Base Labs:模型研究18

    Baseten 发布 Zembed 1 嵌入模型

    Baseten 旗下 Base Labs 推出嵌入模型 Zembed 1,模型标识为 zembed-1,通过 API 返回 embedding 对象列表。该接口按 prompt_tokens 计费,示例请求消耗 37 个 token。

  5. Baseten Base Labs:模型研究18

    Nomic Embed Code

    Nomic Embed Code 的示例响应显示,其返回的 embedding 向量为单元素数组,model 字段标注为 thenlper/gte-base,usage 中 prompt_tokens 与 total_tokens 均为 512。

  6. MiniMax:Blog(网页)71

    MiniMax 开源 H3 通用视频生成模型,支持 2K 分辨率与原生立体声音频

    MiniMax 正式开源下一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频的多模态统一理解,可生成最长 15 秒、768p(经 H3-Regenerate-2K 可达 2K)、24 FPS 并带 32 kHz 立体声音频的视频。

    推荐理由:官方开源公告给出了完整的三模块系统结构、模型规格和本地部署方式,读者可以据此评估在自己的视频生成流程中如何接入。

  7. LMSYS:Blog(Chatbot Arena 团队)76

    千问团队开源 Qwen3.8-Flash-Next,SGLang 提供 day-0 支持

    千问(Qwen)团队开源 Qwen3.8-Flash-Next,一个多模态 MoE 模型,被视为 Qwen4 架构的早期预览。模型总参数 125B 加 51B N-gram Embedding,每 token 激活 6B,48 层中含 36 层 GDN 线性注意力和 12 层 QSA 稀疏注意力,MoE 使用 512 专家 top-10 路由。

    推荐理由:原文给出该模型混合架构细节和 SGLang 的 day-0 推理支持数据,读者可以据此评估长上下文部署的实际收益。

  8. Meta AI:Blog(网页)80

    Meta Superintelligence Labs 发布 Muse Spark 多模态推理模型

    Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线,并向部分用户开放私有 API 预览。

    推荐理由:官方披露了预训练效率、RL 与测试时推理三条扩展路径的具体结果,以及 Apollo Research 关于评估意识的独立发现,可据此了解其技术栈现状。

  9. LMSYS:Blog(Chatbot Arena 团队)64

    SGLang 与 Miles 发布 DeepSeek-V4.1 的 Day-0 支持

    SGLang 和 Miles 团队发布对 DeepSeek-V4.1 的 Day-0 支持,解析其低比率压缩、滑动窗口注意力(SWA)、流形超连接(mHC)和 Engram 记忆等架构对推理栈的影响。

    推荐理由:原文拆解了 DeepSeek-V4.1 新架构对推理栈的影响,并给出 SGLang 与 Miles 的 Day-0 支持方案和实测数字。

  10. Liquid AI 模型与工程博客(网页)44

    Liquid AI 的 LFM 系列模型:面向端侧部署的高效基础模型

    Liquid AI 的 Liquid Foundation Models(LFMs)主打在真实约束下运行,可在 GPU、CPU、NPU 上无缝部署于可穿戴设备、机器人、手机、笔记本、汽车等终端。每个 LFM 均可免费下载、运行和微调(含商用),直到公司年收入超过 $10M。模型面向毫秒级延迟、端侧韧性与数据隐私设计,支持本地、云端及混合 AI 部署。

  11. Fireworks AI(网页)68

    Fireworks Research 发布 Ember-1:以 Kimi K3 为基础实现同等质量下更省 token

    Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。

    推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。

  12. Black Forest Labs:Blog(网页)63

    Black Forest Labs 发布 FLUX 3 多模态基础模型,并与 mimic 合作推出机器人视频动作模型 FLUX-mimic

    Black Forest Labs 发布早期版本 FLUX 3 多模态基础模型,联合训练图像、视频与音频,视频预测占训练算力超 95%。FLUX 3 骨干可解码动作预测,加入动作模态后视频质量先降最多 10%,3500 步后恢复原有水平。

    推荐理由:官方给出训练细节与工厂实测数据,说明同一多模态骨干如何同时支持内容生成与机器人动作控制。

  13. Black Forest Labs:Blog(网页)71

    Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access

    Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。

    推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。

  14. Black Forest Labs:Blog(网页)66

    Black Forest Labs 发布 FLUX 3 Video,文生视频与图生视频正式开放

    Black Forest Labs 宣布 FLUX 3 Video 初版正式开放,可通过 BFL API 和部分合作伙伴使用。模型支持最长 20 秒、HD(720p)与 Full HD(1080p,经上采样)的视频生成,并伴随生成原生音频;能力包括文生视频、图生视频与关键帧、视频续接(最多 4 秒)、单次生成多镜头、多语言对白与唇形同步、Draft Mode 低成本预览等。

    推荐理由:原文给出具体生成时长、分辨率、多语言与评测结果,读者可据此判断 FLUX 3 Video 在视频生成工作流中的可用性。

  15. Artificial Analysis 完整文章(网页)73

    GPT-6.1 Sol 发布 7 天后替代 GPT-6 Sol,智能指数仅比 GPT-6 Astra 低 1 分

    Artificial Analysis 评测 GPT-6.1 Sol:智能指数比 GPT-6 Sol 高 4 分,距 GPT-6 Astra 仅 1 分,每任务成本 $0.72 不到 GPT-6 Astra 的四分之一。

    推荐理由:原文给出 Intelligence Index 得分、Cost per Task 与各基准的逐项对比,读者可据此判断 GPT-6.1 Sol 在成本效率前沿上的位置。

  16. Anthropic:The Institute(旗舰研究长文 · 网页)60

    Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低 40%

    Anthropic 于 9 月 22 日发布 Claude Opus 5.5,称其在多数工作上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。同页还预告 9 月 10 日的威胁情报报告,介绍八个月内在多个行动中识别并阻断威胁行为者滥用 Claude 的案例,以及 2025 年以来恶意使用方式的演变。

  17. OpenAI:官网动态(RSS · 排除企业/客户案例)70

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,定位接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景,价格为其标准 API 输入和输出 token 价格的五分之一。

    推荐理由:原文点出 GPT-6.1 Sol 的定位与价格对比,读者可以据此判断它在编码等场景的成本取舍。