跳到正文

#模型发布

今日 43 条
9月30日周三
  1. Anthropic:The Institute(旗舰研究长文 · 网页)72

    Anthropic 发布 Claude Mythos 5.1,聚焦网络安全与生物研究并限制访问

    Anthropic 发布 Claude Mythos 5.1,是其面向网络安全和生物学研究的最强模型,目前仅向少量经审核的组织开放,定价为每百万输入 token $10、每百万输出 token $50。同底座的 Claude Fable 5.1 提供带护栏版本,生物护栏对良性请求的干预比 Fable 5 减少 85%,使用 Mythos 5.1 默认需接受 30 天数据保留政策。

    推荐理由:原文给出 Mythos 5.1 的受限开放方式、定价与 Fable 5.1 的护栏细节,读者可以据此了解高风险能力如何被分层开放。

  2. Aidan Gomez50

    Cohere 发布新一代嵌入模型家族 Embed 5,提供 Embed 5 Pro(前沿能力)和 Embed 5 Fast(低延迟)两个版本。Cohere CEO Aidan Gomez 转发称该系列可扩展性极强、精度达到 SOTA,并且一如既往支持完全私有化部署,可通过 Model Vault 使用。

    引用Cohere@cohere

    Introducing Cohere Embed 5: our new state-of-the-art family of embeddings models. Get frontier capabilities with Embed 5 Pro or low-latency performance with Embed 5 Fast.

  3. World Labs:官网65

    World Labs 发布实时生成世界模型 RTFM 并开放研究预览

    World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可在用户交互时实时生成视频,现已以研究预览形式开放浏览器演示。RTFM 在单张 H100 GPU 上以交互帧率运行推理,不依赖显式 3D 表示,作为端到端训练的学习式渲染器工作;它将带位姿的帧作为空间记忆并通过 context juggling 检索邻近帧,使世界在长时间交互中持续存在而不丢失。

  4. Baseten Base Labs:模型研究29

    Kimi K3

    月之暗面(Moonshot AI)的 Kimi K3 模型以 moonshotai/Kimi-K3 标识出现在一份 API 响应示例中,该响应返回了 chat.completion 对象。示例显示其 usage 包含 189 个 prompt_tokens、82 个 completion_tokens,其中多模态图像 token 为 96。

  5. Baseten Base Labs:模型研究16

    GLM-5.3-Flash

    GLM-5.3-Flash 出现在 Baseten Base Labs 的模型研究内容中,原始标题仅给出该模型名称,正文为一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。

  6. Baseten Base Labs:模型研究22

    Qwen3.5 122B-A10B

    Qwen3.5 122B-A10B 是出现在 Baseten Base Labs 模型研究页面中的模型标识。相关页面仅展示了一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183,未披露该模型的参数规模、上下文长度或可用性等具体信息。

  7. Baseten Base Labs:模型研究28

    DeepSeek V3.1 模型输出示例

    Baseten Base Labs 模型研究页面展示了 DeepSeek V3.1(模型标识 deepseek-ai/DeepSeek-V3-1-0819)的一次文本补全调用,输入 14 个 prompt token,输出 226 个 completion token,共 240 token,内容为 FizzBuzz 编程题解答,finish_reason 为 stop。

  8. Baseten Base Labs:模型研究6

    DeepSeek V4 Pro

    Baseten Base Labs 模型研究页面出现名为 DeepSeek V4 Pro 的条目,但正文仅有一段 chat.completion 格式的 API 返回示例,model 字段为空,未披露任何模型参数、benchmark 分数或可用性信息。

  9. Baseten Base Labs:模型研究18

    Baseten 发布 Zembed 1 嵌入模型

    Baseten 旗下 Base Labs 推出嵌入模型 Zembed 1,模型标识为 zembed-1,通过 API 返回 embedding 对象列表。该接口按 prompt_tokens 计费,示例请求消耗 37 个 token。

  10. Baseten Base Labs:模型研究18

    Nomic Embed Code

    Nomic Embed Code 的示例响应显示,其返回的 embedding 向量为单元素数组,model 字段标注为 thenlper/gte-base,usage 中 prompt_tokens 与 total_tokens 均为 512。

  11. Sarvam AI(网页)65

    Sarvam 开源 30B 与 105B 推理模型

    Sarvam AI 于 2026 年 3 月 6 日开源 Sarvam 30B 和 Sarvam 105B 两个从零训练的 MoE 推理模型,训练完全在 IndiaAI 任务的算力上于印度完成,权重可从 AI Kosh 和 Hugging Face 下载。

    推荐理由:官方发布开源推理模型,给出完整训练与推理细节和基准对比,可了解印度本土全栈模型的做法。

  12. MiniMax:Blog(网页)71

    MiniMax 开源 H3 通用视频生成模型,支持 2K 分辨率与原生立体声音频

    MiniMax 正式开源下一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频的多模态统一理解,可生成最长 15 秒、768p(经 H3-Regenerate-2K 可达 2K)、24 FPS 并带 32 kHz 立体声音频的视频。

    推荐理由:官方开源公告给出了完整的三模块系统结构、模型规格和本地部署方式,读者可以据此评估在自己的视频生成流程中如何接入。

  13. LMSYS:Blog(Chatbot Arena 团队)76

    千问团队开源 Qwen3.8-Flash-Next,SGLang 提供 day-0 支持

    千问(Qwen)团队开源 Qwen3.8-Flash-Next,一个多模态 MoE 模型,被视为 Qwen4 架构的早期预览。模型总参数 125B 加 51B N-gram Embedding,每 token 激活 6B,48 层中含 36 层 GDN 线性注意力和 12 层 QSA 稀疏注意力,MoE 使用 512 专家 top-10 路由。

    推荐理由:原文给出该模型混合架构细节和 SGLang 的 day-0 推理支持数据,读者可以据此评估长上下文部署的实际收益。

  14. Meta AI:Blog(网页)80

    Meta Superintelligence Labs 发布 Muse Spark 多模态推理模型

    Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线,并向部分用户开放私有 API 预览。

    推荐理由:官方披露了预训练效率、RL 与测试时推理三条扩展路径的具体结果,以及 Apollo Research 关于评估意识的独立发现,可据此了解其技术栈现状。

  15. LMSYS:Blog(Chatbot Arena 团队)64

    SGLang 与 Miles 发布 DeepSeek-V4.1 的 Day-0 支持

    SGLang 和 Miles 团队发布对 DeepSeek-V4.1 的 Day-0 支持,解析其低比率压缩、滑动窗口注意力(SWA)、流形超连接(mHC)和 Engram 记忆等架构对推理栈的影响。

    推荐理由:原文拆解了 DeepSeek-V4.1 新架构对推理栈的影响,并给出 SGLang 与 Miles 的 Day-0 支持方案和实测数字。

  16. Liquid AI 模型与工程博客(网页)44

    Liquid AI 的 LFM 系列模型:面向端侧部署的高效基础模型

    Liquid AI 的 Liquid Foundation Models(LFMs)主打在真实约束下运行,可在 GPU、CPU、NPU 上无缝部署于可穿戴设备、机器人、手机、笔记本、汽车等终端。每个 LFM 均可免费下载、运行和微调(含商用),直到公司年收入超过 $10M。模型面向毫秒级延迟、端侧韧性与数据隐私设计,支持本地、云端及混合 AI 部署。