跳到正文

#模型发布

今日 9 条
9月30日周三
  1. Liquid AI 模型与工程博客(网页)53

    Liquid AI 发布 LFM2-ColBERT-350M 多语言晚交互检索模型

    Liquid AI 发布 LFM2-ColBERT-350M,一个基于 LFM2 骨干的晚交互检索模型,支持用一种语言存储文档、用其他语言查询检索。在扩展的 NanoBEIR 多语言基准上,其跨语言检索能力显著优于 150M 参数的 GTE-ModernColBERT-v1,尤其在德语、阿拉伯语、韩语和日语上;尽管模型体积更大,查询和文档编码吞吐与对方相当。

  2. Liquid AI 模型与工程博客(网页)66

    Liquid AI 发布 LFM2.5-8B-A1B 端侧 MoE 模型,128K 上下文主打工具调用

    Liquid AI 发布 LFM2.5-8B-A1B 端侧 MoE 模型,上下文窗口从 32,768 扩展到 128K tokens,预训练从 12T 增至 38T tokens,词表翻倍到 128,000 以提升非拉丁文字的编码效率。

    推荐理由:官方详细给出上下文、训练管线和实测基准,读者可以据此评估这款端侧 MoE 模型是否适合本地 Agent 工作流。

  3. Liquid AI 模型与工程博客(网页)72

    Liquid AI 发布端侧智能体模型 LFM2.5-2.6B

    Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,Base 与后训练版本已在 Hugging Face 开放。

    推荐理由:原文给出完整的四阶段后训练流程、多基准对比和 CPU 与手机端实测速度,读者可据此评估它对端侧 Agent 部署的适配度。

  4. Fireworks AI(网页)83

    Kimi K3 开源发布并上线 Fireworks:2.8T 参数、Day-0 推理与训练支持

    月之暗面的 Kimi K3 以开源权重发布,共 2.8T 总参数、104B 激活参数、896 专家、1M 上下文,并在 Fireworks 上线 Day-0 推理与训练。

    推荐理由:原文汇总了 K3 的参数规格、多项第三方基准成绩和与 Opus 5 的成本对比,读者可据此评估开源模型在自有工作流中的可行性。

  5. Cursor Blog69

    Cursor 与 SpaceXAI 联合发布 Grok 4.6,聚焦长时程智能体任务

    Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。

    推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。

  6. Cognition 模型 / Devin 博客(网页)65

    Cognition 发布 SWE-grep 和 SWE-grep-mini,用 RL 训练快速并行上下文检索模型

    Cognition 训练了 SWE-grep 和 SWE-grep-mini 两个快速智能体模型,专攻高度并行的上下文检索,检索能力匹敌前沿编码模型,耗时低一个数量级。

    推荐理由:官方公布了模型设计、RL 训练细节和评测数字,读者可以借此了解并行上下文检索的实现路径。

  7. Cognition 模型 / Devin 博客(网页)69

    Cognition 发布 SWE-1.5 编码模型,最高 950 tok/s 并登陆 Windsurf

    Cognition 发布面向软件工程的 SWE-1.5 模型,参数量为数千亿级,与 Cerebras 合作以最高 950 tok/s 推理,比 Haiku 4.5 快 6 倍、比 Sonnet 4.5 快 13 倍,现已在 Windsurf 上线。

    推荐理由:原文给出速度对比、SWE-Bench Pro 成绩和训练细节,读者可以据此评估这款高速编码模型是否改变现有工作流。

  8. Anthropic:The Institute(旗舰研究长文 · 网页)80

    Anthropic 发布 Claude Haiku 4.5,SWE-bench Verified 得分 73.3%

    Anthropic 发布 Claude Haiku 4.5,称其是最快、最具性价比的模型,在编码、计算机使用和 Agent 任务上媲美 Sonnet 4,SWE-bench Verified 得分 73.3%。

    推荐理由:官方给出性能、价格与可用渠道的关键数字,读者可据此评估它在低延迟和多智能体场景中的适用性。

  9. Anthropic:The Institute(旗舰研究长文 · 网页)82

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 并降价最多 30%

    Anthropic 发布 Claude Sonnet 5.5,比 Sonnet 5 运行快 30%,典型负载成本最多低 30%,定价为每百万输入 token $2、输出 token $10,支持 1M 上下文窗口,可通过 Claude API、AWS、Google Cloud 和 Microsoft Foundry 使用。

    推荐理由:官方页面给出价格、token 用量与多客户评测数据,读者可以据此评估它在成本与性能间的取舍。

  10. Anthropic:The Institute(旗舰研究长文 · 网页)86

    Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低约 40%

    Anthropic 发布 Claude Opus 5.5,面向高强度编码和 AI 智能体的混合推理模型,具备 1M 上下文窗口,典型工作负载运行成本比 Opus 5 低约 40%。

    推荐理由:官方给出了定价、token 成本与多个客户实测数字,可帮助开发者评估升级到新 Opus 的成本与效率收益。

  11. Anthropic:The Institute(旗舰研究长文 · 网页)81

    Anthropic 发布 Claude Fable 5.1:面向编码与长时间智能体任务的新旗舰模型

    Anthropic 发布 Claude Fable 5.1,定位为其最强编码与知识工作模型,面向 Pro、Max、Team、Enterprise 用户及 Claude Platform、AWS、Google Cloud、Microsoft Foundry。

    推荐理由:官方页面给出定价、缓存降价、回退机制和客户实测引用,读者可以据此评估长时智能体与编码工作流的成本收益。

  12. Anthropic:The Institute(旗舰研究长文 · 网页)72

    Anthropic 发布 Claude Mythos 5.1,聚焦网络安全与生物研究并限制访问

    Anthropic 发布 Claude Mythos 5.1,是其面向网络安全和生物学研究的最强模型,目前仅向少量经审核的组织开放,定价为每百万输入 token $10、每百万输出 token $50。同底座的 Claude Fable 5.1 提供带护栏版本,生物护栏对良性请求的干预比 Fable 5 减少 85%,使用 Mythos 5.1 默认需接受 30 天数据保留政策。

    推荐理由:原文给出 Mythos 5.1 的受限开放方式、定价与 Fable 5.1 的护栏细节,读者可以据此了解高风险能力如何被分层开放。

  13. Aidan Gomez50

    Cohere 发布新一代嵌入模型家族 Embed 5,提供 Embed 5 Pro(前沿能力)和 Embed 5 Fast(低延迟)两个版本。Cohere CEO Aidan Gomez 转发称该系列可扩展性极强、精度达到 SOTA,并且一如既往支持完全私有化部署,可通过 Model Vault 使用。

    引用Cohere@cohere

    Introducing Cohere Embed 5: our new state-of-the-art family of embeddings models. Get frontier capabilities with Embed 5 Pro or low-latency performance with Embed 5 Fast.

  14. World Labs:官网65

    World Labs 发布实时生成世界模型 RTFM 并开放研究预览

    World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可在用户交互时实时生成视频,现已以研究预览形式开放浏览器演示。RTFM 在单张 H100 GPU 上以交互帧率运行推理,不依赖显式 3D 表示,作为端到端训练的学习式渲染器工作;它将带位姿的帧作为空间记忆并通过 context juggling 检索邻近帧,使世界在长时间交互中持续存在而不丢失。

  15. Baseten Base Labs:模型研究29

    Kimi K3

    月之暗面(Moonshot AI)的 Kimi K3 模型以 moonshotai/Kimi-K3 标识出现在一份 API 响应示例中,该响应返回了 chat.completion 对象。示例显示其 usage 包含 189 个 prompt_tokens、82 个 completion_tokens,其中多模态图像 token 为 96。

  16. Baseten Base Labs:模型研究16

    GLM-5.3-Flash

    GLM-5.3-Flash 出现在 Baseten Base Labs 的模型研究内容中,原始标题仅给出该模型名称,正文为一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。