跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

116条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 1–20 条 · 共 116 条
9月30日周三
  1. Berkeley RDI:Blog(AI 安全与评测)76

    UC Berkeley 用 AI 智能体审计 13 个 AI 基准,发现 45 个满分作弊方案

    UC Berkeley 团队构建了一个全自动 AI 智能体,审计 FrontierCS、Terminal-Bench、WebArena 等 13 个常用 AI 基准,确认了 45 个无需真正解题即可刷高或拿满分的作弊方案,全部附可运行的 PoC,覆盖 16 种攻击类型。

    推荐理由:作者用自动化智能体实测了 13 个常用 AI 基准,找到 45 个可验证的作弊方案,并给出可落地的防作弊设计建议。

  2. Prime Intellect(网页)65

    Prime Intellect 发布 INTELLECT-1:首次全球分布式训练 10B 参数模型

    Prime Intellect 启动 INTELLECT-1,称其为首个全球分布式训练的 10B 参数模型,基于 Llama-3 架构,使用超过 6 万亿 token 的数据混合(55% Fineweb-Edu、20% DLCM、20% Stack v2、5% OpenWebMath),并邀请任何人贡献算力。

    推荐理由:原文给出INTELLECT-1的训练规模、数据配比和通信优化细节,读者可据此了解全球分布式训练10B模型的可行路径。

  3. Prime Intellect(网页)66

    Prime Intellect 发布 INTELLECT-2:首个通过全球分布式强化学习训练的 32B 模型

    Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,在异步、异构的分布式算力网络上训练,性能较 QwQ-32B 在数学与编码基准上有提升。

    推荐理由:官方发布首个通过全球分布式强化学习训练的 32B 推理模型,并开源训练框架、代码和数据,适合关注开源分布式训练路线的读者。

  4. Prime Intellect(网页)71

    Prime Intellect 发布 106B MoE 模型 INTELLECT-3 并开源完整训练配方

    Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM 4.5 Air 基座上经过 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平,超越许多更大的前沿模型,如 AIME24 90.8 分、AIME25 88.0 分、GPQA-Diamond 74.4 分。

    推荐理由:原文同时放出模型权重、训练框架和全部环境,读者可以看到大规模 RL 后训练的完整可复用配方。

  5. Prime Intellect(网页)70

    Prime Intellect 发布 Lab 全栈后训练平台

    Prime Intellect 发布 Lab,一个面向智能体后训练的全栈平台,将 Environments Hub 与 Hosted Training、Hosted Evaluations 整合,覆盖从大规模智能体 RL 到推理评估的完整流程。

    推荐理由:原文给出了平台组成、已完成的训练规模和定价部署细节,读者可以据此判断它能否替代自建训练基础设施。

  6. Prime Intellect(网页)76

    Prime Intellect 发布开源自改进编码智能体 Prime Agent

    Prime Intellect 发布开源编码智能体 Prime Agent,围绕 Recursive Language Model(RLM)和 Continual Harness 两个抽象设计,通过持久 IPython 内核以程序化方式调用工具和子智能体,并支持对提示词、技能、记忆和子智能体进行 CRUD 式自改进。

    推荐理由:官方介绍了 RLM 与 Continual Harness 两个抽象和公开的评测数据,读者可以据此评估这个开源智能体运行时的适用场景。

  7. MiniMax:Blog(网页)72

    MiniMax 发布 M2.7:SWE-Pro 得分 56.22%,展示模型自进化工作流

    MiniMax 发布 M2.7 模型,已在 MiniMax Agent 和 API 平台全面可用。该模型在 SWE-Pro 得分 56.22%(接近 Opus 4.6),VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高,MM Claw 准确率 62.7%。

    推荐理由:官方给出了各基准的具体分数和自进化工作流细节,读者可以据此与同档模型做直接比较。

  8. LMSYS:Blog(Chatbot Arena 团队)63

    SGLang-Diffusion 发布两个月:速度较初版提升至 2.5 倍,新增 ComfyUI 集成与 LoRA 支持

    LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。

    推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。

  9. LMSYS:Blog(Chatbot Arena 团队)68

    SGLang 与 Miles 发布对 DeepSeek-V4 的 Day-0 推理与 RL 训练支持

    LMSYS 的 SGLang 与 Miles 团队宣布对 DeepSeek-V4(1.6T Pro、284B Flash)提供 Day-0 推理和 RL 训练支持,是首个在发布日同时服务与训练该模型的开源栈。

    推荐理由:LMSYS 团队详述了为 DeepSeek-V4 混合稀疏注意力等新架构所做的推理与 RL 训练优化,附基准数据。

  10. LMSYS:Blog(Chatbot Arena 团队)72

    SGLang 和 Miles 实现 NVIDIA Nemotron 3 Ultra Day-0 支持

    SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。

    推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。

  11. LMSYS:Blog(Chatbot Arena 团队)63

    SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持

    SGLang 团队宣布与 Qwen、阿里百炼、NVIDIA 和 AMD 合作,在 SGLang 和 Miles 中于发布当日支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B。

    推荐理由:原文给出 Qwen3.8 混合注意力架构的推理支撑细节和实测性能数字,读者可据此评估新模型在自建推理栈上的部署可行性。

  12. Liquid AI 模型与工程博客(网页)65

    Liquid AI 发布端侧基础模型 LFM2,含 0.35B、0.7B 和 1.2B 三个版本

    Liquid AI 发布新一代 Liquid Foundation Models(LFM2),定位市场上最快的端侧生成式 AI 基础模型,采用混合架构,包含 10 个双门控短程卷积块和 6 个分组查询注意力块。

    推荐理由:官方博客给出了 LFM2 的架构细节、CPU 推理对比和训练方法,读者可以据此评估它在端侧部署中的实际取舍。

  13. Liquid AI 模型与工程博客(网页)66

    Liquid AI 发布 LFM2.5-8B-A1B 端侧 MoE 模型,128K 上下文主打工具调用

    Liquid AI 发布 LFM2.5-8B-A1B 端侧 MoE 模型,上下文窗口从 32,768 扩展到 128K tokens,预训练从 12T 增至 38T tokens,词表翻倍到 128,000 以提升非拉丁文字的编码效率。

    推荐理由:官方详细给出上下文、训练管线和实测基准,读者可以据此评估这款端侧 MoE 模型是否适合本地 Agent 工作流。

  14. Fireworks AI(网页)83

    Kimi K3 开源发布并上线 Fireworks:2.8T 参数、Day-0 推理与训练支持

    月之暗面的 Kimi K3 以开源权重发布,共 2.8T 总参数、104B 激活参数、896 专家、1M 上下文,并在 Fireworks 上线 Day-0 推理与训练。

    推荐理由:原文汇总了 K3 的参数规格、多项第三方基准成绩和与 Opus 5 的成本对比,读者可据此评估开源模型在自有工作流中的可行性。