#数据/训练
#数据/训练
今日 1 条
Perplexity@perplexity_aiAI 评分4343
Sarvam AI(网页)AI 评分5252 Sarvam AI 发布开源混合推理模型 Sarvam-M,基于 Mistral Small 24B 强化印度语言能力
Sarvam AI 发布开源模型 Sarvam-M,基于 24B 的 Apache 2.0 模型 Mistral Small,经 SFT 和 RLVR 后训练而成,支持 think 与 non-think 两种模式。
Prime Intellect(网页)精选AI 评分6565 Prime Intellect 发布 INTELLECT-1:首次全球分布式训练 10B 参数模型
Prime Intellect 启动 INTELLECT-1,称其为首个全球分布式训练的 10B 参数模型,基于 Llama-3 架构,使用超过 6 万亿 token 的数据混合(55% Fineweb-Edu、20% DLCM、20% Stack v2、5% OpenWebMath),并邀请任何人贡献算力。
推荐理由:原文给出INTELLECT-1的训练规模、数据配比和通信优化细节,读者可据此了解全球分布式训练10B模型的可行路径。
Prime Intellect(网页)精选AI 评分6767 Prime Intellect 发布全球分布式协作训练的 10B 模型 INTELLECT-1
Prime Intellect 发布 INTELLECT-1,一个在五大国家、三大洲用最多 112 张 H100 协作训练的 10B 参数语言模型,训练 1T tokens 历时 42 天,基于 Llama-3 架构。
推荐理由:原文给出分布式训练的关键数字与方法细节,读者可以了解社区协作训练大模型的可行路径。
Prime Intellect(网页)AI 评分6060 Prime Intellect 发布 INTELLECT-2:首个全球分布式强化学习训练的 32B 推理模型
Prime Intellect 发布 INTELLECT-2,以 QwQ-32B 为基座,用 GRPO 和可验证奖励进行全球首个 32B 参数的无许可分布式强化学习训练,任何人可贡献异构算力。
Prime Intellect(网页)精选AI 评分6666 Prime Intellect 发布 INTELLECT-2:首个通过全球分布式强化学习训练的 32B 模型
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,在异步、异构的分布式算力网络上训练,性能较 QwQ-32B 在数学与编码基准上有提升。
推荐理由:官方发布首个通过全球分布式强化学习训练的 32B 推理模型,并开源训练框架、代码和数据,适合关注开源分布式训练路线的读者。
Prime Intellect(网页)AI 评分5353 Prime Intellect 发布 SYNTHETIC-2:行星尺度流水线并行推理生成开源推理数据集
Prime Intellect 发布 SYNTHETIC-2,一个基于 DeepSeek-R1-0528 的开源推理数据集,配合全球分布的流水线并行推理运行,支持从消费级 GPU 到 NVIDIA 和 AMD 集群的异构算力贡献。
Prime Intellect(网页)精选AI 评分7171 Prime Intellect 发布 106B MoE 模型 INTELLECT-3 并开源完整训练配方
Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM 4.5 Air 基座上经过 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平,超越许多更大的前沿模型,如 AIME24 90.8 分、AIME25 88.0 分、GPQA-Diamond 74.4 分。
推荐理由:原文同时放出模型权重、训练框架和全部环境,读者可以看到大规模 RL 后训练的完整可复用配方。
Prime Intellect(网页)AI 评分5757 Prime Intellect 整合 23 个任务集,提供约 365,000 个 SWE、终端与搜索智能体 RL 环境
Prime Intellect 发布 research-environments,为 23 个开源智能体任务集提供统一 taskset API,涵盖约 198,000 个软件工程任务、约 28,600 个终端任务和约 137,600 个搜索任务,总计约 365,000 个环境,配套约 135,000 个预构建任务镜像。
LMSYS:Blog(Chatbot Arena 团队)AI 评分3939 Miles 新增 OPD 支持:Qwen3.5-35B-A3B 自蒸馏实验验证
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并新增稀疏的逐位置候选 token 打分流程,避免 O(R²K) 的密集 payload。
Fireworks AI(网页)AI 评分4949 Harvey 联合 Fireworks 基于 Kimi K3 后训练法律模型 Tenet
Harvey 发布首个模型 Tenet,基于 Kimi K3 用 Fireworks Training API 的异步强化学习后训练,面向长周期法律工作。
Fireworks AI(网页)AI 评分5151 Genspark 与 Fireworks Lab 将 MiniMax M3 后训练为 Gen-1 Slides,质量比肩 Opus 5、成本约为其 1/17
Genspark 与 Fireworks Lab 合作,将开放权重多模态模型 MiniMax M3 后训练为 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
Cognition 模型 / Devin 博客(网页)AI 评分6161 Cognition 发布 SWE-1.6 预览,SWE-Bench Pro 得分较 SWE-1.5 高 11%
Cognition 分享正在训练中的 SWE-1.6 早期预览:当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%(51.7% 对 40.1%),推理速度同为 950 tok/s,并向小部分用户开放早期访问。
Cognition 模型 / Devin 博客(网页)AI 评分5858 Cognition 发布 RL 训练的 bug 检测模型 SWE-check,速度约为 Opus 4.6 的 10 倍
Cognition 与 Applied Compute 合作 RL 训练了专用 bug 检测模型 SWE-check,在内部 in-distribution 评测中对 Opus 4.6 的 delta F1 从 0.09 降到 0,out-of-distribution 的 delta F1 从 0.49 降到 0.29,同时运行时间快约 10 倍且推理更便宜。
Cognition 模型 / Devin 博客(网页)AI 评分6262 Cognition 发布 SWE-1.7:以 Kimi K2.7 为基座、更低成本达到前沿级智能体编码能力
Cognition 发布 SWE-1.7,称其为自己训练过的最强模型,以更低成本达到前沿级智能,已通过 Cerebras(1000 TPS)在 Devin 的 Web、Desktop 和 CLI 中可用。
Liquid AI 模型与工程博客(网页)AI 评分5050 Liquid AI 发布 LFM2.5 Q4_0 量化感知蒸馏检查点,面向边缘部署
Liquid AI 发布 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 的 4-bit Q4_0 检查点,采用量化感知蒸馏(QAD)训练,四款模型均保留约 97% 的 BF16 平均性能。
Microsoft Research 博客(RSS)精选AI 评分6666 微软研究院推出面向生物学复杂性的 AI 研究系统 Quine
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,从缩小化合物搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态世界模型与实验闭环设计,读者可了解 AI 参与生物实验设计与验证的具体路径。
clem 🤗@ClementDelangueAI 评分4747开源 RL 环境就是赢。当然是在 Hugging Face 上!
引用Harveen Singh Chadha@HarveenChadhawas looking for a quiet weekend but xiaomi dropped their rl envs repo last night to put in perspective, if you have to buy some tasks like this its usually hundred to thousand dollars per task so this repo is literally worth millions https://huggingface.co/datasets/XiaomiMiMo/MiMo-V2.6-RL-oss
Ant Ling@AntLingAGIAI 评分4646引用Vals AI@ValsAIAnt Group’s Ling 3.0 Flash Fin is a finance-specialized open-weight model that delivers strong financial analysis at budget-model pricing. On Finance Agent v2, it scores 54.9% at just $0.045 per task.
karminski-牙医@karminski3AI 评分4040引用Max For AI@MaxForAI🚨Qwen4家族首次曝光!! 刚刚,在2026年云栖大会的开幕式上,新任@Alibaba_Qwen LLM负责人刘大一恒官宣了即将到来的Qwen4家族! 包含Qwen4-Max Qwen4-Flash&Qwen4-Plus 还有Qwen4-27B!!! 未来Qwen会训5-10T的模型
Latent Space(RSS)精选AI 评分7979 Xiaomi MiMo-V2.6-Pro 1T-A42B 登顶开源权重模型,训练仅花费约 $3M
Latent Space AINews 汇总 2026/9/19-9/21 AI 动态,核心是 Xiaomi 发布 MiMo-V2.6-Pro(1.02T 总参数/42B 激活,MIT 许可),以 Artificial Analysis Intelligence Index 46 分成为新的开源权重榜首,成本为 $0.435/M 输入、$0.87/M 输出 token。
推荐理由:除发布信息外还汇总了 RL 成本与训练细节,读者可以看到开源权重模型追赶闭源的具体路径。
小米 MiMo:GitHub 新仓库(模型发布)AI 评分2828 小米 MiMo 的 verl/HybridFlow:灵活高效的 RL 后训练框架
小米 MiMo 在 GitHub 新建仓库 verl,其 HybridFlow 是一个灵活高效的强化学习后训练框架。该仓库定位为 RL post-training 框架,强调灵活性与效率,目前原文未披露参数规模、benchmark 分数或开源许可等细节。
Jeff Dean@JeffDeanAI 评分4242令人振奋的成果,@LiamFedus!祝贺 Periodic Labs 的整个团队!
引用Liam Fedus@LiamFedusWe built high-throughput materials labs in Menlo Park to create a loop between experiments and models. The labs generate fresh data, the models learn from it, and then help us decide what to try next. Using only 1,300 H200s, plus months of our experimental data, we mid-trained and RL’d an open-source model to surpass GPT-6 Astra on our analysis benchmark. We call it Neon. This is real footage from our lab. We’re focusing first on hard problems in materials science, including superconductors, magnets, and semiconductor materials. Read our blog posts below.
Google DeepMind:Blog(RSS)精选AI 评分8080 Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单核苷酸变异预测
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组全部约 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上。
推荐理由:AlphaGenome Atlas 把 90 亿个单核苷酸变异的预测结果做成可检索资源,读者可了解其数据规模与在罕见病研究中的验证案例。
Google DeepMind:Blog(RSS)精选AI 评分7474 Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型
Google DeepMind 与 Google Research 发布 WeatherNext 3 全球天气 AI 模型,直接学习实时地球静止卫星数据,每小时生成一次预报,地表变量分辨率达 5 公里,整体比 WeatherNext 2 的 25 公里网格清晰约 5 倍。
推荐理由:对比前代的分辨率、更新频率与降水评分提升,可了解实时卫星数据如何改变全球天气预报的精度边界。
Microsoft Research 博客(RSS)AI 评分5252 微软发布 GigaPath-Flash 与 GigaTIME-Flash 高效病理基础模型
微软研究院联合华盛顿大学和 Providence 发布 GigaPath-Flash 与 GigaTIME-Flash,两者均以 Apache 2.0 许可在 Hugging Face 开放权重。
Hugging Face:Blog(RSS)精选AI 评分6666 IBM 发布 Granite 4.2 推理模型系列并详解构建过程
IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense 版本,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文扩展到 512K),经 SFT 和多阶段 GRPO 强化学习训练,8B 和 30B 额外经历 SWE、终端、搜索三类真实环境 agentic RL。
推荐理由:官方完整披露了从预训练、SFT 到多阶段 GRPO 强化学习的训练细节,读者可以据此了解推理模型的完整构建流程。
蚂蚁 inclusionAI:GitHub 新仓库AI 评分1919 蚂蚁 inclusionAI 发布 SingProbe 官方训练代码
蚂蚁 inclusionAI 在 GitHub 上线 SingProbe 官方训练代码仓库。正文仅说明这是 SingProbe 的官方训练代码,未披露模型规模、训练数据或评测结果等细节。
上海人工智能实验室 InternLM:原创项目AI 评分3434 上海人工智能实验室 InternLM 开源 archspace,将 LLM 架构探索沉淀为社区可复用知识
上海人工智能实验室 InternLM 开源 archspace 项目,目标是把 LLM 架构探索转化为社区可复用的知识。该项目以“让架构探索成为可复用知识”为定位,面向 LLM 架构研究场景。
美团 LongCat:HuggingFace 新模型AI 评分7070 美团发布 LongCat-2.0:1.6T 参数 MoE 模型,MIT 协议开源
美团 LongCat 团队发布 LongCat-2.0,总参数 1.6 万亿、每 token 激活约 480 亿的 MoE 大语言模型,权重以 MIT 协议开源。
蚂蚁 inclusionAI:GitHub 新仓库AI 评分3535 蚂蚁 inclusionAI 开源 AReno:单节点扩展 RL 后训练工具包
蚂蚁 inclusionAI 在 GitHub 开源 AReno,一个易用且快速的工具包,用于在单节点上扩展强化学习后训练。该工具定位为轻量级 RL post-training 方案,具体性能数据与支持模型尚未在仓库说明中披露。
Nous Research:GitHub 新仓库AI 评分1818 Nous Research 发布 Megatron-LM 仓库,用于大规模 Transformer 模型训练研究
Nous Research 在 GitHub 新建 Megatron-LM 仓库,用于持续开展大规模 Transformer 模型训练研究。该仓库定位为规模化训练 Transformer 的持续性研究项目,目前公开信息仅包含这一句描述,未披露模型规模、参数或具体训练细节。
Nous Research:GitHub 新仓库AI 评分3939 Nous Research 发布 Megatron-Bridge 训练库
Nous Research 推出 Megatron-Bridge,一个面向 Megatron 系列模型的训练库,支持与 Hugging Face 的双向转换。该库同时提供模型训练能力与 Hugging Face 格式互转功能。
通义 QwenAudio:原创语音项目AI 评分3535 QwenLM 推出 FlashQLA:基于 TileLang 的高性能线性注意力内核库
QwenLM 发布 FlashQLA,一个基于 TileLang 构建的高性能线性注意力内核库。该库面向线性注意力算子提供内核实现,具体性能数据与可用性信息原文未披露。
Alibaba:GitHub 新仓库AI 评分4141 阿里巴巴开源 slime:面向 RL Scaling 的 LLM 后训练框架
阿里巴巴在 GitHub 发布 slime,一个面向 RL Scaling 的 LLM 后训练框架。该仓库为 fork 版本,用于贡献代码,所有改动均计划以 PR 形式提交上游。
Alibaba:GitHub 新仓库AI 评分3636 阿里巴巴开源 verl-recipe:基于 verl 的端到端 RL 训练示例集
阿里巴巴在 GitHub 上线 verl-recipe 仓库,提供一组基于 verl 的端到端强化学习训练示例。该仓库为 fork 版本,用于贡献代码,所有改动计划以 PR 形式提交至上游。
Ahead of AI(RSS)精选AI 评分7676 Sebastian Raschka 解析 2026 年 1-2 月 10 个开源权重 LLM 架构
Sebastian Raschka 按时间顺序梳理 2026 年 1-2 月的十个主要开源权重模型发布,包括 Arcee Trinity Large 400B。
推荐理由:作者以架构对比视角梳理近两个月主要开源权重模型发布,读者可以借此看清各家的注意力机制和效率设计选择。
Baichuan AI@BaichuanAIAI 评分4949引用Baichuan AI@BaichuanAIBaichuan-M3 Technical Report is live. 🚀 Report:https://arxiv.org/abs/2602.06570 Models: https://hf.co/collections/baichuan-inc/baichuan-m3 Try: https://ying.ai Built for clinical decision support, not trivia QA, optimized on the real outpatient workflow: Inquiry → Lab Testing → Diagnosis 🧑⚕️→🔬→🧾
Baichuan AI@BaichuanAIAI 评分5555