跳到正文

#数据/训练

今日 4 条
9月5日周六
  1. a16z:News(RSS)43

    a16z 投资 Gimlet Labs:打造首个多芯片推理云

    a16z 宣布投资 Gimlet Labs,后者正在构建首个多芯片推理云,可在同一功耗范围内为前沿模型带来最高 10 倍吞吐与交互性提升。Gimlet 通过编译器与运行时把不同模型和工具调度到 GPU、CPU 及专用加速器上,并将编排延伸至数据中心层面,对开发者只暴露单一推理 API。其客户已包括一家前沿实验室和一家超大规模云厂商。

9月4日周五
  1. Google Research62

    Google 与 HHMI Janelia 发布完整雄性果蝇脑连接组图谱

    Google Research 与 HHMI Janelia 及剑桥等机构合作,在 Cell 发表论文,发布完整雄性果蝇脑与中枢神经系统连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:读者可了解 AI 重建如何把电子显微镜切片拼成完整脑图谱,以及这一资源对神经科学研究的用途。

9月3日周四
  1. Google DeepMind:Blog(RSS)74

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 与 Google Research 发布 WeatherNext 3 全球天气 AI 模型,直接学习实时地球静止卫星数据,每小时生成一次预报,地表变量分辨率达 5 公里,整体比 WeatherNext 2 的 25 公里网格清晰约 5 倍。

    推荐理由:对比前代的分辨率、更新频率与降水评分提升,可了解实时卫星数据如何改变全球天气预报的精度边界。

9月2日周三
9月1日周二
8月28日周五
  1. Thinking Machines45

    为 RLVR 清洗数据并对齐奖励函数需要前期投入专业知识和精力,但结果是得到一个在复杂任务上达到 SOTA 的模型。 UIUC 和 Bridgewater 研究人员的客座文章,与我们的团队合作完成。 https://thinkingmachines.ai/news/putting-task-expertise-into-rl

    引用Tinker@tinkerapi

    LLMs with scaffolds have lagged on text-to-SQL, a task that relies on human judgment. By folding expert judgment into every part of RLVR on Tinker, @maxYuxuanZhu and @ddkang (UIUC and Bridgwater) trained the first text-to-SQL model to beat the human mark. https://thinkingmachines.ai/news/putting-task-expertise-into-rl

  2. MIT News(RSS)35

    MIT 团队提出 PottsMPNN:不再以还原天然序列衡量蛋白质设计

    MIT 生物学系团队开发出机器学习框架 PottsMPNN,通过引入支配蛋白质结构与稳定性的物理原理并建模氨基酸两两相互作用,提升序列生成与突变稳定性预测能力,成果发表于 PNAS。研究者指出,长期以来以能否复现进化选出的天然序列作为成功标准并非蛋白质设计的最佳指标,PottsMPNN 在减少对天然序列依赖的同时,结构兼容性与能量预测反而改善,可设计出序列不类似任何天然蛋白的结构可行蛋白。

8月26日周三
  1. MIT News(RSS)43

    MIT 提出 CrysVCD 框架:让 AI 生成的材料更稳定、更贴近真实应用

    MIT 研究人员提出 CrysVCD 框架,在材料生成前用语言模型约束价电子规则,使常用材料模型在近 70% 的生成结果中达到高晶格动力学稳定性。该方法比生成后再筛选的方案效率高一个数量级,微调后生成的晶体材料机械稳定性达 68%、亚稳性达 85%,并可定向生成高热导率、高介电常数等材料。

8月25日周二
  1. Hugging Face:Blog(RSS)66

    IBM 发布 Granite 4.2 推理模型系列并详解构建过程

    IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense 版本,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文扩展到 512K),经 SFT 和多阶段 GRPO 强化学习训练,8B 和 30B 额外经历 SWE、终端、搜索三类真实环境 agentic RL。

    推荐理由:官方完整披露了从预训练、SFT 到多阶段 GRPO 强化学习的训练细节,读者可以据此了解推理模型的完整构建流程。

8月22日周六
8月21日周五
  1. jietang46

    精彩评论:FLOPs 是智能;参数是知识!

    引用Liam Fedus@LiamFedus

    An excellent history of scaling laws from @jietang. In 2020, we explored the limits of sparsity in Switch Transformers by routing each token to only 1 out of 2048 experts (in retrospect, a bold choice). The model had fewer than 3B activated parameters, but 1.6T total parameters (comparable to today's frontier models). The 1.6T model achieved better C4 perplexities than the T5 models using far less compute, set a new SOTA on TriviaQA, but was dumb as bricks on reasoning tasks like SuperGLUE. The lesson was that the optimal tokens-per-parameter ratio is highly task-dependent. Or as @NShazeer had already intuited: FLOPs were intelligence; parameters were knowledge!

  2. Microsoft Research 博客(RSS)41

    微软 Skala 1.1 发布:训练数据增 2.5 倍,已接入 CP2K 并推进 Psi4、FHI-aims、ORCA、VASP 集成

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比首个公开版本多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,精度超过当前领先的全局(范围分离)杂化泛函而保持半局域泛函的计算成本。

  3. NVIDIA Technical Blog(开发者技术博客 · RSS)25

    生成式推荐系统如何重新定义大规模 RecSys

    生成式推荐系统正把 RecSys 从传统嵌入向量相似度目标转向生成式目标,即根据用户历史序列预测大目录中的下一个动作或物品。NVIDIA 技术博客指出,RecSys 是消费互联网中最普遍却极难大规模训练与服务的机器学习问题之一,LLM 的出现推动了这一范式转变。

8月20日周四
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)31

    用 NVIDIA FLARE 构建联邦多模态 AI 工作流

    NVIDIA 发布技术博客,介绍如何用 NVIDIA FLARE 构建联邦多模态 AI 工作流,在数据无法集中到一处的情况下跨数据本地站点协调视觉语言模型(VLM)训练。VLM 可支持视觉问答、图像描述和图文推理等任务,而联邦学习为这类分布式数据场景提供了训练协调方案。

8月19日周三
8月17日周一
8月13日周四
  1. Microsoft Research 博客(RSS)37

    MindTopo 揭示多模态大模型的空间推理能力短板

    微软研究院推出 MindTopo 基准,从连续性、分离、顺序、包围、绳结五类拓扑关系评估多模态大模型的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步动作时难以维持拓扑约束。

8月12日周三
8月11日周二
  1. MIT News(RSS)44

    MIT CSAIL 与清华提出 GeoPT:让 AI 模型学会物理,仿真提速 2 倍、数据省 60%

    MIT CSAIL 与清华研究人员提出预训练方法 GeoPT,通过 130 万条"合成动力学"样本让仿真模型学习物理规律,达到峰值性能的速度比领先模型快 2 倍,所需数据最多减少 60%。在工业基准上,GeoPT 在速度、精度和效率上超越 SOTA 模型,模拟船体受风浪时用 60% 更少标注数据、达到峰值精度快 4 倍,并能在数秒内完成超 1 亿网格点的高保真仿真。

8月10日周一
8月6日周四
  1. Meta Engineering Blog(RSS)47

    Meta 广告排序的多阶段序列模型:从用户序列到 LLM 式缩放定律

    Meta 为广告排序提出多阶段序列模型,将离线用户建模与在线排序解耦,并引入稠密 tokenization 与 target-aware attention,使序列模型呈现可预测的 LLM 式缩放定律。该平台已带来 Instagram 转化率 6%、Facebook 转化率 3%、Facebook 广告点击 3.5% 的累计提升,并成为 Meta 生成式广告推荐模型 GEM 的核心组件。

7月31日周五
7月29日周三
7月26日周日
  1. BAIR:Berkeley AI Research Blog32

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 智能体的摘要以自然语言"信念状态"形式隔离并监督其信息内容,替代完整交互历史作为工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 长度也低于全上下文设置。

7月23日周四
7月21日周二
  1. OpenAI:Alignment 研究博客(RSS)74

    OpenAI 与 Apollo Research 提出 Contrastive SDF 测量模型的 reward-seeking 倾向

    OpenAI 与 Apollo Research 发布 Contrastive Synthetic Document Finetuning 方法,通过向模型两个副本灌输相反的评分者信念,测量行为对评分者偏好的因果敏感度。

    推荐理由:原文提出可量化的 reward-seeking 测量方法,并用模型有机体验证其有效性,读者可以据此了解前沿 RL 训练中奖励寻求的演变趋势。

7月16日周四
7月15日周三