跳到正文

#数据/训练

今日 21 条
今天10月1日周四
  1. HuggingFace Daily Papers(社区热门论文)34

    生成式行为克隆中的多模态性研究:确定性回归为何在仿真基准上依然有效

    一项研究重新审视生成式行为克隆(BC)中的多模态假设,发现确定性动作 Transformer 在 LIBERO、Meta-World 等仿真基准上仍能匹配此前报告的 SOTA 结果,且推理延迟往往更低。作者通过 GMM 聚类构建条件模态估计器,估计结果显示所测仿真基准在采样状态下几乎都是单模态的;只有在机器人双模态操作概念验证任务上才观察到模态坍缩。

  2. IT之家(RSS)46

    HBM4 基片 4nm 工艺需求增长,三星晶圆代工 2026 亏损预计同比收窄 41.8%

    受 HBM4 基片 4nm 工艺需求增长带动,三星晶圆代工与 System LSI 业务 2026 年合并营业亏损预计同比收窄 41.8%,从 6.74 万亿韩元降至 3.92 万亿韩元。三星今年 2 月启动 HBM4 量产出货,第三季度 HBM4 收入预计环比增长三倍以上,并已于 7 月上调 4nm 新订单价格,部分先进节点涨幅达 10% 至 15%。

  3. Rohan Paul40

    Meta 论文提出让 AI 智能体自行管理上下文,无需硬编码遗忘规则,模型能判断哪些内容仍重要并保留,效果更好且算力更省。在深度研究基准上,该方法比 Codex 式摘要得分高 11.4%,算力消耗少 21.5%,且无需训练、现有模型即可实现。

    引用Rulin Shao@RulinShao

    ‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness

  4. Bloomberg:Technology(RSS)41

    Micron 业绩指引超预期:关键要点解读

    Micron 给出的本季度销售指引大幅超出市场预期,AI 建设热潮推动内存需求达到前所未有的水平。Gabelli 分析师 Hendi Susanto 指出,投资者要求 Micron 下一财年营收和利润翻倍,超大规模云厂商正提前锁定多年内存供应并附带定价窗口,他认为本轮周期与以往内存行业繁荣萧条有所不同。

  5. Bloomberg:Technology(RSS)54

    美光季度营收指引约 615 亿美元,超出分析师预期

    美光(Micron)给出的本财季(截至 11 月)营收指引约为 615 亿美元,高于分析师平均预期的 568 亿美元;剔除部分项目后每股利润预计约 38.15 美元,超过 36.02 美元的预期。公司称 AI 建设带来前所未有的需求,推动需求超过供给,但标题同时提到加薪压缩了利润率。

  6. Rohan Paul49

    AI 热潮正在抬高自身的资本成本。 物理瓶颈正转变为融资瓶颈。 超大规模厂商的债券发行洪流,使其债务相对其他顶级评级公司变得更贵。 The information 发表了一篇文章 “投资者持有超大规模厂商债务所要求的额外收益率,今年已上升约 0.25 个百分点” 美联储主席 Kevin Warsh 表示,AI 驱动的融资是推高美国国债收益率的部分原因。

  7. NVIDIA Technical Blog:Agentic AI / Generative AI41

    NVIDIA 扩展 xio-sig 加入 cuObject,并发布 SCADA Server SDK

    NVIDIA 将 cuObject 纳入 xio-sig,与 cuFile 并列,并宣布 cuObject 客户端与服务器库正式可用,开发者可基于其 API 和 RDMA 线协议构建加速对象存储应用。新的 SCADA Server SDK 让存储厂商构建响应 GPU 发起请求的 SCADA 服务器,IBM 已用集成 SCADA 与 IBM Storage Scale 的原型验证互操作性。

  8. Google AI:DEV 作者专属(RSS)47

    仅用 61 条数据构建气旋影响预测器:Cyclone Impact Forecaster 如何预测印度东海岸受灾人口

    Cyclone Impact Forecaster 用 61 条 EM-DAT 历史气旋记录训练出一个 2 参数对数线性模型,为北印度洋气旋影响半径内的每个地区输出受灾人口排名及 10-90% 预测区间,并叠加 XGBoost 的 6 小时风速强度预测,在 MapLibre GL 3D 卫星地球上可视化。

  9. HuggingFace Daily Papers(社区热门论文)56

    研究揭示分块 KV-cache 压缩导致模型出现周期性相位敏感弱位

    论文发现采用分块 KV-cache 压缩的模型存在相位敏感,检索准确率随压缩 stride 周期性波动,弱位置足以翻转答案。在 DeepSeek-V4 系列上,128K tokens 下最优与最差相位组差距达 15 到 40 个点;从零预训练的 0.6B 对照实验显示周期始终跟随 stride,full attention 各位置差距仅 6.1 个点而压缩模型可达 78 个点。

  10. Microsoft Research 博客(RSS)47

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可在风险出现前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、纬度、地质电导率和电网数据,评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

  11. Nature:Machine Learning 主题(RSS)28

    FinnGen 人群规模免疫多组学图谱揭示疾病调控机制

    FinnGen 研究团队构建了人群规模的免疫多组学图谱,通过单核 caQTL、eQTL 与 peak–gene link 分析揭示调控性疾病的遗传机制。相关汇总统计数据已公开并可交互浏览,个体级单核计数矩阵等数据需经审批后向研究者开放。研究还整合了 BBJ、日本 COVID-19 工作组及 eQTL Catalogue、TenK10K、SingleBrain 等数据集进行再分析。

  12. 🚨 AI News | TestingCatalog36

    Kled 发布 V3。定制 AI 数据采集任务现可在 72 小时内部署至 500,000+ 贡献者。 108 个可配置任务模板,覆盖图像、视频、音频、文本和标注。从第一视角视频到稀有语言的对话语音,应有尽有。 每天采集 800 万个数据点。 现实世界正在变得可编程 🌍

    引用Kled AI@useKled

    This is Kled V3. We've solved data collection for artificial general intelligence. Any consumer dataset that can exist, can now be collected from physical reality in under 72 hours. All powered by the largest and most comprehensive data application layer on the planet. (Thread)

9月30日周三
  1. Anthropic:Transformer Circuits(可解释性研究)38

    Anthropic 可解释性团队 Circuits Updates:TopK 与 Gated SAE 对比研究

    Anthropic 可解释性团队复现了 TopK SAE 与 Gated SAE 相对标准 L1 惩罚 SAE 的改进,确认两者在 L0/MSE 权衡上均有显著提升且表现相近。在 100 个特征的盲评中,TopK 与 Gated SAE 的特征可解释性未见明显退化,但 TopK 在高密度区间特征更多、平均激活变化更大。团队尚未实现 Gao 等人用于防止死特征的 Ghost Grads 变体。

  2. Berkeley RDI:Blog(AI 安全与评测)51

    Berkeley RDI 提出 DELTA 与 RL Grokking Recipe:RL 可让 LLM 解出此前完全不会的任务

    UC Berkeley 等机构发布论文(arXiv:2509.21016),提出合成编程任务套件 DELTA 与两阶段奖励策略,证明 RL 可以让基础模型在 pass@128=0 的任务上出现 grokking 式相变,准确率跳升至约 100%。方法先用逐测试密集奖励脱离全零区,再切换二值全通过奖励巩固策略;迁移实验显示学会的技能可组合外推,但在需要新不变量的变换性变化上较弱。

  3. Prime Intellect(网页)65

    Prime Intellect 发布 INTELLECT-1:首次全球分布式训练 10B 参数模型

    Prime Intellect 启动 INTELLECT-1,称其为首个全球分布式训练的 10B 参数模型,基于 Llama-3 架构,使用超过 6 万亿 token 的数据混合(55% Fineweb-Edu、20% DLCM、20% Stack v2、5% OpenWebMath),并邀请任何人贡献算力。

    推荐理由:原文给出INTELLECT-1的训练规模、数据配比和通信优化细节,读者可据此了解全球分布式训练10B模型的可行路径。

  4. Prime Intellect(网页)66

    Prime Intellect 发布 INTELLECT-2:首个通过全球分布式强化学习训练的 32B 模型

    Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,在异步、异构的分布式算力网络上训练,性能较 QwQ-32B 在数学与编码基准上有提升。

    推荐理由:官方发布首个通过全球分布式强化学习训练的 32B 推理模型,并开源训练框架、代码和数据,适合关注开源分布式训练路线的读者。

  5. Prime Intellect(网页)71

    Prime Intellect 发布 106B MoE 模型 INTELLECT-3 并开源完整训练配方

    Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM 4.5 Air 基座上经过 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平,超越许多更大的前沿模型,如 AIME24 90.8 分、AIME25 88.0 分、GPQA-Diamond 74.4 分。

    推荐理由:原文同时放出模型权重、训练框架和全部环境,读者可以看到大规模 RL 后训练的完整可复用配方。

  6. Prime Intellect(网页)59

    Prime Intellect 发布 Lab:面向自我改进智能体的训练平台正式开放

    Prime Intellect 宣布其自我改进智能体训练平台 Lab 结束 beta,正式全面开放。平台以环境为核心抽象,提供托管训练、托管评估、Environments Hub、adapter 部署和 Prime Inference 等组件,覆盖评估、训练、检查、部署的完整循环;beta 期间数百名用户已运行超 10,000 个训练任务。