Google Research 揭示扩散模型的创造力从何而来
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源:神经网络训练中的正则化会让学到的 score function 被"平滑",使去噪过程在训练数据点之间插值,从而生成新样本。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源:神经网络训练中的正则化会让学到的 score function 被"平滑",使去噪过程在训练数据点之间插值,从而生成新样本。
Jim Fan 团队发布 RoboTTT,将机器人模型原生扩展到 8000 timestep 上下文(约 5 分钟的肌肉记忆),推理成本恒定,并称比此前 SOTA 推进 3 个数量级。
MIT 与儿童安全非营利组织 Thorn 合作提出一种新的模型审计方法,通过 Gaussian probing 检查 LoRA 微调对模型内部表示的改变,在不生成任何输出的情况下判断模型是否被专门化用于生成 CSAM 等有害图像。
MIT 团队发布 FloatForm 系统,由 21 厘米见方的方形机器人船组成,可自主组装成刚性结构、拆解并重组,单次运行耗时 4 至 8 分钟。该系统仅需轻量中央规划器分配最终位置,其余导航与避碰由机器人自身完成,仿真显示可平滑扩展至 64 艘的集群。相关论文已发表于 Nature Communications。
Google Research 发布 SensorFM,一个大传感器基础模型,用来自 500 万名同意参与研究者的超过一万亿分钟无标签多模态可穿戴数据进行自监督预训练,覆盖 100 多个国家、20 多种 Fitbit 和 Pixel Watch 设备。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至相近耗时的替代路线,在美国 10 座城市测试六个月。结果显示目标路段行驶速度中位数提升约 2%,油耗率中位数下降 0.5% 至 1.0%,每座城市每年可减少数千吨 CO2e 排放。
ENPIRE -> ASPIRE,我们 Physical AutoResearch 系列的第二项工作。我们正在构建机器人自我改进的组件,一次一个 /skill。
Today, we give robots a /skills library that self-evolves and compounds indefinitely! Introducing ASPIRE: a robot solving its 100th task is no longer as clueless as solving its first. Coding agents observe multimodal sensory traces from simulation and real robots, launch an evolutionary search over control programs, and distill the best know-how into an ever-expanding library. ASPIRE is a new type of continual learning: "training" is skill refinement instead of gradient descent. "Trained model" is a repo of sensorimotor skills instead of floating weights. “Distributed training” is a panel of agents each practicing a different skill instead of sharded minibatches. Here's the beauty: ASPIRE gives the tired terms "sim2real transfer" and "cross-embodiment transfer" a whole new meaning. Bridging the sim-to-real gap is notoriously brutal. An end-to-end policy has to swallow both the visual shift (sim looks toyish next to a real camera) and the subtle contact physics it never quite gets right. ASPIRE sidesteps the mess, because it doesn't ship pixels or weights across the gap, but ships the know-how. The robot still has to practice in the real world, not zero-shot, but it gets there way faster because it isn't rediscovering the strategy from scratch. Same for going single-arm to bimanual hardware, which usually requires new data and retraining from zero. ASPIRE achieves up to ~10x cut in "transfer learning” tokens (yes, tokens are the new unit of *training* compute ;) Check out our gallery of 150+ tasks and 90+ skills the robots taught themselves, all on the website! Kind of wild that we can ship the "learned weights" as an HTML page rather than a GGUF. We'll open-source the full stack so your own robot library starts compounding from ours! Deep dive in thread:
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 项迁移任务和 1,331 个专家测试。
Together AI 宣布其 9 篇论文入选 ICML 2026(7 月 6 日至 11 日,首尔,展位 B714),覆盖从智能体到 GPU kernel 的全栈研究。
研究者提出 DiScoFormer(Density and Score Transformer),给定一组数据点即可在单次前向传播中同时估计分布的密度与 score,无需针对新分布重新训练。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境测试数月后,内存占用降低 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用可转为几行 C++ 代码的浅层决策树预测页面 TTL,并在缓存写满时回退到 LRU 淘汰。
MIT 与微软 Azure 研究人员提出智能体工作流优化系统 Murakkab,开发者只需用自然语言描述意图,系统即自动选择模型与工具、并行调度并动态分配云端硬件资源。
Google Research 将在 COLM 2026 发表的论文 Thinking to Recall 发现,开启链式推理能让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 检索到关闭推理时几乎无法召回的简单事实。
MIT 研究人员推出名为 Gleanmer 的系统级芯片,能让小型自主机器人仅用约 6 毫瓦功耗实时构建详细 3D 环境地图,功耗仅相当于一颗 LED。该芯片结合 GMMap 算法与专用硬件,用高斯椭球体替代传统体素表示障碍物与自由空间,单次处理深度图像即可生成高斯分布,无需存储整张图像。该成果已在 IEEE VLSI Symposium 上展示,也有望用于轻量 AR 头显。
Together AI 发布多GPU kernel生成基准 ParallelKernelBench(PKB),含87道源自 Megatron-LM、DeepSpeed、TensorRT-LLM 等真实代码库的问题,任务是将 PyTorch + NCCL 参考实现替换为直接通过 NVLink 通信的 CUDA kernel。
通义 QwenLM 推出 Qwen-AgentWorld,将其定位为面向通用智能体的语言世界模型。该项目的核心思路是用语言模型构建世界模型,以支撑通用智能体的能力。目前公开信息仅包含项目名称与这一方向性描述。
Import AI 第462期报道多项研究:牛津、UK AISI、斯坦福与LSE的实验(4项研究、18,978段对话、6,923人)显示AI文本说服力稳定超越专家人类,Opus 4.1和Opus 4.6最强,AI为Save the Children募集真实捐款的效果约为专业募捐员的3倍;限制AI写作速度和长度可抹平差距。
OpenBMB(清华 NLP)在 GitHub 发布 SHIFT 源码,对应论文《SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generation》。该方法通过门控调制的激活引导,缓解检索增强生成中的知识冲突问题。
OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。
阿里巴巴开源 atrex-bench,一个面向 AI 生成 GPU kernel 的端到端基准,取材自真实生产 trace。它要求把 PyTorch 参考实现改写为 Triton、Gluon、FlyDSL、CuteDSL 等 DSL kernel,并从编译、数值正确性和 speed-of-light 效率三个维度评分,同时覆盖 AMD 与 NVIDIA GPU。
OpenAI 在 Alignment 博客发布 Deployment Simulation 验证工作:用 WildChat 对话前缀重新生成 5 个 OpenAI 模型(含 o3。
上海人工智能实验室 InternLM 项目开源 RNGBench,用于在可控非马尔可夫博弈中评估多模态大语言模型,相关论文已被 EMNLP 2026 收录。该基准聚焦"超越当前观测"的评测场景,官方实现已随项目公开。
Google Research 发布关于 AI 帮助用户理解皮肤状况的研究,包括本周发表于 JAMA Dermatology 的大规模定量研究和此前发表于 ACM CHI 的混合方法研究。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘,通过相对距离检验判断遗忘后模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Gemini Guided Learning 的学生数学成绩提升 0.258 个标准差,约等于 1.2 至 1.7 年的正常学习进度,教师将 Gemini 纳入约一半课时(目标 12 小时)的班级进步更高,约 1.8 至 2.5 年。
推荐理由:原文给出塞拉利昂预注册试验的核心数据,读者可以了解教师主导下 AI 辅助学习的真实效果与局限。
Ahead of AI 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,按架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评估与基准等类别整理。
Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前置摄像头视频在日常用机时后台估计心率与每日静息心率。
推荐理由:这项研究覆盖近700名不同肤色的参与者并在真实生活场景验证,读者可以据此了解手机摄像头被动测心率的精度与局限。
大脑如何从(可能不完整且有噪声的)视觉观察中构建并追踪世界的内部状态? 我相信视觉状态追踪将成为未来几年视觉领域的重大挑战,我希望这个基准能成为一个有用的起点。enjoy!
Can MLLMs actually track what's happening in a video? Introducing VSTAT 🎯, our new benchmark for visual state tracking. The tasks are simple: count cups, read typed words, count page flips. Humans solve them easily. MLLMs don't. https://vision-x-nyu.github.io/vstat-site/ 🧵 [1/11]
上海人工智能实验室 InternLM 团队开源 OVO-S-Bench,一个面向多模态 LLM 流式空间智能的分层评测基准,论文已被 EMNLP 2026 接收为 Oral。该基准用于评估模型在流式输入下的空间理解能力,官方实现已同步放出。
Google 提出一种零信任隐私分析方案,将新型单消息密码学聚合协议与 TEE 结合,使设备只需一次性提交数据,无需多轮在线交互。该设计保证 Google 只能获得匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则验证聚合代码按公开代码正确执行。
上海人工智能实验室 InternLM 项目提出 Skill-as-Pseudocode,把 markdown 技能库重构为带类型的伪代码契约,供 LLM 智能体调用,该工作入选 EMNLP 2026 Findings。
Camera pose matters for video understanding! Today's MLLMs excel at recognizing activities, but still struggle with the underlying space and ego/object dynamics in video. We trace this gap to a missing piece: camera pose. Introducing Cambrian-P: a multimodal LLM natively grounded in camera pose. (1/n)
美团 LongCat 在 HuggingFace 发布 WBench-weights,整合了 WBench 交互式视频世界模型评测框架所需的模型权重,方便社区直接部署。WBench 从视频质量、设定遵循、交互遵循、一致性和物理合规五个维度评测世界模型,包含 289 个测试用例和 1,058 轮交互。权重仅限学术研究与评测用途,可通过 huggingface-cli 下载。
阿里巴巴在 GitHub 上线 EfficientRL,为 ICML 2026 论文《Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization》的官方代码仓库。该工作以信息瓶颈驱动树式策略优化,具体参数与评测结果原文未披露。
Import AI 457 期聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏工程与物理仿真。
FireRedTeam 开源了论文《ReMatch: Boosting Representation through Matching for Multimodal Retrieval》的官方实现,该工作已被 CVPR 2026 收录。ReMatch 通过匹配机制增强多模态检索的表征能力。
Stanford 医学院遗传学家 Gary Peltz 团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药物。
蚂蚁 inclusionAI 在 GitHub 发布 ARGenSeg,将自回归图像生成模型用于图像分割,论文已被 NeurIPS 2025 收录。该工作把分割任务建模为图像生成过程,具体参数规模与 benchmark 分数原文未披露。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论和进化假设来加速复杂科学问题研究,并将在未来几周通过 labs.google/science 向个人研究者开放。
推荐理由:原文给出多智能体架构、想法锦标赛机制和多个实验室应用结果,读者可了解它如何辅助科学假设生成与验证。