GGSD:通过游戏自对弈发现人类可直接操控的智能体技能
研究者提出 Game-Guided Skill Discovery(GGSD)框架,利用游戏中的自对弈发现人类可直接操控的运动技能,由高层策略从少量离散技能中选择、低层策略学习对应行为。在 Ant、Franka-arm 和 Unitree G1 环境中,人类可替换高层策略直接操控智能体,并通过技能组合解决 Maze、CubePush 等未见任务,无需额外训练。
研究者提出 Game-Guided Skill Discovery(GGSD)框架,利用游戏中的自对弈发现人类可直接操控的运动技能,由高层策略从少量离散技能中选择、低层策略学习对应行为。在 Ant、Franka-arm 和 Unitree G1 环境中,人类可替换高层策略直接操控智能体,并通过技能组合解决 Maze、CubePush 等未见任务,无需额外训练。
研究者提出 RoboCoach,一个由世界模型引导的教练框架,通过 Route-Imagine-Diagnose-Improve(RIDI)循环在共享世界模型 COACHWORLD 中执行可复用技能专家,并用进度评判器定位首个失败子任务,从而决定采集哪些演示、更新哪些专家适配器。
一项研究系统评测 GPT-6 Astra 作为通用具身策略的能力,覆盖直接控制、与学习策略协作和反馈驱动适应六个领域。
一项研究重新审视生成式行为克隆(BC)中的多模态假设,发现确定性动作 Transformer 在 LIBERO、Meta-World 等仿真基准上仍能匹配此前报告的 SOTA 结果,且推理延迟往往更低。作者通过 GMM 聚类构建条件模态估计器,估计结果显示所测仿真基准在采样状态下几乎都是单模态的;只有在机器人双模态操作概念验证任务上才观察到模态坍缩。
研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五个前沿模型,两种审计范式的成功率仅 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。
华境 S 大六座 SUV 9 月交付 7416 台,实现连续 5 个月增长,累计交付突破 3 万台。该车是上汽通用五菱与华为合作的首款搭载华为乾崑科技旗舰车型,全系标配华为乾崑智驾 ADS Pro 增强版与鸿蒙座舱。9 月 12 日新增 4 款配置,搭载 MoLA 2.0 混合大模型架构,全系超级置换价 14.98 万元-19.68 万元。
在一场深度问答中,Runway Research 团队探讨了实时模型、生成式界面以及机器人技术的下一步。
如今机器人能完成哪些工作?这对未来数年的经济结构又意味着什么? @rclegateyang 和 Maxim Massenkoff 的新研究今日发布,探讨了这些问题。
很想看看 microduck 的生产和装配线是什么样子! 我们的下一款机器人应该要有手臂,这样它就能参与 microducks 的生产了 😅😅😅
The Microduck adventure continues, and the shipping dates are close enough to feel real now. We are proud to tell you that 10,950 Microducks will come off the line between December 10 and January 10! Weekly batches, earliest orders first. Every date is in here.
Destro 结束隐身状态并获得 800 万美元种子轮融资,其 AI 智能层同时指挥机器人和人类工人,让机器人在物流场景中高效作业。Destro 基于开放权重视觉-语言-动作模型的 Vision 操作系统和 Mothership 操作系统,已在 Yusen Logistics 一个设施试点 3 台机器人,现扩展至 26 台,并在南加州启动 17 台机器人的新试点。
CrossBFM 将潜在行为空间视为可跨形态迁移的资产,用无机器人专属参数的统一编码器同时蒸馏多个训练形态,训练耗时不到 1 GPU 小时,比 Forward-Backward 表示的数百 GPU 小时大幅降低。
Liquid AI 推出面向工业与机器人领域的本地 AI 平台,用硬件感知的定制多模态模型在现有设备上离线运行,为一线工人提供实时免手操作辅助。其智能体 LFMs 可打通 IT 与 OT 数据孤岛,跨 SCADA、PLC 和企业系统进行推理,实现实时分析、预测性维护与自主工作流。模型可直接运行在边缘 CPU、NPU、GPU 上,具备亚毫秒级响应。
斯坦福 HAI 发布政策简报,探讨为何治理世界模型是比大语言模型更复杂的政策挑战。简报将世界模型分为渲染器、模拟器和规划器三类,指出其带来物理风险、国家安全影响和数据集中问题;李飞飞等人建议资助测量科学、以采购要求独立测试、投资共享数据基础设施,并强调当前没有基准足以支持安全关键部署审批。
心资本创始合伙人韩彦在 SuperReturn Asia 2026 演讲中判断,2026 至 2028 年是中国硬科技的早期投资窗口:技术信号清晰、IPO 退出回暖,但早期资本尚未充分回流。
Anthropic 开启 Model Hardware Standard(MHS)研究预览,向首批科研实验室和先进制造商开放这一让 AI 智能体安全操作物理设备的共享规范。
Preferred Networks(PFN)与丰田汽车前沿研究中心(FRC)启动联合研究,用尚在开发中的 MN-Core L 系列 AI 处理器加速 Physical AI 推理。
三菱重工(MHI)与 Preferred Networks(PFN)签署业务联盟协议,将结合 MHI 的硬件、控制与仿真技术,以及 PFN 的国产 AI 基础模型、AI 芯片和计算基础设施,联合开发面向社会基础设施与国家安全等关键任务领域的自主 AI 机械与系统。双方计划在 2026 财年内达成资本与业务联盟协议,以加速中长期研发投入与商业化。
Preferred Networks(PFN)宣布投资 Noetra 并参与其日本国产 Physical AI 多模态基础模型项目,该项目由 METI 与 NEDO 资助,Noetra 与 AIST 共同入选。
ACSL 与 Preferred Networks(PFN)在 NEDO K 计划的小型无人机自主与分布式控制技术项目中,已实现利用生成式 AI 根据任务需求和周边环境自动生成飞行航线的演示阶段。
Preferred Networks(PFN)面向零售与流通行业,利用 AI 和机器人技术开发解决方案、产品与服务,帮助自动化运营并提升零售与物流价值链的生产力。其针对连锁店行业的重点包括防止缺货、优化商品组合,以及通过改进商品陈列减少浪费。这些需求背后是劳动力短缺与改善工作环境的压力。
李飞飞提出“空间智能”概念,即 AI 在 3D 空间中感知、推理并行动的能力,认为这将让机器真正理解并与物理世界交互。该内容来自 World Labs 官网,原文发布于 2024 年 5 月 16 日。
World Labs 宣布完成 10 亿美元新融资,投资方包括 AMD、Autodesk、Emerson Collective、Fidelity Management & Research Company、NVIDIA 和 Sea 等。
World Labs 宣布收购机器人公司 SceniX,SceniX 团队将加入 World Labs。World Labs 称其目标是推进能感知、生成、推理并交互虚拟与物理世界的空间智能,而机器人是空间智能走向物理形态的落点。World Labs 表示将很快分享 SceniX 已构建的早期技术及其能力与后续方向。
李飞飞发表长文,提出空间智能是 AI 的下一个前沿,认为 LLM 擅长语言但在距离估计、物体旋转、物理预测等空间能力上远低于人类。她将世界模型概括为生成一致世界、接受多模态输入、根据动作预测下一状态三项核心能力,并介绍 World Labs 已向部分用户开放可通过多模态输入生成可探索 3D 环境的 Marble,应用将依次覆盖创作工具、机器人和科学研究。
World Labs 发布 World API,这是其多模态世界模型 Marble 的公开接口,可将文本、单张图像、多图、360° 全景和视频生成为可导航的 3D 世界。
World Labs 团队发文将当前各类 world models 按功能分为三类:渲染器输出像素、模拟器输出状态、规划器输出动作,认为三者是对同一感知-动作循环的不同投影。
World Labs 于 7 月 21 日收购机器人仿真公司 SceniX,并发布 real-to-sim-to-real(R2S2R)引擎,把一个物理任务重建为可控制、可复用的对齐仿真世界。
研究者提出 WorldAttention,一种通过专用注意力内核与分层 KV cache 协同设计实现高效推理的注意力架构,用于文本条件交互式视频世界模型。其 Hybrid Sparse Attention 结合线性全局注意力与头自适应稀疏注意力,Hierarchical KV Cache 将历史 KV 对按语义索引分页存放于多级内存。
EVO-WAM 让世界动作模型无需额外专家演示即可适应新任务,通过视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频-动作一致性,再迭代训练。在 RoboTwin 2.0 的 7 个未见任务上,Cosmos3 平均成功率从 26.9% 提升至 68.0%,DreamZero 从 28.5% 提升至 46.4%;真实世界 3 个长程复合任务中 Cosmos3 从 20.0% 提升至 76.7%。
研究者提出 AnisoWM 与 ΛReg,用可学习的对角协方差替换固定各向同性高斯目标,并施加固定迹与各向异性约束,预测目标、预测器架构和欧氏规划器均不变,目标仅在训练时使用。在四个视觉控制环境中,AnisoWM 的规划成功率全部优于 LeWorldModel,其潜在规划代价与任务结果也更一致。
研究发现,Latent WAM 虽在分布内任务上与 Explicit WAM 持平,却丢失了 WAM 原本的泛化优势;在环境扰动、数据效率和任务泛化三个维度上均出现一致退化。
PanoVLN 用 4B 骨干网络和纯 RGB 输入做全景视觉语言导航,在 R2R-CE 和 RxR-CE Val-Unseen 上成功率分别超越此前 SOTA 11.9% 和 8.7%。
ChronoSRL 为 critic 的嵌入向量引入显式时间几何,让状态-动作与目标嵌入之间的距离匹配智能体到达目标所需时间,并将未到达目标和其他轨迹目标推离至少一个折扣视野。
研究针对冻结的 VLA 主干网络,在 LIBERO 和 CALVIN 两个操作基准上分析单层选择与多层融合,发现 54 种配置中有 47 种不如最佳单层策略,且最佳层因主干和基准而异。
GeoWind2Plan 是一个"几何到风场再到规划"的框架,仅凭背景风向量、3D 建筑几何和起终点,即可预测任务相关的 3D 风场并优化 UAV 三维路径与速度。
地平线正式发布 HSD 全场景辅助驾驶系统 V2.1,首批搭载车型 iCAR V27 将于 10 月 8 日起分批推送升级。该版本国内量产首发端到端全场景倒车 Beta,并新增闪灯鸣笛警示、自定义车位遥控泊入泊出、实体钥匙遥控泊车等功能。主动安全方面升级视觉神经网络,提升横穿、转弯低速跟车和目标 Cut in 等场景的避撞能力。
World Labs 发布下一代世界模型 Atlas,一个从零预训练的全能模型,可原生处理文本、图像、视频和 3D。
World Labs 上线 Marble Labs,汇集 Marble 在影视 VFX、虚拟制片、游戏、AR/VR 等场景的项目案例与构建教程。