跳到正文

#具身智能

今日 12 条
今天10月1日周四
  1. HuggingFace Daily Papers(社区热门论文)37

    GGSD:通过游戏自对弈发现人类可直接操控的智能体技能

    研究者提出 Game-Guided Skill Discovery(GGSD)框架,利用游戏中的自对弈发现人类可直接操控的运动技能,由高层策略从少量离散技能中选择、低层策略学习对应行为。在 Ant、Franka-arm 和 Unitree G1 环境中,人类可替换高层策略直接操控智能体,并通过技能组合解决 Maze、CubePush 等未见任务,无需额外训练。

  2. HuggingFace Daily Papers(社区热门论文)34

    生成式行为克隆中的多模态性研究:确定性回归为何在仿真基准上依然有效

    一项研究重新审视生成式行为克隆(BC)中的多模态假设,发现确定性动作 Transformer 在 LIBERO、Meta-World 等仿真基准上仍能匹配此前报告的 SOTA 结果,且推理延迟往往更低。作者通过 GMM 聚类构建条件模态估计器,估计结果显示所测仿真基准在采样状态下几乎都是单模态的;只有在机器人双模态操作概念验证任务上才观察到模态坍缩。

  3. HuggingFace Daily Papers(社区热门论文)49

    WorldAuditBench:用多模态智能体审计交互式 3D 世界

    研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五个前沿模型,两种审计范式的成功率仅 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。

  4. IT之家(RSS)37

    华境 S 大六座 SUV 9 月交付 7416 台:连续 5 个月增长,标配华为乾崑智驾 ADS 5 Pro

    华境 S 大六座 SUV 9 月交付 7416 台,实现连续 5 个月增长,累计交付突破 3 万台。该车是上汽通用五菱与华为合作的首款搭载华为乾崑科技旗舰车型,全系标配华为乾崑智驾 ADS Pro 增强版与鸿蒙座舱。9 月 12 日新增 4 款配置,搭载 MoLA 2.0 混合大模型架构,全系超级置换价 14.98 万元-19.68 万元。

  5. clem 🤗29

    很想看看 microduck 的生产和装配线是什么样子! 我们的下一款机器人应该要有手臂,这样它就能参与 microducks 的生产了 😅😅😅

    引用Pollen Robotics@pollenrobotics

    The Microduck adventure continues, and the shipping dates are close enough to feel real now. We are proud to tell you that 10,950 Microducks will come off the line between December 10 and January 10! Weekly batches, earliest orders first. Every date is in here.

  6. TechCrunch:AI(RSS)44

    Destro AI 如何让机器人与人类工人在物流场景中协同作业

    Destro 结束隐身状态并获得 800 万美元种子轮融资,其 AI 智能层同时指挥机器人和人类工人,让机器人在物流场景中高效作业。Destro 基于开放权重视觉-语言-动作模型的 Vision 操作系统和 Mothership 操作系统,已在 Yusen Logistics 一个设施试点 3 台机器人,现扩展至 26 台,并在南加州启动 17 台机器人的新试点。

9月30日周三
  1. Liquid AI 模型与工程博客(网页)17

    Liquid AI 面向工业与机器人场景推出本地多模态 AI 平台

    Liquid AI 推出面向工业与机器人领域的本地 AI 平台,用硬件感知的定制多模态模型在现有设备上离线运行,为一线工人提供实时免手操作辅助。其智能体 LFMs 可打通 IT 与 OT 数据孤岛,跨 SCADA、PLC 和企业系统进行推理,实现实时分析、预测性维护与自主工作流。模型可直接运行在边缘 CPU、NPU、GPU 上,具备亚毫秒级响应。

  2. Stanford HAI News(网页)52

    斯坦福 HAI 发布政策简报探讨世界模型治理为何是 AI 下一个政策挑战

    斯坦福 HAI 发布政策简报,探讨为何治理世界模型是比大语言模型更复杂的政策挑战。简报将世界模型分为渲染器、模拟器和规划器三类,指出其带来物理风险、国家安全影响和数据集中问题;李飞飞等人建议资助测量科学、以采购要求独立测试、投资共享数据基础设施,并强调当前没有基准足以支持安全关键部署审批。

  3. Preferred Networks:AI 研究与产品43

    三菱重工与 Preferred Networks 结成业务联盟,共同开发日本国产关键任务 AI 技术

    三菱重工(MHI)与 Preferred Networks(PFN)签署业务联盟协议,将结合 MHI 的硬件、控制与仿真技术,以及 PFN 的国产 AI 基础模型、AI 芯片和计算基础设施,联合开发面向社会基础设施与国家安全等关键任务领域的自主 AI 机械与系统。双方计划在 2026 财年内达成资本与业务联盟协议,以加速中长期研发投入与商业化。

  4. Preferred Networks:AI 研究与产品12

    Preferred Networks 如何用 AI 与机器人技术解决零售与物流难题

    Preferred Networks(PFN)面向零售与流通行业,利用 AI 和机器人技术开发解决方案、产品与服务,帮助自动化运营并提升零售与物流价值链的生产力。其针对连锁店行业的重点包括防止缺货、优化商品组合,以及通过改进商品陈列减少浪费。这些需求背后是劳动力短缺与改善工作环境的压力。

  5. World Labs:官网46

    World Labs 收购机器人公司 SceniX,推进空间智能

    World Labs 宣布收购机器人公司 SceniX,SceniX 团队将加入 World Labs。World Labs 称其目标是推进能感知、生成、推理并交互虚拟与物理世界的空间智能,而机器人是空间智能走向物理形态的落点。World Labs 表示将很快分享 SceniX 已构建的早期技术及其能力与后续方向。

  6. World Labs:官网52

    李飞飞:空间智能是 AI 的下一个前沿

    李飞飞发表长文,提出空间智能是 AI 的下一个前沿,认为 LLM 擅长语言但在距离估计、物体旋转、物理预测等空间能力上远低于人类。她将世界模型概括为生成一致世界、接受多模态输入、根据动作预测下一状态三项核心能力,并介绍 World Labs 已向部分用户开放可通过多模态输入生成可探索 3D 环境的 Marble,应用将依次覆盖创作工具、机器人和科学研究。

  7. HuggingFace Daily Papers(社区热门论文)41

    WorldAttention:面向交互式视频世界模型的高效注意力架构

    研究者提出 WorldAttention,一种通过专用注意力内核与分层 KV cache 协同设计实现高效推理的注意力架构,用于文本条件交互式视频世界模型。其 Hybrid Sparse Attention 结合线性全局注意力与头自适应稀疏注意力,Hierarchical KV Cache 将历史 KV 对按语义索引分页存放于多级内存。

  8. HuggingFace Daily Papers(社区热门论文)44

    EVO-WAM:通过视频-动作验证进化世界动作模型

    EVO-WAM 让世界动作模型无需额外专家演示即可适应新任务,通过视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频-动作一致性,再迭代训练。在 RoboTwin 2.0 的 7 个未见任务上,Cosmos3 平均成功率从 26.9% 提升至 68.0%,DreamZero 从 28.5% 提升至 46.4%;真实世界 3 个长程复合任务中 Cosmos3 从 20.0% 提升至 76.7%。

  9. HuggingFace Daily Papers(社区热门论文)33

    JEPA 世界模型新方法 AnisoWM:各向异性表示改进规划

    研究者提出 AnisoWM 与 ΛReg,用可学习的对角协方差替换固定各向同性高斯目标,并施加固定迹与各向异性约束,预测目标、预测器架构和欧氏规划器均不变,目标仅在训练时使用。在四个视觉控制环境中,AnisoWM 的规划成功率全部优于 LeWorldModel,其潜在规划代价与任务结果也更一致。

  10. IT之家(RSS)35

    地平线发布 HSD V2.1 辅助驾驶系统,国内量产首发端到端全场景倒车

    地平线正式发布 HSD 全场景辅助驾驶系统 V2.1,首批搭载车型 iCAR V27 将于 10 月 8 日起分批推送升级。该版本国内量产首发端到端全场景倒车 Beta,并新增闪灯鸣笛警示、自定义车位遥控泊入泊出、实体钥匙遥控泊车等功能。主动安全方面升级视觉神经网络,提升横穿、转弯低速跟车和目标 Cut in 等场景的避撞能力。