对话王家伟:24 岁深朴智能首席科学家为何转身走向具身智能
24 岁的深朴智能(Simple AI)首席科学家王家伟在播客中讲述自己从中科大少年班、MSRA、DeepSeek、字节 Seed 转向具身智能的选择。深朴智能已开源 2,000 小时 HiFi-UMI 数据、内部积累数万小时,模型观察到一定 Zero-shot 泛化,并从数据、具身基础模型、Agentic OS 做到本体。他认为通用大模型会承担更多理解与规划,但机器人快速反应仍需动作模型。
24 岁的深朴智能(Simple AI)首席科学家王家伟在播客中讲述自己从中科大少年班、MSRA、DeepSeek、字节 Seed 转向具身智能的选择。深朴智能已开源 2,000 小时 HiFi-UMI 数据、内部积累数万小时,模型观察到一定 Zero-shot 泛化,并从数据、具身基础模型、Agentic OS 做到本体。他认为通用大模型会承担更多理解与规划,但机器人快速反应仍需动作模型。
机器人学习的研究人员/工程师加入 @theworldlabs 的绝佳机会!❤️🔥
We're hiring in robot learning at @theworldlabs! Join me, @drfeifei, and the team to define and scale the next generation of world models for robot learning! Atlas for Robotics: https://www.worldlabs.ai/blog/atlas#robotics-simulation Real-to-Sim-to-Real: https://www.worldlabs.ai/blog/real-to-sim-to-real Apply: https://jobs.ashbyhq.com/worldlabs/85994fa5-c44c-48b4-84fc-aece7934c2cb
SemiAnalysis 长文分析机器人模型的大脑应放在机上还是数据中心。当前通用机器人模型仅数十亿参数(π0.7 50亿、DreamZero 140亿),远小于 LLM,受实时性、成本、数据和网络约束;Jetson Thor 约为 GB200 的 1/10 FLOPs。
MIT 衍生公司 Atlas Building Composites 开发出 AI 驱动的机器人制造平台,将一次性塑料与美产玻璃纤维熔合,3D 打印房屋地基、地板、屋顶桁架等建筑部件。其无水塑料回收工艺已用于马萨诸塞州湿地一座 40 英尺桥梁,桁架打印不到 13 分钟、承重超 4,000 磅,单个工厂单元每天可产约一栋小房子的结构框架。
MIT 研究人员提出 HardFlow,一种在部署阶段即可用于预训练生成模型的即插即用方法,让模型在机器人操作、迷宫导航和文本引导图像编辑等任务中实现完美的硬约束满足,同时解的质量持续优于基线方法。
🍾🍲 Saturday Robotics x IROS 2026 — Robotics Research Night 👉🏻 https://luma.com/tzbw7n61 We’re bringing a high-signal evening of robotics research to Pittsburgh on September 28. After a full day at IROS, we’ll bring together researchers, engineers, founders, students, and investors for technical discussions, networking, and a series of ~10-minute lightning talks. Tentative preview of the current lineup: 🤖 1. PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball Gary Yang @lzyang2000 (@Caltech) Perception-aware reinforcement learning + Control Barrier Functions for whole-body humanoid safety. Demonstrated on a Unitree G1, with 19/20 successful dodges and zero falls in real-world experiments. 🧠 2. How In-Context Learning Is Reshaping Robot Learning Data at Scale AaronLi (@RhodaAI) Exploring how in-context learning can change the way we think about robot learning data, scaling, and generalization. 🧪 3. X2Real: An eXtensive Simulation Benchmark for Real-World Generalist Policies Liangwang Ruan (@XSquareRobot) A new simulation benchmark built around faithfulness, diversity, and fairness, with 44 hierarchical long-horizon tasks across 10 capability dimensions and a reported 0.84 simulation-to-real correlation. 🦾 4. Rethinking Generalist Robotic Manipulation: Architecture, Data and Inference for Real-World Deployment Peiyan Li (Chinese Academy of Sciences, @CAS__Science) 3D VLA architectures, memory augmentation, ego/UMI human priors, large-scale robot pretraining, and inference-time contextual learning for deployable generalist manipulation. 🎯 5. HiRE: Hindsight Reward Editing for Policy Finetuning Haoyi Niu @t641769919 (@UCBerkeley) Accepted at CoRL 2026. A training-free approach to reward editing that uses successful and failed trajectories to identify “trap states” and provide denser, control-aware feedback for RL. 🔥 6. Lightning Talk — Open Slot We’re opening one additional slot for a technically deep research talk, new project, frontier paper, demo, open problem, or startup technical insight. 10 minutes. A few slides. One sharp technical idea. No fluff. Topics include World Models, Physical AI, Humanoids, VLAs, Robot Foundation Models, Manipulation, RL, Simulation & Sim-to-Real, Spatial Intelligence, Computer Vision, and Embodied AI. 📍 Pittsburgh 📅 September 28, 2026 🕠 5:30–9:30 PM 🍾 Networking + Technical Talks + Research Discussion 📩 junfanzhu98@gmail.com See you in Pittsburgh. 🤖 #IROS2026 #Robotics #PhysicalAI #RobotLearning #WorldModels #HumanoidRobotics #VLA #EmbodiedAI #RobotFoundationModels
在 2026 Inclusion 外滩大会圆桌现场,苏度科技韩铮、蚂蚁灵波沈宇军、自变量王潜、破壳机器人许华哲四位一线从业者,围绕具身智能的数据来源、模型路线与落地场景展开了一场未收敛的路线级分歧讨论。
破壳机器人许华哲、昆腾动力李强、费莫一科技(PHYMI)刘念邱在云启资本与无限基金 SEE Fund 主办的圆桌中,围绕具身智能的世界模型、Scaling 与落地展开讨论。他们认为 Scaling 不只是堆参数和数据小时数,数据多样性、质量分级与多模态信息可能更重要,落地应看节拍、成功率、人工接管率和单位任务的经济价值。
是时候来一次全球点名了。 纯电动、持续前行,Apollo Go 的 RT6 正在从世界各地的道路上打卡报到。⚡
数美万物创始人兼CEO任利锋(卷卷)在近3小时访谈中回顾了从0到1孵化抖音的经历,并介绍了公司最新发布的Hi3D 3.0 2048³模型。他认为基础模型不会吞噬一切,实体制造仍需能产出"生产级"3D资产的模型,难点在于拆件、连接结构、材料适配与交付。数美万物的目标是从Maker OS走向制造业OS,把普通人的创造欲送进现实世界的生产管线。
MIT 与自动驾驶公司 Motional 提出 Concept-Wrapper Network(CW-Net),将自动驾驶深度学习规划器的内部推理翻译为"接近停驶车辆""靠近骑行者"等可理解概念,且不改变原有驾驶性能。该模块用 1.3 亿个自动驾驶场景样本训练,在私人测试跑道的实车测试中帮助安全员更准确预判车辆行为,大规模模拟实验也得到类似结果,相关研究已发表于 Nature。
不止是双臂。 具身 AI 的起点。 LEMO by Galaxea —— 一个平台,开箱即用,即刻开始构建。 🦾 让创造更快发生。
NVIDIA 介绍用 Omniverse NuRec 解决同一套感知软件换装到 SUV、轿车等不同车型后传感器布局、标定、视场与遮挡变化导致感知结果改变的问题。原文未披露具体版本号、参数规模或性能数字。
We have a huge news to share today! Today we are unveiling the first truly accessible RL robot - welcome Microduck A 25 cm tiny open-source biped with 15 actuators and packed with sensors (camera, speaker, LiDAR, NFC, bluetooth, wifi, etc) that you train yourself with reinforcement learning. It's also playable out of the box with more than half a dozen fun and playful pre-trained policies to have it walk, sit, crouch, roller-skate, pick up objects with its articulated beak, and recover on its own. And all for less than $400. See all the details, play with the simulator and order it at: https://pollen-robotics.com/microduck/ (video with sound on 🔊)
OpenBMB 推出 SimpleMemVLA,为视觉-语言-动作模型提供原生视频记忆,通过带时间戳的视觉历史与精确流式推理支持长时程机器人操作。该仓库聚焦长时程机器人操作场景,采用流式推理方式处理视频历史。
Kengo 夺冠了!🏆 星海图的双足人形机器人在 WORLD HUMANOID ROBOT GAMES(2026)自由体操比赛中夺得第一名。 为运动而生——并准备好走得更远。
OpenBMB(清华 NLP)在 GitHub 开源 SimpleNav,一个面向导航 VLA 研究的框架,主打简单、统一、可复现与可扩展。该框架旨在为导航 VLA 研究提供统一且可复现的实验基础,并支持扩展。
NVIDIA 技术博客介绍用 AI 智能体训练跨形态机器人导航策略的方法。导航要求机器人持续定位、理解变化的环境、选择路线并避障,而迁移到新机器人或新场景往往需要新的数据、仿真资产和机器人接口。
下一代机器人技术需要能够在虚拟世界和物理世界中理解、模拟、学习和行动的模型。 我们正在招聘一位高级业务拓展负责人,方向为机器人与物理 AI,帮助将这项技术带入现实世界应用 🤖🚀
QwenLM 推出 Qwen-Drive-1.0,作为面向自动驾驶的视觉语言基础模型迈出的第一步。该模型定位为自动驾驶领域的视觉语言基础模型,具体参数规模、benchmark 分数与开放方式尚未在原文中披露。
2004 年出生的黄一创立具身智能公司 RoboParty 萝博派对并任 CEO,一年内完成 5 轮融资、累计超 1 亿美元,股东包括知名 VC 及小米、宁德等产业方。他将这一年形容为"压缩的人生",认为大学毕业即创业的"愚昧之巅"反而是最佳时机。他把具身智能比作 42 公里马拉松:机器人本体已跑完 1/4,小脑约一半,大脑才一两公里。
感谢我们的全球合作伙伴,在北京 WRC 2026 共度了一个美妙的夜晚。精彩的对话、大胆的想法,以及对具身智能的共同愿景。下次见!#EmbodiedAI #WRC2026 #Galaxea
Google DeepMind 回顾了从 DQN 玩 Atari 到 AlphaStar 打 StarCraft II 的 15 年游戏 AI 研究历程,并宣布与游戏开发商合作打造新玩法原型。
Hugging Face 博客与 AWS Strands Robots 团队演示了在单个 Agent 中跑通机器人数据闭环:录制演示同步到 Storage Bucket,通过 Xet 内容定义分块实现字节级去重上传,再用 stream_dataset() 直接从 Hub 流式读取训练,无需先下载整个数据集。
MIT CSAIL 与清华研究人员提出预训练方法 GeoPT,通过 130 万条"合成动力学"样本让仿真模型学习物理规律,达到峰值性能的速度比领先模型快 2 倍,所需数据最多减少 60%。在工业基准上,GeoPT 在速度、精度和效率上超越 SOTA 模型,模拟船体受风浪时用 60% 更少标注数据、达到峰值精度快 4 倍,并能在数秒内完成超 1 亿网格点的高保真仿真。
MIT CSAIL 主任 Daniela Rus 获 2026 年巴伐利亚州长高科技奖,表彰其在机器人、人工智能与自主系统领域的贡献,该奖由巴伐利亚州政府与巴伐利亚科学院联合颁发,是德国奖金最高的技术与工程奖项。
Google DeepMind 发布 Gemini Robotics ER 2,面向机器人的具身推理模型,支持视频理解、任务进度跟踪、工具编排与多机器人协作,并可将执行交给下层 VLA 模型。
推荐理由:官方发布给出进度分类、moment finding 等具体数字和公开 API 入口,读者可以据此评估其机器人编排与视频理解能力。
Google DeepMind 发布 Gemini Robotics 2 系列,包含全身控制的 VLA 模型、具身推理模型 ER 2 和可本地运行的 On-Device 2。
推荐理由:官方完整说明了三个模型的能力分工、适配速度与安全基准,读者可以据此了解具身智能模型的实际能力边界。