Import AI 466:机器人学的苦涩教训、AI 完成周级编程任务与 OpenAI 模型意外黑客事件
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件,Opus 4.7 用 14 小时、251 美元推理成本完成了人类需 2-17 周的任务,25 个目标程序中 17 个有满分运行。
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件,Opus 4.7 用 14 小时、251 美元推理成本完成了人类需 2-17 周的任务,25 个目标程序中 17 个有满分运行。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上运行,支持人与策略闭环交互控制。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹持器录制约 490€ 的演示数据,无需机器人或遥操作设备,即可自动转成 LeRobot 格式的机器人可用数据集。
OpenBMB(清华 NLP)在 GitHub 新建仓库 MiniCPM-Robot,定位为面向机器人的更智能、更快的端侧 AI 大脑。该仓库目前仅给出这一句定位描述,尚未披露模型参数规模、benchmark 分数或具体可用形式。
Jim Fan 团队发布 RoboTTT,将机器人模型原生扩展到 8000 timestep 上下文(约 5 分钟的肌肉记忆),推理成本恒定,并称比此前 SOTA 推进 3 个数量级。
MIT 团队发布 FloatForm 系统,由 21 厘米见方的方形机器人船组成,可自主组装成刚性结构、拆解并重组,单次运行耗时 4 至 8 分钟。该系统仅需轻量中央规划器分配最终位置,其余导航与避碰由机器人自身完成,仿真显示可平滑扩展至 64 艘的集群。相关论文已发表于 Nature Communications。
空山慈科技联合创始人王曦明在播客中讲述如何用脑机交互与神经调控探索抑郁症、睡眠障碍和认知问题的下一代解决方案。该公司为云启-交大 AI 基金投资的早期项目,讨论覆盖从三甲医院临床到居家卧室的应用路径,以及脑科学、医学工程、AI、仿真与硬件结合下的治疗变化。
Mistral 发布首个具身导航模型 Robostral Navigate,8B 参数,仅靠单个普通 RGB 摄像头、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单摄像头方案高 9.7 分、比最佳多传感器方案高 4.5 分。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:发布方系统列出世界模型策略、奖励模型 API、新基准与部署 CLI 等更新,读者可以据此评估机器人学习工作流的变化。
ENPIRE -> ASPIRE,我们 Physical AutoResearch 系列的第二项工作。我们正在构建机器人自我改进的组件,一次一个 /skill。
Today, we give robots a /skills library that self-evolves and compounds indefinitely! Introducing ASPIRE: a robot solving its 100th task is no longer as clueless as solving its first. Coding agents observe multimodal sensory traces from simulation and real robots, launch an evolutionary search over control programs, and distill the best know-how into an ever-expanding library. ASPIRE is a new type of continual learning: "training" is skill refinement instead of gradient descent. "Trained model" is a repo of sensorimotor skills instead of floating weights. “Distributed training” is a panel of agents each practicing a different skill instead of sharded minibatches. Here's the beauty: ASPIRE gives the tired terms "sim2real transfer" and "cross-embodiment transfer" a whole new meaning. Bridging the sim-to-real gap is notoriously brutal. An end-to-end policy has to swallow both the visual shift (sim looks toyish next to a real camera) and the subtle contact physics it never quite gets right. ASPIRE sidesteps the mess, because it doesn't ship pixels or weights across the gap, but ships the know-how. The robot still has to practice in the real world, not zero-shot, but it gets there way faster because it isn't rediscovering the strategy from scratch. Same for going single-arm to bimanual hardware, which usually requires new data and retraining from zero. ASPIRE achieves up to ~10x cut in "transfer learning” tokens (yes, tokens are the new unit of *training* compute ;) Check out our gallery of 150+ tasks and 90+ skills the robots taught themselves, all on the website! Kind of wild that we can ship the "learned weights" as an HTML page rather than a GGUF. We'll open-source the full stack so your own robot library starts compounding from ours! Deep dive in thread:
蚂蚁 inclusionAI 在 GitHub 开源 Universal-Manipulation-Exoskeleton 项目,通过实时力矩反馈学习柔顺的全身操作策略。该仓库聚焦全身策略学习与力反馈控制,具体模型规模、benchmark 与可用性细节尚未在标题与摘要信息中披露。
QwenLM 上线 Qwen-RobotNav 官方仓库,定位为该项目官方 Repo。目前公开信息仅显示仓库归属 QwenLM 组织,具体模型能力、参数规模与可用形式尚未披露。
QwenLM 上线了 Qwen-RobotManip 的官方仓库,定位为机器人操作方向的官方代码库。目前公开信息仅显示该仓库为官方 Repo,未披露模型规模、benchmark 分数或开放形式等细节。
NVIDIA 推出 ENPIRE 框架,让编码智能体自主为真实机械臂开发策略,在 PushT、整理插针、切割扎带等任务上达到 99% 成功率,测试平台每站配两台 YAM 机械臂和一块 RTX 5090。
越伴动力发布陪伴机器人「小伴」,它不说人话,而是发出类似"外星语"的声音,会撒娇、委屈和拒绝。产品全身 95% 为柔软材质,采用端侧 1.7B 快脑与 7B 慢脑分工,将交互延迟压到 0.4 秒以内,并配备云端超长程记忆推动性格参数演化。创始人世博提出陪伴不是讨好、生命力不是可爱、少就是多三条产品判断。
MIT 研究人员推出名为 Gleanmer 的系统级芯片,能让小型自主机器人仅用约 6 毫瓦功耗实时构建详细 3D 环境地图,功耗仅相当于一颗 LED。该芯片结合 GMMap 算法与专用硬件,用高斯椭球体替代传统体素表示障碍物与自由空间,单次处理深度图像即可生成高斯分布,无需存储整张图像。该成果已在 IEEE VLSI Symposium 上展示,也有望用于轻量 AR 头显。
Google DeepMind 推出为期三个月的 Robotics 加速器,从欧洲选出 15 家机器人初创公司,本周在伦敦启动,它们将获得 Google DeepMind 与 Google 的技术指导,并可使用其 AI 技术栈和 Gemini 机器人模型。
通义 QwenAudio 原创语音项目下出现 Qwen-VLA 官方仓库。目前仅有仓库地址信息,尚未披露模型参数规模、功能细节或可用方式。
Google DeepMind 发布 Gemini Robotics-ER 1.6,相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 提升了空间与物理推理能力,包括指向、计数、成功检测和多视角理解。
OpenBMB(清华 NLP)发布 DeepThinkVLA,用于增强视觉-语言-动作(VLA)模型的推理能力。该仓库已在 GitHub 上线,具体模型规模、benchmark 分数与可用方式尚未在现有信息中披露。
域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。