#具身智能
#具身智能
今日 2 条
Runway@runwaymlAI 评分4343
Runway@runwaymlAI 评分3636
World Labs:官网AI 评分6969 World Labs 发布下一代世界模型 Atlas
World Labs 发布下一代世界模型 Atlas,一个从零预训练的全能模型,可原生处理文本、图像、视频和 3D。
Black Forest Labs:Blog(网页)精选AI 评分6363 Black Forest Labs 发布 FLUX 3 多模态基础模型,并与 mimic 合作推出机器人视频动作模型 FLUX-mimic
Black Forest Labs 发布早期版本 FLUX 3 多模态基础模型,联合训练图像、视频与音频,视频预测占训练算力超 95%。FLUX 3 骨干可解码动作预测,加入动作模态后视频质量先降最多 10%,3500 步后恢复原有水平。
推荐理由:官方给出训练细节与工厂实测数据,说明同一多模态骨干如何同时支持内容生成与机器人动作控制。
Odyssey@odysseymlAI 评分2828
OpenBMB(清华 NLP):GitHub 新仓库AI 评分3131 OpenBMB 发布 SimpleMemVLA:面向视觉-语言-动作模型的原生视频记忆
OpenBMB 推出 SimpleMemVLA,为视觉-语言-动作模型提供原生视频记忆,通过带时间戳的视觉历史与精确流式推理支持长时程机器人操作。该仓库聚焦长时程机器人操作场景,采用流式推理方式处理视频历史。
OpenBMB(清华 NLP):GitHub 新仓库AI 评分2626 OpenBMB 发布 SimpleNav:面向导航 VLA 研究的统一可复现框架
OpenBMB(清华 NLP)在 GitHub 开源 SimpleNav,一个面向导航 VLA 研究的框架,主打简单、统一、可复现与可扩展。该框架旨在为导航 VLA 研究提供统一且可复现的实验基础,并支持扩展。
通义 QwenAudio:原创语音项目AI 评分3737 QwenLM 发布 Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型
QwenLM 推出 Qwen-Drive-1.0,作为面向自动驾驶的视觉语言基础模型迈出的第一步。该模型定位为自动驾驶领域的视觉语言基础模型,具体参数规模、benchmark 分数与开放方式尚未在原文中披露。
Google DeepMind:Blog(RSS)精选AI 评分6969 Google DeepMind 发布 Gemini Robotics ER 2,强化视频理解、任务编排与多机器人协作
Google DeepMind 发布 Gemini Robotics ER 2,面向机器人的具身推理模型,支持视频理解、任务进度跟踪、工具编排与多机器人协作,并可将执行交给下层 VLA 模型。
推荐理由:官方发布给出进度分类、moment finding 等具体数字和公开 API 入口,读者可以据此评估其机器人编排与视频理解能力。
Google DeepMind:Blog(RSS)精选AI 评分6666 Google DeepMind 发布 Gemini Robotics 2 系列模型,实现机器人全身智能控制
Google DeepMind 发布 Gemini Robotics 2 系列,包含全身控制的 VLA 模型、具身推理模型 ER 2 和可本地运行的 On-Device 2。
推荐理由:官方完整说明了三个模型的能力分工、适配速度与安全基准,读者可以据此了解具身智能模型的实际能力边界。
Hugging Face:Blog(RSS)AI 评分4848 NVIDIA Cosmos-H-Dreams:为手术机器人带来实时生成式仿真
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上运行,支持人与策略闭环交互控制。
OpenBMB(清华 NLP):GitHub 新仓库AI 评分3636 OpenBMB 发布 MiniCPM-Robot:面向机器人的端侧 AI 大脑
OpenBMB(清华 NLP)在 GitHub 新建仓库 MiniCPM-Robot,定位为面向机器人的更智能、更快的端侧 AI 大脑。该仓库目前仅给出这一句定位描述,尚未披露模型参数规模、benchmark 分数或具体可用形式。
Mistral AI:News(网页)AI 评分4848 Mistral 推出 Robostral Navigate:8B 具身导航模型,单 RGB 摄像头达 76.6%
Mistral 发布首个具身导航模型 Robostral Navigate,8B 参数,仅靠单个普通 RGB 摄像头、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单摄像头方案高 9.7 分、比最佳多传感器方案高 4.5 分。
蚂蚁 inclusionAI:GitHub 新仓库AI 评分3939 蚂蚁 inclusionAI 发布 Universal-Manipulation-Exoskeleton:用实时力矩反馈学习柔顺全身策略
蚂蚁 inclusionAI 在 GitHub 开源 Universal-Manipulation-Exoskeleton 项目,通过实时力矩反馈学习柔顺的全身操作策略。该仓库聚焦全身策略学习与力反馈控制,具体模型规模、benchmark 与可用性细节尚未在标题与摘要信息中披露。
通义 QwenAudio:原创语音项目AI 评分2020 QwenLM 发布 Qwen-RobotNav 官方仓库
QwenLM 上线 Qwen-RobotNav 官方仓库,定位为该项目官方 Repo。目前公开信息仅显示仓库归属 QwenLM 组织,具体模型能力、参数规模与可用形式尚未披露。
通义 QwenAudio:原创语音项目AI 评分2121 QwenLM 发布 Qwen-RobotManip 官方仓库
QwenLM 上线了 Qwen-RobotManip 的官方仓库,定位为机器人操作方向的官方代码库。目前公开信息仅显示该仓库为官方 Repo,未披露模型规模、benchmark 分数或开放形式等细节。
通义 QwenAudio:原创语音项目AI 评分4040 Qwen-VLA 官方仓库发布
通义 QwenAudio 原创语音项目下出现 Qwen-VLA 官方仓库。目前仅有仓库地址信息,尚未披露模型参数规模、功能细节或可用方式。
Google DeepMind:Blog(RSS)AI 评分5858 Google DeepMind 发布 Gemini Robotics-ER 1.6,强化机器人具身推理
Google DeepMind 发布 Gemini Robotics-ER 1.6,相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 提升了空间与物理推理能力,包括指向、计数、成功检测和多视角理解。