Google AgentHands:为 XR 空间智能体对话生成同步手势
Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。
Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。
QwenLM 推出 Qwen-Drive-1.0,作为面向自动驾驶的视觉语言基础模型迈出的第一步。该模型定位为自动驾驶领域的视觉语言基础模型,具体参数规模、benchmark 分数与开放方式尚未在原文中披露。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性数据与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Hugging Face 发布研究,用三类测试量化 ASR 模型的基准优化(benchmaxxing)现象,评估了 11 个开源模型。
推荐理由:研究用三类探针量化语音识别模型的基准优化行为,并给出模型选型与基准设计的具体建议。
VeRL-Omni v0.2.0 发布,通过 vLLM-Omni 的请求级批处理让 Qwen-Image FlowGRPO rollout 的 GPU 利用率从约 80% 升至约 100%,单次生成时间从 226s 降至 108s,减少 52%。
NVIDIA 发布技术博客,介绍如何用 NVIDIA FLARE 构建联邦多模态 AI 工作流,在数据无法集中到一处的情况下跨数据本地站点协调视觉语言模型(VLM)训练。VLM 可支持视觉问答、图像描述和图文推理等任务,而联邦学习为这类分布式数据场景提供了训练协调方案。
VAST 创始人兼 CEO 宋亚宸在播客中讲述其从商汤、MiniMax 到创办 VAST 的路径,公司核心 3D 创作产品 Tripo AI 可从文字或图片生成 3D 模型。
Google Research 推出研究性深度学习框架 PhotoScan,从标准 2D 手机照片估算体脂率(BF%)、A/G 比和 V/S 比三项三维体成分指标。
vLLM-Omni 团队发布 Distributed Layerwise Offload,让超过单卡 HBM 的视频生成模型(如 Cosmos3-Super 64B / 124 GB)可在多块 NPU 或 GPU 上运行。
AllenAI 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型的 embedding 向量,源代码、模型权重和研究论文公开可查。
微软研究院推出 MindTopo 基准,从连续性、分离、顺序、包围、绳结五类拓扑关系评估多模态大模型的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步动作时难以维持拓扑约束。
Google DeepMind 发布大规模多语言手语转文本模型 SL2T,为 Gboard 和 Pixel 11 的 Live Transcribe 带来手语转文字听写,首先支持 ASL 转英语,后续将扩展更多语言和设备。
推荐理由:原文解释了手语翻译的两类核心难题和 SL2T 的技术取舍,并给出基准分数与隐私设计,读者可了解可用手语 AI 的实现路径。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),可进行实时视频临床问诊,感知非语言视觉和听觉线索并引导虚拟体格检查。
推荐理由:原文给出三智能体架构和随机对照结果,读者可以据此了解实时视频问诊 AI 的设计思路与评估方法。
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,同时支持报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
NVIDIA 发布 Magpie Multilingual TTS 开放权重模型(364M 参数),支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,可在自有基础设施部署并微调。
Meta 发布 30B 参数多模态开源模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,主打本地智能体用途如编码、文档分析和个人助理。
推荐理由:发布方提供了架构细节、完整基准对比和多种部署路径,读者可以据此评估它在本地智能体场景的适配性。
Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重训即可适配文本与图像审核。它以 Apache 2.0 协议开放权重,在文本安全上匹敌最大 7 倍于其体积的开放审核模型,可在单张 16GB NVIDIA GPU 上运行,并输出经校准的连续安全分数。
推荐理由:原文说明了将审核策略写成自然语言问题即可在推理时切换的机制,读者可据此评估它替代固定分类审核模型的可行性。
推荐理由:原文给出参数规模、权重开放和在 Tinker 上微调与对话的入口,读者可评估其部署与使用路径。
Google DeepMind 发布 Gemini Robotics ER 2,面向机器人的具身推理模型,支持视频理解、任务进度跟踪、工具编排与多机器人协作,并可将执行交给下层 VLA 模型。
推荐理由:官方发布给出进度分类、moment finding 等具体数字和公开 API 入口,读者可以据此评估其机器人编排与视频理解能力。
QwenLM 推出 Qwen-MM-Plugins,目标是让任意 agent harness 实现多模态原生支持。该插件项目来自通义 QwenAudio 相关原创语音项目方向,正文未披露具体模型版本、参数规模或可用方式。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款模型,面向大规模 AI agent 构建。
推荐理由:官方发布三款 Gemini Flash 模型,给出具体价格、token 效率与多项基准对比,读者可据此评估 agent 工作流的成本与选型。
DharmaOCR 在葡萄牙语专用基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型经葡萄牙语监督微调与 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量与稳定性上保持优势。
MIT 与 IBM 等机构的研究者提出 GIFT(Geometric Inference Feedback Tuning),可让视觉语言模型自动把 2D 设计图转成可执行的 CAD 程序,精度更高且仅需约 20% 的计算量。
Today, we are introducing Inkling. Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available. https://thinkingmachines.ai/news/introducing-inkling/ Available today for fine-tuning on Tinker. Play with it in the Inkling Playground. 🧵
Today, we are introducing Inkling. Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available. https://thinkingmachines.ai/news/introducing-inkling/ Available today for fine-tuning on Tinker. Play with it in the Inkling Playground. 🧵
推荐理由:Thinking Machines 发布首个模型 Inkling,开放全部权重并支持 Tinker 微调,可关注其跨模态推理的落地方式。
推荐理由:原文给出多模态能力、开放权重和两个可用入口,读者可以据此了解获取和试用方式。
Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 在发布当天通过 Serverless 提供托管推理,支持 1M 上下文窗口和 OpenAI 兼容 API。
推荐理由:原文给出 Inkling 的架构细节、参数规模和初步评测数据,读者可以据此判断其推理与多模态能力是否适合接入。
vLLM 宣布 Day-0 支持 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling,提供 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本。
推荐理由:官方详解了 Day-0 支持背后的 sconv 缓存、TP 分片和 MTP 处理等优化,读者可迁移到类似新架构的推理部署。
Thinking Machines 在 Hugging Face 上发布开源多模态模型 Inkling,共 975B 总参数、41B 激活参数,支持 1M 上下文,原生接收图像、文本和音频输入,训练数据为 45 万亿 token,并同时发布 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:文章给出了 Inkling 的架构细节、各档位 VRAM 需求和多条部署路径,便于读者评估在自己的硬件上运行哪种变体。
Thinking Machines Lab exists to empower humanity through advancing collaborative general intelligence. We're building multimodal AI that works with how you naturally interact with the world - through conversation, through sight, through the messy way we collaborate. We're excited that in the next couple months we’ll be able to share our first product, which will include a significant open source component and be useful for researchers and startups developing custom models. Soon, we’ll also share our best science to help the research community better understand frontier AI systems. To accelerate our progress, we’re happy to confirm that we’ve raised $2B led by a16z with participation from NVIDIA, Accel, ServiceNow, CISCO, AMD, Jane Street and more who share our mission. We’re always looking for extraordinary talent that learns by doing, turning research into useful things. We believe AI should serve as an extension of individual agency and, in the spirit of freedom, be distributed as widely and equitably as possible. We hope this vision resonates with those who share our commitment to advancing the field. If so, join us. https://thinkingmachines.paperform.co/
vLLM-Omni 将 Qwen3-Omni 拆成 Thinker、Talker、Code2Wav 三阶段流水线,并通过 OpenAI 兼容的 /v1/chat/completions 提供文本与语音生成。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),称其为 Nano Banana 家族中最快。
推荐理由:官方同时推出 Nano Banana 2 Lite 与 Gemini Omni Flash,给出了价格、延迟和限制等可核对的发布细节。
OpenAI 在 GitHub 新建仓库 birdingpal,这是一个由 ChatGPT 驱动的鸟类识别助手。该仓库目前仅有一句说明,称 BirdingPal 是用于识别鸟类的 ChatGPT 伙伴,未披露模型版本、参数规模或可用方式等细节。
Mistral 发布 OCR 4 文档解析模型,除提取文本外返回边界框、块类型分类和逐词置信度分数,支持 170 种语言,可单容器自托管部署。
推荐理由:官方说明新模型的结构化输出能力、定价和基准局限,读者可据此判断它在文档解析流程中的适配场景。