World Labs 的多模态世界模型 Marble 正式向所有人开放
World Labs 宣布其多模态世界模型 Marble 正式全面开放,此前两个月仅向小范围 beta 用户开放。
World Labs 宣布其多模态世界模型 Marble 正式全面开放,此前两个月仅向小范围 beta 用户开放。
World Labs 发布 World API,这是其多模态世界模型 Marble 的公开接口,可将文本、单张图像、多图、360° 全景和视频生成为可导航的 3D 世界。
World Labs 团队发文将当前各类 world models 按功能分为三类:渲染器输出像素、模拟器输出状态、规划器输出动作,认为三者是对同一感知-动作循环的不同投影。
月之暗面(Moonshot AI)的 Kimi K3 模型以 moonshotai/Kimi-K3 标识出现在一份 API 响应示例中,该响应返回了 chat.completion 对象。示例显示其 usage 包含 189 个 prompt_tokens、82 个 completion_tokens,其中多模态图像 token 为 96。
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 家族首个实验性多模态模型,在 DeepSeek-V4-Flash 架构上加入视觉模块并继续训练以获得视觉理解能力。
NVIDIA Cosmos 3 Nano (8B) 世界基础模型现可通过 Baseten 在单张 H100 上部署,提供六种 omni 模式:text2image、text2video(默认模式)、image2video、forward/inverse dynamics 和 policy。
MOSS-Transcribe-Diarize 0.9B 是一个端到端音频模型,可在单次推理中完成语音转写、说话人标注和时间戳,把多人长录音整理成结构化的"谁说了什么"。
World Labs 宣布已签署最终协议加入 AMD,交易预计在 2026 年底前完成,尚需监管批准。双方自去年起在 AMD GPU 上的模型训练与推理优化方面开展技术合作。
推荐理由:收购方与被收购方核心人事和交易时间都由当事方直接说明,读者可以据此了解 World Labs 并入 AMD 后的研究安排。
World Labs 发布下一代世界模型 Atlas,一个从零预训练的全能模型,可原生处理文本、图像、视频和 3D。
World Labs 上线 Marble Labs,汇集 Marble 在影视 VFX、虚拟制片、游戏、AR/VR 等场景的项目案例与构建教程。
Suno 发布 Studio 2.0,为浏览器端 DAW 带来 MIDI 导入录制与编辑、wavetable 合成器、Chat(beta)、高级 stem 分离、音频效果与自定义插件以及自动化功能。MIDI 片段还可作为音频生成的提示词,Premier 订阅者可无限导出 32-bit/48kHz 多轨与 stems。
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG 和 Believe 等行业伙伴合作开发,官方称其更快、更具表现力且质量更高。
推荐理由:原文给出 v6 三个模型分工、具体编辑控制能力和与 Warner Music Group 等的合作背景,读者可据此评估其创作工作流的变化。
微软推出 MAI-Code-1.1-Flash 模型,已用于 GitHub Copilot,在命令行编码和 .NET 开发任务上表现提升,用更少 token 完成任务且成本低于 6 月版本。微软还发布开源智能体框架 Orchard,为训练和评估能写代码、浏览网页的 AI 智能体提供可复用环境。此外,微软研究模型 CARE-X 可将多项放射学任务整合,在胸部 X 光任务和真实患者数据上表现良好。
MiniMax 与 Agora 在 Anime Japan 周期间于东京合办了一场面向企业的闭门峰会,聚焦将 AI 角色从概念演示推进为可部署的企业级产品。Agora 展示了实时交互的超低延迟基础设施,MiniMax 则展示了其模型层能力,包括情感丰富的 TTS、多模态生成与细腻的角色表达。
MiniMax 在哈佛大学 HXR 2026 大会上展示了覆盖文本、语音、视频和音乐的多模态 AI 模型套件,可将 XR 开发中分散的工具整合为单一 API 平台。其模型可应用于医疗手术训练、旅游虚拟导览、神经科学数据三维可视化及语音驱动交互培训等场景。Gibran Mourani 代表 MiniMax 演讲,并担任该会议首届路演竞赛的 14 位评委之一。
MiniMax 在 WaytoAGI 东京全球 AI 大会上介绍了其多模态智能体与人类-AI 协作思路:Talkie、MiniMax Agent、Hailuo AI 及音频音乐平台共用同一自研模型栈,并通过开放 API 向外部伙伴开放同等能力。
MiniMax 正式开源下一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频的多模态统一理解,可生成最长 15 秒、768p(经 H3-Regenerate-2K 可达 2K)、24 FPS 并带 32 kHz 立体声音频的视频。
推荐理由:官方开源公告给出了完整的三模块系统结构、模型规格和本地部署方式,读者可以据此评估在自己的视频生成流程中如何接入。
Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线,并向部分用户开放私有 API 预览。
推荐理由:官方披露了预训练效率、RL 与测试时推理三条扩展路径的具体结果,以及 Apollo Research 关于评估意识的独立发现,可据此了解其技术栈现状。
Meta AI 推出 Brain2Qwerty v2,可从非侵入式脑记录(MEG)实时解码完整句子,词准确率 61%,远高于其他非侵入式方法的 8%,最佳参与者达 78%。
Meta 介绍其开源模型 Segment Anything Model 3(SAM 3)和 DINOv3 成为由能源部 Genesis Mission 旗下 SYNAPS-I 项目分割管线的核心。
Meta Superintelligence Labs 发布 Muse Spark 1.1,一个面向智能体任务的多模态推理模型,在工具与计算机使用、编码和多模态理解上较 Muse Spark 有明显提升,支持 100 万 token 上下文管理和多智能体编排。
Liquid AI 发布 LFM2.5-VL-3B 视觉语言模型,已上架 Hugging Face。相比 LFM2-VL-3B,屏幕理解、函数调用、grounding 和多图输入显著提升,ScreenSpot-v2 达 80.7,ToolSandbox 从 26.4 升至 59.5,RefCOCO 从 57.1 升至 87.9。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以约 280M 参数(增加 8.9% 内存占用)换取更快解码,GPU 解码吞吐最高提升 2.66 倍、边缘设备最高 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍。
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,prefill 激活 8B、解码激活 16B,支持 1M token 上下文,采用 Causal Encoder-Decoder 架构与 Compressed Sparse Attention 2。
Goodfire Research 发布 Silico,一款用于机器人与视觉基础模型的物理 AI 研究工具,可在生成任何一帧前直接从潜空间验证模型是否学到真实物理结构。
Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。
CMU 团队提出 CowCorpus 数据集,包含 400 段真实人机协作网页会话和 4200+ 交错动作,用于训练智能体预测人类介入时机。基于该数据将介入预测建模为逐步二分类任务,用大型多模态模型监督微调,并聚类出 Takeover、Hands-on、Hands-off、Collaborative 四类用户交互模式。
CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。
CMU 研究者发布 CHAI,一个基于批判式人机监督的视频描述管线,与 100+ 专业视频创作者合作一年构建,对应 CVPR 2026 论文(Highlight,Top 3%)。
Black Forest Labs 发布早期版本 FLUX 3 多模态基础模型,联合训练图像、视频与音频,视频预测占训练算力超 95%。FLUX 3 骨干可解码动作预测,加入动作模态后视频质量先降最多 10%,3500 步后恢复原有水平。
推荐理由:官方给出训练细节与工厂实测数据,说明同一多模态骨干如何同时支持内容生成与机器人动作控制。
Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。
推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。
Black Forest Labs 宣布 FLUX 3 Video 初版正式开放,可通过 BFL API 和部分合作伙伴使用。模型支持最长 20 秒、HD(720p)与 Full HD(1080p,经上采样)的视频生成,并伴随生成原生音频;能力包括文生视频、图生视频与关键帧、视频续接(最多 4 秒)、单次生成多镜头、多语言对白与唇形同步、Draft Mode 低成本预览等。
推荐理由:原文给出具体生成时长、分辨率、多语言与评测结果,读者可据此判断 FLUX 3 Video 在视频生成工作流中的可用性。
Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。
Anthropic 宣布 Claude Design 现可在任意 Claude 对话中使用,包括 Claude Code 和 Artifacts 标签页,Claude Tag 支持即将推出。
推荐理由:原文给出可用范围、连接器和设计系统管理等具体变化,读者可据此判断它对设计到交付流程的影响。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
NVIDIA 发布 Metropolis Blueprint for Video Search and Summarization(VSS)3.3,用于降低视觉 AI 智能体的构建与运行成本。该蓝图及其智能体技能将视频接入、流处理、事件检测、检索、摘要与报告整合为可维护的系统,让视觉语言模型在生产规模下理解视频。
Apple Creator Studio 将推出全新模板、端到端电影级视频功能及多项提效特性。Freeform 新增自动适配深色模式、文件夹分组协作,Writing Tools 借助 Apple Intelligence 可改写、校对和摘要手写笔记,并支持通过 Shortcuts 自动添加内容。
Xin Liu 与 Eunjo Lee 在 LAS Art Foundation 与 Google Arts & Culture Lab 合作的线上艺术家驻地项目中,用 Google AI 工具创作了《nom nom》和《In Your Eyes, Before My Own》两件作品,探索哲学、心理学与 AI。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,从缩小化合物搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态世界模型与实验闭环设计,读者可了解 AI 参与生物实验设计与验证的具体路径。