We're releasing HeyGen Video, built for businesses that need production-quality video without production-level costs. Pricing starts at $0.01/s through October (50% off) Built on @Minimax_AI H3, post-trained by HeyGen. Learn more: https://developers.heygen.com/heygen-video-1.0-catalog
#视频
#视频
今日 4 条
MiniMax (official)@MiniMax_AIAI 评分4848引用HeyGen@HeyGen
MiniMax (official)@MiniMax_AIAI 评分4343引用Creatify Labs@Creatify_LabsIntroducing Boreal-H3 — a video model built for ads and our next step toward recursive self-improvement in video generation. A good-looking video isn’t enough. The product has to stay the same. The actor has to stay the same. The label has to be right. And the action in the brief actually has to happen. So we post-trained MiniMax H3 specifically for advertising. But this isn’t a one-off SFT or LoRA fine-tune. We built a closed-loop system that learns what to improve next. Human-calibrated evaluation diagnoses failures and guides the next intervention: targeted data collection, reinforcement learning, or inference optimization. When the feedback is unreliable, we revise the evaluator or reward—not just the generator. Every experiment feeds into shared memory, informing the next training decision. The model improves, and so does the process that produces its successor. The results: → 85.3% reference fidelity — highest among the frontier video generation models we evaluated → Brief success: 28% → 50% → Identity match: 83% → 94% → Visible defects per clip: down 70% → Generation time and estimated cost: down 20% Boreal-H3 doesn’t just make better-looking video. It makes more usable ads. Credit to the @MiniMax_AI team for the foundation we’re building on. This launch is a checkpoint, not the finish line. We’re building more than a better video model. We’re building a system that learns how to make the next one better.
NVIDIA AI@NVIDIAAIAI 评分3535
Google Developers Blog(RSS)AI 评分4343 如何在 TPU 上加速视频扩散模型的时空注意力
Google 在 TPU 上通过稀疏注意力内核优化加速视频扩散模型的时空注意力计算。视频扩散中自注意力在单层延迟占比可从 720p 的 55.5% 升至 1440p 的 88.2%。
xAI:News(网页)精选AI 评分6262 xAI 发布 Grok Imagine API,主打高质量低延迟视频生成与编辑
xAI 发布 Grok Imagine API,一套覆盖视频生成与视频编辑的统一 API 套件,称其为迄今最强的音视频生成模型。
推荐理由:官方宣布 Grok Imagine API 上线,附 Artificial Analysis 文生视频排名第一及延迟对比,可据此评估其在视频生成工作流中的位置。
xAI:News(网页)AI 评分4949 xAI 发布 Grok Imagine 1.5 Preview 图生视频模型,上线 xAI API
xAI 最新图生视频模型 grok-imagine-video-1.5-preview 已通过 xAI API 开放预览。该模型可将单张静态图像转为流畅的电影感视频,支持最高 720p 分辨率,用户用自然语言提示词即可控制镜头运动、节奏与声音设计,并能保持原图的细节与光照。模型还支持逐帧生成并串联成更长场景,可用几行 Python 代码调用。
xAI:News(网页)精选AI 评分6666 xAI 发布 Grok Imagine Video 1.5 图生视频模型并开放 API
xAI 发布 Grok Imagine Video 1.5,已在 Imagine API 正式可用(模型名 grok-imagine-video-1.5),并在 grok.com/imagine 和 iOS、Android 应用推出 Video 1.5 Fast。
推荐理由:xAI 官方说明升级点和速度数据,还给出 API 模型名与并发代理等入口,适合评估图生视频工作流。
xAI:News(网页)精选AI 评分6868 xAI 为 Imagine Video 1.5 增加图像与语音参考,支持文本生成视频和原生 1080p
xAI 为 Imagine Video 1.5 增加图像与语音参考、纯提示词生成视频和原生 1080p 输出。
推荐理由:原文列出图像与语音参考、文本生成视频和原生 1080p 的可用范围与 API 情况,读者可据此判断能否接入现有工作流。
Suno:Blog(网页)AI 评分2828 Matt Steffanina 谈用 Suno 掌控舞蹈视频背后的音乐
洛杉矶舞者、编舞师兼 DJ Matt Steffanina 在 Suno 博客访谈中表示,他用 Suno 为舞蹈内容创作原创音乐,把概念落地的时间从数天缩短到几分钟。他此前围绕他人音乐积累了数十亿播放量却不拥有底层资产,转向自制并拥有音乐后获得了更多机会与长期控制权。他近期在市中心地下通道拍摄的舞蹈视频即用 Suno 生成一首 house 曲目,成为其表现最好的 Hooks 之一。
Suno:Blog(网页)AI 评分3333 Dream Relic 如何用 Suno 为超现实视觉世界赋予声音
AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,把积压多年的歌词变成歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。一条深夜发布的视频引来数百条求歌名评论,让他重新重视音乐创作。他认为提示词与反复打磨等创作方向仍然关键,目标是让人感受作品而非关注工具。
LMSYS:Blog(Chatbot Arena 团队)精选AI 评分6363 SGLang-Diffusion 发布两个月:速度较初版提升至 2.5 倍,新增 ComfyUI 集成与 LoRA 支持
LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。
推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。
LMSYS:Blog(Chatbot Arena 团队)AI 评分4646 SGLang-Diffusion 如何为生产级视频生成做深度优化
SGLang-Diffusion 团队公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE 与多请求服务稳定性。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。
Google Developers Blog(RSS)AI 评分3333 HeyGen 与 Google Cloud 合作将 Avatar IV 迁移至 TPU
HeyGen 与 Google Cloud 合作,把 180 亿参数以上的数字人视频扩散模型 Avatar IV 迁移到八芯片 Trillium(v6e)主机上,速度比首个可用版本提升 1.86 倍。
Baseten Base Labs:模型研究AI 评分3535 Baseten 上线 Wan 2.2 T2V 文生视频 API
Baseten 提供 Wan 2.2 T2V 文生视频 API,通过 POST 请求传入提示词即可生成视频,返回 base64 编码结果。支持 720x1280、1280x720、480x832、832x480、704x1280、1280x704、1024x704、704x1024 八种分辨率,可设置 sampling_steps、guide_scale 与 seed 参数。
Baseten Base Labs:模型研究AI 评分5454 Baseten 上线 NVIDIA Cosmos 3 Nano (8B),支持六种生成与动作模式
NVIDIA Cosmos 3 Nano (8B) 世界基础模型现可通过 Baseten 在单张 H100 上部署,提供六种 omni 模式:text2image、text2video(默认模式)、image2video、forward/inverse dynamics 和 policy。
MiniMax:Blog(网页)AI 评分2424 MiniMax Hailuo 成为 WAIFF 2026 全球合作伙伴,携多模态模型亮相戛纳
MiniMax Hailuo 以 WAIFF 2026 全球合作伙伴及中国特别单元联合发起方身份亮相戛纳,并发布由多模态模型生成的 2026 品牌影片。
MiniMax:Blog(网页)精选AI 评分7171 MiniMax 开源 H3 通用视频生成模型,支持 2K 分辨率与原生立体声音频
MiniMax 正式开源下一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频的多模态统一理解,可生成最长 15 秒、768p(经 H3-Regenerate-2K 可达 2K)、24 FPS 并带 32 kHz 立体声音频的视频。
推荐理由:官方开源公告给出了完整的三模块系统结构、模型规格和本地部署方式,读者可以据此评估在自己的视频生成流程中如何接入。
LMSYS:Blog(Chatbot Arena 团队)AI 评分5050 SGLang Diffusion 实测 MiniMax-H3:8×NVIDIA H200 上无损 1.95×、最高 6.24× 加速
SGLang Diffusion 团队发布 MiniMax-H3 视频生成基准,在 8× NVIDIA H200(141 GB)、SGLang v0.5.18。
Meta AI:Blog(网页)AI 评分7474 Meta 发布 Muse Image 并预览 Muse Video
Meta Superintelligence Labs 发布 Muse Image 并预览 Muse Video,均为该实验室首批媒体生成模型。
NVIDIA AI BlogAI 评分5050 NVIDIA 在 IBC 扩展 AI for Media:实时 AI 进入广播、体育与全球流媒体
NVIDIA 在 IBC 2026 宣布大幅扩展 NVIDIA AI for Media,为广播、体育与流媒体工作流新增 GPU 加速 SDK、NIM 微服务与蓝图。
CMU:Machine Learning BlogAI 评分5454 CMU 团队发布 CHAI 视频描述管线,用 100+ 专业创作者的批判式人机协作提升视频语言监督
CMU 研究者发布 CHAI,一个基于批判式人机监督的视频描述管线,与 100+ 专业视频创作者合作一年构建,对应 CVPR 2026 论文(Highlight,Top 3%)。
Black Forest Labs:Blog(网页)精选AI 评分7171 Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access
Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。
推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。
Black Forest Labs:Blog(网页)精选AI 评分6666 Black Forest Labs 发布 FLUX 3 Video,文生视频与图生视频正式开放
Black Forest Labs 宣布 FLUX 3 Video 初版正式开放,可通过 BFL API 和部分合作伙伴使用。模型支持最长 20 秒、HD(720p)与 Full HD(1080p,经上采样)的视频生成,并伴随生成原生音频;能力包括文生视频、图生视频与关键帧、视频续接(最多 4 秒)、单次生成多镜头、多语言对白与唇形同步、Draft Mode 低成本预览等。
推荐理由:原文给出具体生成时长、分辨率、多语言与评测结果,读者可据此判断 FLUX 3 Video 在视频生成工作流中的可用性。
Black Forest Labs:Blog(网页)AI 评分5656 Black Forest Labs 发布 FLUX Video Upscale,可将视频重生成至原生 4K
Black Forest Labs 推出 FLUX Video Upscale,作为独立 FLUX Tool 和 endpoint,可将 480p 起的视频重生成至最高原生 4K,支持 1.5x、2x、3x 放大,并可原生理解 FLUX 3 输出。
Black Forest Labs:Blog(网页)AI 评分1515 Black Forest Labs 研究:自监督流匹配与 FLUX.2 潜空间分析
Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。
AWS Machine Learning BlogAI 评分4141 Condé Nast 如何用 Amazon Bedrock 构建多模态视频检索
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
SenseTime@SenseTime_AIAI 评分2929
ModelScope@ModelScope2022AI 评分5858
NVIDIA AI@NVIDIAAIAI 评分3838
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分3030 NVIDIA VSS Blueprint 3.3 发布:降低视觉 AI 智能体构建与运行成本
NVIDIA 发布 Metropolis Blueprint for Video Search and Summarization(VSS)3.3,用于降低视觉 AI 智能体的构建与运行成本。该蓝图及其智能体技能将视频接入、流处理、事件检测、检索、摘要与报告整合为可维护的系统,让视觉语言模型在生产规模下理解视频。
AWS Machine Learning BlogAI 评分2424 在 SageMaker AI 上用 vLLM-Omni 生成图像与视频(第二部分)
AWS 发布 vLLM-Omni 图像视频生成示例,在同一 vLLM-Omni DLC 上部署两个 SageMaker AI 端点:实时端点跑 FLUX.2-klein-4B 文生图,异步端点跑 Wan2.1-VACE-1.3B 图生视频。
MiniMax Design (H3)@Hailuo_AIAI 评分1717引用awesome_visuals@awesome_visualsthe chef's revenge. made with MiniMax H3 Max @Hailuo_AI
Google Research精选AI 评分6767 Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频,并原生继承 SynthID 水印等安全机制。
推荐理由:Google 把长视频生成拆成四个可组合的智能体框架,并给出三套自建基准与量化结果,便于对照现有方案。
Google DeepMind:Blog(RSS)精选AI 评分6666 Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型结合,让对话 AI 具备动态视觉形象,支持精准唇形同步、自然表情和流畅轮次切换。
推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级数字人交互的落地边界。
Google Blog:AI(RSS)AI 评分4848 Google 发布 Gemini 3.8 Live with Live Avatar,为对话 AI 带来实时视觉形象
Google 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让企业智能体在对话中"能听、能看、能说",并具备精准唇形同步与自然表情。
SenseTime@SenseTime_AIAI 评分2929
MiniMax (official)@MiniMax_AIAI 评分2929更多用 MiniMax-H3 构建的方式。🐮 很高兴看到模型优化与 AMD 推理工程结合,为创作者带来更快的反馈循环。⚡️
引用Nunchux AI@NunchuxAI5s of video, generated in 1.3s! Nunchux brings @MiniMax’s MiniMax-H3 to @AMD MI355X with up to 26.7× faster inference than SGLang on 8 GPUs @AMDServer And with streaming generation, you can change the prompt as the video plays, steering what happens next. One stack, optimized across hardware. Free access to MiniMax-H3 is coming soon! Join the waitlist now at http://nunchux.ai. Our blog: https://www.nunchux.ai/blog/video-generation-on-amd-mi355x #AI #VideoGeneration #MiniMaxH3
Google Blog:AI(RSS)精选AI 评分6868 Google Vids 集成 Gemini Omni 1.1 Flash,所有账号可免费生成 1080p HD 视频
Google 宣布所有 Google 或 Google Workspace 账号均可通过 Google Vids 使用最新的 Gemini Omni 1.1 Flash 模型免费生成高质量视频,入口为 vids.new 并选择 "Create AI videos"。
推荐理由:原文来自产品经理宣布,交代了免费开放入口、具体模型和新控制功能,读者可据此判断是否改变自己的视频制作流程。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分2828 invideo 如何借助 GPT-6 Astra 将调色效率提升 3 倍
invideo 使用 GPT-6 Astra 后,调色与色彩校正任务成功率提升约 3 倍,并在一天内创建约 50 个自定义特效。该模型能以更少推理步骤和输出 token 完成复杂剪辑规划,并实现帧级精度的编辑规划。