跳到正文

#视频

今日 4 条
今天10月1日周四
  1. MiniMax (official)48

    @HeyGen 发布 HeyGen Video,令人印象深刻!✨ 基于 MiniMax H3 构建,由 HeyGen 后训练,以更可及的成本为企业带来制作级视频。 很自豪能为这项工作提供基础,期待看到 HeyGen 团队将它带向多远。

    引用HeyGen@HeyGen

    We're releasing HeyGen Video, built for businesses that need production-quality video without production-level costs. Pricing starts at $0.01/s through October (50% off) Built on @Minimax_AI H3, post-trained by HeyGen. Learn more: https://developers.heygen.com/heygen-video-1.0-catalog

  2. MiniMax (official)43

    基于 MiniMax H3 构建,@Creatify_Labs 的 Boreal-H3 是一款专为广告优化的视频模型,在更精准遵循创意简报的同时,保持产品和角色的一致性。 很高兴看到 MiniMax H3 成为更多面向特定行业的前沿模型的基础!✨

    引用Creatify Labs@Creatify_Labs

    Introducing Boreal-H3 — a video model built for ads and our next step toward recursive self-improvement in video generation. A good-looking video isn’t enough. The product has to stay the same. The actor has to stay the same. The label has to be right. And the action in the brief actually has to happen. So we post-trained MiniMax H3 specifically for advertising. But this isn’t a one-off SFT or LoRA fine-tune. We built a closed-loop system that learns what to improve next. Human-calibrated evaluation diagnoses failures and guides the next intervention: targeted data collection, reinforcement learning, or inference optimization. When the feedback is unreliable, we revise the evaluator or reward—not just the generator. Every experiment feeds into shared memory, informing the next training decision. The model improves, and so does the process that produces its successor. The results: → 85.3% reference fidelity — highest among the frontier video generation models we evaluated → Brief success: 28% → 50% → Identity match: 83% → 94% → Visible defects per clip: down 70% → Generation time and estimated cost: down 20% Boreal-H3 doesn’t just make better-looking video. It makes more usable ads. Credit to the @MiniMax_AI team for the foundation we’re building on. This launch is a checkpoint, not the finish line. We’re building more than a better video model. We’re building a system that learns how to make the next one better.

9月30日周三
  1. xAI:News(网页)49

    xAI 发布 Grok Imagine 1.5 Preview 图生视频模型,上线 xAI API

    xAI 最新图生视频模型 grok-imagine-video-1.5-preview 已通过 xAI API 开放预览。该模型可将单张静态图像转为流畅的电影感视频,支持最高 720p 分辨率,用户用自然语言提示词即可控制镜头运动、节奏与声音设计,并能保持原图的细节与光照。模型还支持逐帧生成并串联成更长场景,可用几行 Python 代码调用。

  2. Suno:Blog(网页)28

    Matt Steffanina 谈用 Suno 掌控舞蹈视频背后的音乐

    洛杉矶舞者、编舞师兼 DJ Matt Steffanina 在 Suno 博客访谈中表示,他用 Suno 为舞蹈内容创作原创音乐,把概念落地的时间从数天缩短到几分钟。他此前围绕他人音乐积累了数十亿播放量却不拥有底层资产,转向自制并拥有音乐后获得了更多机会与长期控制权。他近期在市中心地下通道拍摄的舞蹈视频即用 Suno 生成一首 house 曲目,成为其表现最好的 Hooks 之一。

  3. Suno:Blog(网页)33

    Dream Relic 如何用 Suno 为超现实视觉世界赋予声音

    AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,把积压多年的歌词变成歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。一条深夜发布的视频引来数百条求歌名评论,让他重新重视音乐创作。他认为提示词与反复打磨等创作方向仍然关键,目标是让人感受作品而非关注工具。

  4. LMSYS:Blog(Chatbot Arena 团队)63

    SGLang-Diffusion 发布两个月:速度较初版提升至 2.5 倍,新增 ComfyUI 集成与 LoRA 支持

    LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。

    推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。

  5. Baseten Base Labs:模型研究35

    Baseten 上线 Wan 2.2 T2V 文生视频 API

    Baseten 提供 Wan 2.2 T2V 文生视频 API,通过 POST 请求传入提示词即可生成视频,返回 base64 编码结果。支持 720x1280、1280x720、480x832、832x480、704x1280、1280x704、1024x704、704x1024 八种分辨率,可设置 sampling_steps、guide_scale 与 seed 参数。

  6. MiniMax:Blog(网页)71

    MiniMax 开源 H3 通用视频生成模型,支持 2K 分辨率与原生立体声音频

    MiniMax 正式开源下一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频的多模态统一理解,可生成最长 15 秒、768p(经 H3-Regenerate-2K 可达 2K)、24 FPS 并带 32 kHz 立体声音频的视频。

    推荐理由:官方开源公告给出了完整的三模块系统结构、模型规格和本地部署方式,读者可以据此评估在自己的视频生成流程中如何接入。

  7. Black Forest Labs:Blog(网页)71

    Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access

    Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。

    推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。

  8. Black Forest Labs:Blog(网页)66

    Black Forest Labs 发布 FLUX 3 Video,文生视频与图生视频正式开放

    Black Forest Labs 宣布 FLUX 3 Video 初版正式开放,可通过 BFL API 和部分合作伙伴使用。模型支持最长 20 秒、HD(720p)与 Full HD(1080p,经上采样)的视频生成,并伴随生成原生音频;能力包括文生视频、图生视频与关键帧、视频续接(最多 4 秒)、单次生成多镜头、多语言对白与唇形同步、Draft Mode 低成本预览等。

    推荐理由:原文给出具体生成时长、分辨率、多语言与评测结果,读者可据此判断 FLUX 3 Video 在视频生成工作流中的可用性。

  9. Black Forest Labs:Blog(网页)15

    Black Forest Labs 研究:自监督流匹配与 FLUX.2 潜空间分析

    Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。

  10. SenseTime29

    商汤预览 SenseNova 6.8 Flash 的 Dynamic Design 功能,可将静态图像转为动态设计。它能理解文本、主体与视觉元素的关系,决定哪些保持静态、哪些做动画,并为每个元素选择 HTML/CSS、SVG、透明图像或视频等合适形式,再编排文字显现、主体运动与环境响应,最后对照源设计检查修正输出。该模型尚未正式发布,目前开放限量 beta 体验,评论即可申请加入。

  11. NVIDIA Technical Blog(开发者技术博客 · RSS)30

    NVIDIA VSS Blueprint 3.3 发布:降低视觉 AI 智能体构建与运行成本

    NVIDIA 发布 Metropolis Blueprint for Video Search and Summarization(VSS)3.3,用于降低视觉 AI 智能体的构建与运行成本。该蓝图及其智能体技能将视频接入、流处理、事件检测、检索、摘要与报告整合为可维护的系统,让视觉语言模型在生产规模下理解视频。

9月29日周二
9月28日周一
9月27日周日
9月25日周五
  1. Google Research67

    Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频,并原生继承 SynthID 水印等安全机制。

    推荐理由:Google 把长视频生成拆成四个可组合的智能体框架,并给出三套自建基准与量化结果,便于对照现有方案。

  2. Google DeepMind:Blog(RSS)66

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型结合,让对话 AI 具备动态视觉形象,支持精准唇形同步、自然表情和流畅轮次切换。

    推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级数字人交互的落地边界。

9月24日周四
  1. MiniMax (official)29

    更多用 MiniMax-H3 构建的方式。🐮 很高兴看到模型优化与 AMD 推理工程结合,为创作者带来更快的反馈循环。⚡️

    引用Nunchux AI@NunchuxAI

    5s of video, generated in 1.3s! Nunchux brings @MiniMax’s MiniMax-H3 to @AMD MI355X with up to 26.7× faster inference than SGLang on 8 GPUs @AMDServer And with streaming generation, you can change the prompt as the video plays, steering what happens next. One stack, optimized across hardware. Free access to MiniMax-H3 is coming soon! Join the waitlist now at http://nunchux.ai. Our blog: https://www.nunchux.ai/blog/video-generation-on-amd-mi355x #AI #VideoGeneration #MiniMaxH3

  2. Google Blog:AI(RSS)68

    Google Vids 集成 Gemini Omni 1.1 Flash,所有账号可免费生成 1080p HD 视频

    Google 宣布所有 Google 或 Google Workspace 账号均可通过 Google Vids 使用最新的 Gemini Omni 1.1 Flash 模型免费生成高质量视频,入口为 vids.new 并选择 "Create AI videos"。

    推荐理由:原文来自产品经理宣布,交代了免费开放入口、具体模型和新控制功能,读者可据此判断是否改变自己的视频制作流程。

9月23日周三