跳到正文

AI 视频

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

最新精选

第 1–16 条 · 共 16 条
9月30日周三
  1. LMSYS:Blog(Chatbot Arena 团队)63

    SGLang-Diffusion 发布两个月:速度较初版提升至 2.5 倍,新增 ComfyUI 集成与 LoRA 支持

    LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。

    推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。

  2. MiniMax:Blog(网页)71

    MiniMax 开源 H3 通用视频生成模型,支持 2K 分辨率与原生立体声音频

    MiniMax 正式开源下一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频的多模态统一理解,可生成最长 15 秒、768p(经 H3-Regenerate-2K 可达 2K)、24 FPS 并带 32 kHz 立体声音频的视频。

    推荐理由:官方开源公告给出了完整的三模块系统结构、模型规格和本地部署方式,读者可以据此评估在自己的视频生成流程中如何接入。

  3. Black Forest Labs:Blog(网页)71

    Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access

    Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。

    推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。

  4. Black Forest Labs:Blog(网页)66

    Black Forest Labs 发布 FLUX 3 Video,文生视频与图生视频正式开放

    Black Forest Labs 宣布 FLUX 3 Video 初版正式开放,可通过 BFL API 和部分合作伙伴使用。模型支持最长 20 秒、HD(720p)与 Full HD(1080p,经上采样)的视频生成,并伴随生成原生音频;能力包括文生视频、图生视频与关键帧、视频续接(最多 4 秒)、单次生成多镜头、多语言对白与唇形同步、Draft Mode 低成本预览等。

    推荐理由:原文给出具体生成时长、分辨率、多语言与评测结果,读者可据此判断 FLUX 3 Video 在视频生成工作流中的可用性。

9月25日周五
  1. Google Research67

    Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频,并原生继承 SynthID 水印等安全机制。

    推荐理由:Google 把长视频生成拆成四个可组合的智能体框架,并给出三套自建基准与量化结果,便于对照现有方案。

  2. Google DeepMind:Blog(RSS)66

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型结合,让对话 AI 具备动态视觉形象,支持精准唇形同步、自然表情和流畅轮次切换。

    推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级数字人交互的落地边界。

9月24日周四
  1. Google Blog:AI(RSS)68

    Google Vids 集成 Gemini Omni 1.1 Flash,所有账号可免费生成 1080p HD 视频

    Google 宣布所有 Google 或 Google Workspace 账号均可通过 Google Vids 使用最新的 Gemini Omni 1.1 Flash 模型免费生成高质量视频,入口为 vids.new 并选择 "Create AI videos"。

    推荐理由:原文来自产品经理宣布,交代了免费开放入口、具体模型和新控制功能,读者可据此判断是否改变自己的视频制作流程。

9月2日周三
  1. Google DeepMind:Blog(RSS)70

    Google DeepMind 为 Gemini 推出 agentic 视频理解功能

    Google DeepMind 推出 agentic video understanding,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,通过智能体循环动态调用原生视频工具按需检索画面、音频和字幕,而非固定帧率静态处理。

    推荐理由:原文给出了具体降本增效数字、适用模型和接入方式,开发者可据此评估是否切换视频分析流程。

8月28日周五
7月1日周三
5月18日周一
  1. Google DeepMind:Blog(RSS)80

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式编辑视频

    Google DeepMind 发布 Gemini 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成高质量视频,并支持通过自然语言多轮编辑视频、保持角色和场景一致。

    推荐理由:原文介绍了 Gemini Omni Flash 的多模态输入、对话式视频编辑能力和开放范围,读者可以判断它对视频创作流程的影响。

3月12日周四
  1. OpenAI Developers(RSS)67

    OpenAI 发布 Sora 2 提示词指南

    OpenAI 发布 Sora 2 提示词指南,更新至最新 API 能力,包括角色引用(可上传动物或对象并复用)、1920×1080 或 1080×1920 高分辨率导出、时长上限从 12 秒提高到 20 秒、基于完整原始片段的视频续写,以及支持异步批量生成的 Batch API。

    推荐理由:OpenAI 官方系统讲解 Sora 2 提示词写法,并覆盖角色引用、更长时长和视频续写等新 API 能力。

10月1日周三
  1. Sam Altman:Blog(RSS)85

    Sam Altman 宣布推出 Sora 2 模型及同名视频社交 App

    OpenAI 推出名为 Sora 的 App,由新模型 Sora 2 和视频创作分享产品组成,称其为创意的 ChatGPT 时刻。亮点包括 cameo 功能,可把自己和朋友放进视频并保持角色一致性;同时上线防深度伪造、有害内容防护和用户情绪健康定期检查等措施,并承诺优化长期用户满意度、允许用户控制信息流、优先创作和帮助用户实现长期目标。

    推荐理由:原文给出 Sora 2 与社交 App 的核心功能、cast 佩戴与防止滥用等措施,以及产品原则,可帮助读者了解其定位与设计取舍。