xAI 为 Imagine Video 1.5 增加图像与语音参考,支持文本生成视频和原生 1080p
xAI 为 Imagine Video 1.5 增加图像与语音参考、纯提示词生成视频和原生 1080p 输出。
推荐理由:原文列出图像与语音参考、文本生成视频和原生 1080p 的可用范围与 API 情况,读者可据此判断能否接入现有工作流。
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
xAI 为 Imagine Video 1.5 增加图像与语音参考、纯提示词生成视频和原生 1080p 输出。
推荐理由:原文列出图像与语音参考、文本生成视频和原生 1080p 的可用范围与 API 情况,读者可据此判断能否接入现有工作流。
xAI 宣布 Imagine Image 2.0 正式可用,作为新 Quality Mode 上线 grok.com/imagine 及 iOS 和 Android 应用,API 型号为 grok-imagine-image-2.0。
推荐理由:原文列出精确编辑、多图合成、模板和 API 入口等具体能力,读者可以对照判断它是否适合实际设计工作流。
Suno 宣布与 Warner Music Group(WMG)达成合作,将基于高质量授权音乐构建超越 v5 的新一代模型,并推出由 WMG 艺人自愿授权的互动创作体验,参与艺人可获得补偿。产品方面,下载功能保留但需付费账号并按档位限制每月下载次数,Suno Studio 维持不变且保留无限下载。
推荐理由:Suno 官方宣布与 WMG 合作,读者可以据此了解授权模型、粉丝互动与下载政策变化如何影响平台使用方式。
Suno 发布 v5.5 模型,同时推出 Voices、Custom models 和 My Taste 三项个性化功能。
推荐理由:原文给出 Voices 的验证与隐私细节和两项新个性化功能,读者可以判断这些能力如何改变自己的创作流程。
LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。
推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。
Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。
推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。
Qwen Image 2.1 is here! 🖼️ A 7B params native image generation and editing model, with up to 10 image references The model comes with it's own prompt enhancement LLMs, integrated with diffusers 🧨 and ComfyUI ▶️ on Spaces https://huggingface.co/spaces/hugging-apps/qwen-image-2-1
推荐理由:原文给出了模型的参数量、参考图能力与免配置体验入口,读者可以直接在浏览器试用判断适用性。
Qwen-Image-2.1 is now supported in ComfyUI! Open weights. One 7B checkpoint that generates and edits. → Image generation at native 2K → Instruction editing from up to 10 reference images in a single pass → RGBA output, alpha included
推荐理由:正文点出该模型已在 ComfyUI 支持,读者可以据此更新本地图像生成与编辑工作流。
推荐理由:官方介绍 Pics 的对象级编辑、图内文字修改和协作能力,也说明可用范围与 Workspace 集成,方便判断是否纳入工作流。
Hugging Face 发布 Workflow1111,用 gr.Workflow 在单个画布上以 73 个节点重建了 AUTOMATIC1111 的 11 条媒体管线,涵盖文生图、hi-resolution fix、图生图、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 风格 annotator、背景去除、PNG Info 和图生视频。
推荐理由:官方用 Gradio Workflow 在单个画布上复刻了 AUTOMATIC1111 的主要功能,读者可以对照它了解节点式工作流与 ComfyUI 的差异。
Midjourney 开始让所有用户测试首个 V8.2 图像编辑模型。该模型支持用指令编辑图像、以最多 4 张图像参考生成新图(替代 omni-reference)、局部重绘(inpainting)与扩图(outpainting),并可用 personalization、moodboards 和 srefs。
推荐理由:官方宣布 V8.2 图像编辑模型开放测试,列出指令编辑、多图参考、局部重绘等能力变化和具体入口。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,可像普通模型一样用 from_pretrained() 加载 SVDQuant 4-bit (W4A4) 检查点,无需单独推理引擎或本地 CUDA 编译,内核经 kernels 包从 Hub 下载。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,附带基准数据和自己量化模型的完整流程,适合关注消费级显卡跑扩散模型的读者。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),称其为 Nano Banana 家族中最快。
推荐理由:官方同时推出 Nano Banana 2 Lite 与 Gemini Omni Flash,给出了价格、延迟和限制等可核对的发布细节。
Google 宣布其新方法已在 Google Photos 的 Auto frame 功能中上线,用 ML 模型估计 3D 点图和相机参数,再用生成式扩散模型补全新视角下原先未拍到的内容,实现拍摄后的视角重排。方法分 3D 场景与相机估计、生成式修补两阶段,可自动调整人像构图并校正广角前置镜头的透视畸变,对含人物的合格照片提供单次操作的备选 rendition。
推荐理由:原文拆解了 3D 场景估计与生成修补的两阶段方法,读者可以理解这种视角重排与普通生成式修图的区别。
OpenAI 开发者 Cookbook 发布 gpt-image-1.5 图像模型提示词指南。该模型在写实度、准确性和可编辑性上较前代有明显提升,支持高质量渲染与低延迟场景。指南给出提示词结构、显式约束、迭代式小步修改等方法,并用信息图、照片级写实、UI 模型、Logo、风格迁移、虚拟试穿、多图合成、儿童绘本角色一致性等示例演示生成与编辑工作流。
推荐理由:官方指南给出提示词结构、约束写法和质量与延迟取舍方法,示例覆盖生成与编辑的常见生产场景,可直接迁移到实际工作流。
QwenLM 发布 Qwen-Image,一个图像生成基础模型,主打复杂文字渲染和精确图像编辑能力,代码发布在 GitHub(https://github.com/QwenLM/Qwen-Image)。
Lilian Weng 在 Lil'Log 发表的长文系统讲解扩散模型:通过马尔可夫链逐步加噪再学习反向去噪来生成数据,涵盖 DDPM 的变分下界训练目标、与 NCSN 的联系、β 调度与方差参数化等核心内容。
推荐理由:作者原创长文系统讲解扩散模型,从 DDPM 前反向过程到 DDIM、LDM、DiT 等演进,兼顾数学推导与方法脉络。