xAI 为 Grok Imagine API 推出 Quality Mode,提升图像生成真实感与文字渲染
xAI 在 Grok Imagine API 上线 Quality Mode,面向企业开发者和团队提供图像生成与编辑能力,主打更高真实感、更强文字渲染和更好的创作控制。该模式适用于产品可视化、营销素材、UGC 风格内容等场景,并可结合视频生成能力制作社交媒体视频、产品展示和广告素材。
xAI 在 Grok Imagine API 上线 Quality Mode,面向企业开发者和团队提供图像生成与编辑能力,主打更高真实感、更强文字渲染和更好的创作控制。该模式适用于产品可视化、营销素材、UGC 风格内容等场景,并可结合视频生成能力制作社交媒体视频、产品展示和广告素材。
xAI 为 Imagine Video 1.5 增加图像与语音参考、纯提示词生成视频和原生 1080p 输出。
推荐理由:原文列出图像与语音参考、文本生成视频和原生 1080p 的可用范围与 API 情况,读者可据此判断能否接入现有工作流。
xAI 宣布 Imagine Image 2.0 正式可用,作为新 Quality Mode 上线 grok.com/imagine 及 iOS 和 Android 应用,API 型号为 grok-imagine-image-2.0。
推荐理由:原文列出精确编辑、多图合成、模板和 API 入口等具体能力,读者可以对照判断它是否适合实际设计工作流。
Suno 宣布 2024 年全年向平台创作者发放总额 100 万美元奖金,首期 Summer of Suno Vol. 1 于 6 月 1 日启动,向 6 月最热门的 500 首公开歌曲创作者发放 10 万美元,第一名奖金 1 万美元。歌曲排名由播放、点赞和分享综合决定,所有公开歌曲自动参赛,每位创作者限一首,奖金通过 PayPal 在活动结束后 30 天内发放。
Suno 宣布与 Warner Music Group(WMG)达成合作,将基于高质量授权音乐构建超越 v5 的新一代模型,并推出由 WMG 艺人自愿授权的互动创作体验,参与艺人可获得补偿。产品方面,下载功能保留但需付费账号并按档位限制每月下载次数,Suno Studio 维持不变且保留无限下载。
推荐理由:Suno 官方宣布与 WMG 合作,读者可以据此了解授权模型、粉丝互动与下载政策变化如何影响平台使用方式。
Suno 发布 v5.5 模型,同时推出 Voices、Custom models 和 My Taste 三项个性化功能。
推荐理由:原文给出 Voices 的验证与隐私细节和两项新个性化功能,读者可以判断这些能力如何改变自己的创作流程。
AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,把积压多年的歌词变成歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。一条深夜发布的视频引来数百条求歌名评论,让他重新重视音乐创作。他认为提示词与反复打磨等创作方向仍然关键,目标是让人感受作品而非关注工具。
Sakana AI 提出 Percept-Lens,通过冻结通用视觉模型并拟合简单高斯决策规则来检测 AI 生成图像,在 ECCV2026 论文中该方法在广泛评测套件上超越了所测试的最强已发布 AI 生成图像检测器。研究还表明,检测器在生成器、提示词、风格或图像域变化时性能会急剧下降,而进步也可来自更好利用通用视觉模型中已有的真实与生成结构。
LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。
推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。
SGL-Diffusion 团队用 SRT 替换 HF 后端,将 AR 阶段从扩散 worker 中解耦为独立服务,使 AR 可单独配置 TP、DiT 保留 SP。
卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。
Baseten 推出面向图像生成模型的推理服务,支持部署 FLUX.1 dev、SDXL Lightning 等开源模型及用户微调、自定义模型,兼容 ComfyUI 等框架。SDXL Lightning 可在 4 个 UNet 步内生成 1024x1024 图像,接近实时出图。平台提供弹性自动扩缩容、冷启动优化,并支持 SOC 2 Type II、HIPAA、GDPR 合规部署。
Black Forest Labs 发布 FLUX VTO 虚拟试穿模型,现已公开可用,并加入 FLUX MCP。单次生成低于 4 秒,可自托管实现亚秒级响应,最多可给同一模特叠加 4 件服装,并保留人物身份与服装的 logo、印花、缝线和配件细节。默认审核政策下不支持泳装和内衣,官方提示精确的身材与服装尺码功能仍在演进,输出适合作为视觉搭配参考。
Martin Scorsese 成为 Black Forest Labs 顾问,并已用 FLUX 进行电影分镜创作。他表示该工具能更清晰高效地把脑海中的画面分享给美术指导、艺术设计和摄影指导,在前期制作中加快进度而不牺牲质量与工艺。Black Forest Labs 称其视觉智能模型可同时服务叙事者、建筑师、设计师与工程师,并预告将推出新的 FLUX 模型。
Black Forest Labs 宣布 FLUX.2 [klein] 4B 将预装在 ASUS 下一代 ProArt RTX 笔记本的 MuseTree 应用中,该产品线在台北 Computex 2026 上亮相。
Envato 与 Black Forest Labs 合作,将 FLUX 模型接入其创意平台,FLUX 已占平台图片生成总量的约 25%,累计生成超 5100 万张图片。FLUX.2 发布当天即上线生产环境,其在写实、电影感和产品图场景中比同类模型高出约 10%,下载率高出平台均值 16%。平台按任务智能路由请求,其中素材变体生成可在 8 秒内输出 5 张图片。
World Labs 发布空间智能模型更新,并推出有限访问的 Marble 测试预览,用户可在 marble.worldlabs.ai 用图像或文本提示生成可自由导航的 3D 世界。
SDXL Lightning 是 Stable Diffusion XL 的变体,仅需 4 个 UNet 步骤即可生成 1024x1024 像素图像,实现接近实时的图像生成。模型接收单个 prompt 输入,返回图像的 base64 字符串,该实现采用 4 步 UNet checkpoint 以平衡速度与质量。用户可自行部署 2 步版本以获得更快速度,或 8 步版本以获得更高质量。
Qwen Image 2512 已在 Baseten 平台上线,可通过 OpenAI 兼容 API 调用,模型名为 qwen-image-2512。该模型支持 1024x1024 尺寸图像生成,可配置 num_inference_steps 与 guidance_scale 参数,并返回 b64_json 格式结果。
Baseten Base Labs 上线图像生成模型 Flux.2 [dev],模型名为 flux2-dev,可通过 OpenAI 兼容 API 调用。示例代码以 1024x1024 尺寸、50 步推理、guidance_scale 1.0 生成图像,并以 b64_json 格式返回结果。
Baseten Base Labs 发布 Qwen Image 的 Python 调用示例,通过 httpx 向 Baseten 部署端点发送 prompt、width、height、num_inference_steps 和 seed 等参数生成图像。
World Labs 发布下一代世界模型 Atlas,一个从零预训练的全能模型,可原生处理文本、图像、视频和 3D。
World Labs 发布 Spark,一款面向 THREE.js 的高级 3D Gaussian Splatting 渲染器,可与场景中的其他网格和 splat 集成,并在所有设备上实现快速渲染。该渲染器支持可编程的动态 splat 效果,兼容 ply、sogs、spz、splat、ksplat 等多种格式。
AI 时尚应用 Alta Daily 基于 Meta 的 Segment Anything Model(SAM)完成服装分割与数字化,已处理超 2000 万张图片。
Meta Superintelligence Labs 发布 Muse Image 并预览 Muse Video,均为该实验室首批媒体生成模型。
Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。
推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。
Black Forest Labs 推出 FLUX Video Upscale,作为独立 FLUX Tool 和 endpoint,可将 480p 起的视频重生成至最高原生 4K,支持 1.5x、2x、3x 放大,并可原生理解 FLUX 3 输出。
Black Forest Labs 发布面向企业的 FLUX 方案,提供托管 API、自托管开放权重和联合开发三种模式。自托管可选 FLUX.1 [dev]、FLUX.2 [dev] 及 FLUX.2 [klein] 4B(Apache 2.0)与 9B,数据全程留在自有网络内。托管 API 支持零数据保留、多区域部署,企业协议起订量为每月 20 万次生成。
Black Forest Labs 发布 FLUX 定价页,按生成时长计费,费率为 $0.17 / second,示例为 5 秒共 $0.85,无需订阅或席位费。
Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
Hy Image 3.5 preview is FREE on GMI Cloud for 7 days Generate + edit images up to 2K. Bring up to 5 reference images. Build posters, product shots, game art, and more. And we’re turning the free week into a challenge: 3 tracks. 3 winners. $1,800 in cash + credits. Start creating free 👇
AWS 发布 vLLM-Omni 图像视频生成示例,在同一 vLLM-Omni DLC 上部署两个 SageMaker AI 端点:实时端点跑 FLUX.2-klein-4B 文生图,异步端点跑 Wan2.1-VACE-1.3B 图生视频。
ModelScope 发布 DiffSynth-Studio 下的 Qwen-Image-2.1 LayerExtract 和 LayerRemove 两个 LoRA,组成图层编辑工作流。
很多人想知道如何用我们新的编辑模型来实现一致的角色等等——所以我们为你们做了一个视频 <3
Midjourney 在 alpha.midjourney.com 界面测试快速模型,Styles 侧边栏新增风格预览功能,开启 "Live previews" 可查看提示词在已点赞和精选风格下的效果,点击缩略图即可用该风格生成。