跳到正文

#图像生成

今日 0 条
9月30日周三
  1. xAI:News(网页)44

    xAI 为 Grok Imagine API 推出 Quality Mode,提升图像生成真实感与文字渲染

    xAI 在 Grok Imagine API 上线 Quality Mode,面向企业开发者和团队提供图像生成与编辑能力,主打更高真实感、更强文字渲染和更好的创作控制。该模式适用于产品可视化、营销素材、UGC 风格内容等场景,并可结合视频生成能力制作社交媒体视频、产品展示和广告素材。

  2. Suno:Blog(网页)45

    Suno 启动 Summer of Suno:2024 年向创作者发放 100 万美元奖金

    Suno 宣布 2024 年全年向平台创作者发放总额 100 万美元奖金,首期 Summer of Suno Vol. 1 于 6 月 1 日启动,向 6 月最热门的 500 首公开歌曲创作者发放 10 万美元,第一名奖金 1 万美元。歌曲排名由播放、点赞和分享综合决定,所有公开歌曲自动参赛,每位创作者限一首,奖金通过 PayPal 在活动结束后 30 天内发放。

  3. Suno:Blog(网页)79

    Suno 与 Warner Music Group 达成合作,将用授权音乐训练新一代模型

    Suno 宣布与 Warner Music Group(WMG)达成合作,将基于高质量授权音乐构建超越 v5 的新一代模型,并推出由 WMG 艺人自愿授权的互动创作体验,参与艺人可获得补偿。产品方面,下载功能保留但需付费账号并按档位限制每月下载次数,Suno Studio 维持不变且保留无限下载。

    推荐理由:Suno 官方宣布与 WMG 合作,读者可以据此了解授权模型、粉丝互动与下载政策变化如何影响平台使用方式。

  4. Suno:Blog(网页)33

    Dream Relic 如何用 Suno 为超现实视觉世界赋予声音

    AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,把积压多年的歌词变成歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。一条深夜发布的视频引来数百条求歌名评论,让他重新重视音乐创作。他认为提示词与反复打磨等创作方向仍然关键,目标是让人感受作品而非关注工具。

  5. Sakana AI:Blog(网页)46

    Sakana AI 的 Percept-Lens:AI 生成图像检测的深度解析

    Sakana AI 提出 Percept-Lens,通过冻结通用视觉模型并拟合简单高斯决策规则来检测 AI 生成图像,在 ECCV2026 论文中该方法在广泛评测套件上超越了所测试的最强已发布 AI 生成图像检测器。研究还表明,检测器在生成器、提示词、风格或图像域变化时性能会急剧下降,而进步也可来自更好利用通用视觉模型中已有的真实与生成结构。

  6. LMSYS:Blog(Chatbot Arena 团队)63

    SGLang-Diffusion 发布两个月:速度较初版提升至 2.5 倍,新增 ComfyUI 集成与 LoRA 支持

    LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。

    推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。

  7. CMU:Machine Learning Blog28

    CMU 在 NeurIPS 2025 展示 156 篇论文

    卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。

  8. Baseten 工程博客(网页)18

    Baseten 图像生成推理服务:支持 FLUX.1 dev 与 SDXL Lightning

    Baseten 推出面向图像生成模型的推理服务,支持部署 FLUX.1 dev、SDXL Lightning 等开源模型及用户微调、自定义模型,兼容 ComfyUI 等框架。SDXL Lightning 可在 4 个 UNet 步内生成 1024x1024 图像,接近实时出图。平台提供弹性自动扩缩容、冷启动优化,并支持 SOC 2 Type II、HIPAA、GDPR 合规部署。

  9. Black Forest Labs:Blog(网页)57

    Black Forest Labs 发布 FLUX VTO 目录级规模虚拟试穿模型

    Black Forest Labs 发布 FLUX VTO 虚拟试穿模型,现已公开可用,并加入 FLUX MCP。单次生成低于 4 秒,可自托管实现亚秒级响应,最多可给同一模特叠加 4 件服装,并保留人物身份与服装的 logo、印花、缝线和配件细节。默认审核政策下不支持泳装和内衣,官方提示精确的身材与服装尺码功能仍在演进,输出适合作为视觉搭配参考。

  10. Black Forest Labs:Blog(网页)43

    Martin Scorsese 出任 Black Forest Labs 顾问,用 FLUX 做电影分镜

    Martin Scorsese 成为 Black Forest Labs 顾问,并已用 FLUX 进行电影分镜创作。他表示该工具能更清晰高效地把脑海中的画面分享给美术指导、艺术设计和摄影指导,在前期制作中加快进度而不牺牲质量与工艺。Black Forest Labs 称其视觉智能模型可同时服务叙事者、建筑师、设计师与工程师,并预告将推出新的 FLUX 模型。

  11. Black Forest Labs:Blog(网页)34

    Envato 如何基于 FLUX 打造创意 AI 引擎

    Envato 与 Black Forest Labs 合作,将 FLUX 模型接入其创意平台,FLUX 已占平台图片生成总量的约 25%,累计生成超 5100 万张图片。FLUX.2 发布当天即上线生产环境,其在写实、电影感和产品图场景中比同类模型高出约 10%,下载率高出平台均值 16%。平台按任务智能路由请求,其中素材变体生成可在 8 秒内输出 5 张图片。

  12. Baseten Base Labs:模型研究37

    SDXL Lightning:4 步生成 1024x1024 图像的 Stable Diffusion XL 变体

    SDXL Lightning 是 Stable Diffusion XL 的变体,仅需 4 个 UNet 步骤即可生成 1024x1024 像素图像,实现接近实时的图像生成。模型接收单个 prompt 输入,返回图像的 base64 字符串,该实现采用 4 步 UNet checkpoint 以平衡速度与质量。用户可自行部署 2 步版本以获得更快速度,或 8 步版本以获得更高质量。

  13. Black Forest Labs:Blog(网页)71

    Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access

    Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。

    推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。

  14. Black Forest Labs:Blog(网页)25

    Black Forest Labs 推出 FLUX 企业版:支持自托管与定制

    Black Forest Labs 发布面向企业的 FLUX 方案,提供托管 API、自托管开放权重和联合开发三种模式。自托管可选 FLUX.1 [dev]、FLUX.2 [dev] 及 FLUX.2 [klein] 4B(Apache 2.0)与 9B,数据全程留在自有网络内。托管 API 支持零数据保留、多区域部署,企业协议起订量为每月 20 万次生成。

  15. Black Forest Labs:Blog(网页)15

    Black Forest Labs 研究:自监督流匹配与 FLUX.2 潜空间分析

    Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。

  16. SenseTime29

    商汤预览 SenseNova 6.8 Flash 的 Dynamic Design 功能,可将静态图像转为动态设计。它能理解文本、主体与视觉元素的关系,决定哪些保持静态、哪些做动画,并为每个元素选择 HTML/CSS、SVG、透明图像或视频等合适形式,再编排文字显现、主体运动与环境响应,最后对照源设计检查修正输出。该模型尚未正式发布,目前开放限量 beta 体验,评论即可申请加入。

  17. Tencent Hy30

    3 条赛道。3 位赢家。去创作吧。🥇 Hy Image 3.5 preview 在 GMI Cloud 上免费 7 天 生成 + 编辑图像,最高 2K。最多可上传 5 张参考图。制作海报、产品图、游戏美术等。 我们把这免费一周变成了一场挑战赛: 3 条赛道。3 位赢家。$1,800 现金 + 额度。 免费开始创作 👇

    引用GMI Cloud@gmi_cloud

    Hy Image 3.5 preview is FREE on GMI Cloud for 7 days Generate + edit images up to 2K. Bring up to 5 reference images. Build posters, product shots, game art, and more. And we’re turning the free week into a challenge: 3 tracks. 3 winners. $1,800 in cash + credits. Start creating free 👇

9月29日周二
9月28日周一
9月25日周五