跳到正文

#图像生成

今日 15 条
今天10月1日周四
  1. HuggingFace Daily Papers(社区热门论文)46

    DC-SAE:加速扩散模型收敛的深度压缩语义自编码器

    研究者提出 DC-SAE 解耦紧凑语义自编码器,通过语义编码器实现高压缩比、像素级编码器保留细节,兼顾高保真重建与快速扩散训练收敛。在 ImageNet 512×512 上实现 32 倍空间压缩,PSNR 29.79、gFID 3.37,较此前 SOTA 高压缩 tokenizer DC-AE 分别提升 13.5% 和 54.9%。

  2. IT之家(RSS)28

    华为 Mate 90 系列首发 XMAGE「华为睿影」影像体系,全系配连续可变光圈

    华为 Mate 90 系列首发搭载全新升级的 XMAGE「华为睿影」影像体系,全系配备 F1.4-F4.0 无级调节连续可变光圈,并搭载第三代红枫原色摄像头、超大底 2 亿像素长焦和 18EV 超高动态主摄。Mate 90 Pro Max 依托第十代 ISP 与 CIPA7.5 长焦防抖,20x 长焦人像视频清晰度提升 34%、防抖能力提升 41%;XMAGE 智拍新增 AI 姿势推荐功能。

  3. IT之家(RSS)40

    华为 Mate90 系列升级鸿蒙 AI:小艺帮记、图库助手一句话成片

    华为在 Mate90 系列及全场景新品发布会上围绕智能助手、智能影像和智感交互深化鸿蒙 AI 体验。小艺帮记支持滑动保存页面内容并直接提问,AI 自动提取关键信息、检索总结;小艺图库助手实现一句话成片,支持图片动态变换、电影运镜与素材智能编排。隔空手势可抓取图片跨设备直传,并支持阅后即焚式单次查看隐私模式。

  4. HuggingFace Daily Papers(社区热门论文)40

    IDSpect:用 IDS 分解与细粒度奖励提升中文文本渲染精度

    针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并训练专家 IDS 识别器对齐裁剪级视觉预测,配合整字语义奖励提供部件与空间关系的细粒度反馈。

  5. IT之家(RSS)33

    苹果 Invites App 升级 1.12.0:支持全分辨率照片共享、图乐园扩展与免验证码邮箱验证

    苹果 Invites App 更新至 1.12.0,共享相册现支持全分辨率照片共享,任何收到链接的人(含非 Apple 设备用户)均可加入并上传照片。新版扩展图乐园(Image Playground)功能,新增照片级逼真背景生成能力,并简化邮箱验证流程,宾客点击收件箱链接即可加入活动,无需输入验证码。

  6. Google AI:DEV 作者专属(RSS)29

    产品图背景移除预设:2026 年的治理与例外处理

    产品图背景移除应采用命名、带版本的转换预设来保证可复现,仅对无复用价值的孤立图片走直接处理。预设作为可审计、可下线的策略,需将源图、衍生输出与异步任务状态分开存储,并记录归属与生命周期。直接处理须限制可改参数、绑定源资产 ID 与请求方,并保留幂等键与人工复核,避免一次性例外变成未受控的策略分支。

  7. Arena.ai47

    Hidream-O1-Video-1.0 由 @HiDream_AI 刚刚登陆 Image-to-Video Arena,以 1456 分位列第 7! 该模型已在 @vivago_ai 上线,距 gemini-omni-flash 仅差 8 分,距 dreamina-seedance-2.0 和 2.5 均在 20 分以内。 恭喜 @HiDream_AI 发布!

    引用vivago.ai (HiDream)@vivago_ai

    New HiDream models just landed in vivago R1 Studio 🚀 Introducing: • HiDream-O1 Image 2.0 • HiDream-O1 Editing 1.5 • HiDream-O1 Video All three models are now available in vivago R1 Studio - bringing the latest HiDream image generation, editing, and video capabilities directly into your creative workflow. New models. New possibilities. Go make something the internet can’t ignore. 🔥

  8. Luma50

    Luma AI 宣布 Ideogram 4.5 已接入 Luma,供创意团队使用。该编辑模型据称能消除多轮编辑中的伪影累积和像素色彩偏移,可通过 https://app.lumalabs.ai 体验。

    引用Ideogram@ideogram_ai

    Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.

  9. Google AI:DEV 作者专属(RSS)37

    图像质量评测:内容感知裁剪与居中裁剪的三种配方场景对比

    针对菜谱站点头像与菜品卡片,内容感知裁剪应作为默认方案,它能保留居中裁剪经常切掉的主体,但需存储裁剪框并提供人工调整路径。居中裁剪仅适用于拍摄时强制居中构图的流程,其确定性几何在异构上传中会稳定地切掉偏离中心的人脸或餐盘。Cloudinary、Imgix、ImageKit 等托管方案在运营边界上各有取舍,智能裁剪输出仍需审核与覆盖。

9月30日周三
  1. xAI:News(网页)44

    xAI 为 Grok Imagine API 推出 Quality Mode,提升图像生成真实感与文字渲染

    xAI 在 Grok Imagine API 上线 Quality Mode,面向企业开发者和团队提供图像生成与编辑能力,主打更高真实感、更强文字渲染和更好的创作控制。该模式适用于产品可视化、营销素材、UGC 风格内容等场景,并可结合视频生成能力制作社交媒体视频、产品展示和广告素材。

  2. Suno:Blog(网页)45

    Suno 启动 Summer of Suno:2024 年向创作者发放 100 万美元奖金

    Suno 宣布 2024 年全年向平台创作者发放总额 100 万美元奖金,首期 Summer of Suno Vol. 1 于 6 月 1 日启动,向 6 月最热门的 500 首公开歌曲创作者发放 10 万美元,第一名奖金 1 万美元。歌曲排名由播放、点赞和分享综合决定,所有公开歌曲自动参赛,每位创作者限一首,奖金通过 PayPal 在活动结束后 30 天内发放。

  3. Suno:Blog(网页)79

    Suno 与 Warner Music Group 达成合作,将用授权音乐训练新一代模型

    Suno 宣布与 Warner Music Group(WMG)达成合作,将基于高质量授权音乐构建超越 v5 的新一代模型,并推出由 WMG 艺人自愿授权的互动创作体验,参与艺人可获得补偿。产品方面,下载功能保留但需付费账号并按档位限制每月下载次数,Suno Studio 维持不变且保留无限下载。

    推荐理由:Suno 官方宣布与 WMG 合作,读者可以据此了解授权模型、粉丝互动与下载政策变化如何影响平台使用方式。

  4. Suno:Blog(网页)33

    Dream Relic 如何用 Suno 为超现实视觉世界赋予声音

    AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,把积压多年的歌词变成歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。一条深夜发布的视频引来数百条求歌名评论,让他重新重视音乐创作。他认为提示词与反复打磨等创作方向仍然关键,目标是让人感受作品而非关注工具。

  5. Sakana AI:Blog(网页)46

    Sakana AI 的 Percept-Lens:AI 生成图像检测的深度解析

    Sakana AI 提出 Percept-Lens,通过冻结通用视觉模型并拟合简单高斯决策规则来检测 AI 生成图像,在 ECCV2026 论文中该方法在广泛评测套件上超越了所测试的最强已发布 AI 生成图像检测器。研究还表明,检测器在生成器、提示词、风格或图像域变化时性能会急剧下降,而进步也可来自更好利用通用视觉模型中已有的真实与生成结构。

  6. LMSYS:Blog(Chatbot Arena 团队)63

    SGLang-Diffusion 发布两个月:速度较初版提升至 2.5 倍,新增 ComfyUI 集成与 LoRA 支持

    LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。

    推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。

  7. CMU:Machine Learning Blog28

    CMU 在 NeurIPS 2025 展示 156 篇论文

    卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。

  8. Baseten 工程博客(网页)18

    Baseten 图像生成推理服务:支持 FLUX.1 dev 与 SDXL Lightning

    Baseten 推出面向图像生成模型的推理服务,支持部署 FLUX.1 dev、SDXL Lightning 等开源模型及用户微调、自定义模型,兼容 ComfyUI 等框架。SDXL Lightning 可在 4 个 UNet 步内生成 1024x1024 图像,接近实时出图。平台提供弹性自动扩缩容、冷启动优化,并支持 SOC 2 Type II、HIPAA、GDPR 合规部署。

  9. Black Forest Labs:Blog(网页)57

    Black Forest Labs 发布 FLUX VTO 目录级规模虚拟试穿模型

    Black Forest Labs 发布 FLUX VTO 虚拟试穿模型,现已公开可用,并加入 FLUX MCP。单次生成低于 4 秒,可自托管实现亚秒级响应,最多可给同一模特叠加 4 件服装,并保留人物身份与服装的 logo、印花、缝线和配件细节。默认审核政策下不支持泳装和内衣,官方提示精确的身材与服装尺码功能仍在演进,输出适合作为视觉搭配参考。

  10. Black Forest Labs:Blog(网页)43

    Martin Scorsese 出任 Black Forest Labs 顾问,用 FLUX 做电影分镜

    Martin Scorsese 成为 Black Forest Labs 顾问,并已用 FLUX 进行电影分镜创作。他表示该工具能更清晰高效地把脑海中的画面分享给美术指导、艺术设计和摄影指导,在前期制作中加快进度而不牺牲质量与工艺。Black Forest Labs 称其视觉智能模型可同时服务叙事者、建筑师、设计师与工程师,并预告将推出新的 FLUX 模型。

  11. Black Forest Labs:Blog(网页)34

    Envato 如何基于 FLUX 打造创意 AI 引擎

    Envato 与 Black Forest Labs 合作,将 FLUX 模型接入其创意平台,FLUX 已占平台图片生成总量的约 25%,累计生成超 5100 万张图片。FLUX.2 发布当天即上线生产环境,其在写实、电影感和产品图场景中比同类模型高出约 10%,下载率高出平台均值 16%。平台按任务智能路由请求,其中素材变体生成可在 8 秒内输出 5 张图片。

  12. Baseten Base Labs:模型研究37

    SDXL Lightning:4 步生成 1024x1024 图像的 Stable Diffusion XL 变体

    SDXL Lightning 是 Stable Diffusion XL 的变体,仅需 4 个 UNet 步骤即可生成 1024x1024 像素图像,实现接近实时的图像生成。模型接收单个 prompt 输入,返回图像的 base64 字符串,该实现采用 4 步 UNet checkpoint 以平衡速度与质量。用户可自行部署 2 步版本以获得更快速度,或 8 步版本以获得更高质量。

  13. Eugene Yan:Writing45

    自编码器与扩散模型:简要对比

    自编码器与扩散模型在学习范式上相似:都以数据为输入并重建输出,都在过程中学习数据的低维流形,架构上都使用瓶颈层,U-Net 可视为带残差连接的自编码器。关键区别在于扩散模型以时间步 t 为条件输入,使单一模型和单组参数即可处理不同噪声水平,从而先由高 t 的噪声生成模糊图像、再在低 t 时逐步锐化;当前扩散模型还以图像描述等文本为条件,支持按文本提示词生成图像。