跳到正文

#图像生成

今日 16 条
9月30日周三
  1. HuggingFace Daily Papers(社区热门论文)38

    Thinking Reward Model(TRM):先思考再打分的视觉生成奖励模型

    研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。

  2. arXiv:cs.LG(机器学习,全量分类)34

    生成式去噪模型 Jacobian 谱特性研究:用谱分析区分扩散与流匹配模型

    研究提出用去噪器 Jacobian 的谱特性来刻画扩散、流匹配等生成式去噪模型之间的差异,发现生成性能更好的模型对应更大的 Jacobian 特征值。作者据此设计了一种正则化方案,通过在扰动输入上训练去噪器来抑制或放大 Jacobian 响应,并在 ImageNet 上验证:同时强化数据相关主特征方向、抑制噪声无关方向能改善生成效果。

  3. Black Forest Labs:Blog(网页)71

    Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access

    Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。

    推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。

  4. Black Forest Labs:Blog(网页)25

    Black Forest Labs 推出 FLUX 企业版:支持自托管与定制

    Black Forest Labs 发布面向企业的 FLUX 方案,提供托管 API、自托管开放权重和联合开发三种模式。自托管可选 FLUX.1 [dev]、FLUX.2 [dev] 及 FLUX.2 [klein] 4B(Apache 2.0)与 9B,数据全程留在自有网络内。托管 API 支持零数据保留、多区域部署,企业协议起订量为每月 20 万次生成。

  5. Black Forest Labs:Blog(网页)15

    Black Forest Labs 研究:自监督流匹配与 FLUX.2 潜空间分析

    Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。

  6. SenseTime29

    商汤预览 SenseNova 6.8 Flash 的 Dynamic Design 功能,可将静态图像转为动态设计。它能理解文本、主体与视觉元素的关系,决定哪些保持静态、哪些做动画,并为每个元素选择 HTML/CSS、SVG、透明图像或视频等合适形式,再编排文字显现、主体运动与环境响应,最后对照源设计检查修正输出。该模型尚未正式发布,目前开放限量 beta 体验,评论即可申请加入。

  7. Tencent Hy30

    3 条赛道。3 位赢家。去创作吧。🥇 Hy Image 3.5 preview 在 GMI Cloud 上免费 7 天 生成 + 编辑图像,最高 2K。最多可上传 5 张参考图。制作海报、产品图、游戏美术等。 我们把这免费一周变成了一场挑战赛: 3 条赛道。3 位赢家。$1,800 现金 + 额度。 免费开始创作 👇

    引用GMI Cloud@gmi_cloud

    Hy Image 3.5 preview is FREE on GMI Cloud for 7 days Generate + edit images up to 2K. Bring up to 5 reference images. Build posters, product shots, game art, and more. And we’re turning the free week into a challenge: 3 tracks. 3 winners. $1,800 in cash + credits. Start creating free 👇

  8. arXiv:cs.LG(机器学习,全量分类)31

    学习式压缩能否替代 BAQ?GOTCHA 数据集上的 SAR 相位历史数据压缩可行性研究

    一项基于 AFRL GOTCHA 数据集的可行性研究显示,28,656 参数的卷积自编码器在 SAR 相位历史压缩上全面落后于 BAQ:16 b/cs 时 NMSE 为 -2.87 dB,而 8-bit BAQ 配合 ±3σ 裁剪为 -35.5 dB、调优裁剪范围为 -41.0 dB,也逊于 16×16 块 KLT 的 -5.39 dB,检测 F1 上限仅 33%。

9月29日周二
9月28日周一
9月26日周六
9月25日周五
9月24日周四