#图像生成
#图像生成
今日 0 条
Midjourney@midjourneyAI 评分5656


Google Blog:AI(RSS)AI 评分3434 Google Photos 推出 5 项夏季回忆更新,含 Gemini Spark 一句话修图
Google Photos 上线 5 项更新,其中 Photos in Gemini Spark 支持用一句提示词挑选、提亮并分享家庭合照,面向美国符合条件的 Google AI Pro 和 Ultra 订阅用户。
Tencent Hy@TencentHunyuanAI 评分3030引用GMI Cloud@gmi_cloudHy Image 3.5 preview is now live on GMI Cloud @TencentHunyuan $0.024 per image 8.8x cheaper than GPT Image 2 5.6x cheaper than Nano Banana Pro Create now 👇
Midjourney:Updates(RSS)AI 评分4646 Midjourney Alpha 更新:样式实时预览、默认参数与 Create Feed 改版
Midjourney 为 alpha.midjourney.com 推送更新,Styles 侧边栏新增 "Live previews",可在浏览样式时用当前提示词实时预览效果。设置中新增默认参数保存功能,Create Feed 改为全宽瀑布流并支持悬停显示提示词、视频悬停播放。韩语支持已在 midjourney.com 面向所有用户上线。
Tencent Hy@TencentHunyuanAI 评分4444免费两周!Hy Image3.5 预览版已在 OnSolo 上线。短剧角色设定图。全动态视频游戏素材。关键帧。角色在每一集中保持一致。编辑是精修,而非重来。
引用OnSoloAI@OnSoloAIHy Image3.5 preview is on OnSolo. Exclusive. 5 refs. 2K. 2 weeks Members free.
Tencent Hy@TencentHunyuanAI 评分5959引用ComfyUI@ComfyUIHy Image3.5 preview is now available in ComfyUI. Professional-grade image generation, +30% win rate in human eval vs Hy Image3.0 → Text to image and Image to image in one model, up to 2K → Multilingual text, symbols, and small print that render correctly → Cinematic, comic, commercial photography, and illustration styles → Identity and product features that hold through scene, outfit, and style changes
Tencent Hy@TencentHunyuanAI 评分4545🎨 Hy Image3.5 preview 已在 Miora 上线。编辑时保留已经好用的部分——同一画布,你的品牌规则已被记住。免费两周。
引用Miora Design@Miora_DesignHy Image3.5 preview is live on Miora. FREE through October 7. Campaign visuals. Product scenes. Storyboards. Game concepts. Up to 2K. Text-to-image and image-to-image. Try it: https://miora.design/
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分4747 NVIDIA DLSS 5 发布:3D 引导神经渲染、ACE 更新与 RTX Kit 新能力
NVIDIA 发布 DLSS 5,引入 DLSS 3D-Guided Neural Rendering 和细粒度控制,帮助开发者在保留艺术意图的同时加入逼真光照与材质细节。同步更新 NVIDIA ACE、RTX Mega Geometry 2.0 和 RTX Kit,覆盖角色 AI、高密度几何与渲染工作流。
SenseTime@SenseTime_AIAI 评分5353商汤发布 SenseNova U1.5 技术报告,这是一个开源的 8B-MoT 原生统一模型,通过共享注意力连接理解与生成。
蚂蚁 inclusionAI:HuggingFace 新模型AI 评分4949 蚂蚁 inclusionAI 发布 Ming-Image-0.1-Design-Layer 设计图层分解模型
蚂蚁 inclusionAI 在 Hugging Face 发布 Ming-Image-0.1-Design-Layer,可将扁平化设计图按指定层数拆解为 RGBA 图层,采用 MIT 许可。
蚂蚁 inclusionAI:HuggingFace 新模型AI 评分5151 蚂蚁 inclusionAI 发布 Ming-Image-0.1-Design 文生图模型
蚂蚁 inclusionAI 在 Hugging Face 发布 Ming-Image-0.1-Design,是一个面向 UI、信息图、海报等文字密集视觉设计的 6B 文生图模型,支持完整视觉构图和带透明背景的 RGBA 输出。
Midjourney:Updates(RSS)AI 评分3131 Midjourney Alpha 更新:新增韩语支持并修复 v8.2 编辑器
Midjourney 为 alpha.midjourney.com 推送更新,新增韩语支持,并集中修复 v8.2 编辑器的多项问题。编辑器提示栏在附上图片后会询问“What would you like to change?
MiniMax Design (H3)@Hailuo_AIAI 评分2222引用楽園|AI動画&AI音楽@dave392750うきょさんのプロンプトでMinimaxH3Designで作成しました。 これマジでヤバいですね。 @Hailuo_AI #MiniMaxH3
Midjourney@midjourneyAI 评分1414
Hugging Face:Blog(RSS)精选AI 评分6161 Hugging Face 用 Gradio Workflow 重建 AUTOMATIC1111,推出 Workflow1111
Hugging Face 发布 Workflow1111,用 gr.Workflow 在单个画布上以 73 个节点重建了 AUTOMATIC1111 的 11 条媒体管线,涵盖文生图、hi-resolution fix、图生图、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 风格 annotator、背景去除、PNG Info 和图生视频。
推荐理由:官方用 Gradio Workflow 在单个画布上复刻了 AUTOMATIC1111 的主要功能,读者可以对照它了解节点式工作流与 ComfyUI 的差异。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分5454 OpenAI 发布 ChatGPT Images 2.5
OpenAI 发布 ChatGPT Images 2.5,可将用户的想法、草图和参考照片转化为更个性化、更精致且更贴近创意的图像。材料为官方摘要,未提供更多细节。
Midjourney:Updates(RSS)AI 评分5151 Midjourney alpha 更新:v8.2 编辑模型上线,lightbox 内置编辑器
Midjourney 向 alpha.midjourney.com 推送大规模更新,最大变化是新的 v8.2 编辑模型上线,编辑器直接内置于 lightbox,可用自然语言指令编辑、附加最多 4 张参考图并集中查看本次会话的编辑。
上海人工智能实验室 InternLM:原创项目AI 评分4646 InternLM 发布 InternLumina-U2 多码本扩散大语言模型
上海人工智能实验室 InternLM 团队发布 InternLumina-U2,一个面向全视觉理解、图像生成与编辑的多码本扩散大语言模型。该模型将扩散生成能力与语言建模统一在同一框架内,可同时处理视觉理解与图像生成、编辑任务。
Midjourney:Updates(RSS)AI 评分2828 Midjourney 更新 V8.2 图像编辑模型,提升画质
Midjourney 更新了 V8.2 编辑模型,图像质量得到提升。官方建议过去 24 小时内遇到问题的用户重新尝试,并继续反馈意见。更多更新即将推出。
Midjourney@midjourneyAI 评分3232我们更新了 V8.2 编辑模型,图像质量更好了。如果你在过去 24 小时内遇到任何问题,请再试一次,并继续给我们反馈。谢谢!更多更新即将到来。
Midjourney@midjourneyAI 评分4545Midjourney:Updates(RSS)精选AI 评分6565 Midjourney 开放测试首个 V8.2 图像编辑模型
Midjourney 开始让所有用户测试首个 V8.2 图像编辑模型。该模型支持用指令编辑图像、以最多 4 张图像参考生成新图(替代 omni-reference)、局部重绘(inpainting)与扩图(outpainting),并可用 personalization、moodboards 和 srefs。
推荐理由:官方宣布 V8.2 图像编辑模型开放测试,列出指令编辑、多图参考、局部重绘等能力变化和具体入口。
Midjourney:Updates(RSS)AI 评分2929 Midjourney alpha 站点更新:文件夹分组、Upscale/Zoom/Vary 回归与大量修复
Midjourney 为 alpha.midjourney.com 上线两周的大改版推送了一批 UX 改进与 bug 修复,侧边栏新增可折叠的文件夹树分组,支持双击重命名分组并把新文件夹直接归入其中。
MIT News(RSS)AI 评分6464 MIT CSAIL 研究:生成图像的归因随训练数据规模增大而衰减
MIT CSAIL 团队在 Nature Communications 发表论文,提出“归因衰减”现象:训练数据越大,单个样本对生成结果的影响越小,删除任一图像甚至某艺术家的全部图像后输出不变。
蚂蚁 inclusionAI:GitHub 新仓库AI 评分2323 蚂蚁 inclusionAI 发布 ConceptEdit:ConceptEdit-12M 数据集与 ConceptEdit-Bench 基准
蚂蚁 inclusionAI 在 GitHub 上线 ConceptEdit 项目,包含 ConceptEdit-12M 数据集与 ConceptEdit-Bench 基准。目前公开信息仅给出这两个名称,尚未披露模型规模、评测分数或使用方式等细节。
Midjourney:Updates(RSS)AI 评分4747 Midjourney 发布 V8.2 图像模型
Midjourney 推出 V8.2 图像模型,本次更新聚焦美学、图像质量与个性化。官方称图像将更具创意、大胆、精致、前卫和新颖,低质量图像的随机情况应会大幅减少。V8.2 的个性化档案拥有更大且更优的图像池,能更好理解用户个人品味,尤其适合在个人档案下积累了大量评分的用户。
Hugging Face:Blog(RSS)精选AI 评分6969 Diffusers 原生集成 Nunchaku Lite 4-bit 扩散模型推理
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,可像普通模型一样用 from_pretrained() 加载 SVDQuant 4-bit (W4A4) 检查点,无需单独推理引擎或本地 CUDA 编译,内核经 kernels 包从 Hub 下载。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,附带基准数据和自己量化模型的完整流程,适合关注消费级显卡跑扩散模型的读者。
Midjourney:Updates(RSS)AI 评分5757 Midjourney 宣布首次收购 Co–Star
Midjourney 创始人 David Holz 宣布公司首次收购,对象是创始人 Banu 旗下的 Co–Star。Co–Star 将完全由 Banu 继续掌控和指导,她和团队加入 Midjourney 帮助围绕 Product 和 Design 建立更大的组织。
Google ResearchAI 评分4242 Google Research 揭示扩散模型的创造力从何而来
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源:神经网络训练中的正则化会让学到的 score function 被"平滑",使去噪过程在训练数据点之间插值,从而生成新样本。
Hugging Face:Blog(RSS)AI 评分4545 PRX Part 4:我们的数据策略
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式读取的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式流程,图像统一以 JPEG quality 92 编码。
Google DeepMind:Blog(RSS)精选AI 评分6868 Google DeepMind 发布 Nano Banana 2 Lite 并向开发者开放 Gemini Omni Flash
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),称其为 Nano Banana 家族中最快。
推荐理由:官方同时推出 Nano Banana 2 Lite 与 Gemini Omni Flash,给出了价格、延迟和限制等可核对的发布细节。
Midjourney:Updates(RSS)AI 评分4141 Midjourney V8.1 草稿模式支持随机风格
Midjourney 为 V8.1 草稿模式加入随机风格探索功能,在提示词中加入 --sref random 即可生成 24 张不同风格的图像。开启草稿模式可点击提示词栏的 ⚡ 图标,或在提示词中加入 --draft。
Midjourney:Updates(RSS)AI 评分5555 Midjourney V8.1 推出 Draft mode 并开放 --preview 新功能测试
Midjourney 为 V8.1 推出 Draft mode,每次生成 24 张低分辨率低质量图片,消耗的 fast hours 为 V8.1 SD 任务的一半,可对选中图片点击 Vary 以全质量全分辨率渲染,通过菜单栏 ⚡ 按钮开启。
Midjourney:Updates(RSS)AI 评分5858 Midjourney 将默认模型从 V7 切换为 V8.1
Midjourney 宣布经过测试和反馈后,默认模型已从 V7 更新为 V8.1。V8.1 更聪明、更连贯,更好地遵循详细提示词并渲染文字;开启 HD 模式后图像尺寸为 V7 的两倍、分辨率 4 倍,SD 模式 4 秒、HD 模式 12 秒出图。风格参考、个性化与美学在 V7 与 V8.1 间保持一致;V7 的 omni-reference 仍可使用,V8.0 alpha 将在两周后弃用。
Midjourney:Updates(RSS)AI 评分3939 Midjourney Web 端更新:对话模式与图像提示词改进
Midjourney 改进 Web 端对话模式,语音会话启动时可访问 Image Prompts、Style References、侧边栏设置和最近任务,Image Prompts 现可从托盘和侧边栏使用,托盘图片在语音提交间保留。
Saining Xie@sainingxieAI 评分4545引用Jaskirat Singh@1jaskiratsinghIn Oct last year, Representation Autoencoders provided an elegant solution to unified tokenization for understanding and generation. Today we make them a bit more simple. a bit more general. Result: >10x faster convergence, better reconstruction, better generation. And yes we test them on T2I and world models :) Introducing RAEv2
蚂蚁 inclusionAI:GitHub 新仓库AI 评分3636 蚂蚁 inclusionAI 开源 ARGenSeg:用自回归图像生成模型做图像分割
蚂蚁 inclusionAI 在 GitHub 发布 ARGenSeg,将自回归图像生成模型用于图像分割,论文已被 NeurIPS 2025 收录。该工作把分割任务建模为图像生成过程,具体参数规模与 benchmark 分数原文未披露。
上海人工智能实验室 InternLM:原创项目AI 评分3939 上海人工智能实验室 InternLM 推出 ETCHR:面向 MLLM 的推理感知图像编辑器
上海人工智能实验室 InternLM 项目发布 ETCHR,一个以问题为条件、具备推理感知能力的图像编辑器,定位为多模态大语言模型(MLLM)的解耦式视觉推理助手。该工具通过解耦设计为 MLLM 提供独立的视觉推理支持。
Google Research精选AI 评分6969 Google Photos Auto frame 上线 3D 视角重排功能,可改变照片拍摄视角
Google 宣布其新方法已在 Google Photos 的 Auto frame 功能中上线,用 ML 模型估计 3D 点图和相机参数,再用生成式扩散模型补全新视角下原先未拍到的内容,实现拍摄后的视角重排。方法分 3D 场景与相机估计、生成式修补两阶段,可自动调整人像构图并校正广角前置镜头的透视畸变,对含人物的合格照片提供单次操作的备选 rendition。
推荐理由:原文拆解了 3D 场景估计与生成修补的两阶段方法,读者可以理解这种视角重排与普通生成式修图的区别。
上海人工智能实验室 InternLM:原创项目AI 评分3030 InternLM 发布 EndoCoT:在扩散模型中扩展内生 CoT 推理
上海人工智能实验室 InternLM 团队发布 EndoCoT 官方实现,用于在扩散模型中扩展内生链式推理(CoT),面向复杂结构化生成任务。该工作已被 ECCV 2026 收录,代码随论文一并开源。