蚂蚁 inclusionAI 发布 ConceptEdit:ConceptEdit-12M 数据集与 ConceptEdit-Bench 基准
蚂蚁 inclusionAI 在 GitHub 上线 ConceptEdit 项目,包含 ConceptEdit-12M 数据集与 ConceptEdit-Bench 基准。目前公开信息仅给出这两个名称,尚未披露模型规模、评测分数或使用方式等细节。
蚂蚁 inclusionAI 在 GitHub 上线 ConceptEdit 项目,包含 ConceptEdit-12M 数据集与 ConceptEdit-Bench 基准。目前公开信息仅给出这两个名称,尚未披露模型规模、评测分数或使用方式等细节。
Midjourney 推出 V8.2 图像模型,本次更新聚焦美学、图像质量与个性化。官方称图像将更具创意、大胆、精致、前卫和新颖,低质量图像的随机情况应会大幅减少。V8.2 的个性化档案拥有更大且更优的图像池,能更好理解用户个人品味,尤其适合在个人档案下积累了大量评分的用户。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,可像普通模型一样用 from_pretrained() 加载 SVDQuant 4-bit (W4A4) 检查点,无需单独推理引擎或本地 CUDA 编译,内核经 kernels 包从 Hub 下载。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,附带基准数据和自己量化模型的完整流程,适合关注消费级显卡跑扩散模型的读者。
Midjourney 创始人 David Holz 宣布公司首次收购,对象是创始人 Banu 旗下的 Co–Star。Co–Star 将完全由 Banu 继续掌控和指导,她和团队加入 Midjourney 帮助围绕 Product 和 Design 建立更大的组织。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源:神经网络训练中的正则化会让学到的 score function 被"平滑",使去噪过程在训练数据点之间插值,从而生成新样本。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式读取的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式流程,图像统一以 JPEG quality 92 编码。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),称其为 Nano Banana 家族中最快。
推荐理由:官方同时推出 Nano Banana 2 Lite 与 Gemini Omni Flash,给出了价格、延迟和限制等可核对的发布细节。
Midjourney 为 V8.1 草稿模式加入随机风格探索功能,在提示词中加入 --sref random 即可生成 24 张不同风格的图像。开启草稿模式可点击提示词栏的 ⚡ 图标,或在提示词中加入 --draft。
Midjourney 为 V8.1 推出 Draft mode,每次生成 24 张低分辨率低质量图片,消耗的 fast hours 为 V8.1 SD 任务的一半,可对选中图片点击 Vary 以全质量全分辨率渲染,通过菜单栏 ⚡ 按钮开启。
Midjourney 宣布经过测试和反馈后,默认模型已从 V7 更新为 V8.1。V8.1 更聪明、更连贯,更好地遵循详细提示词并渲染文字;开启 HD 模式后图像尺寸为 V7 的两倍、分辨率 4 倍,SD 模式 4 秒、HD 模式 12 秒出图。风格参考、个性化与美学在 V7 与 V8.1 间保持一致;V7 的 omni-reference 仍可使用,V8.0 alpha 将在两周后弃用。
Midjourney 改进 Web 端对话模式,语音会话启动时可访问 Image Prompts、Style References、侧边栏设置和最近任务,Image Prompts 现可从托盘和侧边栏使用,托盘图片在语音提交间保留。
In Oct last year, Representation Autoencoders provided an elegant solution to unified tokenization for understanding and generation. Today we make them a bit more simple. a bit more general. Result: >10x faster convergence, better reconstruction, better generation. And yes we test them on T2I and world models :) Introducing RAEv2
蚂蚁 inclusionAI 在 GitHub 发布 ARGenSeg,将自回归图像生成模型用于图像分割,论文已被 NeurIPS 2025 收录。该工作把分割任务建模为图像生成过程,具体参数规模与 benchmark 分数原文未披露。
上海人工智能实验室 InternLM 项目发布 ETCHR,一个以问题为条件、具备推理感知能力的图像编辑器,定位为多模态大语言模型(MLLM)的解耦式视觉推理助手。该工具通过解耦设计为 MLLM 提供独立的视觉推理支持。
Google 宣布其新方法已在 Google Photos 的 Auto frame 功能中上线,用 ML 模型估计 3D 点图和相机参数,再用生成式扩散模型补全新视角下原先未拍到的内容,实现拍摄后的视角重排。方法分 3D 场景与相机估计、生成式修补两阶段,可自动调整人像构图并校正广角前置镜头的透视畸变,对含人物的合格照片提供单次操作的备选 rendition。
推荐理由:原文拆解了 3D 场景估计与生成修补的两阶段方法,读者可以理解这种视角重排与普通生成式修图的区别。
OpenAI 在 GitHub 新建仓库 openai-imagegen-demo,这是一个用 OpenAI Image API 构建的 Next.js 照相亭(Photobooth)应用。仓库以 demo 形式展示该 Image API 的实际调用方式,目前未披露更多功能细节。
美团 LongCat 团队开源原生多模态模型 LongCat-Next,基于 LongCat-Flash-Lite MoE(A3B),在单一自回归框架内统一文本、视觉和音频处理,采用 DiNA 离散原生自回归范式,结合 SAE 与 RVQ 构建语义完整的离散视觉表示,并提出 dNaViT 视觉接口。
上海人工智能实验室 InternLM 团队发布 EndoCoT 官方实现,用于在扩散模型中扩展内生链式推理(CoT),面向复杂结构化生成任务。该工作已被 ECCV 2026 收录,代码随论文一并开源。
FireRedTeam 开源图像编辑基础模型 FireRed-Image-Edit,宣称达到开源 SOTA 水平。该模型具备精准指令跟随、高保真生成、优异的身份一致性和多元素无缝融合能力。
美团 LongCat 在 HuggingFace 发布 LongCat-Image-Edit-Turbo,是 LongCat-Image-Edit 的蒸馏版本,仅需 8 次 NFE 即可实现高质量图像编辑,推理延迟极低。
QwenLM 推出 Qwen-Image-Layered,通过分层分解让图像具备内在可编辑性。该模型将图像拆解为多个图层,使各元素可独立编辑,而非在单一平面上修改。
OpenAI 开发者 Cookbook 发布 gpt-image-1.5 图像模型提示词指南。该模型在写实度、准确性和可编辑性上较前代有明显提升,支持高质量渲染与低延迟场景。指南给出提示词结构、显式约束、迭代式小步修改等方法,并用信息图、照片级写实、UI 模型、Logo、风格迁移、虚拟试穿、多图合成、儿童绘本角色一致性等示例演示生成与编辑工作流。
推荐理由:官方指南给出提示词结构、约束写法和质量与延迟取舍方法,示例覆盖生成与编辑的常见生产场景,可直接迁移到实际工作流。
美团 LongCat 发布图像编辑模型 LongCat-Image-Edit,为 Longcat-Image 的编辑版本,支持中英双语编辑。官方称其在开源图像编辑模型中达到 SOTA,支持全局编辑、局部编辑、文本修改和参考引导编辑,能保持未编辑区域的布局、纹理、色调和主体身份一致,适合多轮编辑。
美团 LongCat 发布开源中英双语图像生成基础模型 LongCat-Image,仅 6B 参数,在多个基准上超越数倍于其规模的开源模型。
美团 LongCat 团队发布 13.6B 参数的开源视频生成基础模型 LongCat-Video,统一支持文生视频、图生视频和视频续写三类任务。模型在 Video-Continuation 上预训练,可生成长达数分钟的视频而不出现色彩漂移或质量下降,并通过粗到细策略和 Block Sparse Attention 在数分钟内生成 720p、30fps 视频。
Sora、ImageGen 与 Codex 被放在同一条多模态流水线中,串联视频、图像与代码生成工具,指向创意生产工作流。内容聚焦这些工具之间的衔接方式,而非单一模型的独立能力。
Sam Altman 宣布 Sora 即将推出两项更新:一是给版权方更细粒度的角色生成控制,类似肖像的 opt-in 模式,并特别提到用户与日本内容的深度连接;二是因用户生成量超出预期,将尝试对视频生成收费,并与希望角色被生成的版权方分享部分收入。具体模式仍在试错,目标是先在 Sora 迭代,再在 OpenAI 各产品中统一应用。
FireRedTeam 开源了论文《InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention》的官方实现,该论文已被 NeurIPS 2025 收录。方法通过实例组装注意力机制实现布局感知的图像生成。
上海人工智能实验室 InternLM 团队开源 CapRL 官方实现,通过强化学习提升模型的密集图像描述能力,论文已被 ICLR 2026 接收。
QwenLM 发布 Qwen-Image,一个图像生成基础模型,主打复杂文字渲染和精确图像编辑能力,代码发布在 GitHub(https://github.com/QwenLM/Qwen-Image)。
OpenAI Developers 发布视频演示如何使用 4o 模型创建图像,内容围绕图像生成功能展开。
FireRedTeam 提出 CQ-DINO,通过类别查询缓解广词表目标检测中的梯度稀释问题。该方法针对词表规模庞大时检测性能下降的痛点,用类别查询机制改善梯度传播。
FireRedTeam 的 StoryMaker 项目致力于解决文生图生成中的角色一致性问题。该项目聚焦于让同一角色在不同场景与提示词下保持外观统一,属于原创语音与多模态方向的工作。
FireRedTeam 推出开源项目 PhotoPoster,用于姿态驱动的图像生成,以支持并推进人像动画领域的研究。
FireRedTeam 开源 Target-Driven-Distillation 项目,用目标时间步选择与解耦引导改进一致性蒸馏。该方法面向扩散模型蒸馏场景,通过挑选目标时间步并解耦引导信号来提升生成一致性。项目已公开,具体效果与评测数据未在原文中给出。
Lilian Weng 在 Lil'Log 发布长文,系统梳理扩散模型用于视频生成的方法。文章先讲从零训练的参数化、采样与 3D U-Net、DiT 架构(如 VDM、Imagen Video、Sora),再讲如何改造预训练图像模型生成视频(Make-A-Video、Video LDM、SVD、Lumiere),最后介绍 Text2Video-Zero、ControlVideo 等免训练适配方法。
Lilian Weng 在 Lil'Log 发表的长文系统讲解扩散模型:通过马尔可夫链逐步加噪再学习反向去噪来生成数据,涵盖 DDPM 的变分下界训练目标、与 NCSN 的联系、β 调度与方差参数化等核心内容。
推荐理由:作者原创长文系统讲解扩散模型,从 DDPM 前反向过程到 DDIM、LDM、DiT 等演进,兼顾数学推导与方法脉络。
Lil'Log 目标检测系列第 4 篇聚焦快速检测模型,涵盖 SSD、RetinaNet 和 YOLO 家族,这些均属单阶段检测器,跳过区域候选步骤、直接在密集采样位置上做检测,速度更快但精度可能略有下降。
R-CNN 家族包含 R-CNN、Fast R-CNN、Faster R-CNN 和 Mask R-CNN 四个模型,前三个用于目标识别,Mask R-CNN 用于图像分割。R-CNN 先用 selective search 生成约 2k 个候选区域,再对每个区域独立提取 CNN 特征做分类,并用回归模型修正边界框。文章还介绍了非极大值抑制和难负样本挖掘等常用技巧。
"Object Detection for Dummies"系列第二部分梳理了图像分类的经典卷积网络架构,包括 AlexNet(5 个卷积层 + 2 个 MLP 层 + 1 个 LR 层)、19 层的 VGG 和 152 层的 ResNet,并介绍了残差块对深层网络可训练性的作用。