DC-SAE:加速扩散模型收敛的深度压缩语义自编码器
研究者提出 DC-SAE 解耦紧凑语义自编码器,通过语义编码器实现高压缩比、像素级编码器保留细节,兼顾高保真重建与快速扩散训练收敛。在 ImageNet 512×512 上实现 32 倍空间压缩,PSNR 29.79、gFID 3.37,较此前 SOTA 高压缩 tokenizer DC-AE 分别提升 13.5% 和 54.9%。
研究者提出 DC-SAE 解耦紧凑语义自编码器,通过语义编码器实现高压缩比、像素级编码器保留细节,兼顾高保真重建与快速扩散训练收敛。在 ImageNet 512×512 上实现 32 倍空间压缩,PSNR 29.79、gFID 3.37,较此前 SOTA 高压缩 tokenizer DC-AE 分别提升 13.5% 和 54.9%。
华为 Mate 90 系列首发搭载全新升级的 XMAGE「华为睿影」影像体系,全系配备 F1.4-F4.0 无级调节连续可变光圈,并搭载第三代红枫原色摄像头、超大底 2 亿像素长焦和 18EV 超高动态主摄。Mate 90 Pro Max 依托第十代 ISP 与 CIPA7.5 长焦防抖,20x 长焦人像视频清晰度提升 34%、防抖能力提升 41%;XMAGE 智拍新增 AI 姿势推荐功能。
华为在 Mate90 系列及全场景新品发布会上围绕智能助手、智能影像和智感交互深化鸿蒙 AI 体验。小艺帮记支持滑动保存页面内容并直接提问,AI 自动提取关键信息、检索总结;小艺图库助手实现一句话成片,支持图片动态变换、电影运镜与素材智能编排。隔空手势可抓取图片跨设备直传,并支持阅后即焚式单次查看隐私模式。
针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并训练专家 IDS 识别器对齐裁剪级视觉预测,配合整字语义奖励提供部件与空间关系的细粒度反馈。
苹果 Invites App 更新至 1.12.0,共享相册现支持全分辨率照片共享,任何收到链接的人(含非 Apple 设备用户)均可加入并上传照片。新版扩展图乐园(Image Playground)功能,新增照片级逼真背景生成能力,并简化邮箱验证流程,宾客点击收件箱链接即可加入活动,无需输入验证码。
产品图背景移除应采用命名、带版本的转换预设来保证可复现,仅对无复用价值的孤立图片走直接处理。预设作为可审计、可下线的策略,需将源图、衍生输出与异步任务状态分开存储,并记录归属与生命周期。直接处理须限制可改参数、绑定源资产 ID 与请求方,并保留幂等键与人工复核,避免一次性例外变成未受控的策略分支。
New HiDream models just landed in vivago R1 Studio 🚀 Introducing: • HiDream-O1 Image 2.0 • HiDream-O1 Editing 1.5 • HiDream-O1 Video All three models are now available in vivago R1 Studio - bringing the latest HiDream image generation, editing, and video capabilities directly into your creative workflow. New models. New possibilities. Go make something the internet can’t ignore. 🔥
Simon Willison 用 GPT-6 Astra 构建了实验性工具 Photo Scrubber,可自动识别人脸并模糊处理。该工具基于 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,全部在本地运行。
我让我的 dot 给我画张像。它先发来一张卡通风格的,我让它再努力点,去网上找我最近的照片。它画得好多了。 下面的视频是我在点看我的 dot 的电脑。
Luma AI 宣布 Ideogram 4.5 已接入 Luma,供创意团队使用。该编辑模型据称能消除多轮编辑中的伪影累积和像素色彩偏移,可通过 https://app.lumalabs.ai 体验。
Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.
Ning Xu 凭借展示肺部纤毛运动的视频获得 Nikon Small World in Motion 比赛冠军,多位显微专家质疑视频中紫色、蓝色结构在生物学上不合理,可能由 AI 工具幻觉产生。
针对菜谱站点头像与菜品卡片,内容感知裁剪应作为默认方案,它能保留居中裁剪经常切掉的主体,但需存储裁剪框并提供人工调整路径。居中裁剪仅适用于拍摄时强制居中构图的流程,其确定性几何在异构上传中会稳定地切掉偏离中心的人脸或餐盘。Cloudinary、Imgix、ImageKit 等托管方案在运营边界上各有取舍,智能裁剪输出仍需审核与覆盖。
Ideogram 4.5 现已登陆 Krea。 反复编辑通常会导致伪影、像素偏移和色彩漂移——这个模型正是为解决可重复编辑而打造。 在下方试试 👇
Ideogram 4.5 进入 Image Edit Arena 前 20,总分 1351 分,排名第 18。
Introducing Ideogram 4.5, the most precise edit model. With each edit, leading models add artifacts, pixel shifts, and color changes. Ideogram 4.5 eliminates artifact buildup, making multi-turn editing possible. Live in Ideogram, the API, and launch partners. Open weights soon.
xAI 在 Grok Imagine API 上线 Quality Mode,面向企业开发者和团队提供图像生成与编辑能力,主打更高真实感、更强文字渲染和更好的创作控制。该模式适用于产品可视化、营销素材、UGC 风格内容等场景,并可结合视频生成能力制作社交媒体视频、产品展示和广告素材。
xAI 为 Imagine Video 1.5 增加图像与语音参考、纯提示词生成视频和原生 1080p 输出。
推荐理由:原文列出图像与语音参考、文本生成视频和原生 1080p 的可用范围与 API 情况,读者可据此判断能否接入现有工作流。
xAI 宣布 Imagine Image 2.0 正式可用,作为新 Quality Mode 上线 grok.com/imagine 及 iOS 和 Android 应用,API 型号为 grok-imagine-image-2.0。
推荐理由:原文列出精确编辑、多图合成、模板和 API 入口等具体能力,读者可以对照判断它是否适合实际设计工作流。
Suno 宣布 2024 年全年向平台创作者发放总额 100 万美元奖金,首期 Summer of Suno Vol. 1 于 6 月 1 日启动,向 6 月最热门的 500 首公开歌曲创作者发放 10 万美元,第一名奖金 1 万美元。歌曲排名由播放、点赞和分享综合决定,所有公开歌曲自动参赛,每位创作者限一首,奖金通过 PayPal 在活动结束后 30 天内发放。
Suno 宣布与 Warner Music Group(WMG)达成合作,将基于高质量授权音乐构建超越 v5 的新一代模型,并推出由 WMG 艺人自愿授权的互动创作体验,参与艺人可获得补偿。产品方面,下载功能保留但需付费账号并按档位限制每月下载次数,Suno Studio 维持不变且保留无限下载。
推荐理由:Suno 官方宣布与 WMG 合作,读者可以据此了解授权模型、粉丝互动与下载政策变化如何影响平台使用方式。
Suno 发布 v5.5 模型,同时推出 Voices、Custom models 和 My Taste 三项个性化功能。
推荐理由:原文给出 Voices 的验证与隐私细节和两项新个性化功能,读者可以判断这些能力如何改变自己的创作流程。
AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,把积压多年的歌词变成歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。一条深夜发布的视频引来数百条求歌名评论,让他重新重视音乐创作。他认为提示词与反复打磨等创作方向仍然关键,目标是让人感受作品而非关注工具。
Sakana AI 提出 Percept-Lens,通过冻结通用视觉模型并拟合简单高斯决策规则来检测 AI 生成图像,在 ECCV2026 论文中该方法在广泛评测套件上超越了所测试的最强已发布 AI 生成图像检测器。研究还表明,检测器在生成器、提示词、风格或图像域变化时性能会急剧下降,而进步也可来自更好利用通用视觉模型中已有的真实与生成结构。
LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。
推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。
SGL-Diffusion 团队用 SRT 替换 HF 后端,将 AR 阶段从扩散 worker 中解耦为独立服务,使 AR 可单独配置 TP、DiT 保留 SP。
卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。
Baseten 推出面向图像生成模型的推理服务,支持部署 FLUX.1 dev、SDXL Lightning 等开源模型及用户微调、自定义模型,兼容 ComfyUI 等框架。SDXL Lightning 可在 4 个 UNet 步内生成 1024x1024 图像,接近实时出图。平台提供弹性自动扩缩容、冷启动优化,并支持 SOC 2 Type II、HIPAA、GDPR 合规部署。
Black Forest Labs 发布 FLUX VTO 虚拟试穿模型,现已公开可用,并加入 FLUX MCP。单次生成低于 4 秒,可自托管实现亚秒级响应,最多可给同一模特叠加 4 件服装,并保留人物身份与服装的 logo、印花、缝线和配件细节。默认审核政策下不支持泳装和内衣,官方提示精确的身材与服装尺码功能仍在演进,输出适合作为视觉搭配参考。
Martin Scorsese 成为 Black Forest Labs 顾问,并已用 FLUX 进行电影分镜创作。他表示该工具能更清晰高效地把脑海中的画面分享给美术指导、艺术设计和摄影指导,在前期制作中加快进度而不牺牲质量与工艺。Black Forest Labs 称其视觉智能模型可同时服务叙事者、建筑师、设计师与工程师,并预告将推出新的 FLUX 模型。
Black Forest Labs 宣布 FLUX.2 [klein] 4B 将预装在 ASUS 下一代 ProArt RTX 笔记本的 MuseTree 应用中,该产品线在台北 Computex 2026 上亮相。
Envato 与 Black Forest Labs 合作,将 FLUX 模型接入其创意平台,FLUX 已占平台图片生成总量的约 25%,累计生成超 5100 万张图片。FLUX.2 发布当天即上线生产环境,其在写实、电影感和产品图场景中比同类模型高出约 10%,下载率高出平台均值 16%。平台按任务智能路由请求,其中素材变体生成可在 8 秒内输出 5 张图片。
World Labs 发布空间智能模型更新,并推出有限访问的 Marble 测试预览,用户可在 marble.worldlabs.ai 用图像或文本提示生成可自由导航的 3D 世界。
SDXL Lightning 是 Stable Diffusion XL 的变体,仅需 4 个 UNet 步骤即可生成 1024x1024 像素图像,实现接近实时的图像生成。模型接收单个 prompt 输入,返回图像的 base64 字符串,该实现采用 4 步 UNet checkpoint 以平衡速度与质量。用户可自行部署 2 步版本以获得更快速度,或 8 步版本以获得更高质量。
Qwen Image 2512 已在 Baseten 平台上线,可通过 OpenAI 兼容 API 调用,模型名为 qwen-image-2512。该模型支持 1024x1024 尺寸图像生成,可配置 num_inference_steps 与 guidance_scale 参数,并返回 b64_json 格式结果。
Baseten Base Labs 上线图像生成模型 Flux.2 [dev],模型名为 flux2-dev,可通过 OpenAI 兼容 API 调用。示例代码以 1024x1024 尺寸、50 步推理、guidance_scale 1.0 生成图像,并以 b64_json 格式返回结果。
Baseten Base Labs 发布 Qwen Image 的 Python 调用示例,通过 httpx 向 Baseten 部署端点发送 prompt、width、height、num_inference_steps 和 seed 等参数生成图像。
Eugene Yan 系统梳理文生图的四个核心概念:扩散、文本条件、分类器引导与潜空间。作者亲手复现 DDPM 发现去噪权重低至 0.01-0.02、加噪权重最高 0.14。
自编码器与扩散模型在学习范式上相似:都以数据为输入并重建输出,都在过程中学习数据的低维流形,架构上都使用瓶颈层,U-Net 可视为带残差连接的自编码器。关键区别在于扩散模型以时间步 t 为条件输入,使单一模型和单组参数即可处理不同噪声水平,从而先由高 t 的噪声生成模糊图像、再在低 t 时逐步锐化;当前扩散模型还以图像描述等文本为条件,支持按文本提示词生成图像。
Andrej Karpathy 用 MATLAB 界面手动分类 CIFAR-10 的 400 张图片,人类准确率约为 94%,而当时 Adam Coates 等人的 SOTA 方法仅约 80%。
Andrej Karpathy 抓取约 500 万张带 #selfie 标签的图片并筛选出 200 万张含人脸的自拍,按点赞数与粉丝数归一化后标注好坏,用 Caffe 微调 ImageNet 预训练的 VGGNet,模型达 60% 验证准确率。