Andrej Karpathy 用卷积神经网络分析什么样的自拍更受欢迎
Andrej Karpathy 抓取约 500 万张带 #selfie 标签的图片并筛选出 200 万张含人脸的自拍,按点赞数与粉丝数归一化后标注好坏,用 Caffe 微调 ImageNet 预训练的 VGGNet,模型达 60% 验证准确率。
Andrej Karpathy 抓取约 500 万张带 #selfie 标签的图片并筛选出 200 万张含人脸的自拍,按点赞数与粉丝数归一化后标注好坏,用 Caffe 微调 ImageNet 预训练的 VGGNet,模型达 60% 验证准确率。
研究团队提出 OmniTaskonomy 统一分类体系,覆盖 19 项图生图(I2I)生成任务与 25 项图生文(I2T)理解能力,系统探究视觉生成监督何时以及如何提升视觉理解。
研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。
研究提出用去噪器 Jacobian 的谱特性来刻画扩散、流匹配等生成式去噪模型之间的差异,发现生成性能更好的模型对应更大的 Jacobian 特征值。作者据此设计了一种正则化方案,通过在扰动输入上训练去噪器来抑制或放大 Jacobian 响应,并在 ImageNet 上验证:同时强化数据相关主特征方向、抑制噪声无关方向能改善生成效果。
World Labs 发布下一代世界模型 Atlas,一个从零预训练的全能模型,可原生处理文本、图像、视频和 3D。
World Labs 发布 Spark,一款面向 THREE.js 的高级 3D Gaussian Splatting 渲染器,可与场景中的其他网格和 splat 集成,并在所有设备上实现快速渲染。该渲染器支持可编程的动态 splat 效果,兼容 ply、sogs、spz、splat、ksplat 等多种格式。
AI 时尚应用 Alta Daily 基于 Meta 的 Segment Anything Model(SAM)完成服装分割与数字化,已处理超 2000 万张图片。
Meta Superintelligence Labs 发布 Muse Image 并预览 Muse Video,均为该实验室首批媒体生成模型。
Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。
推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。
Black Forest Labs 推出 FLUX Video Upscale,作为独立 FLUX Tool 和 endpoint,可将 480p 起的视频重生成至最高原生 4K,支持 1.5x、2x、3x 放大,并可原生理解 FLUX 3 输出。
Black Forest Labs 发布面向企业的 FLUX 方案,提供托管 API、自托管开放权重和联合开发三种模式。自托管可选 FLUX.1 [dev]、FLUX.2 [dev] 及 FLUX.2 [klein] 4B(Apache 2.0)与 9B,数据全程留在自有网络内。托管 API 支持零数据保留、多区域部署,企业协议起订量为每月 20 万次生成。
Black Forest Labs 发布 FLUX 定价页,按生成时长计费,费率为 $0.17 / second,示例为 5 秒共 $0.85,无需订阅或席位费。
Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。
MaLiang-Harness 是一个将 MLLM 驱动的视觉生成组织为持续构建、检查与修订过程的统一框架,用于弥合程序可执行但违反构图、外观或运动要求的 Program-to-Visual(P2V)差距。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
Hy Image 3.5 preview is FREE on GMI Cloud for 7 days Generate + edit images up to 2K. Bring up to 5 reference images. Build posters, product shots, game art, and more. And we’re turning the free week into a challenge: 3 tracks. 3 winners. $1,800 in cash + credits. Start creating free 👇
一项基于 AFRL GOTCHA 数据集的可行性研究显示,28,656 参数的卷积自编码器在 SAR 相位历史压缩上全面落后于 BAQ:16 b/cs 时 NMSE 为 -2.87 dB,而 8-bit BAQ 配合 ±3σ 裁剪为 -35.5 dB、调优裁剪范围为 -41.0 dB,也逊于 16×16 块 KLT 的 -5.39 dB,检测 F1 上限仅 33%。
AWS 发布 vLLM-Omni 图像视频生成示例,在同一 vLLM-Omni DLC 上部署两个 SageMaker AI 端点:实时端点跑 FLUX.2-klein-4B 文生图,异步端点跑 Wan2.1-VACE-1.3B 图生视频。
ModelScope 发布 DiffSynth-Studio 下的 Qwen-Image-2.1 LayerExtract 和 LayerRemove 两个 LoRA,组成图层编辑工作流。
Microsoft 在 GitHub 新建仓库 microsoft/amplifier-bundle-imagegen,为 Amplifier 项目提供图像生成 bundle。该仓库定位是 Amplifier 的图像生成能力扩展包,目前公开信息仅说明其用途,未披露支持的模型、参数或可用方式。
viggle-turbo for Qwen-Image-2.1 isn't just faster — for most prompts, it's just as good as base.
Runway 发布新功能 Layers,一键即可把任意图像拆分为可编辑图层。用户可以去除背景、编辑文字并单独修改任意元素,全程无需离开 Runway。
很多人想知道如何用我们新的编辑模型来实现一致的角色等等——所以我们为你们做了一个视频 <3
Midjourney 在 alpha.midjourney.com 界面测试快速模型,Styles 侧边栏新增风格预览功能,开启 "Live previews" 可查看提示词在已点赞和精选风格下的效果,点击缩略图即可用该风格生成。
Google Photos 上线 5 项更新,其中 Photos in Gemini Spark 支持用一句提示词挑选、提亮并分享家庭合照,面向美国符合条件的 Google AI Pro 和 Ultra 订阅用户。
Hy Image 3.5 preview is now live on GMI Cloud @TencentHunyuan $0.024 per image 8.8x cheaper than GPT Image 2 5.6x cheaper than Nano Banana Pro Create now 👇
Midjourney 为 alpha.midjourney.com 推送更新,Styles 侧边栏新增 "Live previews",可在浏览样式时用当前提示词实时预览效果。设置中新增默认参数保存功能,Create Feed 改为全宽瀑布流并支持悬停显示提示词、视频悬停播放。韩语支持已在 midjourney.com 面向所有用户上线。
通过我们的 Day0 合作伙伴 @novita_labs,畅享市面上最佳的文本到图像 UI/UX 设计模型 🤠🥰
Ming-Image-0.1-Design from @AntLingAGI is now available via Novita on @OpenRouter. Launching as a Day-0 partner ⚡ 🎁 Free for 14 days. A text-to-image model built for graphic-design output and legible text rendering.
作者用 GPT 把一张临摹的角色图变成一组漫画,结果原图有特色的角色沦为平庸装饰,直观暴露了"AI 味"的来源——被拉回某种基准线。推文附有临摹图与原图对比,原图来自 Pinterest。