跳到正文

#多模态

今日 32 条
6月17日周三
6月16日周二
6月13日周六
6月12日周五
6月9日周二
  1. Google DeepMind:Blog(RSS)77

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型,可在 16GB 内存笔记本本地运行

    Google DeepMind 发布 Gemma 4 12B,定位于在笔记本上本地运行的智能体多模态模型,性能接近其 26B MoE 模型而内存占用不到一半。

    推荐理由:官方介绍了无编码器统一架构和 16GB 内存本机运行等细节,适合关注端侧多模态部署的开发者参考。

6月5日周五
  1. Google Research71

    Google Research 发布 PHRM 系统用手机前置摄像头被动监测心率与静息心率

    Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前置摄像头视频在日常用机时后台估计心率与每日静息心率。

    推荐理由:这项研究覆盖近700名不同肤色的参与者并在真实生活场景验证,读者可以据此了解手机摄像头被动测心率的精度与局限。

6月3日周三
  1. Saining Xie42

    大脑如何从(可能不完整且有噪声的)视觉观察中构建并追踪世界的内部状态? 我相信视觉状态追踪将成为未来几年视觉领域的重大挑战,我希望这个基准能成为一个有用的起点。enjoy!

    引用Sihyun Yu@sihyun_yu

    Can MLLMs actually track what's happening in a video? Introducing VSTAT 🎯, our new benchmark for visual state tracking. The tasks are simple: count cups, read typed words, count page flips. Humans solve them easily. MLLMs don't. https://vision-x-nyu.github.io/vstat-site/ 🧵 [1/11]

6月2日周二
5月28日周四
5月27日周三
  1. Saining Xie44

    📸cambrian系列最新作品:cambrian-p,p代表pose。 我认为pose可能是我们需要的、用于稳健视频多模态模型的最小充分3D信号(而且很容易获取!)——联合建模帧和pose,将图像序列转变为全局有根基的结构。

    引用Jihan Yang@jihanyang13

    Camera pose matters for video understanding! Today's MLLMs excel at recognizing activities, but still struggle with the underlying space and ego/object dynamics in video. We trace this gap to a missing piece: camera pose. Introducing Cambrian-P: a multimodal LLM natively grounded in camera pose. (1/n)

5月22日周五
  1. Saining Xie45

    来看看 Jas 主导的 RAEv2。通过大量实验,我们发现了一些非常有趣的行为,说明为什么强大的表征编码器对像素解码器至关重要。 剧透:关键不在于爬 FID 的坡;像 ep@fid-k/fdr^k 这样的新指标表明,还有更多值得探索的空间!

    引用Jaskirat Singh@1jaskiratsingh

    In Oct last year, Representation Autoencoders provided an elegant solution to unified tokenization for understanding and generation. Today we make them a bit more simple. a bit more general. Result: >10x faster convergence, better reconstruction, better generation. And yes we test them on T2I and world models :) Introducing RAEv2

5月18日周一
  1. Google DeepMind:Blog(RSS)80

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式编辑视频

    Google DeepMind 发布 Gemini 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成高质量视频,并支持通过自然语言多轮编辑视频、保持角色和场景一致。

    推荐理由:原文介绍了 Gemini Omni Flash 的多模态输入、对话式视频编辑能力和开放范围,读者可以判断它对视频创作流程的影响。

5月17日周日
  1. Google DeepMind:Blog(RSS)65

    Google 扩展内容溯源工具:SynthID 验证进入 Search 与 Chrome,并推出 AI Content Detection API

    Google 扩展内容透明与验证工具:Gemini 应用的 SynthID 图像、视频和音频验证已被使用 5000 万次,该能力今日扩展至 Search,未来几周进入 Chrome。

    推荐理由:原文汇总了内容溯源验证工具在 Search、Gemini、Chrome、Pixel 与 Cloud 的具体落地范围和开放伙伴,读者可据此了解可用入口。

5月16日周六
  1. Google DeepMind:Blog(RSS)85

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 已在 Gemini 应用、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。

    推荐理由:官方发布稿给出了具体基准成绩、速度倍数和开放渠道,读者可以据此评估 3.5 Flash 在智能体和编码场景的可用性。

5月14日周四
5月12日周二
  1. Lilian Weng39

    过去几个月,我们经历了许多乐趣(和压力😅),在训练运行日志中产出了 12 个版本(以及许多子版本)和 137 页内容。 事实证明,人与人之间的协作对于改善人机协作很重要。😊

    引用Thinking Machines@thinkymachines

    People talk, listen, watch, think, and collaborate at the same time, in real time. We've designed an AI that works with people the same way. We share our approach, early results, and a quick look at our model in action. https://thinkingmachines.ai/blog/interaction-models

  2. Andrej Karpathy65

    Andrej Karpathy 分享技巧:在查询末尾要求 LLM "structure your response as HTML",再用浏览器查看生成的文件,也可要求输出为幻灯片。他进一步提出,音频是人类偏好的输入而视觉是 AI 偏好的输出,输出形式将从文本、markdown 演进到 HTML,最终可能是扩散神经网络直接生成的交互式视频;输入端还缺少指向屏幕等交互方式。

    引用Thariq@trq212

    http://x.com/i/article/2052796100608974848

5月11日周一
5月7日周四
4月30日周四
  1. Google DeepMind:Blog(RSS)64

    Google DeepMind 发布 AI co-clinician 医疗协作智能体研究

    Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下辅助患者照护的 AI 智能体。在 98 个真实初级保健问题的盲评中,该系统在 97 例中零关键错误,优于两种医生广泛使用的 AI 系统;在 OpenFDA RxQA 开放式用药问答上超越其他前沿模型。

    推荐理由:原文给出盲评与模拟问诊的测试结果和局限,读者可以了解医疗 AI 在辅助医生与患者场景中的实际表现边界。

4月28日周二
  1. Fuli Luo65

    小米 MiMo 团队开源两款模型:MiMo-V2.5-Pro(Code Agent,总参数 1T)和 MiMo-V2.5(多模态 Agent,总参数 310B)。采用 MIT 许可证,支持商用部署、继续训练和微调,两款模型均支持 1M token 上下文窗口;官方称 MiMo-V2.5-Pro 在开源模型中 GDPVal-AA 和 ClawEval 排名第一。开发者还可申请 100T 免费 token(http://100t.xiaomimimo.com),权重在 Hugging Face 提供。

    引用Xiaomi MiMo@XiaomiMiMo

    Xiaomi MiMo-V2.5 is now officially open-sourced! MIT License, supporting commercial deployment, continued training, and fine-tuning - no additional authorization required. Two models, both supporting a 1M-token context window : • MiMo-V2.5-Pro: built for complex agent and coding tasks, ranking No.1 among open-source models on GDPVal-AA and ClawEval • MiMo-V2.5: a native omni-modal model with strong agent capabilities A model's value isn't measured by rankings alone — it's measured by the problems it solves. Let's build with MiMo now! 🤗 Weights: https://huggingface.co/collections/XiaomiMiMo/mimo-v25 📄 Blog: https://mimo.xiaomi.com/index#blog

4月27日周一
4月24日周五
4月22日周三
4月17日周五
4月13日周一
3月29日周日
  1. Google DeepMind:Blog(RSS)64

    Google DeepMind 推出由 Gemini 驱动的 AI 指针交互

    Google DeepMind 发布 AI 指针实验方案,让指针借助 Gemini 理解所指内容与用户意图,并提出保持流、看即说、用 this/that、像素变实体四条交互原则。用户已可在 Google AI Studio 和 Gemini in Chrome 中通过指向加语音操作网页,Googlebook 将推出 Magic Pointer。

    推荐理由:原文给出 AI 指针的四条交互原则及其在 Chrome 和 Googlebook 中的落地入口,读者可据此理解指向加语音的新交互方式。

3月26日周四
3月25日周三
  1. Google Research40

    Google Research 推出 S2Vec:用自监督嵌入学习城市建成环境

    Google Research 发布自监督框架 S2Vec,将道路、建筑、商业设施等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在 US-wide 人口密度、收入中位数等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态;但在树木覆盖、海拔等环境任务上仍需改进。

3月18日周三
3月17日周二
  1. Mistral AI:News(网页)70

    Mistral 发布开源模型 Mistral Small 4,统一推理、多模态与编码能力

    Mistral 发布 Mistral Small 4,首个将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的开源版本,采用 Apache 2.0 许可证。

    推荐理由:官方发布文给出完整架构参数、性能对比和部署门槛,可以了解这款统一推理与多模态的开源模型是否适配自己的场景。

3月12日周四
  1. Google Research61

    Google 发布 Groundsource:用 Gemini 把新闻报道转为历史洪水数据

    Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。

    推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。