跳到正文
原文
Lilian Weng:Lil'Log(RSS)·· 2022-06-10精选AI 评分64

Lilian Weng 综述广义视觉语言模型(VLM)的四类实现路径

Generalized Visual Language Models

AI 导读

Lilian Weng 在 Lil'Log 发表长文综述视觉语言模型,把让预训练语言模型消费视觉信号的方法分为四类:图像与文本联合训练、学习图像嵌入作为冻结语言模型前缀、用交叉注意力融合视觉信息、以及不做任何训练地拼接模型。

推荐理由

原文系统梳理了让预训练语言模型处理视觉信号的四类方法,覆盖 VisualBERT、Flamingo、CoCa 等代表工作及其训练设计与数据集。

来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io