跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

105条精选相关主题图像生成AI 视频语音与音频

最新精选

第 101–105 条 · 共 105 条
6月23日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)63

    OpenAI 用 Video PreTraining 训练神经网络玩 Minecraft

    OpenAI 通过 Video PreTraining(VPT)在海量无标注的 Minecraft 人类游玩视频上训练神经网络,仅使用少量标注承包商数据。经微调后模型能合成钻石工具,这一任务熟练人类通常需要超过 20 分钟(24,000 个操作);模型使用键盘和鼠标的原生人类接口,是迈向通用计算机操作智能体的一步。

    推荐理由:原文给出 VPT 用少量标注数据加海量无标注视频训练出会玩 Minecraft 的模型,可了解视频预训练在通用操作智能体上的思路。

6月10日周五
  1. Lilian Weng:Lil'Log(RSS)64

    Lilian Weng 综述广义视觉语言模型(VLM)的四类实现路径

    Lilian Weng 在 Lil'Log 发表长文综述视觉语言模型,把让预训练语言模型消费视觉信号的方法分为四类:图像与文本联合训练、学习图像嵌入作为冻结语言模型前缀、用交叉注意力融合视觉信息、以及不做任何训练地拼接模型。

    推荐理由:原文系统梳理了让预训练语言模型处理视觉信号的四类方法,覆盖 VisualBERT、Flamingo、CoCa 等代表工作及其训练设计与数据集。

3月4日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)64

    OpenAI 发现 CLIP 中的多模态神经元

    OpenAI 发现 CLIP 中存在多模态神经元,无论概念以字面、符号还是概念形式呈现,这些神经元都会响应同一概念。这可能解释了 CLIP 在分类概念的各种出人意料的视觉呈现时的准确性,也是理解 CLIP 及类似模型所学到的关联与偏差的重要一步。

    推荐理由:OpenAI 亲自解释了 CLIP 为何能识别概念的非字面视觉呈现,为理解模型学到的关联与偏差提供了线索。

1月5日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)82

    OpenAI 发布 CLIP:连接文本与图像的神经网络

    OpenAI 推出神经网络 CLIP,通过自然语言监督高效学习视觉概念。只需提供待识别视觉类别的名称,CLIP 即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。

    推荐理由:官方介绍 CLIP 用自然语言监督学习视觉概念,可零样本适配任意视觉分类基准,读者可了解其与 GPT 系列能力思路的关联。

4月23日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)65

    OpenAI 发布 Sparse Transformer,可处理比此前长 30 倍的序列

    OpenAI 开发了 Sparse Transformer,一种在预测文本、图像或声音序列下一项任务上创下新纪录的深度神经网络。它通过改进注意力机制的算法,能从比此前可能的长 30 倍的序列中提取模式。

    推荐理由:原文给出 Sparse Transformer 的核心改进点,即注意力算法可处理比此前长 30 倍的序列,读者可据此了解其技术方向。