最新精选
第 101–105 条 · 共 105 条- OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分6363
OpenAI 通过 Video PreTraining(VPT)在海量无标注的 Minecraft 人类游玩视频上训练神经网络,仅使用少量标注承包商数据。经微调后模型能合成钻石工具,这一任务熟练人类通常需要超过 20 分钟(24,000 个操作);模型使用键盘和鼠标的原生人类接口,是迈向通用计算机操作智能体的一步。
推荐理由:原文给出 VPT 用少量标注数据加海量无标注视频训练出会玩 Minecraft 的模型,可了解视频预训练在通用操作智能体上的思路。
- Lilian Weng:Lil'Log(RSS)精选AI 评分6464
Lilian Weng 在 Lil'Log 发表长文综述视觉语言模型,把让预训练语言模型消费视觉信号的方法分为四类:图像与文本联合训练、学习图像嵌入作为冻结语言模型前缀、用交叉注意力融合视觉信息、以及不做任何训练地拼接模型。
推荐理由:原文系统梳理了让预训练语言模型处理视觉信号的四类方法,覆盖 VisualBERT、Flamingo、CoCa 等代表工作及其训练设计与数据集。
- OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分6464
OpenAI 发现 CLIP 中存在多模态神经元,无论概念以字面、符号还是概念形式呈现,这些神经元都会响应同一概念。这可能解释了 CLIP 在分类概念的各种出人意料的视觉呈现时的准确性,也是理解 CLIP 及类似模型所学到的关联与偏差的重要一步。
推荐理由:OpenAI 亲自解释了 CLIP 为何能识别概念的非字面视觉呈现,为理解模型学到的关联与偏差提供了线索。
- OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分8282
OpenAI 推出神经网络 CLIP,通过自然语言监督高效学习视觉概念。只需提供待识别视觉类别的名称,CLIP 即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:官方介绍 CLIP 用自然语言监督学习视觉概念,可零样本适配任意视觉分类基准,读者可了解其与 GPT 系列能力思路的关联。
- OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分6565
OpenAI 开发了 Sparse Transformer,一种在预测文本、图像或声音序列下一项任务上创下新纪录的深度神经网络。它通过改进注意力机制的算法,能从比此前可能的长 30 倍的序列中提取模式。
推荐理由:原文给出 Sparse Transformer 的核心改进点,即注意力算法可处理比此前长 30 倍的序列,读者可据此了解其技术方向。