跳到正文

#多模态

今日 20 条
11月20日周四
10月29日周三
10月27日周一
10月24日周五
10月23日周四
10月22日周三
10月17日周五
10月13日周一
10月9日周四
9月28日周日
9月23日周二
9月21日周日
  1. 通义 QwenAudio:原创语音项目68

    阿里云 Qwen 团队发布全模态模型 Qwen3-Omni

    阿里云 Qwen 团队发布端到端全模态大语言模型 Qwen3-Omni,可理解文本、音频、图像和视频,并能实时生成语音。项目链接:https://github.com/QwenLM/Qwen3-Omni

    推荐理由:作者以官方身份说明 Qwen3-Omni 的模态覆盖和实时语音生成能力,可帮助读者判断其适用场景。

8月1日周五
  1. Mistral AI:News(网页)44

    Mistral 如何通过微调 Pixtral-12B 提升卫星图像视觉语言模型表现

    Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于未微调基线。基线模型在 Playground、Stadium 等易混类别上出错,还会幻觉出不存在的类别名;微调后分类更准确。整个流程通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。

7月25日周五
7月17日周四
6月10日周二
6月5日周四
5月30日周五
5月7日周三
3月17日周一
3月7日周五
5月14日周二
  1. Sam Altman:Blog(RSS)87

    Sam Altman 谈 GPT-4o 发布:免费提供最强模型并强调新语音模式体验

    Sam Altman 发文点评 OpenAI 当日发布的 GPT-4o,强调两点:一是把世界最强模型免费开放给 ChatGPT 用户,无广告,未来靠其他付费项目支撑,希望让数十亿人用上优秀 AI 服务;二是新语音(和视频)模式是他用过最好的计算机界面,达到接近人类水平的响应时间和表达力,感觉像电影里的 AI。他提到未来将加入可选的个性化、访问用户信息和代为执行操作等能力。

    推荐理由:作者作为当事方说明 GPT-4o 免费开放的初衷和新语音模式的使用感受,读者可了解 OpenAI 对这两点的官方表态。

4月12日周五
  1. Lilian Weng:Lil'Log(RSS)52

    Lilian Weng 长文综述扩散模型在视频生成中的应用

    Lilian Weng 在 Lil'Log 发布长文,系统梳理扩散模型用于视频生成的方法。文章先讲从零训练的参数化、采样与 3D U-Net、DiT 架构(如 VDM、Imagen Video、Sora),再讲如何改造预训练图像模型生成视频(Make-A-Video、Video LDM、SVD、Lumiere),最后介绍 Text2Video-Zero、ControlVideo 等免训练适配方法。

6月10日周五
  1. Lilian Weng:Lil'Log(RSS)64

    Lilian Weng 综述广义视觉语言模型(VLM)的四类实现路径

    Lilian Weng 在 Lil'Log 发表长文综述视觉语言模型,把让预训练语言模型消费视觉信号的方法分为四类:图像与文本联合训练、学习图像嵌入作为冻结语言模型前缀、用交叉注意力融合视觉信息、以及不做任何训练地拼接模型。

    推荐理由:原文系统梳理了让预训练语言模型处理视觉信号的四类方法,覆盖 VisualBERT、Flamingo、CoCa 等代表工作及其训练设计与数据集。

11月10日周日
8月12日周日