跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 61–74 条 · 共 74 条
5月11日周一
4月30日周四
  1. Google DeepMind:Blog(RSS)64

    Google DeepMind 发布 AI co-clinician 医疗协作智能体研究

    Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下辅助患者照护的 AI 智能体。在 98 个真实初级保健问题的盲评中,该系统在 97 例中零关键错误,优于两种医生广泛使用的 AI 系统;在 OpenFDA RxQA 开放式用药问答上超越其他前沿模型。

    推荐理由:原文给出盲评与模拟问诊的测试结果和局限,读者可以了解医疗 AI 在辅助医生与患者场景中的实际表现边界。

4月24日周五
3月29日周日
  1. Google DeepMind:Blog(RSS)64

    Google DeepMind 推出由 Gemini 驱动的 AI 指针交互

    Google DeepMind 发布 AI 指针实验方案,让指针借助 Gemini 理解所指内容与用户意图,并提出保持流、看即说、用 this/that、像素变实体四条交互原则。用户已可在 Google AI Studio 和 Gemini in Chrome 中通过指向加语音操作网页,Googlebook 将推出 Magic Pointer。

    推荐理由:原文给出 AI 指针的四条交互原则及其在 Chrome 和 Googlebook 中的落地入口,读者可据此理解指向加语音的新交互方式。

3月17日周二
  1. Mistral AI:News(网页)70

    Mistral 发布开源模型 Mistral Small 4,统一推理、多模态与编码能力

    Mistral 发布 Mistral Small 4,首个将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的开源版本,采用 Apache 2.0 许可证。

    推荐理由:官方发布文给出完整架构参数、性能对比和部署门槛,可以了解这款统一推理与多模态的开源模型是否适配自己的场景。

3月12日周四
  1. Google Research61

    Google 发布 Groundsource:用 Gemini 把新闻报道转为历史洪水数据

    Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。

    推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。

12月3日周三
  1. Mistral AI:News(网页)80

    Mistral 发布 Mistral 3 系列:含 Mistral Large 3 与 Ministral 3 小模型,全部 Apache 2.0 开源

    Mistral 发布新一代模型系列 Mistral 3,包括 Mistral Large 3(41B 激活、675B 总参数的 MoE 模型)和 Ministral 3 的 3B、8B、14B 三种小模型,全部以 Apache 2.0 许可开源。

    推荐理由:官方发布了完整模型规格、开源许可和部署路径,读者可以据此评估这批开源模型在自己的场景中是否可用。

9月21日周日
  1. 通义 QwenAudio:原创语音项目68

    阿里云 Qwen 团队发布全模态模型 Qwen3-Omni

    阿里云 Qwen 团队发布端到端全模态大语言模型 Qwen3-Omni,可理解文本、音频、图像和视频,并能实时生成语音。项目链接:https://github.com/QwenLM/Qwen3-Omni

    推荐理由:作者以官方身份说明 Qwen3-Omni 的模态覆盖和实时语音生成能力,可帮助读者判断其适用场景。

6月10日周二
5月7日周三
3月17日周一
3月7日周五
5月14日周二
  1. Sam Altman:Blog(RSS)87

    Sam Altman 谈 GPT-4o 发布:免费提供最强模型并强调新语音模式体验

    Sam Altman 发文点评 OpenAI 当日发布的 GPT-4o,强调两点:一是把世界最强模型免费开放给 ChatGPT 用户,无广告,未来靠其他付费项目支撑,希望让数十亿人用上优秀 AI 服务;二是新语音(和视频)模式是他用过最好的计算机界面,达到接近人类水平的响应时间和表达力,感觉像电影里的 AI。他提到未来将加入可选的个性化、访问用户信息和代为执行操作等能力。

    推荐理由:作者作为当事方说明 GPT-4o 免费开放的初衷和新语音模式的使用感受,读者可了解 OpenAI 对这两点的官方表态。

6月10日周五
  1. Lilian Weng:Lil'Log(RSS)64

    Lilian Weng 综述广义视觉语言模型(VLM)的四类实现路径

    Lilian Weng 在 Lil'Log 发表长文综述视觉语言模型,把让预训练语言模型消费视觉信号的方法分为四类:图像与文本联合训练、学习图像嵌入作为冻结语言模型前缀、用交叉注意力融合视觉信息、以及不做任何训练地拼接模型。

    推荐理由:原文系统梳理了让预训练语言模型处理视觉信号的四类方法,覆盖 VisualBERT、Flamingo、CoCa 等代表工作及其训练设计与数据集。