跳到正文

#多模态

今日 2 条
今天10月1日周四
  1. Google DeepMind:Blog(RSS)77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。

    推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。

9月30日周三
  1. xAI:News(网页)64

    xAI 将 Grok 4.5 推向 iOS、Android、网页和 X 平台

    xAI 宣布其最强模型 Grok 4.5 当日起在 grok.com、X 以及 iOS 和 Android 应用上可用。官方称该模型更准确理解提问、能跟踪更长对话并更快给出答案,可完成制作电子表格、把大纲转为幻灯片和图表、撰写文稿、提炼长 PDF 要点等任务,并通过 Microsoft 365 插件在 Word、Excel、PowerPoint 和 Outlook 中直接使用。

    推荐理由:xAI 官方说明 Grok 4.5 的能力改进和全平台可用范围,读者可据此评估在日常问答和知识工作中的使用方式。

  2. Suno:Blog(网页)76

    Suno 发布 v3 音乐模型

    Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。

    推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。

  3. Suno:Blog(网页)64

    Suno 发布 v4.5 音乐模型,曲风更准、人声更丰富、歌曲最长 8 分钟

    Suno 发布最新音乐模型 v4.5,带来更动态的音乐、更准的曲风与曲风混搭、更丰富的人声表现。新功能包括提示词增强助手、Covers 与 Personas 组合使用,歌曲长度可达 8 分钟,生成速度和音频质量均有提升。

    推荐理由:官方列出了 v4.5 在曲风、人声、提示词理解和生成速度上的具体改进,适合关注 AI 音乐生成的读者了解能力变化。

  4. Suno:Blog(网页)61

    Suno 发布升级版 Song Editor 与 stem 拆分等创作控制功能

    Suno 推出升级版 Song Editor,可在波形上逐段重排、重写和重制曲目,并可将曲目拆分为 12 个干净 stem 供预览和下载。同时支持最长 8 分钟的整曲上传,新增三个创意滑块控制生成风格,可继续在 DAW 中编辑或在 Suno 内完成曲目。

    推荐理由:官方介绍升级版 Song Editor、12 轨 stem 拆分和 8 分钟上传等新能力,可帮助创作者评估其在音乐工作流中的用法。

  5. Liquid AI 模型与工程博客(网页)17

    Liquid AI 面向国防战术边缘的端侧 AI 方案

    Liquid AI 推出面向国防战术边缘的端侧 AI 方案,其多模态模型完全在设备本地运行,支持威胁检测、自主导航和实时 ISR,推理留在本地以保持速度和断网可用性。该方案针对国防场景的 SWaP 约束调优,适配手持设备、头显、地面车辆和小型 UAS 的 NPU 与 CPU,避免将敏感数据发送至云端带来的安全风险与 ITAR 违规。

  6. Liquid AI 模型与工程博客(网页)16

    Liquid AI 面向电商的定制多模态 AI 模型:语义搜索、站内智能体与商家 Copilot

    Liquid AI 推出面向电商行业的定制多模态 AI 模型,以毫秒级响应支撑语义搜索、站内智能体和商家 Copilot。其意图原生搜索可理解自然语言、图像查询与结构化筛选,并实时调用商家 API 返回商品;站内智能体接入购物车、结账、订阅、订单状态等 API,可引导客户并完成购买流程。商家侧 SLM 基于分析数据、营销活动和商品目录训练,用于总结表现、建议行动并生成商品调整。

  7. Liquid AI 模型与工程博客(网页)18

    Liquid AI 面向消费电子设备的端侧 AI 方案

    Liquid AI 面向消费电子厂商推出端侧 AI 方案,其高效 SLM 可为 PC、智能手机、智能扫地机器人等设备定制适配 NPU、CPU、RAM 和功耗的模型,无需新芯片即可实现智能通知、离线助手和功耗摘要等功能。该方案支持调用厂商自有 API 以打开应用、修改设置并编排设备功能,仅在复杂推理时交由云端 LLM 处理,同时以单一多模态模型覆盖文本、音频和视觉。

  8. Liquid AI 模型与工程博客(网页)21

    Liquid AI 面向汽车行业的本地多模态车载 AI 助手方案

    Liquid AI 推出面向汽车行业的车载 AI 助手方案,其多模态模型完全运行在量产车已有的 CPU 和 NPU 上,无需云端依赖或新增硬件。方案采用边缘优先的 SLM 与混合智能体架构,单个模型支持 20+ 种语言,速度达现有方案的 5 倍,可实现亚秒级响应与自然语音、座舱视觉交互。

  9. Liquid AI 模型与工程博客(网页)55

    Liquid AI 发布 LFM-7B:非 Transformer 架构的高效语言模型

    Liquid AI 发布 LFM-7B,一款基于 Liquid Foundation Model 非 Transformer 架构的语言模型,面向聊天场景。官方称其在 7B-8B 级别英文、阿拉伯语和日语对话评测中领先,上下文窗口为 32k(RULER 有效长度 32k),内存占用低于同类 Transformer 模型,适合本地、低延迟和成本受限部署。

  10. Cursor Blog69

    Cursor 与 SpaceXAI 联合发布 Grok 4.6,聚焦长时程智能体任务

    Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。

    推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。

  11. Claude:Blog(网页)70

    Claude Artifacts 功能页详解:Claude Design、Claude Slides 与 Claude Docs 开放 beta

    Claude 介绍 Artifacts 功能,可在对话旁生成设计、演示文稿、文档、仪表盘或小型交互工具,支持画布编辑、链接分享(默认私有)和导出为 PowerPoint、PDF、HTML 等格式。

    推荐理由:官方页面对 Artifacts 及 Claude Design、Claude Slides、Claude Docs 的功能、协作与导出方式做了较完整说明,便于了解可用范围。

  12. CMU:Machine Learning Blog28

    CMU 在 NeurIPS 2025 展示 156 篇论文

    卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。

  13. Anthropic:The Institute(旗舰研究长文 · 网页)81

    Anthropic 发布 Claude Fable 5.1:面向编码与长时间智能体任务的新旗舰模型

    Anthropic 发布 Claude Fable 5.1,定位为其最强编码与知识工作模型,面向 Pro、Max、Team、Enterprise 用户及 Claude Platform、AWS、Google Cloud、Microsoft Foundry。

    推荐理由:官方页面给出定价、缓存降价、回退机制和客户实测引用,读者可以据此评估长时智能体与编码工作流的成本收益。

  14. Anthropic:The Institute(旗舰研究长文 · 网页)67

    Anthropic 发布 Claude Science 科研工作台公测版

    Anthropic 发布 Claude Science,一款面向科学家的 AI 工作台应用,目前为 macOS、Windows 和 Linux 上的公开 beta,面向 Pro、Max、Team 和 Enterprise 计划。

    推荐理由:官方产品页列出可复现分析、60+ 科学数据库连接和 HPC 计算管理等具体能力,读者可据此判断它对科研工作流的影响。

  15. World Labs:官网65

    World Labs 发布实时生成世界模型 RTFM 并开放研究预览

    World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可在用户交互时实时生成视频,现已以研究预览形式开放浏览器演示。RTFM 在单张 H100 GPU 上以交互帧率运行推理,不依赖显式 3D 表示,作为端到端训练的学习式渲染器工作;它将带位姿的帧作为空间记忆并通过 context juggling 检索邻近帧,使世界在长时间交互中持续存在而不丢失。

  16. World Labs:官网52

    李飞飞:空间智能是 AI 的下一个前沿

    李飞飞发表长文,提出空间智能是 AI 的下一个前沿,认为 LLM 擅长语言但在距离估计、物体旋转、物理预测等空间能力上远低于人类。她将世界模型概括为生成一致世界、接受多模态输入、根据动作预测下一状态三项核心能力,并介绍 World Labs 已向部分用户开放可通过多模态输入生成可探索 3D 环境的 Marble,应用将依次覆盖创作工具、机器人和科学研究。