跳到正文

#多模态

今日 15 条
今天10月1日周四
  1. Artificial Analysis67

    Artificial Analysis 评测称 GPT-6.1 Sol 推高了 OpenAI 模型的成本效率前沿。max effort 下每 Intelligence Index 任务成本 $0.72,不到 GPT-6 Astra($3.26)的四分之一,比 GPT-6 Sol($1.04)低 31%,比 GPT-5.6 Sol($1.99)低 64%。

    推荐理由:第三方评测给出 GPT-6.1 Sol 与多款前代模型的具体成本对比数字,读者可据此评估 OpenAI 模型的性价比变化。

  2. HuggingFace Daily Papers(社区热门论文)40

    IDSpect:用 IDS 分解与细粒度奖励提升中文文本渲染精度

    针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并训练专家 IDS 识别器对齐裁剪级视觉预测,配合整字语义奖励提供部件与空间关系的细粒度反馈。

  3. HuggingFace Daily Papers(社区热门论文)39

    ThinkV2V:释放 MLLM 推理能力,实现指令引导的视频编辑

    ThinkV2V 是一个推理驱动的指令引导视频编辑框架,在视觉生成前显式激活 MLLM 思考,通过 MLLM-to-DiT 架构将思考转化为精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并构建了 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,显著超越更大的 10B 规模基线。

  4. HuggingFace Daily Papers(社区热门论文)49

    WorldAuditBench:用多模态智能体审计交互式 3D 世界

    研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五个前沿模型,两种审计范式的成功率仅 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。

  5. Google DeepMind:Blog(RSS)77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。

    推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。

  6. Nature:Machine Learning 主题(RSS)49

    语音“衰老时钟”:AI 通过声音特征评估衰老速度

    科学家开发出一款“语音时钟”,通过音高、语速等数百项声音特征预测人的年龄,并计算“语音年龄差”。研究基于阿根廷、智利、哥伦比亚、墨西哥和秘鲁 2928 名西班牙语使用者的录音,用机器学习提取 700 多项随衰老和痴呆变化的语音特征。较大的语音年龄差与痴呆等认知问题强烈相关,成果已发表于 Science Advances。

  7. Rohan Paul59

    Vivix Labs 发布实时视频模型 A1 和 A1 Playground + Agent,可创建能对话、移动、玩游戏的直播 AI 角色。模型将音频和视频作为同一个小片段流一起生成,语音和动作属于同一分块,因此用户可在对话中打断角色、变换话题或让其走动,无需协调两个独立系统。入口:https://platform.vivix.ai/vivix-a1-model/

    引用Vivix.AI@VivixLabs_HQ

    Create your own character. Call the shots. Live. Introducing A1 Playground + Agent: build a live AI character that talks, moves, and plays with you. Create yours: https://platform.vivix.ai/vivix-a1-model/ Their look. Their personality. Their voice. Your choice. Describe who you have in mind, upload a picture, and let our Agent bring them to life. And they do a lot more than talk. 💃 Full-body performance. From air guitar to victory dances. 🚶 Move around the scene. Walk and talk. Pace while making a point. 🛍️ Interact with objects. Pick up products, show them off, and pitch them. 🎮 Play web games together. Deal cards, keep score, and play along. Solve a mystery with Sherlock Holmes, then interrupt him for a dance break. Take a walk with Socrates. Hand him a protein shake and debate the meaning of gains. Give Snape a bottle of shampoo. Ask for the most enthusiastic sales pitch of his life. Who will you bring to life?

9月30日周三
  1. xAI:News(网页)64

    xAI 将 Grok 4.5 推向 iOS、Android、网页和 X 平台

    xAI 宣布其最强模型 Grok 4.5 当日起在 grok.com、X 以及 iOS 和 Android 应用上可用。官方称该模型更准确理解提问、能跟踪更长对话并更快给出答案,可完成制作电子表格、把大纲转为幻灯片和图表、撰写文稿、提炼长 PDF 要点等任务,并通过 Microsoft 365 插件在 Word、Excel、PowerPoint 和 Outlook 中直接使用。

    推荐理由:xAI 官方说明 Grok 4.5 的能力改进和全平台可用范围,读者可据此评估在日常问答和知识工作中的使用方式。

  2. Suno:Blog(网页)76

    Suno 发布 v3 音乐模型

    Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。

    推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。

  3. Suno:Blog(网页)64

    Suno 发布 v4.5 音乐模型,曲风更准、人声更丰富、歌曲最长 8 分钟

    Suno 发布最新音乐模型 v4.5,带来更动态的音乐、更准的曲风与曲风混搭、更丰富的人声表现。新功能包括提示词增强助手、Covers 与 Personas 组合使用,歌曲长度可达 8 分钟,生成速度和音频质量均有提升。

    推荐理由:官方列出了 v4.5 在曲风、人声、提示词理解和生成速度上的具体改进,适合关注 AI 音乐生成的读者了解能力变化。

  4. Suno:Blog(网页)61

    Suno 发布升级版 Song Editor 与 stem 拆分等创作控制功能

    Suno 推出升级版 Song Editor,可在波形上逐段重排、重写和重制曲目,并可将曲目拆分为 12 个干净 stem 供预览和下载。同时支持最长 8 分钟的整曲上传,新增三个创意滑块控制生成风格,可继续在 DAW 中编辑或在 Suno 内完成曲目。

    推荐理由:官方介绍升级版 Song Editor、12 轨 stem 拆分和 8 分钟上传等新能力,可帮助创作者评估其在音乐工作流中的用法。

  5. Sarvam AI(网页)42

    Sarvam AI 推出 Sarvam Studio:面向多语言内容转换的智能体平台

    Sarvam AI 推出 Sarvam Studio,一个将语音、文本和文档工作流整合到同一工作空间的多语言内容转换平台,支持 AI 视频配音与智能体文档翻译。其配音在约 280 次与 ElevenLabs、YouTube Dub、Rask AI 的盲测对比中获得最高整体偏好,说话人相似度平均得分 0.88。该平台目前通过受控早期 beta 向政府、教育、媒体和出版领域的少量生产合作伙伴开放。

  6. LlamaIndex:产品、工程与评测32

    智能 OCR:构建生产级文档理解系统

    智能 OCR 将传统字符识别与机器学习、版面感知、语义抽取和校验逻辑结合,把文档转成结构化数据而非原始文本,并支持字段级置信度评分与规则校验。相比传统 OCR 输出扁平文本、遇到未见版式即失效,它可跨版面泛化、支持手写内容,并逐步演进到能自我验证、处理歧义的智能体文档工作流。

  7. LlamaIndex:产品、工程与评测35

    智能文档处理平台:多数厂商做错了什么

    多数智能文档处理(IDP)平台在演示中表现良好,但在生产环境中因文档多样性而失效,演示与生产的准确率差距常达 10 到 20 个百分点,98% 的干净 PDF 提取准确率在实际收件中可能降至 82%。传统平台依赖模板,模板数量会随文档种类增长而不断累积,且普遍忽略图表、示意图、图像等非文本内容。新一代方案采用 LLM 编排层,将文本、表格、图表分别路由给 OCR、版面感知提取和视觉语言模型处理。

  8. LlamaIndex:产品、工程与评测42

    为什么 VLM 读不懂表单?LlamaParse 用 JSON 结构化解析表单

    LlamaIndex 解析了 VLM 处理表单的失败模式:VLM 面向通用推理优化,推理能力提升并不能改善解析结果,且成本高、可靠性差。LlamaParse 专为文档与表单理解构建,将表单表示为含 id、label、field、value 的字段与 section 嵌套树,输出 JSON,以更低成本超越通用 VLM。表单的复选框勾选状态等细微错误会完全改变下游智能体的动作。

  9. LlamaIndex:产品、工程与评测22

    应付账款 OCR 指南:优势、挑战与最佳实践

    LlamaIndex 提出将 OCR 融入更广泛的解析与索引框架,用 VLM 文档解析、机器学习和结构化解析把发票转为可校验的结构化财务数据,而非只做字符识别。该方案称可提升准确率、降低成本、把处理周期从数天缩短到数分钟,并支持行项目级提取与审计追溯。

  10. LlamaIndex:产品、工程与评测35

    什么是 Agentic OCR?智能文档自动化的下一次进化

    Agentic OCR 将推理、验证与自适应模型选择引入文档处理流程,以目标导向的智能体循环取代传统 OCR 的一次性提取。它用多模态语言模型作为推理层,通过视觉定位(bounding box)让每个抽取字段可回溯到原文位置,并自动识别文档类型、无需模板即可适配新格式。相比传统 OCR 与 IDP,它在版面变化时自动适应、能自我纠错并输出带引用的校验结果,新文档类型的接入从数周配置缩短到数分钟。

  11. LlamaIndex:产品、工程与评测33

    Agentic AI 如何提升文档抽取准确率与自动化水平

    Agentic 文档抽取把文档处理当作推理任务,通过"规划-执行-验证"循环先识别文档类型与逻辑结构,再抽取数据并自查结果,可捕获 OCR 高置信度但语义不合理的错误。LlamaParse 对每份文档同时校验视觉布局与语义内容,并用视觉定位将文本绑定到页面坐标,从而区分格式相同的金额或日期字段。该方式无需为 500 种发票格式分别维护模板,可动态推断表头与单元格关系。

  12. LlamaIndex:产品、工程与评测15

    LlamaIndex 的使命与故事:打造最强的智能体文档 OCR

    LlamaIndex 的使命是自动化知识工作,从最难的前沿——文档入手,打造全球最强的智能体文档 OCR,把杂乱的多模态文档转化为结构化、可靠的数据。通过 LlamaAgents,开发者与企业可围绕文档构建从摄取、抽取到推理与自动化的可靠工作流。团队规模虽小,但强调交付经过深思、可靠且可扩展的生产级产品。