不同分词生育率语言间的概念方向可靠性研究
研究测量了英语、豪萨语和约鲁巴语在四个语言模型中的情感方向可复现性,使用最终 token 时 split-half 一致度分别为 0.737-0.870、0.589-0.762 和 0.101-0.399,该语言排序在全部 77 组完整模型对比中保持一致。基于相同层训练的分类器预测情感始终高于随机水平,表明预测准确率并不代表方向一致性。研究未证实分词生育率是跨语言差异的成因。
研究测量了英语、豪萨语和约鲁巴语在四个语言模型中的情感方向可复现性,使用最终 token 时 split-half 一致度分别为 0.737-0.870、0.589-0.762 和 0.101-0.399,该语言排序在全部 77 组完整模型对比中保持一致。基于相同层训练的分类器预测情感始终高于随机水平,表明预测准确率并不代表方向一致性。研究未证实分词生育率是跨语言差异的成因。
研究者提出 VisKG,一个用强化学习让模型把视觉内容转译为问题特定知识图谱(KG)表示的框架,过滤感知噪声并保留链式推理所需的实体-关系结构,所需 token 少于基于 caption 的表示。VisKG 采用 GDPO 稳定 RL 后训练,并用负向推理样本加强监督阶段;在科学、数学和通用视觉理解基准上表现与基线相当或更优,GDPO 训练版本平均准确率比 GRPO 版本高 2%。
研究提出由 story agent、image agent 和 critic agent 协作的多智能体框架,在科学、健康、娱乐领域生成超 9,000 条配对多模态假新闻帖,并基准测试 16 个开源与闭源 MLLM 的自动检测能力。结果显示多数模型准确率远低于人类水平,在识别图像真实性上尤其失败。代码与数据已发布于 GitHub,论文被 EMNLP 2026 Findings 接收。
World Labs 宣布已签署最终协议加入 AMD,交易预计在 2026 年底前完成,尚需监管批准。双方自去年起在 AMD GPU 上的模型训练与推理优化方面开展技术合作。
推荐理由:收购方与被收购方核心人事和交易时间都由当事方直接说明,读者可以据此了解 World Labs 并入 AMD 后的研究安排。
World Labs 发布下一代世界模型 Atlas,一个从零预训练的全能模型,可原生处理文本、图像、视频和 3D。
World Labs 上线 Marble Labs,汇集 Marble 在影视 VFX、虚拟制片、游戏、AR/VR 等场景的项目案例与构建教程。
Suno 发布 Studio 2.0,为浏览器端 DAW 带来 MIDI 导入录制与编辑、wavetable 合成器、Chat(beta)、高级 stem 分离、音频效果与自定义插件以及自动化功能。MIDI 片段还可作为音频生成的提示词,Premier 订阅者可无限导出 32-bit/48kHz 多轨与 stems。
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG 和 Believe 等行业伙伴合作开发,官方称其更快、更具表现力且质量更高。
推荐理由:原文给出 v6 三个模型分工、具体编辑控制能力和与 Warner Music Group 等的合作背景,读者可据此评估其创作工作流的变化。
Sarvam AI 发布印度语言 ASR 评估实践指南,指出 WER/CER 等为英语设计的指标在口语变体、code-mixing、数字多写法等六类场景下会把正确转写误判为错误。
Sarvam AI 汇总首届 Sarvam Epoch 活动上发布的全部内容,覆盖模型、推理、Agent 平台与硬件。
Sarvam AI 发布语音识别模型 Saaras V4,采用音频编码器加 3B 混合状态空间 LLM 解码器的架构,解码器完全从零自研训练。
Sarvam AI 发布 Sarvam Vision 2.1,在 olmOCR-Bench(87.3)与自研 Indic OCR Bench(总体准确率 87.39)上取得领先成绩。
微软推出 MAI-Code-1.1-Flash 模型,已用于 GitHub Copilot,在命令行编码和 .NET 开发任务上表现提升,用更少 token 完成任务且成本低于 6 月版本。微软还发布开源智能体框架 Orchard,为训练和评估能写代码、浏览网页的 AI 智能体提供可复用环境。此外,微软研究模型 CARE-X 可将多项放射学任务整合,在胸部 X 光任务和真实患者数据上表现良好。
MiniMax 与 Agora 在 Anime Japan 周期间于东京合办了一场面向企业的闭门峰会,聚焦将 AI 角色从概念演示推进为可部署的企业级产品。Agora 展示了实时交互的超低延迟基础设施,MiniMax 则展示了其模型层能力,包括情感丰富的 TTS、多模态生成与细腻的角色表达。
MiniMax 在哈佛大学 HXR 2026 大会上展示了覆盖文本、语音、视频和音乐的多模态 AI 模型套件,可将 XR 开发中分散的工具整合为单一 API 平台。其模型可应用于医疗手术训练、旅游虚拟导览、神经科学数据三维可视化及语音驱动交互培训等场景。Gibran Mourani 代表 MiniMax 演讲,并担任该会议首届路演竞赛的 14 位评委之一。
MiniMax 在 WaytoAGI 东京全球 AI 大会上介绍了其多模态智能体与人类-AI 协作思路:Talkie、MiniMax Agent、Hailuo AI 及音频音乐平台共用同一自研模型栈,并通过开放 API 向外部伙伴开放同等能力。
MiniMax 正式开源下一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频的多模态统一理解,可生成最长 15 秒、768p(经 H3-Regenerate-2K 可达 2K)、24 FPS 并带 32 kHz 立体声音频的视频。
推荐理由:官方开源公告给出了完整的三模块系统结构、模型规格和本地部署方式,读者可以据此评估在自己的视频生成流程中如何接入。
Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线,并向部分用户开放私有 API 预览。
推荐理由:官方披露了预训练效率、RL 与测试时推理三条扩展路径的具体结果,以及 Apollo Research 关于评估意识的独立发现,可据此了解其技术栈现状。
Meta AI 推出 Brain2Qwerty v2,可从非侵入式脑记录(MEG)实时解码完整句子,词准确率 61%,远高于其他非侵入式方法的 8%,最佳参与者达 78%。
Meta 介绍其开源模型 Segment Anything Model 3(SAM 3)和 DINOv3 成为由能源部 Genesis Mission 旗下 SYNAPS-I 项目分割管线的核心。
Meta Superintelligence Labs 发布 Muse Spark 1.1,一个面向智能体任务的多模态推理模型,在工具与计算机使用、编码和多模态理解上较 Muse Spark 有明显提升,支持 100 万 token 上下文管理和多智能体编排。
LlamaIndex 发布开源文档抽取基准 ExtractBench,覆盖 370 份企业文档(4,869 页)、8 个业务领域和 67 种文档类型,评测 14 个系统并联合评估长记录完整性、扫描与手写识别、字词级 grounding 和成本。
Liquid AI 发布 LFM2.5-VL-3B 视觉语言模型,已上架 Hugging Face。相比 LFM2-VL-3B,屏幕理解、函数调用、grounding 和多图输入显著提升,ScreenSpot-v2 达 80.7,ToolSandbox 从 26.4 升至 59.5,RefCOCO 从 57.1 升至 87.9。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以约 280M 参数(增加 8.9% 内存占用)换取更快解码,GPU 解码吞吐最高提升 2.66 倍、边缘设备最高 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍。
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,prefill 激活 8B、解码激活 16B,支持 1M token 上下文,采用 Causal Encoder-Decoder 架构与 Compressed Sparse Attention 2。
Goodfire Research 发布 Silico,一款用于机器人与视觉基础模型的物理 AI 研究工具,可在生成任何一帧前直接从潜空间验证模型是否学到真实物理结构。
Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。
CMU 团队提出 CowCorpus 数据集,包含 400 段真实人机协作网页会话和 4200+ 交错动作,用于训练智能体预测人类介入时机。基于该数据将介入预测建模为逐步二分类任务,用大型多模态模型监督微调,并聚类出 Takeover、Hands-on、Hands-off、Collaborative 四类用户交互模式。
CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。
CMU 研究者发布 CHAI,一个基于批判式人机监督的视频描述管线,与 100+ 专业视频创作者合作一年构建,对应 CVPR 2026 论文(Highlight,Top 3%)。
Black Forest Labs 发布早期版本 FLUX 3 多模态基础模型,联合训练图像、视频与音频,视频预测占训练算力超 95%。FLUX 3 骨干可解码动作预测,加入动作模态后视频质量先降最多 10%,3500 步后恢复原有水平。
推荐理由:官方给出训练细节与工厂实测数据,说明同一多模态骨干如何同时支持内容生成与机器人动作控制。
Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。
推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。
Black Forest Labs 宣布 FLUX 3 Video 初版正式开放,可通过 BFL API 和部分合作伙伴使用。模型支持最长 20 秒、HD(720p)与 Full HD(1080p,经上采样)的视频生成,并伴随生成原生音频;能力包括文生视频、图生视频与关键帧、视频续接(最多 4 秒)、单次生成多镜头、多语言对白与唇形同步、Draft Mode 低成本预览等。
推荐理由:原文给出具体生成时长、分辨率、多语言与评测结果,读者可据此判断 FLUX 3 Video 在视频生成工作流中的可用性。
Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。
MaLiang-Harness 是一个将 MLLM 驱动的视觉生成组织为持续构建、检查与修订过程的统一框架,用于弥合程序可执行但违反构图、外观或运动要求的 Program-to-Visual(P2V)差距。
Anthropic 宣布 Claude Design 现可在任意 Claude 对话中使用,包括 Claude Code 和 Artifacts 标签页,Claude Tag 支持即将推出。
推荐理由:原文给出可用范围、连接器和设计系统管理等具体变化,读者可据此判断它对设计到交付流程的影响。
白宫于 9 月 29 日宣布推出 AI 聊天机器人 America.gov,用于帮助民众查找政府服务和信息。Google 确认其 Gemini 模型参与该产品,美国政府首席设计官 Joe Gebbia 补充表示政府也使用了 Grok。文章同时提出疑问:大语言模型仍易产生幻觉,若民众依赖该聊天机器人获取食品券申请、签证续签或报税等信息,错误可能导致错过截止日期、福利被拒或罚款。
Airbnb 在秋季产品更新中上线 AI 搜索,用户可通过开关启用文本或语音提示搜索房源,系统会根据偏好显示动态筛选条件,例如输入 baby 会推荐婴儿床、游乐场等筛选,并用 AI 摘要对比心愿单房源。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
新加坡男子 Ye Lin 因用谷歌 Gemini 生成并传播鳄鱼出现在 Pandan 水库的虚假图片被起诉,最高面临 10 年监禁和 1 万新币(约合 52,585 元人民币)罚款。图片引发 PUB 与国家公园局搜寻鳄鱼并暂停水上活动,发现不实后 PUB 报案;Ye Lin 被控传播虚假信息及删除照片妨碍司法公正,将于 11 月 10 日再次出庭。