MOSS Transcribe Diarize 0.9B 语音转写与说话人分离模型上线
MOSS-Transcribe-Diarize 0.9B 是一个端到端音频模型,可在单次推理中完成语音转写、说话人标注和时间戳,把多人长录音整理成结构化的"谁说了什么"。
MOSS-Transcribe-Diarize 0.9B 是一个端到端音频模型,可在单次推理中完成语音转写、说话人标注和时间戳,把多人长录音整理成结构化的"谁说了什么"。
工业搜索与推荐系统正引入 LLM 与多模态架构来缓解冷启动和长尾问题。YouTube 用 RQ-VAE 将 VideoBERT 内容嵌入压缩为 Semantic IDs。
Andrej Karpathy 以一张奥巴马踩在体重秤上的照片为例,说明人类半秒内就动用了 3D 场景结构、镜子造成的视觉混淆、人物身份、物体可供性、物理规律、他人心理状态乃至"对他人心理的推测"等海量知识,而当前计算机视觉只靠 ImageNet 分类、Pascal VOC 检测、姿态估计、动作识别等彼此割裂且仅"半可用"的任务来评测。
Andrej Karpathy 撰文回顾 2014 年 ILSVRC,他亲自标注 1500 张测试集图像,得到 5.1% 的错误率,比冠军 GoogLeNet 的 6.8% 低约 1.7%(p = 0.022,统计显著)。他分析了双方错误类型:GoogLeNet 更易在过小过细物体、滤镜、抽象表现上出错,人则在细粒度识别(如 120 多种狗)和类别不熟悉上错误更多,并开源了标注界面供读者自行体验。
研究团队提出 VoxPolyMem,一个面向多方语音对话的交互感知多模态记忆框架,结合增量说话人识别与交互记忆、事实记忆、参与者画像三层记忆结构,并将检索建模为智能体顺序决策。
研究团队提出 OmniTaskonomy 统一分类体系,覆盖 19 项图生图(I2I)生成任务与 25 项图生文(I2T)理解能力,系统探究视觉生成监督何时以及如何提升视觉理解。
研究者提出异步 LLM 框架,让用户或智能体自身定义具有重叠内存状态的推理协程,从而把 LLM 从"读取—思考—回复"的串行循环推广为可适应多种并发类型的通用异步智能体。实验显示 Qwen 3.x 模型无需任务特定训练,即可完成流式视频理解、电子游戏和监控等异步任务。
研究者提出 Grounded Entity Biographies(GEB)长视频记忆框架,将同一物理实例在不同片段中的视觉观察归组为可检索的"传记",并在问答时与情节证据一同检索。
LEGO-Anything 是一个 Image-to-Code 框架,让编码智能体迭代编写并执行 Blender 代码、检查场景与渲染结果并修订程序,把单图重建的 3D 场景表示为可检查、可编辑、可查询的场景程序。
研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。
PanoVLN 用 4B 骨干网络和纯 RGB 输入做全景视觉语言导航,在 R2R-CE 和 RxR-CE Val-Unseen 上成功率分别超越此前 SOTA 11.9% 和 8.7%。
研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。
论文提出 Omni-IO Skills,一个即插即用的 Agent Harness,通过分层 Skills、标准化多模态执行接口、依赖感知编排和持久化 Asset Registry,让现有 Agent 无需改动推理核心即可原生处理多模态任务。
MemEvo 是 LLM 驱动的自动研究框架,把流式视频记忆设计转化为可执行记忆程序的搜索问题,用预训练 LLM 迭代生成并优化候选记忆程序,底层视觉语言模型全程冻结。
针对多模态强化学习中视觉敏感度与主张可撤回性的脱节问题,研究者提出持久性感知信用门控(PACG),通过衰减异常持久视觉主张的正向信用来修正信用分配。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 的九基准三种子平均分从 58.1% 提升至 59.9%,VPPO 从 59.8% 提升至 60.9%,同时使无图像支持的主张更易撤回,且无需标注、不增加推理成本。
研究团队提出 AVIO,通过源条件特征调制改造预训练文本到音视频生成模型,让单一模型同时学会添加和移除发声物体,并支持仅凭指令编辑或可选视觉引导。配套数据集 AVIOBench 包含 37.9 小时配对音视频样本、覆盖 1,878 个目标物体名称,用共享身份与视觉掩码关联物体的视觉存在与声音贡献。参考帧课程训练逐步减少参考条件,使模型在添加物体时可通过可选参考控制外观与位置。
研究者提出 Protein-TetSphere,一种按残基配准的蛋白质体积表征:将每条蛋白链四面体化,得到各残基的局部体积区域,再配准到共享固定拓扑的四面体参考并在统一 Laplacian 基下表示,从而建立跨残基一致的体积坐标。
研究者提出 MERID 框架,通过基于经验的递归自我改进(RSI)自动开发抑郁症预测流水线,包含 Grounded State Construction、Coupled Pipeline Exploration 和 Evidence-Guided Evolution 三个组件。在抑郁症基准上,MERID 在多项任务上优于多模态与智能体基线,分析还显示声学与语言线索对抑郁症检测有价值,代码已开源。
研究者提出 FigAct 框架,将静态科学图表转化为按问题定制的可视化演示,直接在图表现有图形元素上施加视觉动作以引导读者注意力。其分层搜索策略将元素定位的 token 消耗降低约 40 倍,并基于 grounding 准确率、搜索效率和渲染质量三项奖励训练出 FigAct-8B。团队还构建了经人工核验的真实论文图表 benchmark,用于评估 MLLM 生成有据可依的视觉解释的能力。
研究者推出 GeoOutageBench,一个评估 LLM 地理时空 KGQA 的基准,其时空知识图谱融合停电记录、遥感、气象观测、风暴与电力事件、地理实体及领域本体等多模态数据。
EnergyEminence 是一个早期测试平台,将 IEEE 118-bus 风格的图时序预测器、非线性 AC 级联仿真与类操作员仪表盘的时间回放耦合,并提出共享有界校准,把野火检测置信度与空间范围转换为来源可比的野火可解释证据。
研究者提出物理驱动的跨模态掩码自编码器 CM-MAE,用于地震数据到测井的表示学习,将地震体与测井深度片段联合 token 化,并用四轴旋转位置嵌入映射到连续物理坐标。
该论文研究面向组织化信号集的神经网络编码器,可将异构采样的信号集投影到任意固定大小的向量空间,使信号集能作为向量处理而消除采样差异。研究以波形分离为重点,通过信号集判别能力评估表示相关性,编码与嵌入判别实验仅使用合成复值射频信号。
研究提出"感知计算的决定价值"概念,定义为输入从廉价感知模式升级到昂贵模式时下游损失的变化,并指出该价值可能为负。为此推出 DEEP 基准,在 KITTI 和 nuScenes 上以已部署的单目几何模型评估升级前分配器,发现 34–54% 改变下游损失的升级反而使其变差。按感知增益而非决定价值选择固定信号,会使实际测试决策增益平均下降全廉价损失的 7.4%。
彭博社马克·古尔曼称,苹果计划于当地时间 10 月 13 日推出首款智能家居控制中枢(Home Hub),以及 2027 款 HomePod mini 和新款 Apple TV。
哔哩哔哩 Index LLM 团队发布基于 Qwen3.5 的 Index-Translate 多语言翻译模型家族,2B / 9B / 35B-A3B(preview)权重已在 Hugging Face 与 ModelScope 开放。
研究用相同刺激(一个伪词加两张图片)对比了视觉语言模型与 53 名人类的选择和眼动,发现部分较大 VLM 的选择与人类一致,但其显著性图与人类注视的吻合度低于图像中心的固定高斯基线。用人类选择微调小 VLM 可让其在未见词和图像上的选择对齐达到人类多数投票参考水平,但注意力仍不及该基线;用人类注视训练模型注意力能提升注意力—注视相关性,却不改善选择对齐。
研究用探针、对比方向和表征相似度考察 Gemma 4 31B 对九种非洲语言及三种对照语言的表征,发现非洲语言间的"非洲 vs 西方"对比方向在多个层上比它们与对照语言更对齐,跨语系比较在十二层中的五层通过 Holm 阈值。
研究测量了英语、豪萨语和约鲁巴语在四个语言模型中的情感方向可复现性,使用最终 token 时 split-half 一致度分别为 0.737-0.870、0.589-0.762 和 0.101-0.399,该语言排序在全部 77 组完整模型对比中保持一致。基于相同层训练的分类器预测情感始终高于随机水平,表明预测准确率并不代表方向一致性。研究未证实分词生育率是跨语言差异的成因。
研究者提出 VisKG,一个用强化学习让模型把视觉内容转译为问题特定知识图谱(KG)表示的框架,过滤感知噪声并保留链式推理所需的实体-关系结构,所需 token 少于基于 caption 的表示。VisKG 采用 GDPO 稳定 RL 后训练,并用负向推理样本加强监督阶段;在科学、数学和通用视觉理解基准上表现与基线相当或更优,GDPO 训练版本平均准确率比 GRPO 版本高 2%。
研究提出由 story agent、image agent 和 critic agent 协作的多智能体框架,在科学、健康、娱乐领域生成超 9,000 条配对多模态假新闻帖,并基准测试 16 个开源与闭源 MLLM 的自动检测能力。结果显示多数模型准确率远低于人类水平,在识别图像真实性上尤其失败。代码与数据已发布于 GitHub,论文被 EMNLP 2026 Findings 接收。
World Labs 宣布已签署最终协议加入 AMD,交易预计在 2026 年底前完成,尚需监管批准。双方自去年起在 AMD GPU 上的模型训练与推理优化方面开展技术合作。
推荐理由:收购方与被收购方核心人事和交易时间都由当事方直接说明,读者可以据此了解 World Labs 并入 AMD 后的研究安排。
World Labs 发布下一代世界模型 Atlas,一个从零预训练的全能模型,可原生处理文本、图像、视频和 3D。
World Labs 上线 Marble Labs,汇集 Marble 在影视 VFX、虚拟制片、游戏、AR/VR 等场景的项目案例与构建教程。
Suno 发布 Studio 2.0,为浏览器端 DAW 带来 MIDI 导入录制与编辑、wavetable 合成器、Chat(beta)、高级 stem 分离、音频效果与自定义插件以及自动化功能。MIDI 片段还可作为音频生成的提示词,Premier 订阅者可无限导出 32-bit/48kHz 多轨与 stems。
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG 和 Believe 等行业伙伴合作开发,官方称其更快、更具表现力且质量更高。
推荐理由:原文给出 v6 三个模型分工、具体编辑控制能力和与 Warner Music Group 等的合作背景,读者可据此评估其创作工作流的变化。
Sarvam AI 发布印度语言 ASR 评估实践指南,指出 WER/CER 等为英语设计的指标在口语变体、code-mixing、数字多写法等六类场景下会把正确转写误判为错误。
Sarvam AI 汇总首届 Sarvam Epoch 活动上发布的全部内容,覆盖模型、推理、Agent 平台与硬件。
Sarvam AI 发布语音识别模型 Saaras V4,采用音频编码器加 3B 混合状态空间 LLM 解码器的架构,解码器完全从零自研训练。
Sarvam AI 发布 Sarvam Vision 2.1,在 olmOCR-Bench(87.3)与自研 Indic OCR Bench(总体准确率 87.39)上取得领先成绩。