HuggingFace Daily Papers(社区热门论文)·· 14 小时前AI 评分41
VoxMem:面向大型音频语言模型的多模态记忆基准
VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models
AI 导读
研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。
来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co