WorldSonus 交互式视频到音频框架发布
热点事件持续更新
WorldSonus 交互式视频到音频框架发布
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Pengjun Fang 等作者提出并发布 WorldSonus,一个面向世界模型的交互式视频转音频框架,可实时合成空间音频,实时因子低至 0.41。 该框架采用流式因果自回归扩散架构,结合以音频为中心的描述流水线与分块索引提示词调度,支持在生成过程中动态操控声音事件。作者称,基于多源立体声与 ambisonic 数据的高质量立体声监督,WorldSonus 在声学质量与空间对齐上匹配或超越当前双向模型。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
WorldSonus:为世界模型带来声音报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.AIWorldSonus:为世界模型带来声音
WorldSonus 是一个面向世界模型的交互式视频转音频框架,可实时合成空间音频,实时因子低至 0.41。它采用流式因果自回归扩散架构,并通过以音频为中心的描述流水线与分块索引提示词调度,支持在生成过程中动态操控声音事件。基于多源立体声与 ambisonic 数据的高质量立体声监督,WorldSonus 在声学质量与空间对齐上匹配或超越当前双向模型。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。