跳到正文
热点事件持续更新

WorldSonus 交互式视频到音频框架发布

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Pengjun Fang 等作者提出并发布 WorldSonus,一个面向世界模型的交互式视频转音频框架,可实时合成空间音频,实时因子低至 0.41。 该框架采用流式因果自回归扩散架构,结合以音频为中心的描述流水线与分块索引提示词调度,支持在生成过程中动态操控声音事件。作者称,基于多源立体声与 ambisonic 数据的高质量立体声监督,WorldSonus 在声学质量与空间对齐上匹配或超越当前双向模型。

AI 根据报道生成 · 2 小时前更新

最新进展10月7日 12:00
WorldSonus:为世界模型带来声音

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    WorldSonus:为世界模型带来声音

    WorldSonus 是一个面向世界模型的交互式视频转音频框架,可实时合成空间音频,实时因子低至 0.41。它采用流式因果自回归扩散架构,并通过以音频为中心的描述流水线与分块索引提示词调度,支持在生成过程中动态操控声音事件。基于多源立体声与 ambisonic 数据的高质量立体声监督,WorldSonus 在声学质量与空间对齐上匹配或超越当前双向模型。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。