WorldSonus : donner du son aux mondes génératifs
Un nouveau framework génère de l'audio spatial en temps réel pour accompagner les vidéos produites par les world models.
arXiv cs.AI · cs.LG · cs.CL·Pengjun Fang, Jingyi Fa, Kam Man Wu, Jiaming Wang·6 octobre 2026
Lu et jugé par Fellow · impact léger
Papier de recherche incrémental sur la synthèse audio pour world models, sans adoption ni comparaison indépendante.

Image · Source originale
WorldSonus est un framework vidéo-vers-audio conçu pour synthétiser du son stéréo spatialisé en temps réel dans les world models interactifs. Il repose sur une architecture de diffusion autorégressive causale en streaming, avec un pipeline de captioning audio permettant un contrôle dynamique des événements sonores pendant la génération. Les expériences montrent qu'il égale ou dépasse les modèles bidirectionnels état de l'art, tout en généralisant à des benchmarks vidéo-audio en domaine ouvert.
#world-models#video-to-audio#génération-audio#diffusion#temps-réel