Skip to main content
GameDev.net gamedev.net
2 sources covering this story

MoSAT: Human Motion Generation from Spatial Audio and Textual Description

arXiv cs.GR details MoSAT, a motion-synthesis model that uses spatial audio plus text to drive full-body animation. The team pairs it with STAM, a new dataset of motion sequences, directional sound, and rich annotations, aiming for more precise and temporally coherent character responses.

First reported 2 days, 10 hours ago animation motion synthesis spatial audio ai
Want to discuss what this means for developers?
Open discussion
PRIMARY SOURCE
arXiv cs.GR arXiv cs.GR

MoSAT: Human Motion Generation from Spatial Audio and Textual Description

2 days, 10 hours ago Read source
arXiv cs.GR arXiv cs.GR 0% match

Intervention, Not Shared Latents: Blocking Visual Shortcuts in Audio-Video Generation

2 days, 10 hours ago Read source