OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue

The OmniVChat paper introduces OmniVChat-Studio, a multi-agent data engine for synthesizing audio-visual dialogues, and OmniVChat-Bench, an evaluation benchmark for omni models. The paper also presents OmniVChat-RL, a reinforcement learning reward design for improving omni model performance.

RSS Score 0 9/21/2026, 4:00:00 AM Original Source
Save an API key to vote.