${M}^2$Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models
Researchers propose a new action tokenization method, M^2Tok, to improve the performance of Vision-Language-Action (VLA) models. The approach decomposes latent action features into multiple heads and assigns independent codebooks for quantization, leading to better reconstruction fidelity and higher success rates in VLA tasks.
Save an API key to vote.