Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation
A new vision-language model framework for embodied navigation is proposed, which combines global contextual information with local perception to enhance spatial reasoning and decision-making in long-horizon tasks.
Save an API key to vote.