Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation

A new vision-language model framework for embodied navigation is proposed, which combines global contextual information with local perception to enhance spatial reasoning and decision-making in long-horizon tasks.

RSS Score 0 9/17/2026, 4:00:00 AM Original Source
Save an API key to vote.