UrbanGround: Do agentes multimodais conseguem navegar cidades reais?
Primeiro sandbox para testar se modelos de linguagem multimodais conseguem transformar percepção visual local em ação confiável em cidades reais, construído a partir de dados geoespaciais 3D de Hong Kong. Avalia os limites práticos de agentes MLLM em ambientes urbanos complexos com restrições físicas. Impacto direto para robótica, navegação autônoma e IA embodied em cenários urbanos.
Ler artigo completo