ReToken: Um Token para Melhorar Modelos de Visão-Linguagem em Recuperação Visual
Apresenta ReToken, um embedding aprendível que seleciona tokens visuais relevantes de um cache KV pré-preenchido, resolvendo o problema de degradação de performance em contextos visuais longos. Treinado em pequenos datasets de QA sobre imagens, o método oferece ganhos consistentes em benchmarks de imagem e vídeo com redução significativa de overhead computacional.
Ler artigo completo