Gaze Heads: Como Modelos de Visão-Linguagem Olham para o que Descrevem
Pesquisadores descobriram que modelos de visão-linguagem desenvolvem cabeças de atenção especializadas (gaze heads) que rastreiam as regiões da imagem sendo descritas em tempo real. O achado oferece insights sobre interpretabilidade de VLMs e como esses modelos internamente coordenam descrição visual com geração de linguagem.
Ler artigo completo