ParVL: Alocação Dinâmica de Computação para Modelos Multimodais
Propõe uma nova estratégia de scaling para Multimodal LLMs que permite alocação flexível de computação entre componentes de visão e linguagem, em vez de usar uma configuração rígida. O framework resolve gargalos de memória e latência, permitindo otimizações específicas por tarefa com impacto direto na eficiência prática de modelos multimodais.
Ler artigo completo