Confiabilidade de LLMs em Raciocínio Probabilístico
Estudo investigando as capacidades de raciocínio probabilístico de modelos de linguagem grandes através de benchmarks com problemas discretos. Modelos alcançam 96% de acurácia em problemas padrão mas apenas 59% em problemas contra-intuitivos, revelando limitações críticas em raciocínio probabilístico que afetam aplicações práticas.
Ler artigo completo