O projeto LLACA e seu dataset atual
O projeto LLACA (LLM Assimilation of Cultural Aspects) nasceu em novembro de 2025 como um ecossistema de colaboração científica franco-chileno de alto nível, com pesquisadores da Universidade do Chile, da equipe-projeto ALMAnaCH do Centro Inria de Paris, na França, e da Inria Chile.
Este projeto de pesquisa foi idealizado no âmbito do Centro Binacional Franco-Chileno de Inteligência Artificial, centro criado pelo Ministério de Ciência, Tecnologia, Conhecimento e Inovação do Chile e pela Inria no final de 2024 e operado pela Inria Chile.
O objetivo do LLACA é desenvolver e validar metodologias sistemáticas para avaliar e integrar aspectos culturais em grandes modelos de linguagem, com ênfase na representação de conhecimentos e valores latino-americanos, de modo que estabeleça as bases para:
- Reduzir vieses culturais em modelos de linguagem de uso global
- Melhorar a representação de perspectivas latino-americanas em tecnologias de IA
- Desenvolver padrões de avaliação cultural para sistemas de IA
- Fomentar o desenvolvimento de tecnologias de IA que respeitem a diversidade cultural
E por que LLACA?
A llaca, yaca ou marmosa elegante ou kun guuma é uma espécie de marsupial didelfimorfo da família Didelphidae, própria da América do Sul e, em particular, do Chile.
Muito poucas pessoas conhecem essa espécie de marsupial — uma das quatro espécies de marsupiais que existem no Chile — nem sabem que ela pode ser chamada ou escrita como llaca, yaca, marmosa elegante ou kun guuma.
As IAs generativas mais conhecidas também não sabem, e quando geram um texto descritivo para explicar “O que é uma llaca?”, produzem erros na descrição. Ao usar os outros nomes do mamífero, as IAs generativas se complicam ainda mais.
É por isso que na Inria Chile decidimos chamar nosso projeto dedicado à avaliação dos grandes modelos de linguagem de LLACA (também porque é o acrônimo de LLM Assimilation of Cultural Aspects).
O objetivo da Datathon Regional é simples: encontre a LLACA da sua cultura e envie as perguntas e respostas que permitirão enganar os LLMs.
O Dataset atual do projeto LLACA
O LatamQA é um benchmark de conhecimento sociocultural sobre a América Latina, criado no âmbito do projeto LLACA para medir vieses culturais em modelos de linguagem. Parte de uma constatação: os modelos de pesos abertos mais conhecidos são treinados com dados do Norte Global e há poucos recursos para detectar vieses fora do inglês, em particular os referentes à América Latina.
- Combina o conteúdo da Wikipédia, a estrutura do grafo de conhecimento do Wikidata e critério especializado de ciências sociais para gerar pares de pergunta/resposta sobre a cultura popular e social de diferentes países da região.
- Foram extraídas mais de 26 mil perguntas a partir de cerca de 26 mil artigos da Wikipédia, convertidas em perguntas de múltipla escolha em espanhol e português e, em seguida, traduzidas para o inglês. A versão final do benchmark fica em 23.499 perguntas de múltipla escolha que cobrem 20 países latino-americanos.
O código e os dados estão publicados no GitHub e no Hugging Face.
Desconhecimento das culturas latino-americanas nos grandes modelos de linguagem: os primeiros achados do projeto
A equipe de cientistas do LLACA busca estabelecer padrões reproduzíveis que permitam medir a assimilação cultural em sistemas de IA e desenvolver técnicas de integração de conhecimento cultural que possam ser aplicadas em escala global.
Os resultados obtidos até agora:
- Construção da base de conhecimento: Seleção de regiões de interesse e coleta massiva de artigos por meio de análise de categorias e enciclopédias digitais.
- Curadoria e filtragem especializada: Validação manual por especialistas e design de um modelo automatizado.
- Geração controlada de dados: Criação de conjuntos de perguntas e respostas utilizando os artigos selecionados como contexto exclusivo.
- Integração de abordagens teóricas: Experimentação com diversas definições de cultura (antropológica, sociológica, simbólica) para orientar a geração de informações.
- Mitigação de alucinações: Implementação de instruções técnicas e critérios rigorosos para evitar a invenção de dados.