O projeto LLACA e seu dataset atual

O projeto LLACA (LLM Assimilation of Cultural Aspects) nasceu em novembro de 2025 como um ecossistema de colaboração científica franco-chileno de alto nível, com pesquisadores da Universidade do Chile, da equipe-projeto ALMAnaCH do Centro Inria de Paris, na França, e da Inria Chile.

Este projeto de pesquisa foi idealizado no âmbito do Centro Binacional Franco-Chileno de Inteligência Artificial, centro criado pelo Ministério de Ciência, Tecnologia, Conhecimento e Inovação do Chile e pela Inria no final de 2024 e operado pela Inria Chile.

O objetivo do LLACA é desenvolver e validar metodologias sistemáticas para avaliar e integrar aspectos culturais em grandes modelos de linguagem, com ênfase na representação de conhecimentos e valores latino-americanos, de modo que estabeleça as bases para:

  • Reduzir vieses culturais em modelos de linguagem de uso global
  • Melhorar a representação de perspectivas latino-americanas em tecnologias de IA
  • Desenvolver padrões de avaliação cultural para sistemas de IA
  • Fomentar o desenvolvimento de tecnologias de IA que respeitem a diversidade cultural
Llaca, marsupial do Chile

E por que LLACA?

A llaca, yaca ou marmosa elegante ou kun guuma é uma espécie de marsupial didelfimorfo da família Didelphidae, própria da América do Sul e, em particular, do Chile.

Muito poucas pessoas conhecem essa espécie de marsupial — uma das quatro espécies de marsupiais que existem no Chile — nem sabem que ela pode ser chamada ou escrita como llaca, yaca, marmosa elegante ou kun guuma.

As IAs generativas mais conhecidas também não sabem, e quando geram um texto descritivo para explicar “O que é uma llaca?”, produzem erros na descrição. Ao usar os outros nomes do mamífero, as IAs generativas se complicam ainda mais.

É por isso que na Inria Chile decidimos chamar nosso projeto dedicado à avaliação dos grandes modelos de linguagem de LLACA (também porque é o acrônimo de LLM Assimilation of Cultural Aspects).

O objetivo da Datathon Regional é simples: encontre a LLACA da sua cultura e envie as perguntas e respostas que permitirão enganar os LLMs.

O Dataset atual do projeto LLACA

O LatamQA é um benchmark de conhecimento sociocultural sobre a América Latina, criado no âmbito do projeto LLACA para medir vieses culturais em modelos de linguagem. Parte de uma constatação: os modelos de pesos abertos mais conhecidos são treinados com dados do Norte Global e há poucos recursos para detectar vieses fora do inglês, em particular os referentes à América Latina.

  • Combina o conteúdo da Wikipédia, a estrutura do grafo de conhecimento do Wikidata e critério especializado de ciências sociais para gerar pares de pergunta/resposta sobre a cultura popular e social de diferentes países da região.
  • Foram extraídas mais de 26 mil perguntas a partir de cerca de 26 mil artigos da Wikipédia, convertidas em perguntas de múltipla escolha em espanhol e português e, em seguida, traduzidas para o inglês. A versão final do benchmark fica em 23.499 perguntas de múltipla escolha que cobrem 20 países latino-americanos.

O código e os dados estão publicados no GitHub e no Hugging Face.

Desconhecimento das culturas latino-americanas nos grandes modelos de linguagem: os primeiros achados do projeto

A equipe de cientistas do LLACA busca estabelecer padrões reproduzíveis que permitam medir a assimilação cultural em sistemas de IA e desenvolver técnicas de integração de conhecimento cultural que possam ser aplicadas em escala global.

Os resultados obtidos até agora:

  • Construção da base de conhecimento: Seleção de regiões de interesse e coleta massiva de artigos por meio de análise de categorias e enciclopédias digitais.
  • Curadoria e filtragem especializada: Validação manual por especialistas e design de um modelo automatizado.
  • Geração controlada de dados: Criação de conjuntos de perguntas e respostas utilizando os artigos selecionados como contexto exclusivo.
  • Integração de abordagens teóricas: Experimentação com diversas definições de cultura (antropológica, sociológica, simbólica) para orientar a geração de informações.
  • Mitigação de alucinações: Implementação de instruções técnicas e critérios rigorosos para evitar a invenção de dados.

No âmbito do LLACA, a equipe publicou seus primeiros resultados em “Leveraging Wikidata for Geographically Informed Sociocultural Bias Dataset Creation: Application to Latin America”, de Yannis Karmim (Inria, Inria Chile) como autor principal, junto com pesquisadores da Inria, da Inria Chile, da Universidade do Chile, da Pontifícia Universidade Católica e do CENIA.