El proyecto LLACA y su dataset actual

El proyecto LLACA (LLM Assimilation of Cultural Aspects) nació en noviembre de 2025 como un ecosistema de colaboración científica franco-chileno de alto nivel, con investigadores de la Universidad de Chile, el equipo-proyecto ALMAnaCH del Centro Inria de París en Francia e Inria Chile.

Este proyecto de investigación se ideó en el marco del Centro Binacional Franco-Chileno de Inteligencia Artificial, Centro creado por el Ministerio de Ciencia, Tecnología, Conocimiento e Innovación de Chile e Inria a finales de 2024 y operado por Inria Chile.

El objetivo de LLACA es desarrollar y validar metodologías sistemáticas para evaluar e integrar aspectos culturales en grandes modelos de lenguaje, con énfasis en la representación de conocimientos y valores latinoamericanos, de manera que siente las bases para:

  • Reducir sesgos culturales en modelos de lenguaje de uso global
  • Mejorar la representación de perspectivas latinoamericanas en tecnologías de IA
  • Desarrollar estándares de evaluación cultural para sistemas de IA
  • Fomentar el desarrollo de tecnologías de IA que respeten la diversidad cultural
Llaca, marsupial de Chile

¿Y por qué LLACA?

La llaca, yaca o, marmosa elegante o kun guuma es una especie de marsupial didelfimorfo de la familia Didelphidae propio de Sudamérica, y en particular de Chile.

Muy poca gente conoce esta especie de marsupial - una de las cuatros especies de marsupiales que existen en Chile - ni sabe que se puede nombrar o escribir llaca, yaca, marmosa elegante, o kun guuma.

Las IAs generativas más conocidas tampoco lo saben y si es que generan un texto descriptivo para explicar “¿Qué es una llaca?”, generan errores en el texto de descripción. Utilizando los otros nombres del mamífero, las IA generativas se complican aún más.

Es por esto que en Inria Chile, decidimos llamar nuestro proyecto dedicado a la evaluación de los grandes modelos de lenguaje, LLACA (también porque es el acrónimo de LLM Assimilation of Cultural Aspects).

El objetivo de la Datathon Regional es simple: encuentra la LLACA de tu cultura y envía las preguntas y las respuestas que permitirán engañar a los LLMs.

El Dataset actual del proyecto LLACA

LatamQA es un benchmark de conocimiento sociocultural sobre América Latina, creado en el marco del proyecto LLACA para medir sesgos culturales en modelos de lenguaje. Parte de una constatación: los modelos de pesos abiertos más conocidos se entrenan sobre datos del Norte Global y hay pocos recursos para detectar sesgos fuera del inglés, en particular los referidos a Latinoamérica.

  • Combina el contenido de Wikipedia, la estructura del grafo de conocimiento de Wikidata y criterio experto de ciencias sociales para generar pares de pregunta/respuesta sobre la cultura popular y social de distintos países de la región.
  • Se extrajeron más de 26 mil preguntas a partir de unos 26 mil artículos de Wikipedia, convertidas en preguntas de opción múltiple en español y portugués, y luego traducidas al inglés. La versión final del benchmark queda en 23.499 preguntas de opción múltiple que cubren 20 países latinoamericanos.

El código y los datos están publicados en GitHub y Hugging Face.

Desconocimiento de las culturas latinoamericanas en los grandes modelos de lenguaje: los primeros hallazgos del proyecto

El equipo de científicos de LLACA busca establecer estándares reproducibles que permitan medir la asimilación cultural en sistemas de IA y desarrollar técnicas de integración de conocimiento cultural que puedan ser aplicadas a escala global.

Los resultados obtenidos hasta ahora:

  • Construcción de la base de conocimiento: Selección de regiones de interés y recopilación masiva de artículos mediante análisis de categorías y enciclopedias digitales.
  • Curaduría y filtrado especializado: Validación manual por expertos y diseño de un modelo automatizado.
  • Generación controlada de datos: Creación de conjuntos de preguntas y respuestas utilizando los artículos seleccionados como contexto exclusivo.
  • Integración de enfoques teóricos: Experimentación con diversas definiciones de cultura (antropológica, sociológica, simbólica) para guiar la generación de información.
  • Mitigación de alucinaciones: Implementación de instrucciones técnicas y criterios estrictos para evitar la invención de datos.

En el marco de LLACA, el equipo ha publicado sus primeros resultados en “Leveraging Wikidata for Geographically Informed Sociocultural Bias Dataset Creation: Application to Latin America”, de Yannis Karmim (Inria, Inria Chile) como principal autor, junto con investigadores de Inria, Inria Chile, la Universidad de Chile, la Pontificia Universidad Católica y el CENIA.