Datathon Regional

Engañemos a los grandes modelos de lenguaje

Los grandes modelos de lenguaje se utilizan masivamente en América Latina, liderando las tasas de uso (el 76 % de la población adulta en Chile la utiliza, una de las tasas más altas del mundo) y de compras de aplicaciones de pago de inteligencia artificial generativa (Brasil es el tercer mercado mundial para OpenAI).

Pero los datos utilizados para entrenar estos modelos provienen mayoritariamente de países del Norte y están en inglés, lo que genera contenidos sesgados o vacíos de conocimiento cuando se aplican a contextos culturales del Sur, debido a la ausencia o subrepresentación de datos en su entrenamiento.

La Datathon Regional busca corregir la asimetría de cobertura cultural que lleva a sesgos sociales y culturales de la IA generativa mediante contribuciones directas de estudiantes latinoamericanos que conocen su contexto cultural de primera mano, y realizar un diagnóstico profundo de los sesgos culturales, lingüísticos, históricos, de género y de minorías en los grandes modelos de lenguaje.

Un día para poner en valor la identidad cultural latinoamericana

El sábado 3 de octubre, desde las 11:00 a las 21:00 horas (horario UTC-3), los participantes serán invitados a crear preguntas y respuestas para evaluar los modelos de lenguaje según sus países, culturas, idiomas y regiones de origen.

Fecha

Sábado 3 de octubre, 2026

Duración

1 día, desde las 11 a las 21 horas UTC-3

Alcance

Países de América Latina y el Caribe

Quien puede participar: Equipos de la Datathon Regional

Los equipos tienen que ser conformados por:

  • 4 a 5 estudiantes de pregrado, maestría o doctorado, inscritos en una universidad participante de la Datathon Regional y residentes de los países de América Latina o el Caribe de esta universidad.
  • Estudiantes de todas las áreas del conocimiento y carreras. Los equipos deben ser interdisciplinares (al menos un integrante con formación en ciencias exactas o ingeniería, y al menos un integrante con formación en humanidades o ciencias sociales). Se valorará especialmente la diversidad regional, de género y cultural.

Los equipos deben elegir:

  • un nombre de Equipo
  • designar a un Representante de Equipo, quien actuará como canal oficial de comunicación.

LA TAREA El 3 de octubre, los equipos deberán:

  • Crear un conjunto de preguntas siguiendo el modelo de preguntas de opción múltiple (sólo una respuesta correcta entre cuatro).
  • Proporcionar una lista de preguntas diseñadas para capturar conocimientos específicos de su región, país o cultura, donde solo una de las opciones propuestas sea la respuesta correcta.

POR EJEMPLO, UNA PREGUNTA PODRÍA SER

¿Qué es el milcao?

A.
Un batido a base de chocolate
B.
Un pájaro de la Araucanía
c.
Una herramienta para ordeñar cabras del pueblo mapuche
d.
Un pan de papas típico de Chiloé

Wikipedia: https://en.wikipedia.org/wiki/Milcao

¿Cómo se elige al equipo ganador?

Revisión inicial:

Realizada por un sistema mixto que combina análisis de similitud de texto y revisión humana.

Evaluación posterior:

La evaluación estará a cargo de un panel de modelos de lenguaje (LLMs).

Puntuación:

Basada en la capacidad de las preguntas de cada equipo para “engañar” exitosamente a dichos modelos.

Ranking:

Actualización periódica durante el evento

Tras la evaluación:

Será seleccionado un equipo ganador regional, que será anunciado este mismo día durante la Datathon Regional y durante el Encuentro Francia América Latina sobre Ciencia Abierta (https://soframlat2026.sciencesconf.org)

¿Qué gana el mejor equipo?

01

2.000 €

El equipo ganador de la Datathon Regional recibirá 2.000 euros para ser repartidos equitativamente entre sus miembros.

02

Co-autoría

Los integrantes de la Datathon Regional serán mencionados como contribuyentes en la publicación de LatamQA v2.

03

Premio adicional

La Embajada de Francia en el país o la universidad local organizadora podrá entregar un premio al equipo ganador nacional, por iniciativa y a cargo de la misma.