Datathon Regional

Enganemos os grandes modelos de linguagem

Os grandes modelos de linguagem são utilizados massivamente na América Latina, liderando as taxas de uso (76 % da população adulta no Chile os utiliza, uma das taxas mais altas do mundo) e de compras de aplicativos pagos de inteligência artificial generativa (o Brasil é o terceiro mercado mundial da OpenAI).

No entanto, os dados usados para treinar esses modelos vêm majoritariamente de países do Norte e estão em inglês, o que gera conteúdos enviesados ou vazios de conhecimento quando aplicados a contextos culturais do Sul, devido à ausência ou sub-representação de dados em seu treinamento.

A Datathon Regional busca corrigir a assimetria de cobertura cultural que leva a vieses sociais e culturais da IA generativa por meio de contribuições diretas de estudantes latino-americanos que conhecem seu contexto cultural em primeira mão, e realizar um diagnóstico profundo dos vieses culturais, linguísticos, históricos, de gênero e de minorias nos grandes modelos de linguagem.

Um dia para valorizar a identidade cultural latino-americana

No sábado, 3 de outubro, das 11h às 21h (horário UTC-3), os participantes serão convidados a criar perguntas e respostas para avaliar os modelos de linguagem de acordo com seus países, culturas, idiomas e regiões de origem.

Data

Sábado, 3 de outubro de 2026

Duração

1 dia, das 11h às 21h UTC-3

Abrangência

Países da América Latina e do Caribe

Quem pode participar: Equipes da Datathon Regional

As equipes devem ser formadas por:

  • 4 a 5 estudantes de graduação, mestrado ou doutorado, matriculados em uma universidade participante da Datathon Regional e residentes dos países da América Latina ou do Caribe dessa universidade.
  • Estudantes de todas as áreas do conhecimento e cursos. As equipes devem ser interdisciplinares (pelo menos um integrante com formação em ciências exatas ou engenharia, e pelo menos um integrante com formação em humanidades ou ciências sociais). Será especialmente valorizada a diversidade regional, de gênero e cultural.

As equipes devem escolher:

  • um nome de Equipe
  • designar um Representante de Equipe, que atuará como canal oficial de comunicação.

A TAREFA No dia 3 de outubro, as equipes deverão:

  • Criar um conjunto de perguntas seguindo o modelo de perguntas de múltipla escolha (apenas uma resposta correta entre quatro).
  • Fornecer uma lista de perguntas elaboradas para capturar conhecimentos específicos de sua região, país ou cultura, em que apenas uma das opções propostas seja a resposta correta.

POR EXEMPLO, UMA PERGUNTA PODERIA SER

O que é o milcao?

A.
Um batido à base de chocolate
B.
Um pássaro da Araucanía
c.
Uma ferramenta para ordenhar cabras do povo mapuche
d.
Um pão de batata típico de Chiloé

Wikipedia: https://en.wikipedia.org/wiki/Milcao

Como a equipe vencedora é escolhida?

Revisão inicial:

Realizada por um sistema misto que combina análise de similaridade de texto e revisão humana.

Avaliação posterior:

A avaliação ficará a cargo de um painel de modelos de linguagem (LLMs).

Pontuação:

Baseada na capacidade das perguntas de cada equipe de “enganar” com sucesso esses modelos.

Ranking:

Atualização periódica durante o evento

Após a avaliação:

Será selecionada uma equipe vencedora regional, que será anunciada no mesmo dia durante a Datathon Regional e durante o Encontro França-América Latina sobre Ciência Aberta (https://soframlat2026.sciencesconf.org)

O que a melhor equipe ganha?

01

2.000 €

A equipe vencedora da Datathon Regional receberá 2.000 euros para serem divididos igualmente entre seus membros.

02

Coautoria

Os integrantes da Datathon Regional serão mencionados como contribuidores na publicação do LatamQA v2.

03

Prêmio adicional

A Embaixada da França no país ou a universidade local organizadora poderá conceder um prêmio à equipe vencedora nacional, por iniciativa e a cargo da própria.