Metodologia
Como o Vota Aí! analisa os programas
Visão geral dos procedimentos usados para organizar temas, comparar programas e calcular o match — sem jargão de engenharia.
Temas a partir do texto
Cada programa é dividido em trechos. Esses trechos são convertidos em representações numéricas (embeddings) que capturam o sentido do texto. Em seguida, reduzimos a dimensão dessas representações com UMAP e agrupamos trechos semelhantes com HDBSCAN. O resultado são tópicos — conjuntos de trechos que falam de coisas parecidas — usados para descrever o perfil temático de cada candidatura.
Dimensões da análise
- Temas — mostra quais tópicos predominam no programa selecionado.
- Nuvem de palavras — destaca os termos mais frequentes no texto.
- Frequência — ordena as palavras por quantas vezes aparecem.
- Rede — liga palavras que costumam aparecer próximas umas das outras (coocorrência).
- Contexto — busca um termo e mostra trechos em que ele aparece.
- Similaridade — aproxima programas pelo perfil residual (depois de remover o “vocabulário comum” da corrida), contrapõe o peso dos temas à média do recorte, destaca frases e permite busca lexical no documento.
- Comparação — coloca dois programas lado a lado para contrastar temas e palavras.
Match programático
O Match sorteia trechos literais dos programas — dois por candidatura, com temas o mais distintos possível — e pede que você concorde, discorde ou pule. O ranking usa uma suavização estatística simples (Laplace), considera apenas quem teve respostas, e combina isso com a afinidade aos temas que você marcou como prioritários. Não é previsão de voto: é alinhamento com o que está escrito nos documentos registrados no TSE.
Mapa de proximidade
No mapa, cada programa vira um ponto em duas dimensões. A posição resume a média dos embeddings do documento, projetada para o plano. Programas próximos no mapa tendem a compartilhar mais vocabulário e ênfases; a distância não mede qualidade nem viabilidade eleitoral.
Limites
Temas de campanhas de presidente e governadores podem aparecer em caráter provisório até a validação da pesquisa. Resultados de similaridade e match dependem do texto registrado — não substituem leitura crítica do programa completo.