CatBoost

Lucas José Gonçalves Freitas, Pamella Sada Dias Edokawa, Thaís Carvalho Valadares Rodrigues, Ariane Hayana Thomé de Farias e Euler Rodrigues de Alencar · 2023

O artigo, que tem a participação de Euler Alencar, integrante do <labbia_lab>, avalia o uso do algoritmo CatBoost para classificar automaticamente textos jurídicos (petições iniciais e acórdãos) conforme os 17 Objetivos de Desenvolvimento Sustentável (ODS) da Agenda 2030 da ONU. O trabalho foi feito no contexto do Supremo Tribunal Federal (STF) e busca auxiliar servidores do Judiciário em uma tarefa de classificação que hoje é manual e repetitiva.

Principais pontos

  • A base de dados continha 1643 petições e acórdãos já rotulados com os ODS, excluindo processos repetidos, ilegíveis ou com menos de 15 palavras.
  • O grande diferencial do CatBoost é reunir, num mesmo modelo, variáveis textuais, numéricas e categóricas. Os metadados escolhidos foram: contagem de palavras-chave de cada ODS, classe processual do STF (ex.: ADI, que representa mais de 50% da base) e ramo do direito (predominantemente Direito Administrativo).
  • O processamento de texto incluiu remoção de stopwords, pontuação, caracteres especiais, números e termos jurídicos desnecessários, além de lowercase. Compararam-se duas formas de limpeza: a básica e uma mais agressiva usando post tag (apenas substantivos, adjetivos, advérbios e verbos).
  • Tecnicamente, o CatBoost se distingue por dar suporte nativo a dados categóricos, usar árvores simétricas (oblivious trees) menos propensas a overfitting, e empregar a técnica de ordered boosting.
  • O estudo focou no ODS 16 (Paz, Justiça e Instituições Eficazes), o mais frequente na base e o mais complexo de classificar, dado o caráter constitucional do STF. Foram testados 7 cenários combinando texto e metadados, com e sem post tag (15% dos dados separados para teste).
  • O Cenário 5 (ações do STF + contagem de palavras-chave dos ODS + post tag) teve a melhor acurácia: 0,85. O ramo do direito sozinho foi a variável de pior desempenho.

Conclusão

As acurácias e F1-scores (acima de 0,7) foram bons em quase todos os cenários, tornando o CatBoost um forte candidato para classificação textual nesse contexto jurídico. Ao restringir a análise apenas a processos da classe ADI e Direito Administrativo, a acurácia subiu de 68% (texto completo) para mais de 85% com post tag — a maior diferença observada no estudo, o que reforça a importância de usar metadados de qualidade nos fluxos de classificação. Os autores destacam que a proposta não é substituir o trabalho humano, mas reduzir tarefas repetitivas, e que o método de combinar metadados com o CatBoost pode ser aplicado a qualquer rótulo, não só aos da Agenda 2030.

<mais_publicações/>

Continue lendo

O eleitor que nunca existiu

Acessar