CatBoost
O artigo, que tem a participação de Euler Alencar, integrante do <labbia_lab>, avalia o uso do algoritmo CatBoost para classificar automaticamente textos jurídicos (petições iniciais e acórdãos) conforme os 17 Objetivos de Desenvolvimento Sustentável (ODS) da Agenda 2030 da ONU. O trabalho foi feito no contexto do Supremo Tribunal Federal (STF) e busca auxiliar servidores do Judiciário em uma tarefa de classificação que hoje é manual e repetitiva.
Principais pontos
- A base de dados continha 1643 petições e acórdãos já rotulados com os ODS, excluindo processos repetidos, ilegíveis ou com menos de 15 palavras.
- O grande diferencial do CatBoost é reunir, num mesmo modelo, variáveis textuais, numéricas e categóricas. Os metadados escolhidos foram: contagem de palavras-chave de cada ODS, classe processual do STF (ex.: ADI, que representa mais de 50% da base) e ramo do direito (predominantemente Direito Administrativo).
- O processamento de texto incluiu remoção de stopwords, pontuação, caracteres especiais, números e termos jurídicos desnecessários, além de lowercase. Compararam-se duas formas de limpeza: a básica e uma mais agressiva usando post tag (apenas substantivos, adjetivos, advérbios e verbos).
- Tecnicamente, o CatBoost se distingue por dar suporte nativo a dados categóricos, usar árvores simétricas (oblivious trees) menos propensas a overfitting, e empregar a técnica de ordered boosting.
- O estudo focou no ODS 16 (Paz, Justiça e Instituições Eficazes), o mais frequente na base e o mais complexo de classificar, dado o caráter constitucional do STF. Foram testados 7 cenários combinando texto e metadados, com e sem post tag (15% dos dados separados para teste).
- O Cenário 5 (ações do STF + contagem de palavras-chave dos ODS + post tag) teve a melhor acurácia: 0,85. O ramo do direito sozinho foi a variável de pior desempenho.
Conclusão
As acurácias e F1-scores (acima de 0,7) foram bons em quase todos os cenários, tornando o CatBoost um forte candidato para classificação textual nesse contexto jurídico. Ao restringir a análise apenas a processos da classe ADI e Direito Administrativo, a acurácia subiu de 68% (texto completo) para mais de 85% com post tag — a maior diferença observada no estudo, o que reforça a importância de usar metadados de qualidade nos fluxos de classificação. Os autores destacam que a proposta não é substituir o trabalho humano, mas reduzir tarefas repetitivas, e que o método de combinar metadados com o CatBoost pode ser aplicado a qualquer rótulo, não só aos da Agenda 2030.
