RoBERTaLexPT: um modelo RoBERTa jurídico pré-treinado com deduplicação para língua Portuguesa

Eduardo Garcia; Nádia Silva; Juliana Gomes; Hidelberg Albuquerque; Ellen Souza; Felipe Siqueira; Eliomar Lima; André de Carvalho

doi:10.21814/lm.16.2.457

RoBERTaLexPT: um modelo RoBERTa jurídico pré-treinado com deduplicação para língua Portuguesa

Autores

Eduardo Garcia Universidade Federal de Goiás https://orcid.org/0000-0002-0549-8771 (não autenticado)
Nádia Silva Universidade Federal de Goiás https://orcid.org/0000-0002-3875-2211 (não autenticado)
Juliana Gomes Universidade Federal de Goiás https://orcid.org/0000-0001-6900-1931 (não autenticado)
Hidelberg Albuquerque Universidade Federal Rural de Pernambuco https://orcid.org/0000-0003-2277-8860 (não autenticado)
Ellen Souza Universidade Federal Rural de Pernambuco https://orcid.org/0000-0003-3470-2783 (não autenticado)
Felipe Siqueira Universidade de São Paulo https://orcid.org/0000-0001-7528-6726 (não autenticado)
Eliomar Lima Universidade Federal de Goiás https://orcid.org/0009-0007-5671-9478 (não autenticado)
André de Carvalho Universidade de São Paulo https://orcid.org/0000-0002-4765-6459 (não autenticado)

DOI:

https://doi.org/10.21814/lm.16.2.457

Palavras-chave:

modelo de linguagem, domínio jurídico, benchmark

Resumo

Este trabalho investiga a aplicação do Processamento de Linguagem Natural (PLN) no contexto jurídico para a língua portuguesa, enfatizando a importância de adaptar modelos pré-treinados, como o RoBERTa, a partir de corpora especializados no domínio jurídico. Compilamos e pré-processamos um corpus jurídico em português, o corpus "LegalPT", abordando os desafios da alta duplicação de documentos em corpora jurídicos e medindo o impacto dos hiperparâmetros e da inicialização de embeddings. Experimentos revelaram que o pré-treinamento em dados jurídicos e em dados gerais resultou em modelos mais eficazes para tarefas jurídicas, com o nosso modelo, intitulado RoBERTaLexPT, superando modelos maiores treinados em corpora genéricos e outros modelos jurídicos de trabalhos relacionados. Também agregamos um benchmark jurídico, o benchmark "PortuLex". Este estudo contribui para melhorar as soluções de PLN no contexto jurídico brasileiro, fornecendo modelos aprimorados, um corpus especializado e um conjunto de dados de referência. Para fins de reprodutibilidade, disponibilizaremos o código, os dados e os modelos relacionados.

Downloads

Publicado

2024-12-31

Edição

Vol. 16 N.º 2

Secção

PROPOR 2024 | Artigos Convidados

Licença

Ao publicar na presente revista, os autores concordam com os seguintes termos:

os direitos sobre a obra pertencem aos autores, que apenas concedem à Linguamática o direito de primeira publicação sob a licença Creative Commons, que permite que outros possam redistribuir a obra desde que acompanhada de referência ao autor e à Linguamática.
os autores podem estabelecer outros contratos para a distribuição não exclusiva da obra, desde que mencionem que a sua primeira publicação foi efectuada na Linguamática.
para aumentar as referências ao seu trabalho, os autores são encorajados a disponibilizar a obra, como "pré-publicação", antes de ou durante o processo de apreciação pela Linguamática, por exemplo em repositórios institucionais ou nas suas páginas pessoais na rede.

Como Citar

RoBERTaLexPT: um modelo RoBERTa jurídico pré-treinado com deduplicação para língua Portuguesa. (2024). Linguamática, 16(2), 183-200. https://doi.org/10.21814/lm.16.2.457