Extraction of Literary Character Information in Portuguese

Eckhard Bick

doi:10.21814/lm.15.1.397

Extração de Informação sobre Personagens Literários em Português

Eckhard Bick University of Southern Denmark

DOI: https://doi.org/10.21814/lm.15.1.397

Palabras clave: leitura distante, extração de informação, reconhecimento de entidades nomeadas, constraint grammar, resolução de anáforas

Resumen

Este capítulo descreve o PALAVRAS-DIP, um sistema para a identificação automática de personagens e dos seus perfis sociais na literatura portuguesa e brasileira. O sistema foi concebido como um módulo adicional para um analisador morfossintáctico e semântico. Etiquetamos as entidades nomeadas (NE) humanas para profissão e posição social, e usamos as etiquetas relacionais do formalismo Constraint Grammar (Gramática de Restrições, CG) para estabelecer co-referências (por exemplo, anáfora de pronomes, verbos com sujeito zero) assim como relações familiares entre as personagens. A anotação de base resultante permite a extração de redes de personagens. O programa de extração reconhece e agrupa as variantes de nomes de personagens e distingue entre nomes que têm função narrativa e nomes contextuais de referência cultural. O desenvolvimento do sistema foi motivado pelo DIP, uma avaliação conjunta sobre 100 romances históricos, evento em que uma versão protótipo do sistema obteve medidas F razoáveis para as tarefas de identificação de personagens (63,4%) e de unificação/co-identificação de nomes (68,1%), mas teve problemas com as relações familiares (15,5%).

PDF (English)

Publicado

2023-06-30

Cómo citar

Bick, E. (2023). Extração de Informação sobre Personagens Literários em Português. Linguamática, 15(1), 31-40. https://doi.org/10.21814/lm.15.1.397

Descargar Cita

Número

Vol. 15 Núm. 1

Sección

DIP - Desafío de Identificación de Personajes

Derechos de autor 2023 Eckhard Bick

Esta obra está bajo licencia internacional Creative Commons Reconocimiento 4.0.

Los autores que envíen sus trabajos a esta revista implícitamente estón de acuerdo con los siguientes términos:

Los autores retienen los derechos de autor de sus trabajos, permitiendo a esta revista su primera publicación bajo licencia de Creative Commons Attribution License, que permite a otros acceder libremente, usar y compartir dicho trabajo, citando adecuadamente la autoría del trabajo y su presentación en esta revista.
Los autores pueden prescindir de los términos de licencia de CC y acordar por su cuenta arreglos contractuales adicionales independientes para la distribución no exclusiva y posterior publicación de este trabajo (p.e., para incluirlo en un repositorio institucional o publicarlo en un libro), citando adecuadamente su publicación inicial en esta revista.
Además, se anima a los autores a poner en línea su trabajo (p.e., en repositorios institucionales o en su propio sitio web) en cualquier momento antes o durante el proceso de envío, ya que eso puede conducir a intercambios productivos y a un número mayor y más temprano de citas del trabajo publicado (Ver The Effect of Open Access).