Un método de análisis de lenguaje tipo SMS para el castellano

  • Andrés Alfonso Caurcel Díaz Universidad Politécnica de Madrid
  • Jose Maria Gomez Hidalgo Departamento de I+DOptenet S.A.
  • Yovan Iñiguez del Rio Universidad Politécnica de Madrid
Palabras clave: Lenguaje SMS, lenguaje chat, tokenizador, traductor automático, Procesamiento del Lenguaje Natural, detección de edad

Resumen

Debido a las características propias del lenguaje tipo SMS utilizado en las comunicaciones por medio de Internet y de los teléfonos móviles, no se puede realizar una tokenización o separación de palabras estándar a la hora de dividir en palabras una oración o frase. La cantidad de elementos no alfanuméricos que se pueden insertar en una palabra, los errores tipográficos y el hecho de no utilizar espacios entre palabras son las principales causas de este problema.

En este artículo presentamos un nuevo sistema de separación de palabras para el análisis del lenguaje natural en español en redes sociales y otras comunicaciones electrónicas. El sistema está integrado en una herramientas para la detección de edad en redes sociales enmarcada en el proyecto de investigación y desarrollo WENDY, y se evalúa cuantitativamente tanto de manera directa, como indirectamente en el marco de dicha aplicación, con resultados positivos en ambos casos.

Publicado
2013-07-20
Cómo citar
Caurcel Díaz, A. A., Gomez Hidalgo, J. M., & Iñiguez del Rio, Y. (2013). Un método de análisis de lenguaje tipo SMS para el castellano. Linguamática, 5(1), 31-39. Recuperado a partir de https://linguamatica.com/index.php/linguamatica/article/view/156
Sección
Artículos de investigación