La Text Encoding Initiative (TEI) es un consorcio que desarrolla y mantiene un estándar para la representación de los textos en forma digital. Se trata de un proyecto de investigación en humanidades digitales que goza de una amplia difusión y utilización en bibliotecas y colecciones de texto digitales y en la creación de corpora lingüísticos[cita requerida]. Se basa en el lenguaje XML, una versión simplificada del SGML.
Las TEI Guidelines en su conjunto lo que hacen es definir una gramática XML. Difiere de otros formatos textuales, como HTML y OpenDocument, en que se trata un marcado o etiquetado semántico y no presentacional, es decir, se preocupa por lo que es el texto y establece el significado de cada elemento y atributo. Las pautas describen más de 500 elementos textuales agrupados en veinte módulos, a veces altamente especializados, como el módulo para diccionarios, teatro, corpus lingüísticos, transcripción de fuentes primarias, mientras que otros son generales y básicos para cualquier documento TEI.
Antes de la creación del TEI, los humanistas no tenían estándares comunes para codificar textos electrónicos. A lo largo de los años los académicos desarrollaron métodos variados con el objetivo de representar caracteres especiales y codificar divisiones lógicas de un texto, así como representar información analítica e interpretativa y reducir el aparato de texto crítico a una secuencia lineal única.
Debido a la falta de un formato estándar y unificado, entre 1960 y 1980 se empezaron a desarrollar esquemas de codificación desde cero y a partir de adaptaciones de los ya existentes. Los esquemas ya existentes reflejaban principalmente los intereses de sus desarrolladores y estaban adaptados a los programas que utilizaban. En su mayoría eran incompatibles con las investigaciones de otros humanistas, debido a que tenían que modificarlos sustancialmente para poder usarlos, siempre y cuando se pudiesen reutilizar.
Cuando la comunidad de humanidades informáticas (en inglés, Computing humanities) reconoció esta problemática, se reunieron e intentaron en varias ocasiones (San Diego, 1977; Pisa, 1980) desarrollar estándares de codificación para los textos legibles por ordenadores. Sin embargo, no se llegó a ningún consenso y se interrumpieron.
La Text Encoding Initiative nació en un congreso organizado por la Association for Computers and the Humanities (ACH) en el Vassar College en 1987, y fue financiado por la U.S. National Endowment for the Humanities (en español, Fundación Nacional de los Estados Unidos para las Humanidades). Al congreso asistieron alrededor de 30 representantes de diferentes archivos, centros de humanidades informáticas, proyectos de investigación y organizaciones profesionales para reconsiderar la viabilidad de la estandarización y realizar recomendaciones en relación a su ámbito de aplicación, estructura, contenido y redacción, conocidos actualmente como los «principios de Poughkeepsie» (en inglés, Poughkeepsie Principles).
El congreso fue un éxito, ya que, por una parte, se supo más sobre los problemas de la codificación y se aclararon los principios que debían seguirse para resolver esta problemática. Por otra parte, el grupo de Vassar logró reunir y componerse de una mayor representación de organizaciones clave y centros de investigación activos que en anteriores reuniones. Además, el reciente desarrollo del Standard Generalized Markup Language aportó una herramienta para desarrollar un esquema de codificación sencillo, flexible y extensible que cumpliese con las diferentes necesidades de la investigación textual. El consenso que se alcanzó en el congreso fue que esta necesidad estaba creciendo y había que resolverla urgentemente.
Tras el congreso, la Association for Computational Linguistics (ACL) y la Association for Literary and Linguistic Computing (ALLC) acordaron unirse a la ACH como patrocinadores para elaborar las pautas del estándar. Estas tres organizaciones se comprometieron a guiar el esfuerzo y la búsqueda de financiación para apoyar la TEI como un proyecto a nivel internacional y multilingüe. Sin embargo, pronto se reconoció que este proyecto no solo era del interés de las humanidades, sino que también se podía aplicar a diversas aplicaciones de la industria del lenguaje.
En 1994, la TEI publicó su primera versión completa de las Guidelines for the Encoding and Interchange of Machine-Readable Texts (en español, Pautas para la codificación e intercambio de textos legibles por ordenadores), coeditada por Michael Sperberg-McQueen y Lou Bernard.
Durante sus primeras versiones, hasta la P3, la TEI se desarrolló sobre la base del SGML. En la versión P4, publicada en 2002, apareció la primera especificación en XML. En 2007 se publicó la versión P5 La última versión de la P5 es la 3.3.0 y fue publicada el 31 de enero de 2018 bajo el nombre en clave Johnny Rotten.
Escribe un comentario o lo que quieras sobre Text Encoding Initiative (directo, no tienes que registrarte)
Comentarios
(de más nuevos a más antiguos)