NAUČNI RAD UDK 004.439:004.55XML UDK 519.76 
SMERNICE INICIJATIVE ZA KODIRANjE TEKSTA I NjIHOVA LOKALIZACIJA 
Tomaž Erjavec* 
Institut Jožef Štefan, Odsek za tehnologije znanja Ljubljana, Slovenija 
Apstrakt: Rad predstavlja "Smernice inicijative za kodiranje teksta", formalnu specifikaciju i prateću dokumentaciju za rečnik XML elemenata koji je namenjen za obeležavanje tekstova u naučne svrhe. 
TEI je u širokoj upotrebi za kodiranje najraznovrsnijih tipova tekstova, pogotovo složenih tekstova u digitalnim bibliotekama. 
Rad opisuje istoriju i organizacija Inicijative za kodiranje teksta (TEI), strukturu Smernica i daje nekoliko primera upotrebe. 
U radu se razmatra i pitanje lokalizacije: dok TEI elementi mogu da se koriste za opisivanje teksta na bilo kom jeziku, same Smernice su napisane na engleskom jeziku. 
Međutim, TEI nudi više mogućnosti za prevod delova Smernica 
o kojima se raspravlja na kraju rada i predlaže nova, jednostavna alternativa punom prevodu. 
Ključne reči: XML, TEI, standardizacija kodiranja teksta, lokaliza- cija. 
1. Uvod 
Dugo vremena su tekstovi u digitalnoj formi bili posmatrani samo kao digitalni ekvivalent štampanog primerka i bili su tesno povezani sa softverom pomoću koga su nastali ili sa kime su trebali biti predstavljeni. 
Takvi tekstovi nisu bili pogodni za mašinsku obradu i brzo su zastarevali. 
Da bi se rešili ovi problemi stvoren je ISO standard SGML koji je pružao sredstva za reprezentaciju teksta koja ne zavise ni od platforme ni od izlaza. 
SGML je dopuštao korisnicima da definišu sopstvene skupove etiketa pogodnih za kodiranje proizvoljnih tipova tekstova. 
Najpoznatija primena SGML-a je, bez sumnje, HTML (jezik za obeležavanje hiperteksta) koji se koristi za kodiranje dokumenata radi prikazivanja u veb prelistačima. 
Ali ni SGML ni HTML nisu bili pogodni kao široka osnova za kodiranje proizvoljnih tekstova svrhe:SGML je bio previše složen dok je HTML definisao samo mali rečnik elemenata koji su uglavnom namenjeni vizuelnom prikazu. 
Ovo su bili razlozi zbog kojih je W3C (World Wide Web Consortium) stvorio novi standard, proširivi jezik za obeležavanje XML.1 
XML je podskup SGML-a i kao takav, za razliku od HTML-a, specifikuje sredstvo za definisanje proizvoljnih skupova etiketa. 
Kako je XML u isto vreme mnogo jednostavniji od SGML-a pisanje softvera koji će ga obrađivati je postalo mnogo lakše. 
Otkako je nastao, XML je postao veoma uspešan kao format za razmenu podataka u digitalnom obliku sa mnoštvom softvera i povezanih standarda koji podržavaju njegov razvoj, validaciju i transformacije. 
1http://www.w3.org/XML/ 
Od ovih standarda, trebalo bi pomenuti XSLT,2 jezik za transformaciju XML dokumenata; 
skriptovi u XSLT-u transformišu dokumente u drugačije strukturirane dokumente. 
Kako se XML pre svega koristi kao format za skladištenje i razmenu podataka, XSLT omogućava njegovu transformaciju u formate koji se mogu direktno primeniti, na primer u HTML za veb prelistače. 
2 http://en.wikipedia.org/wiki/XSL_Transformations 
XML je, kao i SGML, meta-jezik: on ne definiše određen skup etiketa već samo obezbeđuje sredstva za njihovo definisanje, a koji će se skup etiketa definisati zavisi od tipa podataka koji se obrađuju i predviđenog načina upotrebe, 
iako postoji mogućnost da istraživači definišu svoje skupove etiketa, ili tačnije, XML šeme koje specifikuju etikete (XML elemente i atribute) i validne međusobne veze etiketa, uglavnom je bolje koristiti ranije definisane, standardne šeme jer su one pažljivo dizajnirane, imaju dobru dokumentaciju i održavanje, garantuju povezivanje sa drugim aplikacijama, a može ih obrađivati i postojeći, njima namenjen softver. 
Do sada već postoji veliki broj standardnih XML šema za najrazličitije oblasti primene, kao što su aplikacije za mobilne telefone, za predstavljanje matematičkih formula, za muzičke notacije, i za tehničku dokumentaciju. 
Ali šta je sa tekstovima iz područja humanističkih nauka, tj. sa onim tekstovima koji su predmet istraživanja u humanističkim naukama, nezavisno od toga kojoj vrsti teksta pripadaju, na kom jeziku su napisani, iz kog perioda potiču ili koje metode se koriste u njihovoj analizi? 
Do danas, postoji samo jedan standard (ili bolje rečeno, preporuka) koji pokriva ovu široku oblast, a to je TEI - Inicijativa za kodiranje teksta. 
2. Inicijativa za kodiranje teksta 
Inicijativa za kodiranje teksta (TEI) je razvila opšti standard koji predstavlja izražajno sredstvo za predstavljanje tekstova u digitalnom obliku i koji odgovara istraživačkim potrebama naučnika u humanističkim naukama. 
TEI se može okarakterisati kao:3 - slobodno dostupan skup smernica za kodiranje tekstova u humanističkim naukama uz upotrebu XML-a - međunarodni konzorcijum koji postoji da bi podržao razvoj ovih smernica - zajednicu projekata i pojedinaca koji koriste TEI Smernice. 
3 Ovaj odeljak prati odličan uvod u TEI koji je dostupan na http://www.wwp.brown.edu/encoding/seminars/tei.html 
Kao i mnogi pokušaji standardizacije i TEI se suočava sa izazovima koji su svojstveni ovakvom tipu projekata. 
Kako mogu tako brojne oblasti i zajednice u okviru humanističkih nauka da pronađu zajedničko uporište u jednom jeziku za kodiranje? 
Kako možemo da se dogovorimo koliko detaljno ili pogodno je potrebno opisati naš tekstualni materijal? 
Kako da pomirimo prednosti koje donose doslednost i dogovor sa potrebom za specijalizacijom u pojedinačnim slučajevima? 
Kako se nositi sa nečim što je stvarno jedinstveno i neočekivano? 
Za razliku od mnogih pokušaja standardizacije TEI ova i slična pitanja rešava tako što otvoreno prihvata varijacije i raspravu u okviru svojih tehničkih mogućnosti. 
TEI Smernice su smišljene tako da budu modularne i prilagodljive, pa specifični projekti mogu da izaberu delove TEI koji su bitni za njih, a ostalo da zanemare. 
Isto tako, ukoliko je neophodno, mogu se kreirati dodaci TEI jezika koji će obraditi aspekte teksta kojima se TEI još nije bavio. 
Pošto je sam TEI složen, proces prilagođavanja nije sasvim trivijalan, ali je zamišljen tako da bude što je moguće jednostavniji. 
2.1. Za šta se TEI koristi? 
TEI Smernice se pretežno upotrebljavaju za stvaranje digitalnih biblioteka koje omogućavaju pristup velikoj količini tekstualnog materijala pri čemu se akcenat stavlja na redak i osetljiv materijal koji jedino digitalno može da postane široko dostupan. 
Kodiranje tekstova u ovakvim kolekcijama naglašava svojstva koja će biti od koristi za pretragu i pronalaženje, kao što su bibliografski podaci, predmetne ključne reči i drugi meta- podaci koji korisnicima pomažu da pronađu materijal koji ih interesuje. 
TEI Smernice koriste i specijalizovani istraživački projekti za predstavljanje manjih kolekcija tekstova koje su tematski usmerene. 
One se često odnose na neki određeni žanr, ili na autora, period ili zemlju (ili predstavljaju njihovu kombinaciju). 
Projekti ovog tipa često koriste detaljnije obeležavanje da bi predstavili osobena svojstva teksta koja su relevantna za određenu kolekciju ili su važna za auditorijum naučnika kojem su namenjeni. 
Na primer kolekcija koja se ograničava na dela nekog autora čiji radovi predstavljaju važan izvor informacija o poznatim savremenicima može da obeležava sva pominjanja imena i radova, uz mogućnost uključivanja veza koje će upućivati na detaljnije indekse biografskih ili kritičkih informacija. 
Slično tome, elektronsko izdanje određenog autora ili dela može da obuhvati i predstavljanje različitih čitanja, revizija autora, uredničkih ispravki i sličnih uredničkih informacija. 
Namena nekih kolekcija ove vrste je da podrže veoma specifične istraživačke ciljeve, kao što je lingvistička analiza, ili treba da posluže kao osnova za rečnik i u ovim slučajevima obeležavanje može da bude veoma usko specijalizovano. 
Sve upotrebe koje su ovde opisane predstavljaju neku vrstu izdavanja: cilj je da se stvori digitalna kolekcija koju uža ili šira publika može da koristi online. 
Korišćenje može da bude ograničeno na malu zajednicu korisnika ili na preplatnike, a može i da bude otvoreno za široku publiku. 
Ređe, TEI koriste pojedinci da bi stvorili digitalnu prezentaciju tekstualnog materijala da bi podržali sopstvena istraživanja, u oblicima koji se mogu objaviti ali i ne moraju. 
Dok cilj i svrhu velikih kolekcija mogu da uslovljavaju korisnici ili način finansiranja, u slučaju radova pojedinaca ograničenja su lična i profesionalna: obeleženi materijal može da služi kao lični alat za istraživanje a može se i razviti u nešto što odgovara digitalnoj monografiji koja predstavlja autorovu analizu skupa tekstova. 
Upotreba TEI Smernica u ovim slučajevima može biti onoliko detaljna koliko daleko je autor spreman da ide: jedino ograničenje predstavljaju vreme, energija, maštovitost i isplativost. 
2.2. Učenje TEI 
TEI veb stanica4 je dobar izvor opštih informacija o TEI i mesto gde se mogu pronaći TEI Smernice. 
Ali TEI veb stanica je samo jedan od mnogih izvora korisnih informacija o tome kako treba koristiti TEI i kako razumeti njegov značaj. 
Iako ne postoji jedan izvor koji može dati potpunu sliku, ima sve više literature koja se bavi ulogom obeležavanjem teksta u naučnom radu. 
Bibliografija Univerziteta Braun5 daje korisne izvore ali je možda najbolji način za sticanje osnovnih znanja o TEI pohađanje neke radionice. 
Svake godine se održava mnogo takvih radionica, uglavnom u Sjedinjenim Američkim Državama i Velikoj Britaniji i one se reklamiraju na TEI veb stanici. 
4 http://www.tei-c.org/ 
5 http://www.wwp.brown.edu/encoding/seminars/readings.html 
Za one kojima je potrebno detaljnije razumevanje samog procesa obeležavanja, radionice su dobar početak ali one nisu dovoljne. 
Učenje TEI je kao i učenje jezika: TEI ima prilično obiman rečnik i složen raspon upotrebe. 
Neka uvodna radionica daje dobar uvid u mogućnosti TEI jezika i upoznaje polaznike sa osnovnim terminima. 
Ali to mora biti praćeno kako praktičnim radom tako i detaljnim istraživanjem korišćenja samog jezika. 
Od velike pomoći je postojanje konkretnog projekta u vidu skupa dokumenata od interesa na kojem će se raditi. 
Da bi se upoznao sa TEI Smernicama u toku korisnik može uz čitanje Smernica, da radi još nekoliko stvari. 
TEI održava listu slanja TEI-L, gde će skoro sva pitanja, čak i ona koja postavljaju početnici, dobiti odgovore. 
Lista se i arhivira, pa se odgovori na pitanja koja se najčešće postavljaju kao i ona koja se ređe postavljaju mogu naći u arhivi. 
Opseg različitih stavova i pristupa takođe može da doprinese boljem shvatanju kako sve različite vrste projekata koriste TEI. 
Dobar način za učenje TEI je i izučavanje rada na nekim konkretnim projektima obeležavanju tekstova. 
Mnogi projekti imaju dokumentaciju, a neki čak i izuzetno dobru dokumentaciju koja obrazlaže razloge za donošenje nekih odluka pri obeležavanju i daje kriterijume po kojima se prepoznaju i obeležavaju određena svojstva teksta. 
Mnogi će rado podeliti sa drugima uzorke svojih obeleženih tekstova koji mogu biti veoma korisni za sticanje uvida u kompletnu sliku obeležavanja. 
3. Istorijat TEI6 
TEI je pokrenut 1987. godine na sastanku u koledžu Vasar, koji je okupio različite grupe naučnika iz mnogo različitih disciplina i predstavnike vodećih profesionalnih društava, biblioteka, arhiva i projekata iz mnogih zemalja Evrope, Severne Amerike i Azije. 
Rezultat početne faze njihovog rada je izdavanje 1990. godine prvog nacrta Smernica, poznatog kao P1. 
Odmah zatim je započeta druga faza rada, a rezultati su objavljivani od 1990. do 1993. godine. 
Zatim, nakon sledećeg ciklusa revizija, proširivanja i dodavanja objavljena je 1994. godine prva zvanična verzija Smernica ,,P3". 
Kako se sve više naučnika upoznavalo sa Smernicama, njihovi komentari, ispravke i zahtevi za proširenjima su stizali sa svih strana sveta. 
Na kraju je bilo skoro 200 naučnika iz različitih disciplina, profesija i zemalja koji su činili jezgro grupe koja se bavila razvojem TEI Smernica. 
6 Za detaljniji prikaz istorije TEI videti http:// www.tei-c.org/About/history.xml na koji se ovaj odeljak oslanja 
TEI Konzorcijum je ustanovljen 2000. godine. 
To je organizacija s međunarodnim članstvom koja sada održava, nastavlja da razvija i promoviše TEI. 
Cilj osnivanja TEI Konzorcijuma je bio da se stvori stalni dom za TEI kao demokratski ustanovljenu, akademski i ekonomski nezavisnu, neprofitnu organizaciju koja se sama održava. 
Nakon osnivanja TEI Konzorcijuma, prioritet je bio izdavanje XML verzije TEI Smernica kao unapređene verzije P3 koja je još bila zasnovana na SGML-u kako bi se korisnicima omogućio rad sa XML alatima koji su počeli da se pojavljuju. 
Verzija P4 Smernica je objavljena 2002. godine. 
Suštinski, to je bila XML verzija P3, u kojoj nisu bitno promenjena ograničenja izraženim u šemama osim onih koje su bile neophodne zbog samog prelaska na XML i ispravka uočenih grešaka u tekstu P3 Smernica. 
Pa ipak, imajući u vidu da je P3 do tada već bio u stalnoj upotrebi od 1994. godine, bilo je jasno da je potrebna temeljna revizija njegovog sadržaja, pa je odmah započet rad na verziji P5. 
Ona je bila zamišljena kao generalna popravka koja je uključivala i javni poziv korisnicima za svojstvima i novi razvoj u skupu presudnih oblasti kao što su kodiranje karaktera, grafika, opisa rukopisa i jezika na kome su same TEI Smernice napisane. 
Verzija P5 Smernica je izdata krajem 2007. godine. 
Uticaj TEI na digitalno istraživanje je bio ogroman. 
Danas je TEI međunarodno priznat kao veoma važan alat, kako za dugotrajno čuvanje elektronskih podataka tako i kao sredstvo koje podržava efikasnu upotrebu takvih podataka u mnogim predmetnim oblastima. 
To je šema kodiranja koja predstavlja pravi izbor pri proizvodnji kritičkih i naučnih izdanja literarnih tekstova, za izradu naučnih referentnih radova i velike lingvističke korpuse kao i za upravljanje i proizvodnju podrobnijih meta-podataka koji su pridruženi raznim vrstama elektronskih tekstova i kolekcijama kulturnog nasleđa. 
Mnogobrojne organizacije su prihvatile TEI preporuke, a među njima su i US National Endowment (Državna zadužbina za društvene nauke SAD-a), the UK's Arts and Humanities Research Board (Istraživački odbor za umetnost i kulturu Velike Britanije), the Modern Language Association (Društvo za savremene jezike), the European Union's Expert Advisory Group for Language Engineering Standards (Ekspertska savetnička grupa za standarde jezičkog inženjerstva Evropske unije) kao i mnoge druge agencije širom sveta koja finansiraju ili promovišu projekte vezane za digitalne biblioteke i elektronske tekstove. 
Kongresna biblioteka je prepoznajući značaj TEI u opštem porastu zajednice digitalnih biblioteka izdala Smernice za najbolju primenu TEI preporuka za meta- podatke u praksi, da bi se postigla usklađenost sa drugim standardima. 
Uspeh TEI je dosta doprineo da se obezbedi da se naše kulturno nasleđe uvede u novi, umreženi svet u nastajanju i da postane dostupno studentima, naučnicima i široj javnosti. 
4. TEI Smernice 
TEI Smernice za kodiranje i razmenu elektronskih tekstova definišu i dokumentuju jezik za obeležavanje koji služi da predstavi strukturna i konceptualna svojstva teksta, kao i ona svojstva koja se odnose na njegovo prikazivanje. 
Glavni, ali ne i jedini akcenat je na kodiranju dokumenata koji pripadaju humanističkim i društvenim naukama, a posebno na predstavljanju primarnih izvora za istraživanje i analizu. 
Ove smernice su predstavljene u vidu modularne i proširive XML šeme koju prati detaljna dokumentacija i objavljene su pod licencom otvorenog koda. 
TEI Smernice su dostupne u nekoliko formata: štampana i povezana kopija mogu da se kupe, dok su online verzije u formatima HTML i PDF besplatno dostupne sa zvaničnog TEI sajta. 
Sa stanice TEI SourceForge mogu se, takođe preuzeti šeme, izvorne XML datoteke Smernica, dokumentacija i sl. kao zapakovani paketi. 
Detaljnija uputstva za pristup i upotrebu ovog materijala mogu se naći na matičnoj stranici TEI. 
Same TEI Smernice su pisane u XML-u i slede paradigmu pismenog programiranja Donalda Knuta, koja podrazumeva da isti dokument sadrži formalnu specifikaciju, kao i prateću dokumentaciju u obliku vezanog teksta. 
TEI Smernice definišu nekoliko stotina elemenata i atributa za obeležavanje dokumenata bilo koje vrste. 
Svaka definicija se sastoji od sledećih komponenti: - tekstualni opis, - formalna deklaracija izražena preko XML rečnika koji je definisan u Smernicama i kombinovan sa elementima preuzetim iz ISO jezika za RELAX NG šeme7, i - primeri upotrebe. 
7 http://www.relaxng.org/ 
Primera radi, slika 1. predstavlja HTML izgled definicije TEI elementa    <subst>       .     
Ona pokazuje da element pripada modulu za transkripciju primarnih izvora (Transcription of Primary Sources) i daje hipervezu do punog teksta poglavlja u kojem je objašnjen ovaj modul (o modulima se govori u sledećem odeljku). 
Tekstualni opis objašnjava da element "grupiše jedno ili više izbacivanja iz teksta sa jednim ili više dodavanja kada tu kombinaciju treba posmatrati kao jednu intervenciju u tekstu". 
Definicija dalje objašnjava koje atribute element koristi, koji TEI model koristi ovaj element, koje elemente može da sadrži, kakva je formalna definicija šeme tog elementa, i na kraju daje primer upotrebe i napomene. 
Slika 1. Definicija TEI elementa    <subst>        
4.1. TEI moduli 
Svako poglavlje Smernica, osim što predstavlja grupu povezanih elemenata, definiše i odgovarajući skup deklaracija koje se zovu moduli. 
Sve definicije su okupljene u referentnom odeljku u dodatku Smernica. 
Formalne deklaracije za dato poglavlje su okupljene u okviru odgovarajućeg modula. 
Radi jednostavnosti, svaki element je dodeljen jednom modulu, obično da bi se koristio u nekom specifičnom polju primene ili kako bi podržao određenu vrstu upotrebe. 
Prema tome, modul je prosto pogodan način za grupisanje većeg broja povezanih deklaracija o elementima. 
U najjednostavnijem slučaju TEI šema se dobija kombinovanjem manjeg broja modula. 
U tabeli 1 navedeni su svi moduli koje definišu TEI Smernice P5. 
Ime modula Opis modula Poglavlje smernica u kome se modul definiše 
analysis Analiza i interpretacija 17 Jednostavni analitički mehanizmi 
certainty Izvesnost i neizvesnost 21 Izvesnost, preciznost i odgovornost 
core Zajedničko jezgro 3 Elementi dostupni u svim TEI dokumentima 
corpus Meta-podaci za jezičke korpuse 15 Jezički korpusi 
dictionaries štampani rečnici 9 Rečnici 
drama Tekstovi koji se izvode 7 Tekstovi koji se izvode 
figures Tabele, formule, slike 14 Tabele, formule slike 
gaiji Dokumentacije o karakterima i glifovima 5 Predstavljanje nestandardnih karaktera i glifova 
header Zajednički meta- podaci 2 TEI zaglavlje 
iso-fs Strukture svojstava 18 Strukture svojstava 
linking Povezivanje, segmentacija i poravnavanje 16 Povezivanje, segmentacija i poravnavanje 
msdescription Opis rukopisa 10 Opis rukopisa 
namesdates Imena, datumi ljudi i mesta 13 Imena, datumi ljudi i mesta 
nets Grafovi, mreže i drveta 19 Grafovi, mreže i drveta 
spoken Transkribovani govor 8 Transkripcija govora 
tagdocs Elementi za dokumentaciju 22 Elementi za dokumentaciju 
tei Infrastruktura TEI 1 Infrastruktura TEI 
textcrit Kritička izdanja teksta 12 Kritički aparat 
textstructure Pretpostavljena struktura teksta 4 Pretpostavljena struktura teksta 
transcr Transcripcija primarnih izvora 11 Predstavljanje primarnih izvora 
verse Stihovi 6 Stihovi 
Tabela 1. TEI moduli 
4.2. Konstruisanje TEI XML šeme 
Da bi se utvrdilo da je neki XML dokument validan, a ne samo dobro formiran, njegova struktura se mora proveriti pomoću šeme. 
Za validan TEI dokument ova šema mora da bude u saglasnosti sa TEI šemom. 
Specifikacija za šemu koja je u saglasnosti sa TEI je i sam TEI dokument koji koristi elemente modula "Elementi za dokumentaciju". 
Takav dokument se neformalno naziva "ODD" dokumentom. 
Ovaj naziv potiče od cilja koji je prvobitno bio postavljen pri dizajniranju sistema: "Jedan dokument radi sve" (One Document Does it all). Programe za obradu ODD dokumenata održava TEI, a i same Smernice su napisane kao takav dokument. 
Šemu ODD čini izbor TEI modula, pojedini elementi se mogu i zabraniti ili im se može promeniti ime, a mogu se uključiti i dodatne deklaracije koje modifikuju deklaracije elemenata i atributa koje sadrži svaki modul. 
Isti sistem se može koristiti i za specifikovanje šema koje proširuju TEI eksplicitnim dodavanjem novih elemenata ili upućivanjem na druge XML rečnike. 
ODD dokument može da obrađuje ODD procesor koji će iz ovog skupa deklaracija generisati odgovarajuću XML šemu, koristeći neki od standardnih jezika za šeme: - jezik XML DTD (deo samog XML-a), - jezik ISO RELAX NG, - jezik W3C Schema,8 - ili, u principu, bilo koji dovoljno izražajan jezik za šeme. 
8 http://www.w3.org/XML/Schema 
Ove izlazne šeme potom može koristiti bilo koji XML procesor, na primer, validator ili uređivač da bi proverio ili na drugi način obradio dokumente. 
Na zvaničnoj TEI stanici dostupan je ODD procesor koji se naziva Roma za koji je obezbeđen veb interfejs koji pomaže pri kreiranju prilagođene TEI šeme. 
5. Tri primera TEI tekstova 
Dok je u prethodnim odeljcima TEI predstavljen u najširim crtama u ovom odeljku ćemo dati neke konkretne primere iz našeg sopstvenog rada na slovenačkim tekstovima. 
Svi tekstovi o kojima ćemo govoriti su pisani kao XML dokumenti koji su u saglasnosti sa TEI: za neke starije korišćen je TEI P4, dok je za one nedavno završene korišćen TEI P5. 
Mehanizam isporučivanja se razlikuje od slučaja do slučaja, što zavisi od konkretnog scenarija za upotrebu, ali u svim slučajevima se zasniva na XSLT stilskim listovima koji koriste izvorni TEI i transformišu ga u format koji omogućava njegovo korišćenje, a to je obi4no HTML koji je pogodan za pregledanje u veb prelistaču. 
Za sledeća tri primera o kojima ćemo govoriti ćemo prvo ukratko predstaviti tekstove ili, bolje rečeno, projekate u okviru kojih su prikupljeni, zatim ćemo ilustrovati proces kodiranja na malom primeru i na kraju ćemo pokazati kako su izvorni XML tekstovi konvertovani za potrebe konkretne upotrebe resursa. 
5.1. Biblioteka eZISS 
Digitalna biblioteka eZISS9 nastala je u saradnji Naučno- istraživačkog centra Slovenačke akademije nauka i umetnosti i Instituta Jožef Stefan. 
Sadrži izabrane, obično starije slovenačke tekstove sa integrisanim reprodukcijama, prepisima i naučnim komentarima, a u nekim slučajevima i audio-vizuelnim zapisima. 
Ova izdanja su namenjena za dugotrajnu javnu upotrebu i besplatno se mogu pregledati na vebu, ali se mogu i preuzimati kao izvorni TEI dokumenti ili izvedeni HTML dokumenti. 
Pošto su objavljeni pod licencom Creative Commons10 ova izdanja se mogu distribuirati i trećim licima. 
9 http://nl.ijs.si/e-zrc/ 
10 http://creativecommons.org 
eZISS izdanja koriste TEI šeme koje se sastoje od modula za opis rukopisa (Manuscript Descriptions), za transkripciju primarnih izvora (Transcription of Primary Sources) i za kritička izdanja teksta (Textual Criticism) kao i drugih modula, na primer, modula za tekstove za izvođenje (Performance Texts). 
Obeležavanje različitih izdanja nije uniformno jer su strukture tekstova veoma različite tako da su potrebni različiti elementi za njihov opis. 
Slika 2 koja prikazuje kratak izvod iz eZISS "Processio Locopolis", najstarijeg teksta namenjenog izvođenju na slovenačkom jeziku koji je napisan početkom 18. veka ukratko ilustruje koja vrsta obeležavanja se koristi u našim izdanjima. 
Izvod prikazuje jedan govor (TEI element    <sp>       ) iz igrokaza koji izgovara (    <speaker>       ) Đavo.     
Obratite pažnju da atribut xml:id pridružuje jedinstveni identifikator govorniku u ovom govoru, a da atribut xml:lang označava jezik na kome govornik priča kao latinski, gde je "lat" troslovni kod za jezik po ISO 639. 
Takođe obratite pažnju da je označeno da "Diabolus" treba da bude istaknut dok je zahtevani izgled isticanja podvlačenje. 
Govor potom sadrži osam redaka (    <l>       ), a svakom od njih je dodeljen tekući broj retka u drami (atribut n) i jedinstveni identifikator.     
Prva dva retka sadrže i zamenu (    <subst>       , na slici 1 je data definicija ovog elementa) s kojom je prepisivač precrtao deo teksta i dodao neki drugi tekst (pun opis prepisivača je dat u TEI zaglavlju, a vrednost atributa "hand" se odnosi na taj opis).     
Atribut "place" označava mesto gde je dodatak napravljen: u prvom retku unutar retka, a u sledećem iznad. 
Slika 2. Tekst jednog govora iz eZISS izdanja igrokaza "Processio Locopolis". 
Da bi se mogla pregledati, izdanja su transformisana u HTML dokumenta pomoću XSLT stilskih listova. 
Svako starije izdanje (P4) je imalo sopstveni stilski list za transformaciju u HTML, dok izdanja pisana u TEI P5 imaju pridružene mnogo jednostavnije stilske listove koji samo konvertuju složeni izvorni XML dokument u pojednostavljeni XML dokument koji je i dalje u saglasnosti sa TEI. 
Ovaj XML dokument se potom transformiše u HTML pomoću standardnih TEI XSLT stilskih listova koji su dostupni na zvaničnoj TEI stanici. 
5.2. Rečnik jaSlo 
Japansko- slovenački online rečnik "jaSlo"11 razvijen je u saradnji Filozofskog fakulteta Univerziteta u Ljubljani i Instituta Jožef Stefan. 
To je rečnik za učenje jezika namenjen slovenačkim studentima japanskog jezika i trenutno sadrži oko 10.000 odrednica. 
11 http://nl.ijs.si/jaslo/ 
Šema za rečnik jaSlo koristi TEI P4 modul za rečnike. 
Na slici 3 može se videti početak jedne odrednice ; 
kao što se može videti, odrednica prvo sadrži vodeću reč na japanskom (    <form type="hw">       ).     
Ona se dalje deli na zapis u tri različita pisma: romaji (transliteracija u latinično pismo), hiragana (fonetsko japansko pismo) i kanji (kineski ideogrami). 
Gramatička grupa (    <gramGrp>       ) daje vrstu reči (glagol, klasa 5) i njegovu podkategorizaciju (neprelazni).     
Zatim slede tri flektivna oblika glagola sa sufiksima koji određuju njegovo flektivno ponašanje. 
Prevod daje tri prevodna ekvivalenta na slovenačkom jeziku. 
Zatim sledi jedan primer na japanskom preveden na slovenački. 
Leksičke odrednice sadrže i dodatne informacije: nivo težine reči, upućivanje na godinu i poglavlje u udžbeniku u kome se reč prvi put pojavila, definicije (uglavnom za vlastite imenice), etimologiju, unakrsne uputnice, itd. 
Slika 3. Početak jedne rečničke odrednice rečnika jaSlo. 
Rečnik je dostupan online preko veb sučelja za pretragu. 
Sučelje je implementirano kao Perl CGI servis koji prema kriterijumima za pretragu pretražuje TEI kodirani rečnik i vraća relevantne odrednice i transformiše ih iz XML zapisa u HTML radi prikazivanja. 
5.3. Korpus JOS 
Projekat JOS12 razvija lingvistički anotirane korpuse i pridružene izvore slovenačkog čija je svrha da za slovenački jezik olakšaju razvoj tehnologija zasnovanih na ljudskom jeziku. 
Trenutni rezultati uključuju morfosintaksičke specifikacije, dva korpusa koja su ručno anotirana na nivou reči i dva veb servisa. 
Ovi izvori su dostupni pod licencom Creative Commons. 
12 http://nl.ijs.si/jos/ 
JOS korpusi sadrže uzorke pasusa iz slovenačkog referentnog korpusa FidaPLUS13 koji je anotiran nedvosmislenim morfosintaksičkim opisima i lemama. 
jos100k korpus sadrži 100.000 reči i on je temeljno ručno proveren, dok jos1M sadrži milion reči čije su anotacije samo delimično ručno proverene. 
Korpusi se mogu koristiti kao skupovi podataka za obučavanje tagera vrsta reči i lematizera za slovenački jezik. 
13 http://www.fidaplus.net/ 
Korpusi su kodirani u TEI P5 sa šemom koja koristi module za meta- podatke za jezičke korpuse (Metadata for Language Corpora), lingvističku analizu (Linguistic Analysis) i strukture svojstava (Feature Structures) sa još nekim JOS proširenjima. 
Slika 4 prikazuje prvi deo jedne anotirane rečenice iz jos100k korpusa. 
Rečenica sadrži reči (    <w>       ), interpunkcijske znakove (    <c>       ) i razmake (    <S>       ).     
Svaka reč je anotirana morfosintaksičkim opisom (msd) i lemom. 
Morfosintaksički opisi su kompaktne niske koje se direktno razlažu u strukture svojstava koje su definisane u TEI zaglavlju. 
Tako se, na primer, morfosintaksički opis "Zk-mer" razlaže u "zaimek vrsta= kazalni spol=moški število= ednina sklon=rodilnik" ili, na engleskom jeziku "Pronoun Type=demonstrative Gender= masculine Number= singular Case= genitive", 
Slika 4. Početak anotirane rečenice "Tistega večera sem preveč popil, zgodilo se je..." iz jos100k korpusa. 
Korpusi su dostupni u izvornom XML formatu, ali i kao tabularne datoteke koje su proizvedene iz izvornih pomoću XSLT skriptova. 
Format tabularnih datoteka je pogodniji za obučavanje tagera i lematizera. 
Kao što je već pomenuto, JOS projekat nudi i veb servis za morfo- sintaksičko tagiranje i lematiziranje predatih tekstova na slovenačkom jeziku, pri čemu su ova dva alata obučena na JOS korpusima. 
6. Međunarodno korišćenje 
TEI Smernice su široko prihvatili projekti i institucije u mnogim zemljama Evrope, Severne Amerike i Azije i one se koriste za kodiranje tekstova na desetinama jezika. 
TEI zajednica je internacionalna i višejezična i ona svake godine pokriva sve veće geografsko područje. 
Međutim, složeno kodiranje tekstova u čemu je TEI izvanredan, zahteva dobro razumevanje dostupnih elemenata (kojih ima preko 500) i oni koji ne vladaju engleskim jezikom su u mnogo nepovoljnijoj situaciji pri učenju i upotrebi Smernica od engleskih govornika. 
Zato TEI radi na stvaranju funkcionalne arhitekture za: 1) lokalizaciju TEI izvora; 2) lokalizaciju stilskih listova za isporuku referentnog dela TEI Smernica; 3) prevod referentne dokumentacije TEI. 
Ovaj rad je veoma napredovao za šest velikih jezika, zahvaljujući donaciji Udruženja za književno i lingvističko računarstvo ALLC (The Association for Literary and Linguistic Computing). 
Međutim, malo je verovatno da će Smernice biti uskoro prevedene na jezike koji imaju mali broj govornika kao što je slovenački. 
Kompletno štampano izdanje ima preko 1300 stranica, što uključuje referentni odeljak od skoro 500 stranica u kome se daju detaljni opisi i definicije svih elemenata. 
Precizno XML kodiranje tekstova takođe predstavlja specijalizovanu oblast rada tako da bi broj potencijalnih čitaoca Smernica prevedenih na slovenački verovatno ostao mali. 
Uprkos tome što bi bilo nerealno očekivati kompletan prevod Smernica ili njihovog referentnog dela na svaki jezik, postoje, ipak, neke oblasti u kojima se sa malim naporima već postižu korisni rezultati. 
Za slovenački jezik preveli smo jezičke niske u TEI XSLT stilskim listovima koji proizvode HTML izlaz, a koji, takođe, izvršavaju i zadatke kao što je pravljenje sadržaja, podela velikih TEI dokumenata u više HTML datoteka itd, na primer "Table of Contents" ili "Next" preveli smo u "Kazalo" i "Naslednji" u slovenačkom 
Takođe smo preveli nazive svih TEI elemenata na slovenački; ovo ne znači da su imena elemenata u XML-u prevedena već da su uz definicije elemenata pripisane glose na slovenačkom jeziku, kao što je prikazano na slici 5. 
Kao što se može videti, struktura specifikacije jednog elementa je ovde prilično jednostavna: element "teiHeader" pripada modulu "header" i ima glosu na engleskom "TEI Header" sa slovenačkim prevodom "kolofon TEI" 
Treba napomenuti da, u stvari, samo mali broj TEI elemenata ima glosu na engleskom jeziku, jer većina elemenata, kao npr. "sponsor", imaju naziv koji je istovremeno i glosa. 
Slika 5. Korišćenje elemenata za dokumentaciju za lokalizaciju glosa TEI elementa na slovenački. 
Datoteka koja sadrži ovakve skraćene specifikacije svih TEI elemenata, zajedno sa njihovim prevodom na slovenački je dostupna na vebu.14 
Nadamo se da će u budućnosti biti dodati i drugi jezici. 
14 http://nl.ijs.si/tei/localise/teiLocalise-sl.xml 
I dok takva objašnjenja mogu biti interesantna kao dodatak samim Smernicama, mi ih koristimo na drugačiji način u našim izdanjima. 
Napisali smo XSLT stilski list koji konvertuje TEI zaglavlje u jednostavan HTML dokument zamenjujući imena elemenata njihovim glosama, na engleskom ili na slovenačkom, ili bilo kom drugom jeziku koji bi bio dodat specifikacionoj datoteci. 
Ovo omogućava prevod meta- podataka dokumenta; kako tipično TEI zaglavlje sadrži i informacije o upotrebi etiketa u dokumentu, u njemu se nalaze i prevodi naziva svih elemenata koji su upotrebljeni u dokumentu. 
Slika 6 predstavlja deo TEI zaglavlja za jos100k korpus, u kome se vidi i deo zaglavlja o upotrebi etiketa. 
Zaglavlje jos100k je napisano i na engleskom i na slovenačkom jeziku (razlikovanje jezika se vrši pomoću atributa xml:lang) tako da XSLT stilski list umeće u HTML sadržaj zaglavlja na odgovarajućem jeziku, kao i glose elemenata tog jezika. 
Takve HTML datoteke se potom koriste za predstavljanje svakog izdanja, bilo na engleskom bilo na slovenačkom jeziku. 
Slika 6. TEI zaglavlje korpusa jos100k transformisano u HTML sa engleskim i slovenačkim glosama imena elemenata i sadržajem zaglavlja. 
7. Zaključci 
U radu je predstavljena Inicijativa za kodiranje teksta (TEI), međunarodni napor da se razvije zajednički standard za reprezentaciju digitalnih tekstova na način koji nudi mnoštvo mogućnosti i istovremeno odgovara istraživačkim potrebama naučnika u humanističkim naukama. 
Razmatrali smo organizaciju TEI, njenu istoriju, Smernice i konstruisanje šema, a dali smo i tri primera iz naše prakse u kojima smo koristili TEI šeme kodiranja. 
Rad smo zaključili diskusijom o međunarodnom korišćenju TEI Smernica. 
Predstavili smo "lagan" pristup lokalizaciji koji je pogodan za male jezike u kome su glose TEI elemenata prevedene da bi se potom mogle koristiti, na primer, za HTML prezentaciju TEI zaglavlja. 
XML datoteka sa svim elementima, njihovim glosama na engleskom i odgovarajućim prevodima na slovenački jezik, je slobodno dostupna na vebu i mogu joj se dodati prevodi i na druge jezike. 
Kao što se i može videti iz ovog rada, TEI Smernice su obiman i prilično složen dokument tako da je sasvim opravdano pitanje da li vredi utrošiti potrebno vreme i trud da bi se preporuke savladale i koristile i nije li možda bolje da se za određene projekte razvije sopstveni način kodiranja koji bi savršeno odgovarao potrebama konkretnog projekta. 
Na osnovu naših iskustava ne možemo dati konačan odgovor. 
Za jednostavnije tekstove koje će koristiti određeni pojedinac ili koji će se koristiti u okviru jedne institucije, odgovor bi mogao biti negativan. 
Međutim, ako je potrebno mnogo vremena za anotiranje tekstova, što ih čini dragocenim i vrednim za dugoročno čuvanje, i čime se stvara mogućnost da se oni koriste na razne načine, a posebno ako tekstovi treba da budu široko dostupni u svom izvornom obliku, onda je TEI pravi odgovor: obeležavanje tekstova se može formalno proveriti, po definiciji je ono dobro dokumentovano a projekti mogu računati i na sve više softvera koji je pridružen TEI. 
Reference 
Ovde dajemo listu najvažnijih URL adresa koje su u tekstu pomenute. 
U ovom radu ne dajemo klasične bibliografske reference do kojih se, međutim, može doći ako se prate dole navedene adrese. 
Svim stanicama koje su povezane s ovim adresama je pristupljeno 10. 09. 2009. 
XML - Proširiv jezik za obeležavanje (Extensible Markup Language): http://www.w3.org/XML/ 
ISO Relax NG - Šema jezik za proveru validnosti XML dokumenata (Schema language for validating XML documents): http://www.relaxng.org/ 
XSLT - XSL transformacije (XSL Transformations): http://en.wikipedia.org/wiki/XSL_Transformations 
TEI Consortium Web Site: Veb stanica TEI konzorcijuma: http://www.tei-c.org/ 
eZISS - Digitalna biblioteka slovenačkih književnih tekstova: http://nl.ijs.si/e-zrc/ 
jaSlo - Japansko-slovenački on-line rečnik za učenje jezika: http://nl.ijs.si/jaslo/ 
JOS - Jezički korpus slovenačkog za istraživanja u oblasti tehnologija zasnovanih na ljudskim jezicima: http://nl.ijs.si/jos/ 
TEI element name translations into Slovene: Prevod na slovenački imena TEI elemenata: http://nl.ijs.si/tei/localise/teiLocalise-sl.xml 
