SAŽETAK: 
Rad je nastao kao odgovor na zadatak klasifikacije medicinskih dokumenata, postavljen tokom letnje škole Keyword Search in Big Linked Data, održane u okviru COST akcije Keystone 2017. godine na Tehnološkom univerzitetu u Beču. 
U njemu se prikazuju rezultati specifičnog pristupa klasifikaciji zasnovanog na kreiranju minimalnih surogata teksta. Kao osnova klasifikacije uzeta je MeSH ontologija, zasnovana na tezaurusu Medical Subject Headings. 
U tekstovima, prethodno klasifikovanim pomoću taksonomije ove ontologije, najpre se pronalaze pojmovi od važnosti, a potom se zamenjuju taksonomskim referencama. 
Tako ekstrahovane reference koriste za klasifikaciju unutar MeSH taksonomije pomoću prostog algoritma, a rezultati se evaluiraju u odnosu na ručno klasifikovane dokumente.  
KLjUČNE REČI: klasifikacija dokumenata, MeSH, ontologije, ekstrakcija informacija  
Ovaj rad opisuje rešenje problema koji je zadao predavač na jednodnevnom hakatonu letnje škole Keystone 3rd training school: 
Keyword Search in Big Linked Data, održanoj u Beču 21–25. avgusta 2017. u okviru COST akcije IC1302 - Keyword Search in Big Linked Data. 
Problem se sastoji u klasifikovanju 10.000 dokumenata iz digitalne kolekcije Nacionalne medicinske biblioteke Sjedinjenih Američkih Država (slika 1), koje je obezbedio predavač, dok je na učesnicima bilo da te dokumente klasifikuju u klase predefinisane u MeSH (Medical Subject Headings) ontologiji (Dragoni, 2017).  
... Goserelin in the adjuvant treatment of breast cancer An update of the Zoladex Early Breast Cancer Research Association (ZEBRA) trial was presented by Professor R Blamey (Nottingham City Hospital, UK). Goserelin was found to be better ... Results were presented by the Austrian Breast and Colorectal Cancer Study Group comparing ... 
Slika 1. Odlomak jednog od dokumenata koji treba klasifikovati 
Klasifikacija u ovom radu napravljena je, shodno pravilima, na osnovu taksonomije medicinskih pojmova iz verzije MeSH ontologije iz 2016. godine. 
Ontologija se može pretraživati na vebu 3, gde se mogu naći predefinisani upiti među kojima su oni za klase i predikate, ili gde se novim SPARQL upitima mogu dobiti drugi željeni podaci.  
Dokumentacija, RDF trojke i preuzimanje primera su takođe dostupni je na vebu,4 dok za pregledanje predikata postoji i šira opcija5 koja nudi tabelarni prikaz predikata, njihov opis i XML etiketu koja je posebno važna ako se koristi lokalna kopija MeSH ontologije u vidu XML serijalizacije. Ontologija se sastoji od 56.309 medicinskih koncepata, opisanih i sistematski svrstanih u hijerarhijsko drvo (slika 2).  
Koncepti iz ontologije su hijerarhijski poređani, a svaki od njih ima dodeljen i identifikator koji se sastoji od blokova cifara razdvojenih tačkama, a koji opisuju nadređene koncepte u opadajućem redosledu, od najvišeg do najnižeg u hijerarhiji. 
Klase za klasifikaciju se, konkretno u ovom zadatku, odnose na drugi nivo hijerarhije drveta – ima ih ukupno 1.718 – a prepoznaju se tako što se njihovi identifikatori sastoje dva bloka, na primer [M01.055] Adult children (slika 2), gde prvi blok M01 označava da mu je nadređen čvor [M01] Persons, a drugi blok 055 je jedinstven među sabratnim čvorovima.  
Problem klasifikacije dokumenata, u najopštijem smislu, javlja se u dve varijante: klasifikacija u nepoznatom, i klasifikacija u poznatom, ograničenom domenu klasa. 
Za obe varijante problem se svodi na određivanje sličnosti dva dokumenta, pri čemu je uobičajeno korišćenje takozvanog Dajsovog6 indeksa, odnosno koeficijenta sličnosti.  
On nam kaže da ako je Si skup termina dodeljenih dokumentu Di, a Sj skup termina dodeljenih dokumentu Dj, onda se ovaj indeks može definisati kao dvostruki broj zajedničkih termina prema ukupnom broju termina u oba dokumenta (ako je S skup, onda je jSj broj elemenata skupa). 
Ako dokumenta nemaju zajedničkih termina u tom slučaju je sim(Di; Dj) = 0 i odražava minimalnu sličnost dvaju dokumenata, a ukoliko dva dokumenta imaju dodeljene potpuno iste skupove termina onda je sim(Di; Dj) = 1 i odražava maksimalnu sličnost. 
Kada je domen klasa unapred poznat i ograničen, što je naš slučaj, problem se svodi na pronalaženje odgovarajuće klase sa najvećom sim(dokument, klasa dokumenata) vrednošću, za svaki dokument koji je predmet klasifikacije. 
Problem koji se javlja prilikom izračunavanja koeficijenta sličnosti između tekstova je visoka cena, koja se mora platiti bilo procesorskom moći ili vremenom izvršenja. 
Upravo zbog toga prvi korak u klasifikaciji najčešće predstavlja kreiranje surogata teksta, gde se on prevodi u vektorski prostor koji čine vektori reči sa frekvencijama pojavljivanja. 
Reči u indeksu se nekada dobijaju stemovanjem, nekada lematizacijom, nekada zamenom sinonima, ili hiponima hiperonimima, kako bi se surogati teksta dodatno smanjili i kako bi se ubrzalo vreme izvršenja izračunavanja. 
Za kvalitetnu klasifikaciju u ovom postupku, neophodno je da surogati budu ispravno kreirani i da verno predstavljaju tekst.  
U radovima (Trieschnigg et al., 2009) i (Elberrichi et al., 2012) testirano je više metoda klasifikacije medicinskih dokumenata zasnovanih na MeSH ontologiji ili tezaurusu. 
Napravljeni klasifikatori koristili su: 
– Samo MeSH tezaurus (‘Thesaurus-oriented’ classifiers); 
– Trening skup za izgradnju eksplicitnih modela za svaki MeSH koncept (‘Concept-oriented’ classifiers); 
– Ručno kreirane anotacije dokumenata slično kao kod običnih klasifikatora teksta, da se odredi odgovarajući koncept (‘K-Nearest Neighbor’ classifier); 
– Hibridne i ručno profinjene sisteme koji kombinuje više pristupa (‘Hybrid’ classifiers).  
U oba rada je zaključeno da K-Nearest Neighbor klasifikator (KNN) daje najbolje rezultate, ali da je, uprkos svojim prednostima, mnogo sporiji od klasifikatora zasnovanih na tezaurusu, kao i da se sa rastom skupa dokumenata za testiranje njegove performanse dodatno smanjuju, što nije bilo poželjno pri rešavanju dobijenog zadatka.  
U ovom radu eksperimentiše se jednostavnim pristupom klasifikaciji da bi se ocenio značaj blagovremenog upravljanja velikom količinom podataka, kao i upotrebna vrednost semantike pohranjene u MeSH ontologiji. 
Cilj je bio napraviti klasifikator koji bi bio brz i jednostavan, kako bi se rešio problem velike količine teksta koju treba klasifikovati. 
Primenjuje se drastična sumarizacija dokumenata i samih klasa –  
klase (koncepti drugog nivoa ontologije) svedene su na jedan jedini termin – njihov naziv. 
Sa druge strane, dokumenti su svedeni samo na pojavljivanja termina (naziva koncepata iz MeSH ontologije) koji se uz jednostavno mapiranje (pohranjeno u njihovim identifikatorima u samoj ontologiji) poistovećuju sa terminom koji označava neku klasu, njima nadređeni objekat. 
Ovo umnogome olakšava i ubrzava proces izračunavanja sličnosti, jer svaka klasa sada ima samo jedan termin. 
Na ovaj način dokument će pomoću Dajsovog indeksa uvek biti klasifikovan u klasu čiji (jedini) termin se najviše puta u njemu javlja, čime se izračunavanje izbegava i svodi na pronalaženje najfrekventnijeg termina u surogatu teksta.  
Cilj eksperimenta je provera mogućnosti i uspešnosti klasifikacije medicinskih dokumenata na osnovu taksonomije iz MeSH ontologije i kao i na osnovu sistema zasnovanog na pravilima – pojavljivanju termina vezanih za koncepte iz MeSH ontologije u dokumentima koji treba da se klasifikuju. 
Tok eksperimenta se može podeliti na pet sukcesivnih etapa.  
1. Ekstrakcija taksonomije iz MeSH ontologije korišćenjem SPARQL upita. 
Ova etapa je neophodna kako bi se prikupila lista identifikatora i utvrdila taksonomska pozicija termina upotrebljenih u dokumentima, kao i pozicija njihovih čvorova u odnosu na pozicije čvorova mogućih klasa.  
2. Konverzija dokumenata u vektore identifikatora koncepata koji se u njima javljaju. 
Ova etapa omogućava da dokumentima dodelimo atribute koji su neposredno i neraskidivo povezani sa klasama u koje te dokumente treba svrstati.  
3. Uklanjanje šumova. 
Ova etapa treba da omogući i obezbedi što bolje rezultate pri klasifikaciji dokumenata.  
4. Klasifikacija dokumenata u klase na osnovu njihovih vektora identifikatora i jednostavnih skupova pravila.  
5. Evaluacija uspešnosti klasifikacija dokumenata za svaki od korišćenih skupova pravila. 
Ova etapa nam omogućava da sagledamo i uporedimo različita pravila klasifikacije, kao i da ustanovimo da li se neki skupovi pravila mogu smatrati uspešnim, koji su to skupovi i koliko su uspešni.  
U narednim poglavljima, etape eksperimenta biće opisane detaljnije, kako bi se stekao bolji uvid u korišćene metode i dobijene rezultate.  
Ekstrakcija matrice naziva koncepata i njihovih identifikatora pozicija u klasifikacionom drvetu obavlja se pomoću SPARQL upita. 
Kako u ovoj ontologiji postoje trojke koji se sastoje od koncepta, predikata i objekta tog predikata, a koji odražava poziciju u taksonomiji, ovaj deo zadatka svodi se na ekstrakciju subjekta i objekta za svaku od ovih trojki.  
Najpre je potrebno odrediti ime predikata u ontologiji koji odražava identifikator pozicije u taksonomiji oblika [A-Z][0-9][0-9]([.][0-9][0-9][0-9])*. 
Korišćen je jednostavan SPARQL upit, koji za bilo koji koncept iz ontologije izlistava sve predikate i objekte svih trojki iz MeSH 2016 ontologije čiji je taj koncept deo (slika 3). 
Upit smo ilustrovali konceptom (mesh2016: D049916 ). 
PREFIX mesh2016: <http://id.nlm.nih.gov/mesh/2016/>   SELECT DISTINCT ?predikat ?objekat  FROM <http://id.nlm.nih.gov/mesh/2016>   WHERE mesh2016:D049916 ?predikat ?objekat  ORDER BY ?class 
Slika 3. SPARQL upit ya dobavljanje taksonomija svih koncepata iy MeSH 2016 ontologije 
Na osnovu upita dobijen je izlaz iz koga se, pored ostalog, zaključuje da je traženi predikat meshv:treeNumber, jer sadrži blokove cifara koji opisuju hijerarhiju (slika 4). 
Ovaj podatak se koristi u narednom upitu koji ima cilj da izlista sve nazive koncepata (termine) i njihove meshv:treeNumber vrednosti. 
rdf:type; meshv:TopicalDescriptor rdfs:label; Polyplacophora meshv:identifier; D049916 meshv:dateEstablished; 2006-01-06 meshv:historyNote; 2006 meshv:publicMeSHNote; 2006 meshv:treeNumber; mesh2016:B01.050.500.644.600 
Slika 4. Neki od Izlaza SPARQL upita, među kojima su i željeni predikat i objekat 
PREFIX rdfs: <http://www.w3.org/2000/01/rdf-schema#>  PREFIX meshv: <http://id.nlm.nih.gov/mesh/vocab#>   PREFIX mesh2016: <http://id.nlm.nih.gov/mesh/2016/>   SELECT DISTINCT ?naziv ?treeNumber FROM <http://id.nlm.nih.gov/mesh/2016>   WHERE ?koncept rdfs:label ?naziv . ?koncept meshv:treeNumber ?treeNumber  ORDER BY DESC(STRLEN(?naziv)) 
Slika 5. SPARQL upit za dobavljanje liste naziva i pozicija svih koncepata iz ontologije MeSH 2016. 
Drugi SPARQL upit pribavlja nazive koncepata na osnovu predikata rdfs:label, a zatim traži i mesh:treeNumber tog istog koncepta. 
Termini su na izlazu poređani po veličini naziva od najdužeg do najkraćeg, kako bi se tim redom pretraživali u dokumentima da bi se izbeglo da duža poklapanja ne budu prepoznata zbog kraćih (slika 5).  
Rezultat ovog upita je CSV datoteka čiji svaki red sadrži naziv (rdfs:label) i taksonomski identifikator (treeNumber) svakog od koncepata (slika 6). 
Ova datoteka biće korišćena u narednom koraku, u kojem se u dokumentima pronalaze nazivi koncepata, to jest termini, nakon čega se zamenjuju identifikatorima čvorova u taksonomskom drvetu. 
Treba istaći da se mogu naći i jednočlani termini kao i višečlani (na primer Bacteria i Gram-Negative Bacteria), 
ali imajući u vidu redosled primene zamena (po dužini niske, od najduže do najkraće) neće doći do pogrešne zamene i prepoznavanja samo dela termina. 
Ganglia;A08.340 Neurons;A08.675 Malleus;A09.246.397.247.524 Cochlea;A09.246.631.246 Eyelids;A09.371.337 Choroid;A09.371.894.223 Tissues;A10 Chorion;A10.615.284.473 Muscles;A10.690 
Slika 6. Primeri linija CSV dokumenta koji sadrži nazive i identifikatore čvorova koncepata.  
Ova etapa sastoji se od dva koraka. 
Najpre se u svim dokumentima pronalaze i zamenjuju prethodno izlistani termini, a zatim se uklanja preostali tekst kako bi se dokumenti transformisali u listu vektora identifikatora. 
Nikakva normalizacija ni dokumenta ni termina nije rađena, što za engleski jezik, koji nema bogat flektivni sistem može da bude prihvatljivo, ali bi za flekitvno bogat jezik, kao što je srpski, bila neophodna prethodna lematizacija ili neki drugi vid normalizacije oba resursa.  
Pronalaženje koncepata iz ontologije u tekstu. 
Kako je ono što želimo da postignemo da u dokumentima nešto (termine koji označavaju koncepte) pronađemo i potom nečim (odgovarajućim taksonomskim identifikatorima) zamenimo, pri čemu te dve stvari imamo izlistane zajedno u prethodno generisanoj datoteci, bilo je moguće listu iz datoteke direktno transformisati u C# funkciju koja bi to radila.  
Ovo je postignuto zamenom karaktera ; u listi sa niskom karakatera ", " zatim konkatenacijom (ili dopisivanjem) niske karaktera doc = doc.Replace(" na početak svakog novog reda i niske karaktera "); na kraj svakog reda, gde se doc odnosi na varijablu koja predstavlja kompletan sadržaj dokumenta (slika 7). 
doc = doc.Replace("Ganglia", "A08.340"); doc = doc.Replace("Neurons", "A08.675"); doc = doc.Replace("Malleus", "A09.246.397.247.524"); doc = doc.Replace("Cochlea", "A09.246.631.246"); doc = doc.Replace("Eyelids", "A09.371.337"); doc = doc.Replace("Choroid", "A09.371.894.223"); doc = doc.Replace("Tissues", "A10"); doc = doc.Replace("Chorion", "A10.615.284.473"); doc = doc.Replace("Muscles", "A10.690"); 
Slika 7. Odlomak C# skripte za pronalaženje i zamenu koja se zasniva na prethodno navedenim konceptima i identifikatorima (slika 6) 
Za zamenu u svim dokumentima koje treba klasifikovati pripremljen je drugi C# kod koji učitava jedan po jedan dokument za klasifikaciju i na njima primenjuje skriptu generisanu u prethodnom koraku kako bi koncepti bili pronađeni prema imenima i zamenjeni identifikatorom čvora iz ontologije. 
Ova etapa je najduža i vremenski najzahtevnija jer se za naš eksperiment podrazumeva primenjivanje 56.309 replace izraza nad 10.000 dokumenata što daje ukupno 563.090.000 transformacija. 
Dalje istraživanje može ići u pravcu korišćenja konačnih automata i transduktora za rešenje ovog problema, koje je kompleksnije za implementaciju, ali brže vrši obrade ovog tipa.  
Transformacija dokumenata u vektore identifikatora (kreiranje surogata) Nakon što su dokumenti uspešno obeleženi identifikatorima koncepata koji se u njima pojavljuju, bilo je neophodno dokumente očistiti od ostalog, neuparenog teksta. 
Kako se ovo ne bi radilo pojedinačno za svaki dokument, oni su spojeni u jedan, veličine 230MB, sa novim redovima kao granicom između dokumenata. 
Informacije od važnosti – nazivi dokumenata ([0-9]+[.]txt), identifikatori u njima ([A-Z][0-9][0-9]([.][0-9][0-9][0-9])*) i oznake za novi red ([\r\n]+) - pronalaze se pomoću regularnog izraza ([A-Z][0-9][0-9]([.][0-9][0-9][0-9])*)|([0-9]+[.]txt)|([\r\n]+), dok se sve ostalo uklanja. 
Ovim se veličina datoteke smanjila preko 450 puta (nova veličina: 0.5MB).  
Po završetku transformacije dobija se datoteka u kojoj svaki novi red predstavlja novi dokument: red započinje nazivom dokumenta (bez ekstenzije) iza koga sledi tačka zarez, a zatim svi identifikatori koncepata koji su u njemu pronađeni odvojeni zarezima (slika 8). 
2875592;M01.060.116 2875593;D13.444.308,D13.444.308 2875594;C04.557.465.625.650.510,D13.444.735,D13.444.735 2875595;A01.236,A01.236;A01.236 2875596;D13.444.735 2875598; 2875599;D02.455.612 
Slika 8. Odlomak datoteke koja sadrži nazive dokumenata i sve identifikatore u njima. 
Ilustrovaćemo na jednom primeru transformaciju jednog od polaznih dokumenta po koracima. 
U delu dokumenta sa Slike 1 prepoznati su neki termini (slika 9), koji su potom zamenjeni identifikatorima (slika 10). 
Uočava se da je u primeru Colorectal došlo do prepoznavanja dela reči i tako je niska Color pogrešno zamenjena sa G01.590.540.19910 jer se termini colorectal cancer i colorectal ne nalaze kao pojmovi u korišćenoj verziji ontologije. 
Slika 11 prikazuje konačan surogat teskta sa Slike 1. 
Goserelin in the adjuvant treatment of breast cancer An update of the Zoladex Early Breast Cancer Research Association (ZEBRA) trial was presented by Professor R Blamey (Nottingham City Hospital, UK). Goserelin was found to be better ... Results were presented by the Austrian Breast and Colorectal Cancer Study Group comparing ... 
Slika 9. Odlomak originalnog dokumenta sa oboleženim terminima koji se nalaze u MeSH ontologiji. 
... D06.472.699.327.740.320.340 in the adjuvant treatment of bre-ast cancer An update of the Zoladex Early A01.236 Cancer H01.770.644 F02.463.425.069 (ZEBRA) trial was presented by Professor R Blamey (Nottingham City Hospital, UK). D06.472.699.327.740.320.340 was found to be better... 
Results were presented by the Z01.542.088 A01.236 and G01.590.540.199ectal Cancer Study Group comparing ... 
Slika 10. Odlomak dokumenta u kome su termini iz MeSH ontologije zamenjeni svojim taksonomskim identifikatorima. 
D06.472.699.327.740.320.340;A01.236;H01.770.644;F02.463.425. 069;D06.472.699.327.740.320.340;A01.236;G01.590.540.199;...  
Slika 11. Konačan surogat odlomka originalnog dokumenta.  
Pre prelaska na klasifikaciju bilo je potrebno je detektovati moguće šumove u vidu pogrešnih obeležja ili pojmova koji se javljaju u prevelikom broj dokumenata te nisu diskriminatorni, kao i koncepata koji se često javljaju, a teško da mogu uspešno klasifikovati dokument. 
Za svaku klasu izbrojan je ukupan broj ponavljanja, što je pružilo uvid u neravnomernu raspodelu (Slika 12).  
Prvi identifikatori koji su dodati u listu stop reči i odstranjeni jesu oni koji se odnose na geografske lokacije pobrojane u ontologiji pod klasom Z01 geografske lokacije kao i homonimi poput termina back, koji se pojavljuje u dokumentima 11.440 puta, očigledno ne uvek da bi označio deo ljudskog tela (leđa). 
Na Slici 13 se, međutim, vidi da je neravnomerna raspodela frekvencija klasa ostala i nakon ovog koraka.  
Nad dokumentima koji su predmet klasifikacije primenjena su dva postupka obrade, pa su tako nastala dva test skupa. 
Kontrolna metoda je bila zamena identifikatora njihovom klasom, opštijom hijerarhijskom oznakom. 
U eksperimentalnoj metodi je uzeta u obzir i dužina identifikatora, pa su oni zamenjivani određenim brojem ponavljanja nadređene klase u zavisnosti od njihove dužine, kako bi se testirala pretpostavka da je korišćenje uže specijalizovanih termina od veće važnosti za određivanje klase dokumenata. 
Dakle, umesto da identifikatori budu skraćeni na prva dva bloka cifara, u obzir je uzeta njihova dužina, to jest dubina svakog od koncepata u drvetu. 
Identifikatori su zamenjeni određenim brojem identifikatora klasa na osnovu njihove dužine, na primer: identifikator D04.345.295.750.650.700 zamenjen je pomoću odgovarajućeg regularnog izraza sa D04.345,D04.345 što je ekvivalentno pojavljivanju dvaju koncepata koji pripadaju klasi D04.345 u tom dokumentu. 
Način mapiranja dužine koncepata u odgovarajući broj ponavljanja dat je u tabeli 1. 
Tu se vidi da se termini poistovećuju sa najviše četiri ponavljanja (u slučaju da imaju preko osam blokova) termina koji označava neku klasu. 
Nakon primene ovih koraka, u surogatima dokumenata sada se pojavljuju samo identifikatori klasa, koje treba jednostavno prebrojati.  
Nakon što su test skupovi uspešno napravljeni, za klasifikaciju dokumenata pripremljen je jednostavan program koji kao ulaz zahteva datoteku sa niskama koje označavaju klase (prva dva bloka cifara) koji su prepoznati. 
Program jednostavno prebrojava klase koje se javljaju u surogatu dokumenta i vraća onu koja se najčešće javlja, 
a ukoliko postoji više klasa koje se u dokumentu javljaju sa istom frekvencijom, vraća se klasa koja se prva pojavljuje, što je logično jer je u surogatima zadržan redosled pojavljivanja termina. 
Takođe, neophodno je da svakom dokumentu bude dodeljen neki identifikator, pa se u slučaju da neki dokument nema dodeljene identifikatore, njemu dodeljuje jedan od najopštijih – H02.403 – koji označava medicinu.  
Kada je niz identifikatora u svakom dokumentu sveden na jednu klasu, ona je uzeta za rezultat klasifikacije i prosleđena na evaluaciju.  
Eksperimenti su izvršeni nad tekstovima iz TREC Clinical Decision Support 2016 skupa (Podrška kliničkom odlučivanju). 
11 Cilj je bio da se dokumenti klasifikuju na osnovu termina koji označavaju koncepte iz ontologije MESH, a koji se u njima javljaju. 
Anotiranje korišćeno u evaluaciji ručno je sproveo ekspertski tim. 
Primenjene su uobičajene metrike srednje prosečne preciznosti, odziva i F-mere, kao i metrika preciznost@10, koja odražava uspešnost vraćanja relevantnih dokumenata u prvih 10 rezultata za neki upit.  
Tabela 2 pokazuje da je uzimanja dužine identifikatora u obzir donelo malo poboljšanje rezultata (5% poboljšana preciznost i F-mera, 7% poboljšan odziv, 12% preciznost@10).  
Uzimajući u obzir dobijene vrednosti, odmah se može primetiti da je preciznost neobično niska u odnosu na odziv. 
Primenjivanjem detaljnije analize podataka, primećuje se jako veliki broj lažnih pogodaka (false positive), pa sa tim opada i preciznost date strategije. 
Ovaj rezultat ne iznenađuje nego je u skladu sa trenutnim standardima u polju klasifikacije medicinskih dokumenata (Cal`ı et al., 2017). 
Glavni problem u konceptno orijentisanom pronalaženju informacija u biomedicinskoj sferi je veliki broj pogrešno negativno klasifikovanih dokumenata, što vodi izuzetno niskom odzivu. 
Mala preciznost je tako u ovom radu prihvatljiva jer je nadomeštena višim odzivom i mnogi relevantni dokumenti su vraćeni na najvišim pozicijama, sa vrednostima za preciznost@10 čak do 58%. 
Ipak i ovde postoji prostor za napredak.  
U ovom radu je predstavljen pristup klasifikaciji dokumenata, koji se zasniva na kreiranju minimalnih surogata teksta. 
U medicinskim tekstovima najpre se pronalaze pojmovi od značaja koji se potom zamenjuju taksonomskim referencama. 
Tako ekstrahovane reference, koriste za klasifikaciju tekstova pomoću prostog algoritma korišćenjem klasa iz MeSH ontologije, a rezultati se potom evaluiraju u odnosu anotaciju ekspertskog tima.  
Preliminarni rezultati pokazuju pogodnost ponuđenog pristupa rešenju ovog kompleksnog zadatka. 
Budući rad fokusiraće se na smanjenje lažnih pogodaka kako bi se unapredile performanse sistema.  
Klasifikacija zasnovana na ontologijama ne zavisi od domena u kom se primenjuje, ali svakako zavisi od raspoloživih resursa, konkretno ontologije ili taksonomije koja se koristi za klasifikaciju (Rakesh et al., 2001), tako da jednom uspostavljen sistem može naići i na širu primenu. 
Kada je u pitanju klasifikacija (medicinskih) dokumenata za srpski jezik, neophodno je najpre pripremiti resurse, pri čemu bi svakako od koristi bila Međunarodna klasifikacija bolesti – Šifarnik bolesti MKB 10. U okviru istraživanja na Rudarsko-geološkom fakultetu kreirana je taksonomija sa ovom klasifikacijom (Kolonja et al., 2016), gde je određen broj termina povezan sa engleskim i latinskim ekvivalentima, što omogućava proširenje pretrage naziva koncepata i njihovog pronalaženja u dokumentima. 
Ipak, treba imati u vidu bogatu morfologiju srpskog jezika koja bi zahtevala dopunu pristupa korišćenjem leksičkih resursa specifičnih za oblast medicine za normalizaciju teksta pre klasifikacije ili indeksiranja, što bi pripomoglo prepoznavanju većeg broja taksonomskih pojmova u dokumentima (Stankovi´c et al., 2015).  
Ovaj rad je nastao u okviru letnje škole Keyword Search in Big Lin-ked Data (Pretraživanje ključnim rečima velike količine podataka), organizovane u okviru COST akcije Keystone od 21. do 25. avgusta 2017. godine na Tehnološkom univerzitetu u Beču.  
