SAŽETAK: U radu se predstavlja izrada sintetičkog skupa za evaluaciju Srpskog SentiWordNet-a koja koristi velike jezičke modele, posebno model Mistral.
 Zbog nedostatka resursa za analizu sentimenta na srpskom jeziku, cilj istraživanja je premošćavanje ovog jaza generisanjem skupa za evaluaciju i unapređenje alata za analizu sentimenta na srpskom.
 Vrednosti polariteta sentimenta iz engleskog SentiWordNet-a automatski su mapirane na Srpski Vordnet.
 Kako bi se ove vrednosti preciznije prilagodile srpskom jeziku, kreiran je poseban skup za evaluaciju.
 Inicijalno je odabrano 500 sinsetova iz Srpskog Vordneta, na osnovu njihove usklađenosti sa senti-pol-sr leksikonom i mapiranim vrednostima iz SentiWordNet-a.
 Ovi sinsetovi su klasifikovani prema polaritetu sentimenta korišćenjem Mistral-a.
Izbalansirani podskup od 75 sinsetova nasumično je izdvojen, dodatno profinjen finijom gradacijom sentimenta i ručno pregledan.
 Rezultati pokazuju visoku preciznost, približno 93%.
KLjUČNE REČI: Analiza sentimenta, veliki jezički modeli, sintetički skup podataka, Srpski jezik, SentiWordNet
Analiza sentimenta je proces računarskog određivanja emocionalnog tona iza teksta kako bi se razumeli stavovi, mišljenja i emocije izražene u njemu.
 Jedna od metoda za analizu sentimenta zasniva se na leksikonima sentimenta.
 Leksikoni sentimenta su specijalizovani rečnici koji povezuju reči i fraze sa vrednostima sentimenta, omogućavajući automatizovanu analizu polariteta emocija u tekstu (Liu 2010).
Jedan od problema koji se identifikuje kod leksikona sentimenta je taj što neki izrazi mogu imati više značenja, pri čemu različita značenja reči mogu izazivati različite sentimente.
 Rešavanje ovog problema podrazumeva dodeljivanje sentimenta prema kontekstualnom značenju reči, a ne prema samoj reči.
 Istaknuti primer takvog leksikona je SentiWordNet (SWN), koji proširuje Princeton WordNet (PWN) rečnik dodeljivanjem ocena sentimenta svakom sinsetu (skup kognitivnih sinonima) kako bi odražavao kolektivni emocionalni ton pojma.
 Ovaj proces uključuje odabir malog broja sinsetova sa visokim polaritetom, nakon čega sledi proširenje ovog skupa kroz poluautomatski metod, koji identifikuje odnose unutar vordneta, a koji ili očuvavaju ili preokreću polaritet.
 Dobijeni prošireni skup se zatim koristi za obučavanje klasifikatora zasnovanih na definicijama ovih sinsetova (Baccianella, Esuli, and Sebastiani 2010).
Vordneti za mnoge jezike su međusobno povezani putem međunarodnog jezičkog indeksa (ILI) – sinset u vordnetu određenog jezika dobija vrednost iz ILI-a, koja predstavlja apstraktan koncept i dodeljuje se sinsetovima u drugim jezicima koji leksikalizuju isti koncept.
 I EuroWordNet (Vossen 2004) i BalkaNet (Tufis, Cristea, and Stamou 2004) su na ovaj način povezani sa PWN-om, a samim tim i sa SWN-om.
 EuroWordNet uključuje vordnete za osam jezika: engleski, holandski, španski, italijanski, nemački, francuski, češki i estonski, dok BalkaNet proširuje ovu listu dodavanjem vordneta za pet dodatnih jezika: bugarski, grčki, rumunski, srpski i turski (Krstev et al. 2004; Krstev, Koeva, and Vitas 2006; Stanković et al. 2018).
 Moguće je lako mapirati SWN na bilo koji vordnet koji ima ILI, što je slučaj za sve vordnete koji pripadaju projektu Otvorenog višejezičkog vordneta (OMW) (Bond and Paik 2012) a koji trenutno uključuje 200 jezika.
Istraživanja su pokazala da se vrednosti sentimenta iz SWN- a mogu primeniti na neengleske jezike korišćenjem ILI-ja (Denecke 2008).
 Srpski vordnet (SrpVN) sadrži vrednosti sentimenta dobijene direktnim mapiranjem sinsetova korišćenjem ILI-ja na SWN (Krstev et al. 2004; Mladenović, Mitrović, and Krstev 2014).
 SrpVN je korišćen u kreiranju hibridnog okvira za analizu sentimenta na srpskom jeziku (Mladenović et al. 2015).
Naša hipoteza je da se ovakav leksikon može poboljšati zamenom mapiranih vrednosti sentimenta onima koje su reprezentativnije za srpski jezik.
 Ovo je već sprovedeno za druge jezike, kao što su turski (Dehkharghani et al. 2016), arapski (Alhazmi and Black 2013), vijetnamski (Vu and Park 2014), odija (Mohanty, Kannan, and Mamidi 2017), indonežanski (Wijayanti and Arisal 2021) i hindi (Bakliwal, Arora, and Varma 2012).
 Međutim, potreban je evaluacioni skup podataka – podskup sinsetoba iz SrpVN-a već anotiranog sa polaritetom sentimenta – kako bi se procenila ovakva poboljšanja za srpski jezik.
Za SWN već postoji takav evaluacioni skup podataka: Micro-WNO (Cerini et al. 2007), ručno označen podskup sinsetova iz PWN-a, koji je javno dostupan.
1 Kreiranje uporedivog evaluacionog skupa podataka za srpski jezik ručnim putem zahtevalo bi značajan napor, uključujući angažovanje malog broja stručnih annotatora ili veće grupe manje veštih annotatora.
 S obzirom na nedostatak takvih resursa, neophodno je razmotriti alternativni pristup.
Sintetički evaluacioni skupovi podataka predstavljaju veštački kreirane kolekcije podataka, razvijene za testiranje i validaciju računarskih modela, posebno u oblastima gde stvarni podaci mogu biti oskudni, pristrasni ili previše osetljivi za upotrebu.
 Ovi skupovi podataka generišu se putem algoritama ili simulacija, sa ciljem da imitiraju statističke osobine stvarnih podataka, omogućavajući istraživačima da sprovode robusne evaluacije pod kontrolisanim uslovima (Lu et al. 2024).
Pojava velikih jezičkih modela (VJM) omogućila je kreiranje značajno boljih sintetičkih skupova podataka.
 Pokazano je da VJM- ovi, za potrebe zadataka iz oblasti obrade prirodnog jezika (OPJ), uključujući analizu sentimenta, mogu uspešno anotirati podatke na osnovu samo nekoliko poznatih (viđenih) primera (Amatriain 2024; Brown et al. 2020).
U scenariju učenja bez ijednog pokušaja (engl. Zero-shot learning), model donosi predikcije ili anotacije bez eksplicitno viđenih primera zadatka tokom treninga.
 Ova sposobnost je posebno korisna za analizu sentimenta u jezicima ili kontekstima gde su anotirani podaci retki, jer omogućava VJM-u da primeni svoje već postojeće znanje na nove, neviđene zadatke (Amatriain 2024; Brown et al. 2020).
Učenje sa nekoliko pokušaja (engl. Few-shot learning), s druge strane, omogućava modelu da iz malog broja primera nauči kako da obavlja određeni zadatak.
 Ovaj pristup je posebno koristan za poboljšanje razumevanja modela i povećanje njegove tačnosti u specifičnim primenama, kao što je razlikovanje nijansiranih izraza sentimenta (Brown et al. 2020).
Korišćenje upita i odgovora (engl. prompts and reposnse) sa VJM-ovima omogućava da se ovi pristupi učenja efikasno primene.
 Kreiranjem upita koji usmeravaju model ka željenom izlazu, istraživači mogu iskoristiti sposobnosti VJM-ova za analizu sentimenta.
 Ovo uključuje dizajn upita koji jasno definiše zadatak, kao što je identifikacija sentimenta datog teksta, i omogućavanje modelu da generiše odgovor na osnovu svog prethodnog treninga i konteksta koji daje upit.
 Takav pristup pomaže u korišćenju potencijala VJM-ova za detaljnu analizu sentimenta, nudeći fleksibilan i efikasan metod za analizu sentimenta u različitim skupovima podataka (Amatriain 2024)
Ovo postavlja pitanje da li bi se VJM-ovi mogli koristiti ne samo za kreiranje skupa za evaluaciju podataka, već i za anotaciju celokupnog SrpVN-a sa vrednostima polariteta sentimenta.
 Odluka da se fokusira na kreiranje malog skupa za evaluaciju proističe iz visokih računarskih troškova povezanih sa anotacijom celokupne mreže.
Primarni cilj ovog pristupa je poboljšanje postojećih vrednosti sentimenta u SrpVN-u, koje su dobijene mapiranjem iz SWN-a.
 Fokus je na sinsetovima koji su u mapiranju označeni kao objektivni, iako sadrže reči koje u leksikonu sentimenta imaju polaritet.
Da bi se postigao balansiran uzorak pogodan za efikasnu evaluaciju, posebno u kasnijoj primeni modela mašinskog učenja za klasifikaciju sentimenta, nasumično je odabrano 500 sinsetova. Ovi sinsetovi su obrađeni korišćenjem modela Mistral.
 Prvi korak u obradi bio je kategorizacija sinsetova u tri grupe: pozitivni, negativni i objektivni sentiment.
 Nakon toga, iz svake kategorije je odabran jednak broj sinsetova za finesu u daljoj gradaciji.
Rezultati su prošli kroz proces ručne anotacije, gde je svaki sinset, zajedno sa vrednostima koje je vratio VJM, procenjen i ocenjen jednostavnom oznakom „uspeh“ ili „neuspeh“, na osnovu njihove usklađenosti sa očekivanim vrednostima sentimenta.
Prvobitno je metodologija bila osmišljena da uključi učenje sa nekoliko pokušaja za finiju gradaciju sentimenta, koristeći primere iz sinsetova koji nisu izabrani za primarni skup podataka — konkretno, onih sinsetova koji su pokazivali očiglednu usklađenost sentimenta u srpskom i engleskom SWN-u.
 Međutim, preliminarni rezultati dobijeni pristupom učenja bez ijednog pokušaja pokazali su se zadovoljavajućim, čime je komponenta učenja sa nekoliko pokušaja postala nepotrebna.
 Zbog toga se istraživanje nastavilo isključivo sa paradigmom učenja bez ijednog pokušaja, pri čemu je Mistral model primenjen bez prethodnih specifičnih primera za zadatak analize sentimenta.
Ručna anotacija rezultata potvrdila je validnost ovog pojednostavljenog pristupa.
 Metodologija učenja bez ijednog pokušaja pokazala je izvanrednu stopu uspeha od preko devedeset procenata, afirmativno pokazujući da čak i bez uključivanja učenja sa nekoliko pokušaja i dodatnog konteksta koji ono pruža, VJM može efikasno da prepozna i klasifikuje sentiment u okviru odabranih srpskih sinsetova.
Glavni VJM korišćen u ovom istraživanju je Mistral 7B – Instruct. To je fino podešena varijanta modela Mistral 7B, jezičkog modela sa 7 milijardi parametara, dizajniranog za vrhunske performanse i efikasnost.
 Mistral 7B nadmašuje model Llama 2 13B na raznim benčmarkovima. Naročito, prevazilazi Llama 1 34B u zadacima rasuđivanja, matematike i generisanja koda (Jiang et al. 2023).
 Mistral 7B – Instruct takođe nadmašuje model Llama 2 13B – Chat kako na ljudskim, tako i na automatizovanim benčmarkovima (Jiang et al. 2023).
 Objavljen pod Apache 2.0 licencom, ovaj model nudi fleksibilno sredstvo za istraživače, sa mogućnošću da se koristi na lokalnom računaru bez dodatnih troškova (Jiang et al. 2023).
Ovaj rad je organizovan u nekoliko ključnih poglavlja kako bi se sveobuhvatno diskutovalo o istraživanju i rezultatima.
 U poglavlju 2 detaljno je opisana metodologija, uključujući odabir definicija sinsetova za obradu, specifične upite korišćene u istraživanju, kao i primenu ovih upita.
 Pored toga, ukratko su pomenuti pokušaji korišćenja drugih jezičkih modela radi poređenja.
 Poglavlje 3 prikazuje rezultate, opisujući tačnost modela sa primerima sinsetova ocenjenih kao ispravni i neispravni, kao i odgovore koji nisu pripadali zadatom skupu definisanom instrukcijama upita.
 Na kraju, poglavlje 4 zaključuje rad sa sažetkom nalaza i diskusijom o potencijalnim budućim radovima koji bi mogli proširiti ovo istraživanje.
Senti-pol-sr je leksikon polariteta za srpski jezik, anotiran na nivou reči, a ne na nivou značenja reči (Stanković et al. 2022).
 U našem istraživanju, ovaj leksikon je korišćen za odabir uzorka pogodnog za anotaciju pomoću VJM-a.
 Ovo je postignuto identifikacijom svih sinsetova iz SrpVN-a koji sadrže literale prisutne u leksikonu sentipol- sr i istovremeno imaju neutralnu vrednost sentimenta (0,0), kako je mapirano iz SWN-a.
Detektovana su četiri glavna razloga za neslaganja između vrednosti sentimenta u leksikonu senti-pol-sr i onih izvedenih iz SWN- a.
 Prvo, dok reč može prenositi polarizujući sentiment, stvarno značenje u kojem se koristi možda ne nosi taj sentiment.
 Na primer, sinset ENG30-06828389-n (def. „karakter nalik na zvezdu (*) koji se koristi u štampanim tekstovima“) u Srpskom Vordnetu sadrži literal „zvezda“, koja u drugim sinsetovima može imati pozitivne konotacije.
 Drugo, vrednosti sentimenta u SWN-u, generisane metodama mašinskog učenja, mogu biti netačne.
 Na primer, sinset ENG30-02585489-v (def. „izazvati patnju“) koji je očigledno veoma negativan.
 Treće, ako sinset nema odgovarajući sinset u PWN-u, kao što je BILI-00000941 (def, „Glasno izražavati žalost, zapevati, tužiti.“), uobičajeno mu se dodeljuje polaritet (0,0).
Najinteresantnija mogućnost je da se koncept smatra objektivnim na engleskom, dok na srpskom jeziku nosi sentiment.
 Takvi sinsetovi još nisu pronađeni.
Početna analiza identifikovala je 2.956 sinsetova od ukupno 25.320 unutar SrpVN-a(Mladenović, Stanković, and Krstev 2017) koji su sadržali literale anotirane sa jasnim polaritetom u leksikonu senti-pol-sr i imali vrednost polariteta (0,0), od čega 1.511 pokazuje pozitivan sentiment, a 1.445 negativan.
 S obzirom na veliki obim, obrada svih ovih sinsetova pomoću VJM-a nije bila izvodljiva, pa je nasumično odabran uzorak od 500 sinsetova za dalju analizu.
Radi kreiranja uravnoteženog skupa uzoraka, definicije iz ovog nasumičnog uzorka su obrađene korišćenjem LangChain Python biblioteke, moćnog alata za kreiranje, eksperimentisanje i analiziranje jezičkih modela i agenata (Chase 2022).
 LangChain Python biblioteka funkcioniše kao interfejs za module više velikih jezičkih modela.
 Ovaj projekat je koristio omotače projektovane za Hugging Face Hub i Transformer biblioteke.
 Procedura korišćena u ovom istraživanju sadržala je samo jedan šablon upita sa jednom ulaznom promenljivom – definicijom sinseta, i Mistral 7B – Instruct model preuzet sa Hugging Face Hub-a.
 Model je izvršen na lokalnom računaru.
 Biblioteka LangChain omogućava da se upitni šabloni sa promenljivama, koje su označene vitičastim zagradama, popune vrednostima tih promenljivih i proslede kao upit VJM modulu, koji zatim vraća odgovor.
Koristeći odgovarajući upit kao što je prikazano na slici 1, uzorak je podeljen na one označene kao pozitivne, negativne, objektivne i one koji nisu ispravno označeni.
 Bilo je 290 objektivnih, 102 negativna, 33 pozitivna i 75 pogrešno označenih sinsetova.
Slika 1. Šablon upita za određivanje polariteta.
Da bi se iskoristile pune mogućnosti VJM-a za analizu sentimenta, upit je pažljivo projektovan da obuhvati tri ključna elementa: dodelu uloga (engl. role-play), jasne instrukcije i očekivane ishode.
1. Dodela uloga: instrukcija VJM-u kao ekspertu:
 Upit započinje scenarijom igranja uloga, gde se VJM-u daje instrukcija da preuzme ulogu eksperta za analizu sentimenta (slika 1).
 Ovaj pristup je usvojen kako bi se model usmerio ka analitičkom i fokusiranom ispitivanju teksta, oslanjajući se na svoje opsežno unapred obučeno znanje i razumevanje nijansi analize sentimenta.
2. Jasne instrukcije:
 suština efikasne komunikacije sa VJM-om leži u jasnoći instrukcija.
 Upit eksplicitno opisuje zadatak, vodeći VJM da identifikuje i analizira sentiment izražen u datom delu teksta (definiciji sinseta).
 Ova jasnoća osigurava da su analitičke sposobnosti modela usmerene ka tačnom procenjivanju sentimenta, minimizujući dvosmislenost u njegovim odgovorima.
3. Očekivani ishodi:
 da bi se dodatno usavršio izlaz modela, upit precizira očekivane ishode analize.
 Navodi željeni format odgovora, bilo da je to klasifikacija sentimenta (pozitivan, negativan, neutralan) ili nijansiranija ocena sentimenta.
Upit korišćen za klasifikaciju je usavršen putem eksperimentalnog testiranja na manjem podskupu definicija sinseta.
 Uporedne analize instrukcija upita na engleskom i srpskom jeziku otkrile su da su upiti na srpskom jeziku davali tačnije rezultate.
 Kako bi se obezbedilo sveobuhvatno pokrivanje potencijalnih odgovora, broj tokena u izlazu je postavljen na pet.
Dalje ispitivanje pokazalo je postojanje duplikata unutar skupa, zbog toga što neki sinsetovi sadrže više literala koji su takođe reči iz senti-pol-sr leksikona, kao što je sinset ENG30-01375831-a „slavan, poznat, čuven, značajan, renomiran, priznat, proslavljen: opšte prihvaćen i uvažen“. Važno je napomenuti da se svi osim dva literala („renomiran“, „priznat“) iz ovog sinseta pojavljuju u leksikonu, i označeni su kao pozitivni.
 Nakon uklanjanja duplikata, ostalo je 279 objektivnih, 97 negativnih i 27 pozitivnih sinsetova.
 U ovom koraku nije bilo potrebe za brojanjem nepravilno označenih sinsetova, jer uklanjanje duplikata iz njih nema praktičan značaj.
Za detaljniju analizu sentimenta, nasumično je odabran podskup od po 25 sinsetova iz svake kategorije sentimenta, formirajući takozvani „balansirani uzorak“.
Balansirani uzorak je dalje obrađen kroz dva šablona upita za nijansiranu obradu sentimenta, jedan za pozitivan i jedan za negativan sentiment (slike 2 i 3).
 Ovi šabloni upita su projektovani eksperimentalno, kroz iterativno testiranje raznih opcija i postepeno prilagođavanje teksta, koristeći male skupove definicija sinsetova iz SrpVN-a.
 Na primer, ponavljanje rečenice „Nijedan drugi odgovor neće biti prihvaćen“ dva puta značajno je smanjilo broj odgovora van okvira.
Slika 2. Šablon upita za finu oznaku pozitivnog sentimenta.
Slika 3. Šablon upita za finu oznaku negativnog sentimenta.
Jedinstveni upit za određivanje obe vrednosti nije odabran kako bi se očuvala doslednost sa strukturom SWN-a, gde sinset može imati pozitivne (POS) i negativne (NEG) vrednosti iznad nule, sve dok njihov zbir nije veći od jedan.
Tokom ove faze, testirani su i drugi VJM modeli na malom uzorku – GPT2-ORAO (Škorić 2024), Llama-2-7b (Touvron et al. 2023), alpacaserbian- 7b-base i WizardLM-1.0-Uncensored-Llama2-13b.
 Ideja je bila da se uporede različiti rezultati, simulirajući anotaciju od strane više anotatora.
 Međutim, rezultati su doveli do njihovog isključenja iz daljeg rada zbog prevelikog broja nepravilno označenih sinsetova i nedostatka finije gradacije.
Za svaku definiciju u balansiranom uzorku, dodeljene su dve vrednosti na taj način.
 Intencija šablona upita i dizajn ograničavaju odgovore na sledeći set odgovora:
– Za pozitivan sentiment:
• „nije pozitivan“
• „slabo pozitivan“
• „umereno pozitivan“
• „veoma pozitivan“
• „ekstremno pozitivan“
– Za negativan sentiment:
• „nije negativan“
• „slabo negativan“
• „umereno negativan“
• „veoma negativan“
• „ekstremno negativan“
Rezultirajući skup podataka je sačuvan u formi datoteke sa vrednostima odvojenim zarezima (CSV).
3 Kolone u toj datoteci su sledeće:
ILI: Međuєzički Indeks, koji povezuje sinset sa njegovim ekvivalentima u WordNet-ima drugih jezika.
Definition: Glosa sinseta, koja pruža njegovo značenje ili objašnjenje.
 Lemma_names: Literali sadržanih u sinsetu.
Sentiment_SWN: Vrednost sentimenta mapirana iz SWN-a, koja pokazuje originalni skor sentimenta u engleskoj verziji.
Sentiment_lexicon : Vrednost sentimenta izvedena iz leksikona sentimenta senti-pol-sr kreiranog za srpski jezik, odražavajući lokalne nijanse sentimenta.
Sentiment_sa : Inicijalna klasifikacija od strane velikog jezičkog modela, kategorizujući sentiment kao pozitivan, negativan ili neutralan.
Sentiment_sa_positive : Fino klasifikovanje sentimenta za pozitivan sentiment, označavajući stepen pozitivnosti od „nije pozitivan“ do „ekstremno pozitivan“.
Sentiment_sa_negative : Fino klasifikovanje sentimenta za negativan sentiment, označavajući stepen negativnosti od „nije negativan“ do „ekstremno negativan“.
S obzirom na mali uzorak od 75, autor je mogao sprovesti ručnu evaluaciju celog skupa podataka.
 Ovaj proces je unapređen korišćenjem Data Wrangler ekstenzije u Visual Studio Code-u, koja je alatka za vizualizaciju i čišćenje podataka i dobro se integriše sa VS Code-om i VS Code Jupyter Notebooks-om.
 Alatka pruža interaktivni interfejs za pregled i analizu podataka, nudi informativne statistike i vizuelne prikaze, i može ubrzati čišćenje podataka automatskim generisanjem Pandas skripti za modifikaciju podataka.
 Koristila se za pažljivo ispitivanje definicija sinsetova i njihovo poređenje sa detaljnim povratnim informacijama o sentimentu.
Rezime izlaza generisanih od strane VJM-a korišćenjem šablona upita za finu gradaciju sentimenta prikazan je u tabelama 1 i 2.
Izlaz Broj u sentiment_sa_negative ekstremno negativan 1 nije negativan 60 umereno negativan 1 umjereno negativan 2 veoma negativan 11 Ukupno 75
Tabela 1. Negativan sentiment.
Izlaz Broj u sentiment_sa_positive Nije Ova iz 1 Nije pozitivan 39 Nijedan O 6 Nijedan Tekst 1 Učimo se držati 1 Umereno pozitivan 3 Umereno pozitivan The 2 Umjereno pozitivan 6 veoma pozitivan 12 Veoma pozitivan O 1 Veoma pozitivan R 2 Veoma pozitivan Ov 1 Ukupno 75
Tabela 2. Pozitivan sentiment
Podaci u tabelama pokazuju da izlaz VJM-a nije bio ograničen kako je naznačeno u šablonu upita, ali je ostao unutar granica koje se lako mogu ispraviti.
 Izlaz generisan od negativnog šablona upita u velikoj meri se poklapao sa predloženim izlazom, uz samo manje dijalekatske varijacije.
 Nasuprot tome, izlaz iz pozitivnog šablona upita uključivao je jedan besmislen odgovor, „učimo se držati“, kao i neke odgovore koji se mogu labavo tumačiti kao ne-pozitivni.
 Tokom ručne provere, svi ovi odgovori su klasifikovani kao ne-pozitivni.
Dodatno, manje tipografske greške, kao što su dodatna slova, pogrešni padeži ili greške u velikim slovima, zanemarene su tokom ručne provere.
 Samo jedna osoba je sprovela evaluaciju. Nadalje, u izlazima nisu pronađeni primeri blago pozitivnih ili blago negativnih sinsetova.
 Za sadržaj su dva sinseta očigledno nepravilno označena, a tri su bila sumnjiva.
Očigledno nepravilno su označeni sinsetovi:
– BILI-00000941, ‘naricati: Glasno izražavati žalost, zapevati, tužiti.’ označen je kao potpuno objektivan (niti pozitivan niti negativan), dok očigledno nosi negativan sentiment, štaviše, izrazito negativan.
– ENG30-04525038-n, ‘baršun, somot, pliš, kadifa: Svilenkasta, gusta, čupava tkanina, ravna sa poleđina.’, koji je označen kao blago pozitivan.
 Kao vrsta tekstila, trebalo bi da bude objektivan.
Sinsetovi koji se smatraju sumnjivim su:
– ENG30-01215137-v, ‘uhapsiti, zatvoriti, skembati: Staviti u pritvor, kao osumnjičene kriminalce; o policiji.’ označen kao blago negativan, dok ga je evaluator ocenio kao izrazito negativan.
– ENG30-00309647-n, ‘ekspedicija: Putovanje organizovano sa specijalnim ciljem.’ označen kao veoma pozitivan, dok ga je evaluator smatrao neutralnim.
– ENG30-03135152-n, ‘krst: krst kao znamenje hrišćanstva’ označen kao veoma pozitivan, dok ga je evaluator smatrao neutralnim.
Od većine sinsetova koji su tačno označeni tokom našeg procesa analize sentimenta, ovde predstavljamo izbor ilustrativnih primera.
 Ovi primeri bi takođe trebalo da demonstriraju kriterijume korišćene u evaluaciji prilikom razmatranja ispravne oznake u klasifikacijama na pozitivne, negativne i neutralne sentimente.
 Neki primeri su:
– ENG30-01220336-n: Sinset povezan sa akcijama poput „kleveta“, „klevetanje“ i „omalovažavanje“, opisan kao „oštar napad na čiju ličnost ili dobro ime“.
 Sentiment ovog sinseta ocenjen je kao „Nije pozitivan“, što odražava odsustvo pozitivnog sentimenta, i preciznije, „Ekstremno negativan“, tačno hvatajući negativne konotacije opisanih akcija.
– ENG30-06828389-n: Ovaj sinset se odnosi na „karakter nalik na zvezdu (*) koji se koristi u štampanim tekstovima“, sa literalima „asterisk“, „zvezdica“ i „zvezda“.
 Sentiment za ovaj sinset je precizno klasifikovan kao „Nije pozitivan“ i „Nije negativan“, ukazujući na njegovu objektivnu prirodu bez inherentnog pozitivnog ili negativnog sentimenta.
– ENG30-10407310-n: Odnosi se na „onaj koji voli i brine o svojoj zemlji“, sa literalima „domoljub“, „patriota“ i „rodoljub“.
Sentiment ovog sinseta je fino ocenjen kao „Veoma pozitivan“ i „Nije negativan“, efikasno hvatajući pozitivne konotacije povezane sa patriotizmom.
Analiza izlaza generisanog od strane VJM-a, konkretno Mistral modela, pokazuje da je 70 od 75 odgovora ispunilo kriterijume prihvatljivosti definisane za ovo istraživanje.
 Ovaj rezultat, koji predstavlja značajnu većinu skupa podataka, naglašava pouzdanost i efikasnost Mistral modela u izvođenju klasifikacije sentimenta za srpski jezik.
 Sa približnom stopom uspeha od 93,3%, može se sa sigurnošću zaključiti da je skup podataka i upotrebljiv i dovoljnog kvaliteta za nameravanu svrhu evaluacije predloženih korekcija polariteta sentimenta unutar Srpskog WordNet-a.
Neuspeh drugih testiranih modela može biti rezultat upita optimizovanih za Mistral model.
 Kreiranje upita za svaki model pojedinačno moglo bi omogućiti upotrebu više modela za postizanje boljeg kvaliteta.
Značajno područje za buduća istraživanja uključuje proširenje šablona upita sa specifičnim primerima, prelazeći iz trenutnog pristupa učenja bez ijednog pokušaja na paradigmu učenja sa nekoliko pokušaja.
 Ova modifikacija se očekuje da poboljša kapacitet modela za nijansiranu gradaciju sentimenta, nudeći precizniju i kontekstualno svesniju analizu.
 Posebno se preporučuje da se ovo unapređenje selektivno primeni na šablone za finu gradaciju sentimenta, gde je potencijal za povećanu tačnost i osetljivost na jezičke suptilnosti najizraženiji (Brown et al. 2020).
Ovo istraživanje predstavlja inicijalno ispitivanje mogućnosti korišćenja modela Mistral za generisanje dodatnih sintetičkih skupova podataka za srpski jezik, posebno u oblastima gde su resursi oskudni ili ih je teško pribaviti iz prirodnih korpusa.
 Uspešna primena modela Mistral za analizu sentimenta naglašava njegov potencijal kao vrednog alata u prevazilaženju ovih izazova.



