Multilingual language model evaluation on low-resource languages

master
dc.abstract.enThis thesis investigates how multilingual language models behave in the context of low-resource languages, assessing their ability to generate texts comparable to those written by humans. The analysis adopts a stylometric approach, relying on linguistic features extracted from examined texts with the spaCy library, which are then analysed using a gradient boosted decision tree classifier (LightGBM) and interpreted with SHAP values. As part of the study, a parallel dataset of machine-generated texts is constructed, covering a diverse set of languages representing different families and structural types. The texts are intended to reflect the style and content of Wikipedia article summaries serving as reference data. In the multiclass classification setting, the approach maintains strong performance, with accuracy scores reaching up to 0.90. The explanatory analysis further reveals a variety of distinctive linguistic features relevant to the classification, among which punctuation consistently proves particularly influential, although the exact patterns remain model- and language-specific. The findings indicate that machine-generated texts are distinguishable from human-authored texts, as well as from one another.pl
dc.abstract.plNiniejsza praca bada funkcjonowanie wielojęzycznych modeli językowych na językach mniej zasobnych, skupiając się na zdolności modeli do generowania tekstów porównywalnych z tekstami pisanymi przez ludzi. Analiza ma charakter stylometryczny. Opiera się ona na cechach językowych wydobytych z badanych tekstów za pomocą biblioteki spaCy, które następnie są analizowane z użyciem klasyfikatora opartego na drzewach decyzyjnych z wzmocnieniem gradientowym (LightGBM) oraz interpretowane za pomocą wartości SHAP. W ramach pracy powstaje zbiór danych obejmujący równoległe teksty generowane maszynowo. Zbiór ten uwzględnia wiele języków należących do różnych rodzin i typów strukturalnych. Teksty mają odzwierciedlać styl i treść streszczeń artykułów z Wikipedii, które pełnią rolę danych referencyjnych. W zadaniu klasyfikacji wieloklasowej zastosowane podejście uzyskuje wysokie wyniki, osiągając dokładność nawet do 0.90. Analiza wyjaśniająca wskazuje na szerokie spektrum cech językowych istotnych dla klasyfikacji, spośród których szczególnie często wyróżnia się interpunkcja, choć jej rola okazuje się zależna od modelu i od języka. Wyniki wskazują, że teksty generowane przez modele można odróżnić zarówno od tekstów autorstwa człowieka, jak i od siebie nawzajem.pl
dc.affiliationUniwersytet Jagielloński w Krakowiepl
dc.contributor.advisorOchab, Jeremi - 122224 pl
dc.contributor.authorZięba, Cezary - USOS291053 pl
dc.contributor.departmentbycodeUJK/UJKpl
dc.contributor.reviewerOchab, Jeremi - 122224 pl
dc.contributor.reviewerNalepa, Grzegorz - 200414 pl
dc.date.accessioned2025-09-29T22:31:09Z
dc.date.available2025-09-29T22:31:09Z
dc.date.createdat2025-09-29T22:31:09Zen
dc.date.submitted2025-09-25pl
dc.date.submitted2025-09-25
dc.fieldofstudyinformatyka stosowanapl
dc.identifier.apddiploma-179203-291053pl
dc.identifier.urihttps://ruj.uj.edu.pl/handle/item/561588
dc.languageengpl
dc.source.integratorfalse
dc.subject.enmultilingual language models, low-resource languages, natural language processing, parallel language model excerpts dataset, stylometric analysispl
dc.subject.plwielojęzyczne modele językowe, języki mniej zasobne, przetwarzanie języka naturalnego, zbiór równoległych tekstów generowanych maszynowo, analiza stylometrycznapl
dc.titleMultilingual language model evaluation on low-resource languagespl
dc.title.alternativePorównanie jakości wielojęzycznych modeli językowych na językach mniej zasobnychpl
dc.typemasterpl
dspace.entity.typePublication
dc.abstract.enpl
This thesis investigates how multilingual language models behave in the context of low-resource languages, assessing their ability to generate texts comparable to those written by humans. The analysis adopts a stylometric approach, relying on linguistic features extracted from examined texts with the spaCy library, which are then analysed using a gradient boosted decision tree classifier (LightGBM) and interpreted with SHAP values. As part of the study, a parallel dataset of machine-generated texts is constructed, covering a diverse set of languages representing different families and structural types. The texts are intended to reflect the style and content of Wikipedia article summaries serving as reference data. In the multiclass classification setting, the approach maintains strong performance, with accuracy scores reaching up to 0.90. The explanatory analysis further reveals a variety of distinctive linguistic features relevant to the classification, among which punctuation consistently proves particularly influential, although the exact patterns remain model- and language-specific. The findings indicate that machine-generated texts are distinguishable from human-authored texts, as well as from one another.
dc.abstract.plpl
Niniejsza praca bada funkcjonowanie wielojęzycznych modeli językowych na językach mniej zasobnych, skupiając się na zdolności modeli do generowania tekstów porównywalnych z tekstami pisanymi przez ludzi. Analiza ma charakter stylometryczny. Opiera się ona na cechach językowych wydobytych z badanych tekstów za pomocą biblioteki spaCy, które następnie są analizowane z użyciem klasyfikatora opartego na drzewach decyzyjnych z wzmocnieniem gradientowym (LightGBM) oraz interpretowane za pomocą wartości SHAP. W ramach pracy powstaje zbiór danych obejmujący równoległe teksty generowane maszynowo. Zbiór ten uwzględnia wiele języków należących do różnych rodzin i typów strukturalnych. Teksty mają odzwierciedlać styl i treść streszczeń artykułów z Wikipedii, które pełnią rolę danych referencyjnych. W zadaniu klasyfikacji wieloklasowej zastosowane podejście uzyskuje wysokie wyniki, osiągając dokładność nawet do 0.90. Analiza wyjaśniająca wskazuje na szerokie spektrum cech językowych istotnych dla klasyfikacji, spośród których szczególnie często wyróżnia się interpunkcja, choć jej rola okazuje się zależna od modelu i od języka. Wyniki wskazują, że teksty generowane przez modele można odróżnić zarówno od tekstów autorstwa człowieka, jak i od siebie nawzajem.
dc.affiliationpl
Uniwersytet Jagielloński w Krakowie
dc.contributor.advisorpl
Ochab, Jeremi - 122224
dc.contributor.authorpl
Zięba, Cezary - USOS291053
dc.contributor.departmentbycodepl
UJK/UJK
dc.contributor.reviewerpl
Ochab, Jeremi - 122224
dc.contributor.reviewerpl
Nalepa, Grzegorz - 200414
dc.date.accessioned
2025-09-29T22:31:09Z
dc.date.available
2025-09-29T22:31:09Z
dc.date.createdaten
2025-09-29T22:31:09Z
dc.date.submittedpl
2025-09-25
dc.date.submitted
2025-09-25
dc.fieldofstudypl
informatyka stosowana
dc.identifier.apdpl
diploma-179203-291053
dc.identifier.uri
https://ruj.uj.edu.pl/handle/item/561588
dc.languagepl
eng
dc.source.integrator
false
dc.subject.enpl
multilingual language models, low-resource languages, natural language processing, parallel language model excerpts dataset, stylometric analysis
dc.subject.plpl
wielojęzyczne modele językowe, języki mniej zasobne, przetwarzanie języka naturalnego, zbiór równoległych tekstów generowanych maszynowo, analiza stylometryczna
dc.titlepl
Multilingual language model evaluation on low-resource languages
dc.title.alternativepl
Porównanie jakości wielojęzycznych modeli językowych na językach mniej zasobnych
dc.typepl
master
dspace.entity.type
Publication
Affiliations

* The migration of download and view statistics prior to the date of April 8, 2024 is in progress.

Views
45
Views per month
Views per city
Warsaw
40
Frankfurt am Main
3
Krakow
1
Poznan
1

No access

No Thumbnail Available
Collections