Simple view
Full metadata view
Authors
Statistics
Multilingual language model evaluation on low-resource languages
Porównanie jakości wielojęzycznych modeli językowych na językach mniej zasobnych
wielojęzyczne modele językowe, języki mniej zasobne, przetwarzanie języka naturalnego, zbiór równoległych tekstów generowanych maszynowo, analiza stylometryczna
multilingual language models, low-resource languages, natural language processing, parallel language model excerpts dataset, stylometric analysis
Niniejsza praca bada funkcjonowanie wielojęzycznych modeli językowych na językach mniej zasobnych, skupiając się na zdolności modeli do generowania tekstów porównywalnych z tekstami pisanymi przez ludzi. Analiza ma charakter stylometryczny. Opiera się ona na cechach językowych wydobytych z badanych tekstów za pomocą biblioteki spaCy, które następnie są analizowane z użyciem klasyfikatora opartego na drzewach decyzyjnych z wzmocnieniem gradientowym (LightGBM) oraz interpretowane za pomocą wartości SHAP. W ramach pracy powstaje zbiór danych obejmujący równoległe teksty generowane maszynowo. Zbiór ten uwzględnia wiele języków należących do różnych rodzin i typów strukturalnych. Teksty mają odzwierciedlać styl i treść streszczeń artykułów z Wikipedii, które pełnią rolę danych referencyjnych. W zadaniu klasyfikacji wieloklasowej zastosowane podejście uzyskuje wysokie wyniki, osiągając dokładność nawet do 0.90. Analiza wyjaśniająca wskazuje na szerokie spektrum cech językowych istotnych dla klasyfikacji, spośród których szczególnie często wyróżnia się interpunkcja, choć jej rola okazuje się zależna od modelu i od języka. Wyniki wskazują, że teksty generowane przez modele można odróżnić zarówno od tekstów autorstwa człowieka, jak i od siebie nawzajem.
This thesis investigates how multilingual language models behave in the context of low-resource languages, assessing their ability to generate texts comparable to those written by humans. The analysis adopts a stylometric approach, relying on linguistic features extracted from examined texts with the spaCy library, which are then analysed using a gradient boosted decision tree classifier (LightGBM) and interpreted with SHAP values. As part of the study, a parallel dataset of machine-generated texts is constructed, covering a diverse set of languages representing different families and structural types. The texts are intended to reflect the style and content of Wikipedia article summaries serving as reference data. In the multiclass classification setting, the approach maintains strong performance, with accuracy scores reaching up to 0.90. The explanatory analysis further reveals a variety of distinctive linguistic features relevant to the classification, among which punctuation consistently proves particularly influential, although the exact patterns remain model- and language-specific. The findings indicate that machine-generated texts are distinguishable from human-authored texts, as well as from one another.
| dc.abstract.en | This thesis investigates how multilingual language models behave in the context of low-resource languages, assessing their ability to generate texts comparable to those written by humans. The analysis adopts a stylometric approach, relying on linguistic features extracted from examined texts with the spaCy library, which are then analysed using a gradient boosted decision tree classifier (LightGBM) and interpreted with SHAP values. As part of the study, a parallel dataset of machine-generated texts is constructed, covering a diverse set of languages representing different families and structural types. The texts are intended to reflect the style and content of Wikipedia article summaries serving as reference data. In the multiclass classification setting, the approach maintains strong performance, with accuracy scores reaching up to 0.90. The explanatory analysis further reveals a variety of distinctive linguistic features relevant to the classification, among which punctuation consistently proves particularly influential, although the exact patterns remain model- and language-specific. The findings indicate that machine-generated texts are distinguishable from human-authored texts, as well as from one another. | pl |
| dc.abstract.pl | Niniejsza praca bada funkcjonowanie wielojęzycznych modeli językowych na językach mniej zasobnych, skupiając się na zdolności modeli do generowania tekstów porównywalnych z tekstami pisanymi przez ludzi. Analiza ma charakter stylometryczny. Opiera się ona na cechach językowych wydobytych z badanych tekstów za pomocą biblioteki spaCy, które następnie są analizowane z użyciem klasyfikatora opartego na drzewach decyzyjnych z wzmocnieniem gradientowym (LightGBM) oraz interpretowane za pomocą wartości SHAP. W ramach pracy powstaje zbiór danych obejmujący równoległe teksty generowane maszynowo. Zbiór ten uwzględnia wiele języków należących do różnych rodzin i typów strukturalnych. Teksty mają odzwierciedlać styl i treść streszczeń artykułów z Wikipedii, które pełnią rolę danych referencyjnych. W zadaniu klasyfikacji wieloklasowej zastosowane podejście uzyskuje wysokie wyniki, osiągając dokładność nawet do 0.90. Analiza wyjaśniająca wskazuje na szerokie spektrum cech językowych istotnych dla klasyfikacji, spośród których szczególnie często wyróżnia się interpunkcja, choć jej rola okazuje się zależna od modelu i od języka. Wyniki wskazują, że teksty generowane przez modele można odróżnić zarówno od tekstów autorstwa człowieka, jak i od siebie nawzajem. | pl |
| dc.affiliation | Uniwersytet Jagielloński w Krakowie | pl |
| dc.contributor.advisor | Ochab, Jeremi - 122224 | pl |
| dc.contributor.author | Zięba, Cezary - USOS291053 | pl |
| dc.contributor.departmentbycode | UJK/UJK | pl |
| dc.contributor.reviewer | Ochab, Jeremi - 122224 | pl |
| dc.contributor.reviewer | Nalepa, Grzegorz - 200414 | pl |
| dc.date.accessioned | 2025-09-29T22:31:09Z | |
| dc.date.available | 2025-09-29T22:31:09Z | |
| dc.date.createdat | 2025-09-29T22:31:09Z | en |
| dc.date.submitted | 2025-09-25 | pl |
| dc.date.submitted | 2025-09-25 | |
| dc.fieldofstudy | informatyka stosowana | pl |
| dc.identifier.apd | diploma-179203-291053 | pl |
| dc.identifier.uri | https://ruj.uj.edu.pl/handle/item/561588 | |
| dc.language | eng | pl |
| dc.source.integrator | false | |
| dc.subject.en | multilingual language models, low-resource languages, natural language processing, parallel language model excerpts dataset, stylometric analysis | pl |
| dc.subject.pl | wielojęzyczne modele językowe, języki mniej zasobne, przetwarzanie języka naturalnego, zbiór równoległych tekstów generowanych maszynowo, analiza stylometryczna | pl |
| dc.title | Multilingual language model evaluation on low-resource languages | pl |
| dc.title.alternative | Porównanie jakości wielojęzycznych modeli językowych na językach mniej zasobnych | pl |
| dc.type | master | pl |
| dspace.entity.type | Publication |