АВТОМАТИЧЕСКОЕ СИНОНИМИЧЕСКОЕ ПЕРЕФОРМУЛИРОВАНИЕ ТЕКСТА НА КАЗАХСКОМ ЯЗЫКЕ: МЕТОД, ОСНОВАННЫЙ НА МОРФОЛОГИЧЕСКИХ И СЕМАНТИЧЕСКИХ ОГРАНИЧЕНИЯХ

Авторы

  • Аяулым Сайранбекова Евразийский национальный университет имени Л.Н. Гумилёва
  • Гульмира Бекманова Евразийский национальный университет имени Л.Н. Гумилёва
  • Валентина Франзони University of Perugia, Перуджа, Италия
  • Айжан Назырова Евразийский национальный университет имени Л.Н. Гумилёва
  • Жанар Ламашева Евразийский национальный университет имени Л.Н. Гумилёва

Ключевые слова:

обработка естественного языка, казахский язык, перефразирование, морфологический анализ, Word2Vec, KazRoBERTa

Аннотация

В статье рассматривается метод автоматического синонимического перефразирования казахскоязычных текстов с учётом морфологических и семантических ограничений. Агглютинативная структура казахского языка, закон сингармонизма и фонетические чередования создают специфические трудности в задаче перефразирования. В основе предлагаемого метода лежит гибридная архитектура, объединяющая лингвистические правила (морфологический анализатор, графемные трансформации) с семантическими моделями (Word2Vec, UD-парсинг). Обработка текста выполняется в несколько этапов: лемматизация, поиск синонимов-кандидатов, морфосинтаксическая фильтрация и реконверсия. Эксперимент проводился на корпусе из 1000 предложений политико-публицистической направленности. Морфологическая точность метода составила 92,4%, показатель BERTScore (KazRoBERTa) – 0,873, средняя экспертная оценка – 4,12 из 5. Полученные результаты существенно превосходят показатели mBERT (BERTScore 0,791) и mT5 без fine-tuning (BERTScore 0,684). Метод применим для лексического обогащения, перефразирования и автоматической обработки политических и публицистических текстов.

Библиографические ссылки

Sairanbekova A. et al. Automatic Analysis of Political Discourse: A Comparative Study of Multilingual and Large Language Models //Journal of Applied Data Sciences. -2026.-Vol.7(2). -P.1136-1148. DOI 10.47738/jads.v7i2.1118.

Fairclough I., Fairclough N. Political discourse analysis: A method for advanced students. -Routledge, 2013. -244 p.

Washington J. N. et al. Finite-state morphological transducers for three Kypchak languages //LREC. -2014. -P.3378-3385.

Makhambetov O. et al. Data-driven morphological analysis and disambiguation for Kazakh //CICLing. -Springer, 2015. -P.151-163.

Makhambetov O. et al. KazNLP: NLP tools for Kazakh language [Electronic resource]. -2018. URL: https://github.com/nlacslab/kaznlpю -Date of access: 05.05.2026.

Baitenova L. et al. Hybrid artificial intelligence architectures for automatic text correction in the Kazakh language //Frontiers in Artificial Intelligence. -2025.-Vol.8. -P.1708566. DOI 10.3389/frai.2025.1708566.

Hakimov S. TurkicNLP: An NLP Toolkit for Turkic Languages //arXiv preprint. -2026. -P.1-7. DOI arXiv:2602.19174.

Mikolov T. et al. Efficient estimation of word representations in vector space //arXiv preprint. -2013. -P.1-12. DOI arXiv:1301.3781.

Pennington J., Socher R., Manning C. D. Glove: Global vectors for word representation //Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP). -2014. -P.1532-1543.

Bojanowski P. et al. Enriching Word Vectors with Subword Information //Transactions of the Association for Computational Linguistics. -2017.-Vol.5. -P.135-146. DOI 10.1162/tacl_a_00051.

Devlin J. et al. BERT: Pre-training of deep bidirectional transformers for language understanding //Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. -2019.-Vol.1. -P.4171-4186. DOI 10.18653/v1/N19-1423.

Tosun E. et al. Beyond Cosine Similarity: Taming Semantic Drift and Antonym Intrusion in a 15-Million Node Turkish Synonym Graph //arXiv preprint. -2026. -P.1-20. DOI arXiv:2601.13251.

Yeshpanov R., Varol H. A. KazSAnDRA: Kazakh sentiment analysis dataset of reviews and attitudes //Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024). -2024. -P.9657-9667.

Togmanov M. et al. KazMMLU: Evaluating language models on Kazakh, Russian, and regional knowledge of Kazakhstan //Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics. -2025.-Vol.1. -P.14403-14416. DOI 10.18653/v1/2025.acl-long.701.

Vaswani A. et al. Attention is all you need //Advances in Neural Information Processing Systems. -2017.-Vol.30.

Raffel C. et al. Exploring the limits of transfer learning with a unified text-to-text transformer //Journal of Machine Learning Research. -2020.-Vol.21(140). -P.1-67.

Lewis M. et al. BART: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension //Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. -2020. -P.7871-7880.

Zhang J. et al. PEGASUS: Pre-training with extracted gap-sentences for abstractive summarization //International Conference on Machine Learning. -PMLR, 2020. -P.11328-11339.

Wahle J. P. et al. How large language models are transforming machine-paraphrase plagiarism //Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing. -2022. -P.952-963.

Biloshchytska S. et al. Text Similarity Detection in Agglutinative Languages: A Case Study of Kazakh Using Hybrid N-Gram and Semantic Models //Applied Sciences. -2024.-Vol.15(12). -P.6707. DOI 10.3390/app15126707.

Papineni K. et al. Bleu: a method for automatic evaluation of machine translation //Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics. -2002. -P.311-318.

Lin C. Y. Rouge: A package for automatic evaluation of summaries //Text Summarization Branches Out. -2004. -P.74-81.

Zhang T. et al. Bertscore: Evaluating text generation with bert //arXiv preprint. -2019. -P.1-43. DOI arXiv:1904.09675.

Banerjee S., Lavie A. METEOR: An automatic metric for MT evaluation with improved correlation with human judgments //Proceedings of the ACL Workshop. -2005. -P.65-72.

Yuan W., Neubig G., Liu P. BARTScore: Evaluating generated text as text generation //Advances in Neural Information Processing Systems. -2021.-Vol.34. -P.27263-27277.

Shen L. et al. On the evaluation metrics for paraphrase generation //Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing. -2022. -P.3178-3190.

Опубликован

26.06.2026

Как цитировать

Сайранбекова, А., Бекманова, Г., Франзони, В., Назырова , А. ., & Ламашева, Ж. (2026). АВТОМАТИЧЕСКОЕ СИНОНИМИЧЕСКОЕ ПЕРЕФОРМУЛИРОВАНИЕ ТЕКСТА НА КАЗАХСКОМ ЯЗЫКЕ: МЕТОД, ОСНОВАННЫЙ НА МОРФОЛОГИЧЕСКИХ И СЕМАНТИЧЕСКИХ ОГРАНИЧЕНИЯХ. Вестник КазАТК, 144(3). извлечено от https://vestnik.alt.edu.kz/index.php/journal/article/view/3511

Выпуск

Раздел

Автоматизация, телемеханика, связь, компьютерные науки

Наиболее читаемые статьи этого автора (авторов)

Похожие статьи

Вы также можете начать расширеннвй поиск похожих статей для этой статьи.