РАЗРАБОТКА ГИБРИДНОЙ МОДЕЛИ ДЛЯ СЕНТИМЕНТ-АНАЛИЗА И РАСПОЗНАВАНИЯ ЭМОЦИЙ В КАЗАХОЯЗЫЧНЫХ ТЕКСТАХ С УЧЕТОМ АГГЛЮТИНАТИВНОЙ МОРФОЛОГИИ
DOI:
https://doi.org/10.52167/1609-1817-2026-142-1-124-133Ключевые слова:
сентимент-анализ, BERT, распознавание эмоций, казахский язык, обработка естественного языка (NLP), агглютинативные языки, морфологический анализ,трансформеры, многозадачное обучение, гибридная модель.Аннотация
Казахский язык обладающий богатой агглютинативной морфологией, свободным порядком слов и специфическими лингвистическими конструкциями, представляет значительную сложность для стандартных методов обработки естественного языка (NLP). В работе предлагается комплексный гибридный подход, сочетающий глубокую морфологическую предобработку, основанную на негаторов и усилителей, правилах обработки аффиксов, с современными нейросетевыми архитектурами на основе трансформеров. Модель выполняет многозадачное обучение - классификацию тональности (положительная, нейтральная, отрицательная) и мульти-лейбл классификацию эмоций в соответствии с моделью Роберта Плутчика, расширенной для учета культурно-специфичной эмоции «ұят» (стыд). Детально описаны этапы предобработки, архитектура модели, используемые функции потерь и особенности обучающего корпуса. Экспериментально подчеркивается критическая важность учета языковой специфики для достижения высокой точности и предлагаются пути решения проблем, связанных с недостатком размеченных данных для казахского языка. Показано, что предложенная гибридная модель превосходит по точности базовые подходы, не учитывающие морфологические особенности.
Данная статья посвящена решению актуальной задачи автоматического анализа тональности и распознавания эмоций в текстах на казахском языке.
Библиографические ссылки
Smith, A., & Anderson, M. (2018). Social Media Use in 2018. Pew Research Center.
Liu, B. (2012). Sentiment Analysis and Opinion Mining. Synthesis Lectures on Human Language Technologies.
Ruder, S., Ghaffari, P., & Breslin, J. G. (2016). A survey of sentiment analysis in the Russian language. Artificial Intelligence Review.
Barnes, J., et al. (2019). Challenges for Sentiment Analysis in Low-Resource Languages. Proceedings of the 5th Workshop on Noisy User-generated Text.
Johanson, L. (1998). The Structure of Turkic. In The Turkic Languages.
Сеитов, А.М. (2015). Қазақ мәтінін компьютерлік өңдеу ерекшеліктері. Вестник КазНУ.
Baskakov, N. A. (1966). The Turkic Languages of Central Asia. The Central Asian Research Centre.
Мусабаева, Г.Т. (2018). Қазақ тілінің морфологиясы: теориялық және қолданбалы аспектілері. Қазақ университеті.
Karibayeva, A., et al. (2021). Negation Handling in Kazakh Sentiment Analysis. Proceedings of the International Conference on Computational Linguistics.
Vaswani, A., et al. (2017). Attention is All You Need. Advances in Neural Information Processing Systems.
Plutchik, R. (1980). Emotion: A Psychoevolutionary Synthesis. Harper & Row.
Nauruzbayeva, Z. (2020). Cultural Dimensions of Emotion: The Concept of Uyat in Kazakh Society. Journal of Eurasian Studies.
Yildirim, S., & Yildiz, T. (2018). Sentiment Analysis for Turkish with Deep Learning. IEEE Access.
Şahin, G. G., & Steedman, M. (2018). Character-level models versus morphology in semantic role labeling. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics.
Yergesh, B., et al. (2017). Sentiment Analysis for Kazakh Language: Dataset and Preliminary Results. AIP Conference Proceedings.
Assylbekov, Z., et al. (2020). KazSAnDRA: Kazakh Sentiment Analysis Dataset of Reviews and Applications. Proceedings of the 12th Language Resources and Evaluation Conference.
Cambria, E., et al. (2017). Computational Intelligence for Sentiment Analysis: A Survey. IEEE Computational Intelligence Magazine.
Collobert, R., & Weston, J. (2008). A Unified Architecture for Natural Language Processing. Proceedings of the 25th International Conference on Machine Learning.
KazNLP Toolkit. (2022). Электрондық ресур - URL: http://kaznlp.kz (дата обращения: 01.10.2023).
Forcada, M. L., et al. (2011). Apertium: a free/open-source platform for rule-based machine translation. Machine Translation.
Conneau, A., et al. (2020). Unsupervised Cross-lingual Representation Learning at Scale. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics.
KazBERT: A BERT model for Kazakh. (2023). Электрондық ресурс - URL: https://github.com/kaz-nlp/kazbert.
Загрузки
Опубликован
Как цитировать
Выпуск
Раздел
Категории
Лицензия
Copyright (c) 2026 Ляйла Кенжина, Бану Жантуғақызы, Асель Сериковна

Это произведение доступно по лицензии Creative Commons «Attribution-NonCommercial-NoDerivatives» («Атрибуция — Некоммерческое использование — Без производных произведений») 4.0 Всемирная.











