ИССЛЕДОВАНИЕ МОДЕЛЕЙ СЕМАНТИЧЕСКОГО ПОИСКА ИНФОРМАЦИИ ИЗ ПРАВОВЫХ НОРМАТИВНЫХ ДОКУМЕНТОВ
Ключевые слова:
семантический поиск, поиск правовой информации, многоязычные embeddings, векторный поиск, юридические документыАннотация
Доступ к необходимой правовой информации имеет большое значение для юристов и организаций. Традиционные поисковые системы, основанные на ключевых словах, обладают ограниченными возможностями для определения семантических связей между запросами и юридическими документами. В данном исследовании предлагаются модели семантического поиска информации в нормативных правовых актах и судебных решениях Республики Казахстан с использованием многоязычных эмбеддингов и поиска по векторному сходству. В рамках исследования обрабатывается крупный двуязычный корпус на казахском и русском языках, содержащий около 77 миллионов токенов. Документы были разделены на текстовые фрагменты и закодированы с использованием моделей многоязычных эмбеддингов, включая multilingual-e5-large и bge-m3. Экспериментальная оценка проводилась с использованием набора юридических запросов, рассмотренных отраслевыми экспертами. Результаты показали, что семантический поиск значительно повышает точность поиска по сравнению с традиционными методами. В оптимальной конфигурации использовались эмбеддинги multilingual-e5-large с длиной фрагмента 1024 токена и перекрытием (overlap) в 20 токенов. Предложенное исследование демонстрирует эффективные модели семантического поиска для многоязычных правовых информационных систем.
Библиографические ссылки
C. Manning, P. Raghavan and H. Schütze, “Introduction to Information Retrieval,” Cambridge University Press, Cambridge, http://www-nlp.stanford.edu/IR-book, 2008, http://dx.doi.org/10.1017/CBO9780511809071
F. Ariai, J. Mackenzie, G. Demartini, “Natural Language Processing for the legal domain: A survey of tasks, datasets, models, and challenges,” ACM Computing Surveys, 58(6), 1–37, 2025, https://doi.org/10.1145/3777009
G. M. Csányi, D. Lakatos, I. Üveges, A. Megyeri, J. P. Vadász, D. Nagy, & R.Vági, “From fact drafts to operational systems: Semantic search in legal decisions using fact drafts,” Big Data and Cognitive Computing, 8(12), 185, 2024, https://doi.org/10.3390/bdcc8120185
Lee Yoon‑seop, “Semantic Legal Searcher: Neural information retrieval-based semantic search for case law,” Master’s thesis in Data Science, Seoul National University, 2024
J. Arora, T. Patankar, A. Shah, S. Joshi, “Artificial Intelligence as Legal Research assistant,” In Working Paper, 2020, https://ceur-ws.org/Vol-2826/T1-11.pdf
S. Zhu, Y. Chen, “The trio of computational jurisprudence: history, present, and future,” In Artificial intelligence and the rule of law, pp. 35–60, 2025, https://doi.org/10.1007/978-3-031-97389-5_3
M. C. Meftah, A.Soussa, A. Herzallah, “An Intelligent Arabic Legal Assistant system (IALAS) based on Ontology,” Transportation Research Procedia, 84, pp. 440–447, 2025, https://doi.org/10.1016/j.trpro.2025.03.094
T. Mikolov, K. Chen, G. Corrado, J. Dean, “Efficient estimation of word representations in vector space,” 2013, arXiv.org. https://arxiv.org/abs/1301.3781
J. Pennington, R. Socher, C. Manning, “Glove: Global Vectors for Word Representation,” Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP), pp.1532–1543, 2014, https://doi.org/10.3115/v1/d14-1162
J. Devlin, M. Chang, K. Lee, K. Toutanova, “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding,” 2018, arXiv.org. https://arxiv.org/abs/1810.04805
N. Reimers, I. Gurevych, “Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks,” 2019, arXiv.org. https://arxiv.org/abs/1908.10084
M. Płonka, K. Kocot, K. Hołda, K. Daniec, A. Nawrat, “A comparative evaluation of the effectiveness of document splitters for large language models in legal contexts,” Expert Systems With Applications, p. 272, 126711, 2025, https://doi.org/10.1016/j.eswa.2025.126711
J. Martinez-Gil, & Software Competence Center Hagenberg, “A survey on legal question answering systems,” Computer Science Review, 2021
N. H. Phung, C. T. Nguyen, M. Nguyen, T. H. Nguyen, H. L. Le, T. Nguyen, “A fine-tuning framework based on question, context, and answer relationships for enhancing legal information retrieval,” Engineering Applications of Artificial Intelligence, 159, 111570, 2025, https://doi.org/10.1016/j.engappai.2025.111570
A. Omotoso, H. Shopeju, A. Joshua, S. Oni, “Improving BGE-M3 multilingual dense embeddings for Nigerian low resource languages,” In Proceedings of the 9th Widening NLP Workshop, pp. 224–229, Association for Computational Linguistics, 2025
J. Chen, S. Xiao, P. Zhang, K. Luo, D. Lian, Z. Liu, “University of Science and Technology of China, & BAAI, M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity text embeddings through Self-Knowledge distillation,” arXiv:2402.03216v5 [cs.CL] 12 Dec 2025.
J. Lee, F. Chen, S. Dua, D. Cer, M. Shanbhogue, “Gemini Embedding Team, & Google, Gemini Embedding: Generalizable Embeddings from Gemini,” In arXiv (Vol. 2503, p. 1) [Report], 2025, https://arxiv.org/abs/2503.07891v1
M. Ciancone, I. Kerboua, M. Schaeffer, W. Siblini, “Extending the massive text embedding benchmark to French,” License: CC BY 4.0, arXiv:2405.20468v1 [cs.CL], 30 May 2024
“kazakh-oscar-corpus, Kazakh Language Corpus from Oscar,” https://www.kaggle.com/datasets/zhaseke/kazakhoscarcorpus/data
“Russian books text corpus, Text corpus created from russian books,” https://www.kaggle.com/datasets/itachi666/dontsova-books
L. Wang, N. Yang, X. Huang, L. Yang, R. Majumder, F. Wei, “Multilingual E5 Text Embeddings: a Technical report,” 2024, arXiv.org. https://arxiv.org/abs/2402.05672
A. Michail, S. Clematide, R. Sennrich, “Examining Multilingual embedding Models Cross-Lingually through LLM-Generated Adversarial Examples,” In Findings of the Association for Computational Linguistics: EMNLP 2025, pp. 2161–2170, 2025
Опубликован
Как цитировать
Выпуск
Раздел
Категории
Лицензия
Copyright (c) 2026 Нуржан Мукажанов, Айнур Ахмедиярова, Жибек Алибиева, Руслан Ахматгалиев, Нурмұхаммед Абеуов

Это произведение доступно по лицензии Creative Commons «Attribution-NonCommercial-NoDerivatives» («Атрибуция — Некоммерческое использование — Без производных произведений») 4.0 Всемирная.











