Н.Н. Олтян1
1 Финансовый университет при Правительстве РФ (Москва, Россия)
1 nikitaoltyan@mail.ru
Постановка проблемы. Использование больших языковых моделей для извлечения и структурирования данных из текста сопровождается недетерминизмом вывода, отсутствием формальных гарантий синтаксической и схемной корректности, а также сложностью воспроизводимого применения в промышленных и регламентированных системах.
Цель. Формализовать концепцию и разработать алгоритм детерминированного конвейера преобразования неструктурированного текста в структуры JSON/XML с использованием LLM, обеспечивающего корректность, типобезопасность и воспроизводимость результатов.
Результаты. Предложена архитектура детерминированного конвейера, объединяющая грамматически ограниченное декодирование, схемную валидацию, строгую типизацию и механизмы восстановления. Определены инварианты корректности и сформулирован алгоритм, исключающий недетерминизм генерации.
Практическая значимость. Результаты исследования могут быть использованы при разработке надежных и проверяемых систем структурирования данных, включая аналитические, интеграционные и ведомственные решения, требующие воспроизводимости, формальной валидации и соответствия регуляторным требованиям.
Олтян Н.Н. Архитектура и алгоритм детерминированного конвейера структурирования JSON и XML данных с использованием LLM // Нейрокомпьютеры: разработка, применение. 2026. Т. 28. № 4. С. 47–53. DOI: https://doi.org/10.18127/j19998554-202604-04
- Олтян Н.Н. Эволюция методов извлечения и структурирования данных из текста в JSON и XML // Нейрокомпьютеры. 2025. № 6. С. 37–49.
- Beurer-Kellner L., Fischer M., Vechev M. Guiding LLMs the right way: Fast, non-invasive constrained generation // arXiv preprint. arXiv:2403.06988. 2024.
- Geng S., Cooper H., Moskal M. et al. JSONSchemaBench: A rigorous benchmark of structured outputs for language models // arXiv preprint. arXiv:2501.10868. 2025.
- Geng S., Josifoski M., Peyrard M. et al. Grammar-constrained decoding for structured NLP tasks without finetuning // arXiv preprint. arXiv:2305.13971. 2023.
- Korn F., Saha B., Srivastava D. et al. On repairing structural problems in semi-structured data // Proceedings of the VLDB Endowment. 2013. V. 6. № 9. P. 601–612.
- Shen Z., Wang D.Y.-B., Mishra S.S. et al. SLOT: Structuring the output of large language models // Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: Industry Track. 2025. P. 472–491.
- Viotti J.C., Mior M.J. Blaze: Compiling JSON schema for 10x faster validation // arXiv preprint. arXiv:2503.02770. 2025.
- Yao Y., Mao S., Zhang N. et al. Schema-aware reference as prompt improves data-efficient knowledge graph construction // Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval. 2023. P. 911–921.

