500 руб
Журнал «Нейрокомпьютеры: разработка, применение» №4 за 2026 г.
Статья в номере:
Архитектура и алгоритм детерминированного конвейера структурирования JSON и XML данных с использованием LLM
Тип статьи: научная статья
DOI: https://doi.org/10.18127/j19998554-202604-04
УДК: 004.85:311.2
Авторы:

Н.Н. Олтян1
1 Финансовый университет при Правительстве РФ (Москва, Россия)

1 nikitaoltyan@mail.ru

Аннотация:

Постановка проблемы. Использование больших языковых моделей для извлечения и структурирования данных из текста сопровождается недетерминизмом вывода, отсутствием формальных гарантий синтаксической и схемной корректности, а также сложностью воспроизводимого применения в промышленных и регламентированных системах.

Цель. Формализовать концепцию и разработать алгоритм детерминированного конвейера преобразования неструктурированного текста в структуры JSON/XML с использованием LLM, обеспечивающего корректность, типобезопасность и воспроизводимость результатов.

Результаты. Предложена архитектура детерминированного конвейера, объединяющая грамматически ограниченное декодирование, схемную валидацию, строгую типизацию и механизмы восстановления. Определены инварианты корректности и сформулирован алгоритм, исключающий недетерминизм генерации.

Практическая значимость. Результаты исследования могут быть использованы при разработке надежных и проверяемых систем структурирования данных, включая аналитические, интеграционные и ведомственные решения, требующие воспроизводимости, формальной валидации и соответствия регуляторным требованиям.

Страницы: 47-53
Для цитирования

Олтян Н.Н. Архитектура и алгоритм детерминированного конвейера структурирования JSON и XML данных с использованием LLM // Нейрокомпьютеры: разработка, применение. 2026. Т. 28. № 4. С. 47–53. DOI: https://doi.org/10.18127/j19998554-202604-04

Список источников
  1. Олтян Н.Н. Эволюция методов извлечения и структурирования данных из текста в JSON и XML // Нейрокомпьютеры. 2025. № 6. С. 37–49.
  2. Beurer-Kellner L., Fischer M., Vechev M. Guiding LLMs the right way: Fast, non-invasive constrained generation // arXiv preprint. arXiv:2403.06988. 2024.
  3. Geng S., Cooper H., Moskal M. et al. JSONSchemaBench: A rigorous benchmark of structured outputs for language models // arXiv preprint. arXiv:2501.10868. 2025.
  4. Geng S., Josifoski M., Peyrard M. et al. Grammar-constrained decoding for structured NLP tasks without finetuning // arXiv preprint. arXiv:2305.13971. 2023.
  5. Korn F., Saha B., Srivastava D. et al. On repairing structural problems in semi-structured data // Proceedings of the VLDB Endowment. 2013. V. 6. № 9. P. 601–612.
  6. Shen Z., Wang D.Y.-B., Mishra S.S. et al. SLOT: Structuring the output of large language models // Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: Industry Track. 2025. P. 472–491.
  7. Viotti J.C., Mior M.J. Blaze: Compiling JSON schema for 10x faster validation // arXiv preprint. arXiv:2503.02770. 2025.
  8. Yao Y., Mao S., Zhang N. et al. Schema-aware reference as prompt improves data-efficient knowledge graph construction // Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval. 2023. P. 911–921.
Дата поступления: 09.02.2026
Одобрена после рецензирования: 27.02.2026
Принята к публикации: 29.06.2026