Интеллектуальный парсинг документов от Диасофт для обучения корпоративных LLM
«Диасофт» расширил платформу «Фабрика данных» (Digital Q.DataFactory) модулем интеллектуального разбора документов — по данным CNews.ru, новый «Сервис интеллектуального парсинга документов» принимает…
Лука Демьянов·обновлено 29 июля 2026 г.

«Диасофт» расширил платформу «Фабрика данных» (Digital Q.DataFactory) модулем интеллектуального разбора документов — по данным CNews.ru, новый «Сервис интеллектуального парсинга документов» принимает PDF, DOCX, сканы и аудио через единый HTTP API и возвращает структурированный JSON, Markdown или HTML. Для команд, запускающих корпоративные LLM (большие языковые модели) и RAG-проекты (Retrieval-Augmented Generation — архитектура, где модель опирается на внешнюю базу знаний), это прямой ответ на боль «грязных» входных данных, на которой чаще всего и ломаются промышленные ИИ-ассистенты.
Что делает сервис и почему это инженерно нетривиально
Суть в том, что на входе — произвольный файл из реального документооборота: PDF с многостраничными таблицами, скан договора с рукописной резолюцией, запись совещания на сорок минут. На выходе — структурированное представление, готовое для индексации поисковым движком и подачи в языковую модель. Под капотом связка из нескольких технологий: продвинутый OCR (Optical Character Recognition — распознавание символов на изображениях) с поддержкой рукописного ввода и любых языков, ASR (Automatic Speech Recognition — преобразование речи в текст) с разделением по спикерам, временными метками и расстановкой знаков препинания, плюс блок извлечения логической структуры — заголовков, таблиц, иерархии разделов. Именно сохранение логики, а не просто поток символов, критично: если модель получает «плоский» текст без разметки таблиц, она теряет связи между ячейками и начинает галлюцинировать — уверенно выдумывать факты, которых нет в источнике.
Архитектура и импортозамещение
Продукт построен в микросервисной архитектуре — каждый шаг конвейера можно масштабировать и обновлять независимо. Развёртывание контейнеризированное, то есть сервис упаковывается в изолированные среды вроде Docker и ставится в закрытый контур заказчика, что критично для банков и госкомпаний. Руководитель продукта «Фабрика данных» Илья Шуйков подчёркивает главный мотив: снять с команд разработки необходимость собирать собственный конвейер конвертации и уйти от зависимости от зарубежных библиотек Docling и Apache Tika. Иначе говоря, это попытка закрыть импортозамещение не на уровне презентации, а на уровне конкретного пайплайна подготовки данных — той самой «невидимой» инфраструктуры, без которой любой RAG-проект оказывается хрупким.
Что меняется на практике и за чем следить
Эффект проявится там, где раньше данные приходилось либо переносить вручную, либо довольствоваться поиском по ключевым словам. Со структурированным выходом появляется возможность строить RAG поверх внутренней документации — чтобы ИИ-ассистент отвечал на вопросы по регламентам, договорам или техдокументации, опираясь не на выдумку, а на конкретные пункты исходника. Схожий запрос на «причёсывание» сырых данных есть и в нишах, далёких от чистого софта — даже в цифровой печати в упаковке компании упираются в то, что отчёты и спецификации нужно сначала структурировать, а уже потом принимать решения. Стоит отслеживать публичные пилоты в крупных банках и госструктурах — именно они покажут, работает ли заявленное «из коробки» на реальных форматах документов или потребуется тонкая настройка под каждую отрасль.