LIVE
Новость

Интеллектуальный парсинг документов от Диасофт для обучения корпоративных LLM

«Диасофт» расширил платформу «Фабрика данных» (Digital Q.DataFactory) модулем интеллектуального разбора документов — по данным CNews.ru, новый «Сервис интеллектуального парсинга документов» принимает…

Лука Демьянов·обновлено 29 июля 2026 г.

Интеллектуальный парсинг документов от Диасофт для обучения корпоративных LLM

«Диасофт» расширил платформу «Фабрика данных» (Digital Q.DataFactory) модулем интеллектуального разбора документов — по данным CNews.ru, новый «Сервис интеллектуального парсинга документов» принимает PDF, DOCX, сканы и аудио через единый HTTP API и возвращает структурированный JSON, Markdown или HTML. Для команд, запускающих корпоративные LLM (большие языковые модели) и RAG-проекты (Retrieval-Augmented Generation — архитектура, где модель опирается на внешнюю базу знаний), это прямой ответ на боль «грязных» входных данных, на которой чаще всего и ломаются промышленные ИИ-ассистенты.

Что делает сервис и почему это инженерно нетривиально

Суть в том, что на входе — произвольный файл из реального документооборота: PDF с многостраничными таблицами, скан договора с рукописной резолюцией, запись совещания на сорок минут. На выходе — структурированное представление, готовое для индексации поисковым движком и подачи в языковую модель. Под капотом связка из нескольких технологий: продвинутый OCR (Optical Character Recognition — распознавание символов на изображениях) с поддержкой рукописного ввода и любых языков, ASR (Automatic Speech Recognition — преобразование речи в текст) с разделением по спикерам, временными метками и расстановкой знаков препинания, плюс блок извлечения логической структуры — заголовков, таблиц, иерархии разделов. Именно сохранение логики, а не просто поток символов, критично: если модель получает «плоский» текст без разметки таблиц, она теряет связи между ячейками и начинает галлюцинировать — уверенно выдумывать факты, которых нет в источнике.

Архитектура и импортозамещение

Продукт построен в микросервисной архитектуре — каждый шаг конвейера можно масштабировать и обновлять независимо. Развёртывание контейнеризированное, то есть сервис упаковывается в изолированные среды вроде Docker и ставится в закрытый контур заказчика, что критично для банков и госкомпаний. Руководитель продукта «Фабрика данных» Илья Шуйков подчёркивает главный мотив: снять с команд разработки необходимость собирать собственный конвейер конвертации и уйти от зависимости от зарубежных библиотек Docling и Apache Tika. Иначе говоря, это попытка закрыть импортозамещение не на уровне презентации, а на уровне конкретного пайплайна подготовки данных — той самой «невидимой» инфраструктуры, без которой любой RAG-проект оказывается хрупким.

Что меняется на практике и за чем следить

Эффект проявится там, где раньше данные приходилось либо переносить вручную, либо довольствоваться поиском по ключевым словам. Со структурированным выходом появляется возможность строить RAG поверх внутренней документации — чтобы ИИ-ассистент отвечал на вопросы по регламентам, договорам или техдокументации, опираясь не на выдумку, а на конкретные пункты исходника. Схожий запрос на «причёсывание» сырых данных есть и в нишах, далёких от чистого софта — даже в цифровой печати в упаковке компании упираются в то, что отчёты и спецификации нужно сначала структурировать, а уже потом принимать решения. Стоит отслеживать публичные пилоты в крупных банках и госструктурах — именно они покажут, работает ли заявленное «из коробки» на реальных форматах документов или потребуется тонкая настройка под каждую отрасль.