Документ → текст
Превращает любой входящий файл в текст, с которым можно работать дальше: искать, извлекать данные, передавать дальше по цепочке. Формат и качество исходника не важны — читается и обычный документ, и кривой скан без текстового слоя.
Как работает
- 1Принимает файл любого формата — без предварительной подготовки.
- 2Сам определяет тип содержимого: документ с текстовым слоем читается напрямую, скан уходит на распознавание постранично.
- 3Возвращает единый текст, пригодный для поиска, извлечения данных и дальнейшей обработки.
Что умеет
Страница скана распознаётся примерно за 7 секунд: реальный 45-страничный договор без текстового слоя прочитан целиком меньше чем за шесть минут. Дорогое распознавание включается только когда документ действительно скан — обычные файлы читаются дёшево и мгновенно. Распознавание работает на собственных серверах: документы не уходят третьим сторонам.
С чем работает вместе
Базовый вход всей работы с документами: с выданного им текста начинаются извлечение позиций и разбор условий договора, а дальше по цепочке — требования к позиции. Счёт идёт своим путём: он разбирается из файла сразу в строки с ценами.