NumeraОбсудить задачу
Документы → данные

Документ → текст

файл — PDF, Word, Excel, скан, фото → машиночитаемый текст

Превращает любой входящий файл в текст, с которым можно работать дальше: искать, извлекать данные, передавать дальше по цепочке. Формат и качество исходника не важны — читается и обычный документ, и кривой скан без текстового слоя.

Как работает

  1. 1Принимает файл любого формата — без предварительной подготовки.
  2. 2Сам определяет тип содержимого: документ с текстовым слоем читается напрямую, скан уходит на распознавание постранично.
  3. 3Возвращает единый текст, пригодный для поиска, извлечения данных и дальнейшей обработки.

Что умеет

Страница скана распознаётся примерно за 7 секунд: реальный 45-страничный договор без текстового слоя прочитан целиком меньше чем за шесть минут. Дорогое распознавание включается только когда документ действительно скан — обычные файлы читаются дёшево и мгновенно. Распознавание работает на собственных серверах: документы не уходят третьим сторонам.

С чем работает вместе

Базовый вход всей работы с документами: с выданного им текста начинаются извлечение позиций и разбор условий договора, а дальше по цепочке — требования к позиции. Счёт идёт своим путём: он разбирается из файла сразу в строки с ценами.