Нейросеть для работы с документами: что она извлекает сама, а что обязан проверить человек

Кажется, что «нейросеть для документов» — это функция «загрузил файл, получил ответ». На деле нейросеть не читает документ. Она получает то, что осталось после распознавания. Ровный текст из PDF или Word модель разбирает почти без ошибок. Кривой скан с печатью боком превращается в текст с пропущенными цифрами, и дальше модель работает уже с этим испорченным текстом, а не с оригиналом. Разница между этими двумя случаями решает всё. Она определяет, где автоматизировать документы выгодно, а где это только множит ошибки. Дальше разбираю три документа, с которыми сталкивается почти любой бизнес: договор, счёт, акт. Что нейросеть находит в них сама, где она спотыкается и какие данные ей нельзя показывать вовсе.

Что нейросеть делает с документом на самом деле

Нейросеть не «видит» страницу так, как человек. Она получает набор символов и ищет в нём то, что попросили найти: сумму, дату, сторону договора, номер счёта. Документ пришёл цифровым, текстовым файлом? Модель извлекает данные почти без ошибок: буквы и цифры она получает готовыми, без искажений.

Документ — это скан или фото? Между файлом и моделью встаёт ещё один шаг: распознавание текста, OCR. Оно превращает изображение в буквы, и здесь чаще всего рождается ошибка. Смазанная печать. Кривой угол съёмки. Рукописная правка поверх бланка. Всё это OCR распознаёт с искажениями, а модель честно отвечает по тому тексту, который получила. Отличить настоящую опечатку от сбоя распознавания она не может.

Отсюда простое правило. Данные из чистого цифрового файла можно доверить модели, почти не проверяя. Данные из скана стоит сверить хотя бы по сумме и дате. Время экономится в обоих случаях. Доверие к результату — нет.

ФайлPDF, сканили фотоРаспознаваниеOCR, еслиэто сканИзвлечениемодель находитсумму, дату, стороныПроверкачеловек сверяетспорные поляЧем хуже скан, тем больше поле, которое остаётся на проверку человеку.
Путь документа от файла до данных в системе: где нужна проверка человеком

Три документа, которые есть у любого бизнеса

Большинство запросов на то, чтобы автоматизировать документы, сводится к трём типам. У каждого своя частая ошибка и свой пункт для ручной проверки.

ДокументЧто нейросеть находит хорошоЧастая ошибкаЧто проверить человеку
ДоговорСтороны, сроки, сумму, предмет договораПутает похожие пункты в длинных приложениях и допсоглашенияхДаты, итоговую сумму и номер актуальной редакции
СчётСумму к оплате, реквизиты, номер и датуНе всегда видит НДС отдельной строкой, если он спрятан в примечанииИтоговую сумму против CRM или 1С
АктПеречень работ или товаров, даты, подписиНе сравнивает объём работ в акте с тем, что записано в договореСовпадает ли акт с договором и счётом за тот же период

Договор: где извлечение экономит время, а где спотыкается

Договор — самый длинный из трёх документов, и длина создаёт проблему. Пока в тексте один блок условий, модель находит сумму и срок за секунды. Дальше в договоре появляются три допсоглашения. Каждое со своей датой. Каждое правит один и тот же пункт. И модель иногда берёт условие не из последней редакции, а из той, что встретилась раньше по тексту.

Это не повод отказываться от нейросети, а повод сузить задачу. Просите не «перескажи договор», а «найди действующий срок оплаты и укажи, из какого допсоглашения он взят». Ответ со ссылкой на источник проверяется в разы быстрее пересказа без неё.

Счёт и акт: сверка без ручного пересчёта

Счёт и акт редко живут отдельно. Их сверяют друг с другом и с договором: совпадает ли сумма, совпадает ли перечень работ, не задвоилась ли позиция. Руками эту работу делает бухгалтер или менеджер, построчно сравнивая три документа.

Нейросеть помогает быстрее сравнивать, а не решать за вас. Она достаёт цифры из каждого документа и показывает расхождение, если оно есть. Что с ним делать, решает человек.

Пример из нашей практики: в продукте AI Backoffice подписанный договор, оплаченный счёт и закрытый акт связаны одной логикой. Событие в одной системе сразу создаёт нужный документ и обновляет статус в остальных, а расхождение между системами видно сразу, а не через несколько дней, пока кто-то сверяет их вручную. В одном из наших кейсов такой единый маршрут для документов и согласований убрал у команды из восьми человек около двадцати ручных пересылок и напоминаний в день.

Похожий приём есть в нашем боте для застройщиков. Перед ответом клиенту встроенный валидатор сверяет цифры из диалога с базой документов по объекту, чтобы бот не назвал цену или срок сдачи, которых там нет.

Что нельзя загружать в нейросеть: 152-ФЗ

Отдельный вопрос — не что нейросеть умеет, а что ей вообще можно показывать. Персональные данные граждан России — ФИО, телефон, адрес, паспортные реквизиты — по 152-ФЗ обязаны храниться на серверах в России. Договор с физлицом, счёт частному клиенту, акт с домашним адресом подрядчика подчиняются этому правилу без исключений.

Отправить такой документ во внешний зарубежный API, не обезличив его, значит нарушить закон. Это не деталь, которую подрядчик решает по своему усмотрению. С 1 июля 2025 года за хранение базы с персональными данными россиян за рубежом положен штраф до 18 млн ₽. Есть два законных пути. Вычистить из документа имена, телефоны и адреса перед отправкой. Или взять модель, которая физически стоит на сервере в России.

Юридические реквизиты компании — ИНН, номер счёта, название юрлица — сюда не относятся: это не данные гражданина. Граница проходит по конкретному человеку в документе, а не по типу документа целиком.

Обезличенный документ+ можно в любой APIимена и телефоны убраныФИО, телефон, адрес− нельзя в зарубежный APIбез обработкиМодель на сервере в РФ+ можно с ПДн как естьданные не покидают РФ
Что можно отправлять в нейросеть по 152-ФЗ, а что требует обработки

Как это работает как система, а не разовый запрос в чат

Проверить один договор в окне чата — это разовая задача. Поток документов, который приходит каждый день, работает по другим правилам. Файл попадает в систему сам. Если это скан, его распознают. Нужные поля модель находит по заданному шаблону. Человеку остаются только спорные случаи. Обычный чат так не работает: здесь модель должна быть подключена и к месту, откуда приходит документ, и к системе, куда уходят данные.

Принцип тот же, что и в любом другом процессе: систему строят вокруг события и результата, а не вокруг разового вопроса. Про то, с какого процесса начинать и как считать окупаемость, я писал отдельно: Автоматизация бизнес-процессов с ИИ.

Когда автоматизировать документы выгодно

Автоматизация окупается, когда снимает измеримый объём рутины: время, которое уходит на то, чтобы переносить данные из одного документа в другой, а не на творческую часть работы. Час в день на то, чтобы разбирать документы, — экономию сразу не увидишь. Три-четыре часа в день — счёт уже идёт на десятки тысяч рублей в месяц.

Калькулятор ниже считает не всю стоимость проекта, а сколько компания платит за сотрудника с этой функцией сейчас против цены системы, которая берёт её на себя.

Посчитайте на своих цифрах

Во что обходится человек на процессе и во что агент. Считается в вашем браузере, цифры никуда не уходят.

полные затраты на людей, в месяц
экономия в месяц с агентом
окупаемость внедрения
разница за первые 12 месяцев

Люди, накопленные затраты Агент: внедрение и абонентка

ПериодКак естьС агентомРазница

Суммы в рублях, нарастающим итогом с начала работы.

Ставки 2026 года: НДФЛ 13%, страховые взносы 30%. Пониженный тариф МСП (15% с части свыше 1,5 МРОТ, это 40 640 ₽) с 2026 года остался только у приоритетных отраслей из перечня правительства.

Расчёт держится, если система забирает функцию целиком. На практике она чаще забирает часть: извлекает данные и сверяет цифры, а спорные документы всё равно отправляет человеку. Тогда экономию считают по доле, которую система реально закрыла, а не по всей ставке сотрудника.

Читайте также: Автоматизация бизнес-процессов с ИИ и разбор сметы на ИИ для бизнеса

Частые вопросы

Может ли нейросеть сама заполнить договор по шаблону?

Да, если шаблон уже согласован и меняются только переменные части: имя стороны, сумма, срок, предмет. Нейросеть подставляет эти значения быстро и почти без ошибок. Составление договора с нуля, где нужно юридическое решение по формулировке, она заменить не должна. Итоговый текст здесь проверяет юрист.

Как нейросеть работает со сканами и фото документов?

Сначала документ проходит распознавание текста, OCR: изображение превращается в буквы. Модель дальше работает с этим текстом, а не с оригинальной картинкой. Если OCR исказил цифру или слово, модель подмены не заметит и просто ответит по испорченному тексту. Данные из скана стоит сверять с оригиналом хотя бы по сумме и дате.

Можно ли загружать в нейросеть документы с персональными данными клиентов?

Только после обезличивания или на модели, которая физически работает на сервере в России. Отправлять документ с ФИО, телефоном или адресом гражданина России в зарубежный API без обработки — нарушение 152-ФЗ. Штраф за хранение таких данных за рубежом с 1 июля 2025 года доходит до 18 млн ₽.

Чем нейросеть для документов отличается от обычного OCR?

OCR решает одну задачу: превратить изображение в текст. Смысл документа он не понимает и сумму от даты не отличает. Нейросеть работает на следующем шаге. Она берёт уже распознанный текст, находит в нём нужные поля, сравнивает документы между собой или собирает по ним новый файл.

Сколько стоит автоматизация обработки документов для небольшой компании?

Зависит от объёма и сценария. Разовое извлечение данных из типового документа стоит на порядок дешевле связки, которая сверяет договор, счёт и акт между несколькими системами и сама формирует документы по событию. Точная цифра считается по числу документов в месяц и количеству систем для интеграции. Общий подход к смете разобран в статье разбор сметы на ИИ для бизнеса.

Разберём, что из статьи применимо у вас.

Бесплатный аудит процессов, 30 минут