Словарь
OCR: что это и как работает распознавание текста
OCR - что это и чем он поможет бухгалтерии? Это технология, которая превращает скан или фото документа в текст, который можно копировать и искать. Но разнести счет по полям учета OCR не сможет: для этого нужно ИИ-извлечение. Разбираем разницу на одном счете и рассказываем, как подготовить документы к распознаванию.
Обновлено 29.09.2026
Коротко
- OCR (Optical Character Recognition) - оптическое распознавание символов: из картинки получается текст.
- OCR не понимает смысл. Он не знает, где на счете поставщик, а где покупатель.
- ИИ-извлечение идет дальше: находит нужные поля, приводит их к формату и проверяет суммы.
- Tesseract - бесплатный движок OCR для разработчиков, OCR-редакторы - программы для ручной работы с документами.
- Качество распознавания больше всего зависит от скана: разрешение, ровность, отсутствие теней.
OCR простыми словами: из картинки в текст
OCR расшифровывается как Optical Character Recognition - оптическое распознавание символов. Технология смотрит на изображение, находит на нем буквы и цифры и выдает их как обычный текст.
Для компьютера скан договора - просто картинка, как фотография кота. Найти в нем слово «неустойка» нельзя. После OCR у документа появляется текст, по которому работает поиск и копирование.
- Подготовка изображения. Программа выравнивает перекос, повышает контраст, убирает шум.
- Поиск текста. Определяет блоки, строки и отдельные слова, отделяет их от таблиц и картинок.
- Распознавание символов. Сопоставляет каждый фрагмент с буквами и цифрами. Современные движки делают это нейросетями.
- Сборка результата. Выдает текст, файл Word или PDF с текстовым слоем.
Что такое PDF OCR
Так называют PDF, в котором поверх картинки скана лежит невидимый текстовый слой. Документ выглядит как скан, но в нем работает поиск и выделение текста. Многие сканеры и программы умеют делать такие файлы сразу.
Один счет, два результата: OCR и ИИ-извлечение полей
Лучше всего разницу видно на одном документе. Возьмем скан счета от условного поставщика ООО «Северный склад» на три позиции.
Что выдает OCR
OCR честно переводит картинку в текст, строка за строкой:
Счет на оплату № 418 от 12 сентября 2026 г. Поставщик: ООО «Северный склад» ИНН 77ХХХХХХХХ КПП 77ХХХХХХХ Покупатель: ООО «Ромашка» ... 1 Перчатки нитриловые уп 20 350,00 7 000,00 2 Лента упаковочная шт 40 95,00 3 800,00 ... Итого: 11 600,00 В том числе НДС ...
Весь текст есть, но это сплошной поток. Где ИНН поставщика, а где покупателя, где цена, а где сумма строки - программа не знает. Таблица рассыпалась в одну линию. Чтобы занести счет в учет, человек все равно перебирает цифры глазами.
Что выдает ИИ-извлечение
| Поле | Значение | Проверка |
|---|---|---|
| Номер и дата | 418, 12.09.2026 | Дата приведена к единому формату. |
| Поставщик | ООО «Северный склад», ИНН 77ХХХХХХХХ. | ИНН проверен по контрольному числу. |
| Покупатель | ООО «Ромашка». | Совпадает с вашим юрлицом. |
| Позиции | Три строки: название, единица, количество, цена, сумма. | Количество на цену равно сумме строки. |
| Итого | 11 600,00 | Сумма строк сошлась с итогом. |
| Дубль | Нет. | Счет с таким номером от этого поставщика раньше не приходил. |
Цифры в примере условные. Главное - ИИ понимает структуру документа и возвращает не текст, а заполненные поля. Если проверка не сошлась или скан плохой, документ уходит в ручную очередь, а не угадывается.
OCR отвечает на вопрос «что здесь написано». ИИ-извлечение отвечает на вопрос «что это значит для учета».
На практике они работают вместе: сначала OCR или нейросеть читает изображение, затем языковая модель раскладывает текст по полям и проверяет его. Какие поля первички распознаются надежно, показано в статье про первичные документы.
Tesseract, OCR-редакторы и сервис 1С: что выбрать
| Инструмент | Что это | Кому подходит |
|---|---|---|
| Tesseract OCR | Бесплатный движок OCR с открытым кодом, поддерживает русский язык с установкой языкового пакета. | Разработчикам, которые встраивают распознавание в свою систему. |
| OCR-редактор, например ABBYY FineReader | Программа, где можно распознать документ и сразу поправить результат вручную. | Офису, который переводит в текст отдельные документы. |
| Встроенное распознавание в учетных системах | Например, сервис 1С для первичных документов. | Бухгалтерии на типовых формах. |
| ИИ-извлечение под ваши документы | OCR плюс языковая модель, свои поля и проверки. | Компаниям с потоком разных документов и выгрузкой в Excel, CRM или 1С. |
Установка Tesseract - это установка программы на компьютер или сервер и отдельно языковых данных для русского. Без программиста дальше этого шага обычно не уходят: движок работает из командной строки и выдает только текст. Когда хватает встроенного сервиса 1С, а когда нужна своя настройка, разобрано на странице распознавание документов в 1С.
OCR или ручной ввод, OCR или LLM для документов
- Ручной ввод оправдан, если документов единицы в неделю и формы каждый раз разные.
- Простой OCR подходит, когда нужен поиск по архиву сканов: договоры, письма, старые приказы.
- OCR и языковая модель нужны, когда из документа надо достать поля и положить их в учет. Это счета, акты, УПД, накладные, анкеты.
Одна языковая модель без этапа распознавания тоже умеет читать картинки, но на плохих сканах и мелких таблицах чаще ошибается в цифрах. Поэтому в рабочих решениях этапы совмещают и добавляют проверки. Как с этим справляются популярные учетные сервисы, сравнили в статье распознавание в СБИС, Диадоке и 1С.
Как подготовить документы для OCR
- Разрешение 300 dpi. Это обычная настройка для документов в сканере. Меньше - буквы слипаются, больше - файлы тяжелеют без пользы.
- Ровно и целиком. Лист без перекоса, без обрезанных краев и пальцев в кадре.
- Без теней и бликов. При съемке телефоном - при дневном свете, камера параллельно листу.
- Один документ в файле. Если в PDF счет, акт и договор подряд, система потратит время на разделение и может ошибиться.
- Электронный оригинал лучше скана. Если поставщик может прислать PDF из учетной системы, распознавание почти не нужно.
- Печати и подписи не на цифрах. Синяя печать поверх суммы - частая причина ручной проверки.
С рукописными документами отдельная история, ее мы разобрали в статье как распознать рукописный текст с помощью ИИ.
