Обучаем интернет-маркетингу с 2022 года
ИИ в маркетинге

Нейросеть для распознавания текста с фото: от снимка до готовой таблицы

Поставщик прислал прайс фотографиями листов, клиент - договор снимками с телефона, коллега - скрин таблицы вместо файла. И вы садитесь перепечатывать это руками. Нейросети читают текст с фото давно, но сила не в самом распознавании: бот сразу превращает снимок в таблицу и вытаскивает нужные поля. Разбираем инструменты, промты и границы - включая то, что грузить в чужой сервис нельзя.

Фотография документа превращается в редактируемый текст и таблицу
Что узнаете из статьи
  • Чем распознавать: таблица инструментов
  • Как снять фото, чтобы распозналось с первого раза
  • Промты: фото прайса сразу в таблицу
  • Что нельзя загружать в чужой сервис
Разобраться за 10 мин Прайс в таблицу за 15 минут Уровень: Новичок

Где это нужно каждый день

Коротко

Распознавание текста - не задача «для айтишников», а ежедневная рутина любого, кто работает с бумагами и скринами. Прайс, конспект, визитка, чек, чужая карточка товара за минуту превращаются в текст, который можно править, искать и считать.

Вот что накапливается за одну неделю у обычной кофейни или небольшого магазина:

  • Прайс от поставщика - фотографии листов или PDF из сканов, где текст не выделяется мышкой.
  • Скрин таблицы - коллега прислал отчёт картинкой вместо файла.
  • Визитки с выставки - пачка картонок, из которой нужен список контактов.
  • Конспект от руки - записи с обучения или планёрки надо перевести в задачи.
  • Чеки и накладные - раз в месяц сводятся в таблицу расходов.
  • Договор в фотографиях - надо найти в нём конкретный пункт про сроки.
  • Чужая карточка товара - разобрать её структуру, как в статье про ИИ для интернет-магазина.

Раньше на это уходили часы набора или платная программа. Сейчас почти всё закрывается бесплатными инструментами, которые уже стоят у вас в телефоне.

Как работает и почему рукопись сложнее

Коротко

Классическое распознавание разбирает картинку на строки и символы и сравнивает их с образцами букв. Нейросети читают строку целиком и достраивают смысл по контексту - точнее, но с побочным эффектом: непонятное слово они заменяют правдоподобным. Поэтому вычитка обязательна, а для рукописи - вдвойне.

Технология называется OCR - оптическое распознавание символов. Старый подход работал механически: найти блоки текста, разбить на строки, строки на символы, каждый сопоставить с эталоном, а поверх наложить словарь языка. Когда буква была нечёткой, программа честно выдавала абракадабру - и вы сразу видели сбой.

Современные модели смотрят на строку и на весь лист сразу и понимают не только форму букв, но и смысл. За счёт этого они справляются с наклонным кадром, плохим светом и таблицами в несколько колонок. Обратная сторона: если слово нечитаемо, нейросеть подставит подходящее по контексту. В прайсе такая ошибка выглядит невинно и доезжает до заказа.

Рукопись сложнее по трём причинам: у печатной буквы одна форма на весь документ, у рукописной - своя в каждом слове; буквы слиты, и модель должна ещё угадать границы; плюс личные сокращения и пометки на полях. Работает то же правило, что и с расшифровкой аудио: черновик машина делает за минуту, ответственность за точность остаётся на человеке.

Чем распознавать: таблица инструментов

Коротко

Четыре группы: встроенное распознавание в телефоне, сервисы Яндекса и Сбера, универсальные чат-боты с загрузкой картинки и программы для документов на компьютере. Для фразы с вывески хватит телефона, для прайса в таблицу нужен чат-бот, для пачки договоров - программа.

Встроенное в телефон. На iPhone это «Живой текст»: открываете снимок в приложении «Фото», зажимаете текст и копируете как обычный. На Android то же делает «Google Объектив» - через камеру или галерею. Ноль установок и секунды на выделение фразы, но результат вы получаете как есть, без структуры.

Сервисы Яндекса и Сбера. Яндекс Переводчик читает текст с фотографии и сразу переводит - удобно для этикеток, меню и инструкций (подробнее - в статье про нейросети для перевода). Алиса AI принимает фото и разбирает не только текст, но и таблицы, схемы и формулы. GigaChat умеет то же самое и заявлен как распознающий и печатный, и рукописный текст. Полезная мелочь: Яндекс Диск ищет фотографии по словам, которые на них написаны, - так находится снимок визитки среди тысяч кадров.

Универсальные чат-боты. ChatGPT, Gemini, Claude, DeepSeek, Kimi принимают картинку прямо в диалог. Их преимущество не в распознавании, а в том, что следующим сообщением вы просите привести данные в порядок. Оговорка по доступности: у части зарубежных сервисов регистрация из России проходит не всегда, а российские карты для оплаты платных тарифов не принимаются - это разные ограничения, и проверять их стоит заранее. Что под какие задачи брать, сравнивали в обзоре бесплатных нейросетей.

Программы для компьютера. Когда документов десятки и нужен аккуратный экспорт в Word или Excel с сохранением колонок, чат-бот проигрывает специализированной программе. Прежний ABBYY FineReader в России официально не продаётся, его прямой преемник - ContentReader PDF: это тот же продукт под новым именем, права на который остались за выделенным в 2022 году российским подразделением ABBYY, теперь оно называется Content AI. Программа платная, условия смотрите на сайте разработчика. Главный плюс - файл не уходит в чужое облако; про такой подход в целом - в статье про нейросети локально на компьютере.

ИнструментЧто распознаётЯзыкБесплатноИз России
Живой текст (iPhone), Google Объектив (Android)Печатный текст на фото и на экранеРусский и десятки другихДа, встроеноРаботает
Яндекс ПереводчикПечатный текст + сразу переводМногоязычныйДаРоссийский сервис
Алиса AIТекст, таблицы, схемы, формулыРусскийДа, с лимитамиРоссийский сервис
GigaChatПечатный и рукописный текст, таблицы, графикиРусскийДа, с лимитамиРоссийский сервис
ChatGPT, Gemini, Claude, KimiТекст + структурирование по запросуМногоязычныеЕсть бесплатные режимыЕсть ограничения регистрации и оплаты
DeepSeekТекст + структурирование по запросуПонимает русскийДаОткрывается
ContentReader PDF и подобныеМногостраничные документы, экспорт в Word и ExcelРусский и другиеНет, платноРоссийский разработчик
Бесплатно · Telegram

Такие связки экономят часы каждую неделю

В 4 бесплатных видео разбираем вход в маркетинг: какие навыки приносят деньги быстрее всего, как собрать портфолио и где найти первого клиента.

Смотреть 4 видео Открывается в Telegram

Как снять, чтобы распозналось

Коротко

Свет, отсутствие бликов и ровный кадр решают больше, чем выбор сервиса. Длинный документ снимайте по частям, а если есть исходный файл или скан - берите его вместо фотографии. И всегда вычитывайте цифры: именно на них распознавание ошибается чаще всего.

  1. Дневной или яркий рассеянный свет. Вспышка почти всегда даёт блик посередине листа.
  2. Камера строго над документом. Наклон превращает прямоугольник в трапецию, и строки по краям плывут.
  3. Никакой тени от руки. Свет должен падать сбоку, а не из-за вашей спины.
  4. Глянец - под небольшим углом. Ламинированное меню и экран монитора бликуют; экран лучше снимать, подняв его яркость.
  5. Снимайте по частям. Два кадра по половине листа дают вдвое более крупный шрифт. Ориентир простой: на готовом снимке мелкая строка должна читаться без увеличения.
  6. Скан или исходный файл лучше фото. Если поставщик может прислать PDF, просите PDF.
  7. Проверьте резкость до отправки. Если вы сами не читаете мелкую строку, нейросеть тоже её не прочтёт, а сообщит об этом не всегда.

Ошибки русского распознавания предсказуемы, и это хорошая новость - их легко ловить поиском. Путаются похожие символы: «о» и ноль, «З» и тройка, «б» и шестёрка, «и» и «н», «л» и «п», «г» и «т». Отдельная беда - латинские буквы внутри русских слов: «с», «е», «о», «а», «р» выглядят одинаково в двух раскладках, и поиск по такому слову потом не работает. В таблицах слипаются соседние колонки и теряются пробелы в разрядах чисел.

Вычитка на две минуты: пробегитесь по всем цифрам, сложите итог по столбцу и сверьте с итогом на фото, проверьте фамилии и названия брендов, а в конце попросите бота отдельным сообщением перечитать результат на типичные ошибки распознавания. Полностью доверять машине нельзя: она не знает, что в прайсе стояло 1 490, а распозналось 149 с потерянной цифрой.

Распознал - и сразу обработал: промты

Коротко

Сила чат-ботов не в самом распознавании, а в следующем шаге. Одним запросом фото прайса становится таблицей, пачка визиток - списком контактов, два прайса - сравнением с разницей в процентах. Главное правило промта: не додумывать, а помечать нечитаемое.

Обычное распознавание отдаёт простыню текста, которую всё равно надо руками раскладывать по колонкам. Чат-бот делает это сам. Как формулировать запросы в принципе - в статье о том, как составить промт, ниже - готовые заготовки.

Промт 1: фото прайса сразу в таблицу

«На фото - прайс поставщика. Распознай его и верни таблицей с колонками: наименование, артикул, единица измерения, цена. Правила: цены сохраняй ровно как в оригинале, включая копейки; ничего не додумывай, нечитаемую ячейку помечай словом «неразборчиво»; порядок строк не меняй; в конце напиши, сколько позиций распознал».

Промт 2: сравнить два прайса

«Вот два прайса разных поставщиков в виде фото. Распознай оба и собери одну таблицу: наименование, цена поставщика А, цена поставщика Б, разница в рублях, разница в процентах. Сопоставляй позиции по смыслу названия, а не буква в букву. Позиции, которые есть только у одного, вынеси в список внизу».

Промт 3: вытащить только нужные поля

«На фото - визитки. Достань только нужные поля и верни списком через точку с запятой: имя; должность; компания; телефон; почта; сайт. Телефоны приведи к формату +7 (XXX) XXX-XX-XX. Если поля нет - ставь прочерк, ничего не подставляй от себя. В конце перечисли карточки, которые распознались плохо».

Готовую таблицу переносите в редактор простым копированием. Формулы, сортировка и сводные - в статье про нейросети для таблиц Excel.

Приватность и закон

Коротко

Свои документы грузите куда хотите, чужие персональные данные - нет. Паспорта, договоры с фамилиями, медицинские справки и базы клиентов в сторонний сервис без правового основания отправлять нельзя. Выход: закрыть чувствительные поля, распознавать локальной программой или работать в корпоративном сервисе.

Это самый пропускаемый раздел в статьях про распознавание и самый важный для тех, кто работает с клиентами. Обработка персональных данных в России регулируется законом 152-ФЗ, и загрузка чужого паспорта в публичный чат-бот - именно обработка, причём с передачей третьему лицу. Ответственность лежит на том, кто данные собрал. Конкретные санкции зависят от состава нарушения, и уточнять их стоит в актуальной редакции закона, а не в статьях в интернете.

  • Разделяйте документы. Прайс, меню, чек, чужая карточка товара, свой конспект - персональных данных там нет, грузите спокойно.
  • Обезличивайте. Нужен только пункт договора про сроки - закройте фамилии, реквизиты и подписи до съёмки.
  • Чувствительное - локально. Паспорта, медицинские документы и списки клиентов распознавайте программой на своём компьютере. В справке сервиса обычно написано, обрабатывается снимок на устройстве или уходит в облако - проверьте это один раз.
  • Читайте условия про обучение. Часть сервисов использует загруженное для улучшения моделей, иногда это отключается в настройках.
  • В компании - через договорённости. Если распознавание становится частью процесса, вопрос решается корпоративным сервисом и оформленными отношениями по обработке данных.

Кейс: прайс в таблицу за 15 минут

Коротко

Прайс кофейни на 4 листах, снятый телефоном, превращается в таблицу для заказа примерно за 15 минут вместо часа набора. Основное время уходит не на распознавание, а на съёмку по частям и вычитку цифр - и сокращать именно вычитку не стоит.

Поставщик кофе прислал обновлённый прайс фотографиями распечатки, а заказ надо собрать сегодня:

  1. Съёмка, 3 минуты. Листы на столе у окна, каждый снимаем двумя кадрами - верх и низ. Восемь снимков вместо четырёх, зато шрифт крупный.
  2. Распознавание, 4 минуты. Загружаем кадры в чат-бота по одному и применяем промт 1. По одному принципиально: пачкой модель чаще путает строки между листами.
  3. Сборка, 3 минуты. «Объедини таблицы из предыдущих сообщений в одну, шапку оставь один раз, порядок позиций сохрани».
  4. Вычитка, 4 минуты. Сверяем цены по фото - единственный шаг, который нельзя ускорить. Отдельно смотрим строки с пометкой «неразборчиво».
  5. Заказ, 1 минута. Копируем таблицу в редактор, проставляем количество, считаем сумму формулой.

Честная оговорка: так гладко выходит с печатным прайсом на белой бумаге. Скан плохого качества, помятый лист или мелкий шрифт в четыре колонки съедят больше времени, а вычитывать придётся построчно. И если позиций несколько сотен, а прайс приходит еженедельно, разумнее один раз выпросить у поставщика файл. Нейросеть отлично закрывает разовую боль, но не заменяет нормальный обмен данными.

Частые вопросы

Какая нейросеть распознаёт текст с фото бесплатно?

Проще всего начать с того, что уже под рукой: на iPhone это «Живой текст» в приложении «Фото», на Android - «Google Объектив», а Яндекс Переводчик читает текст с картинки и сразу переводит. Если нужен не сырой текст, а приведённый в порядок результат, бесплатно работают Алиса AI от Яндекса и GigaChat от Сбера: оба принимают фото и разбирают текст, таблицы и формулы. У бесплатных режимов бывают ограничения по числу запросов, и площадки меняют их без объявления - актуальные лимиты смотрите в справке сервиса. Платные программы нужны, только когда документов много и требуется точный экспорт в Word или Excel.

Можно ли распознать рукописный текст на фото?

Да, но качество ниже, чем у печатного, и результат всегда нужно вычитывать. Аккуратный разборчивый почерк с раздельными буквами современные модели читают неплохо: GigaChat, например, заявлен как распознающий и печатный, и рукописный текст. Слитную скоропись, личные сокращения и записи по диагонали ИИ разбирает с ошибками, причём ошибки правдоподобные - вместо мусора он подставит похожее по смыслу слово. Поэтому рукопись распознают по одной странице за раз и сверяют глазами все цифры, фамилии и термины.

Как повысить точность распознавания текста с фото?

Главное - свет и ровный кадр: снимайте при дневном или ярком рассеянном свете и держите камеру строго над листом, без наклона и без тени от руки. Убирайте блики: глянцевую бумагу и экран монитора лучше снимать под небольшим углом к источнику света, а не со вспышкой. Длинный документ снимайте по частям, чтобы буквы были крупными: на готовом снимке мелкая строка должна читаться без увеличения. И если есть выбор между фотографией и сканом или исходным PDF, берите файл - он распознаётся точнее.

Можно ли загружать паспорт или договор в нейросеть?

Свои документы вы вправе загружать куда захотите, а вот чужие персональные данные - паспорта клиентов, договоры с фамилиями, медицинские справки - в сторонний сервис так просто отправлять нельзя: обработка персональных данных в России регулируется законом 152-ФЗ и требует правового основания, а ответственность лежит на том, кто данные собрал. Безопасный путь: закрыть чувствительные поля до загрузки, распознавать программой на своём компьютере или работать в корпоративном сервисе, с которым у компании оформлены отношения. Отдельно посмотрите в условиях, использует ли сервис загруженное для обучения моделей. На прайс, меню или чужую карточку товара эти ограничения не распространяются.

Как превратить фото прайса в таблицу Excel?

Снимите прайс по частям, загрузите первый кусок в чат-бота и попросите не просто распознать, а вернуть данные таблицей с колонками: наименование, артикул, единица измерения, цена. Обязательно добавьте правило: не додумывать значения, а помечать нечитаемые ячейки словом «неразборчиво». Таблицу скопируйте в редактор и проверьте выборочно 5-10 строк по фото плюс все цены с копейками - именно на цифрах распознавание ошибается чаще всего. На прайс в 3-4 листа уходит около 15 минут вместо часа ручного набора.

Ануфриев МихаилАМ
Автор

Основатель SkillMagnet, эксперт по применению ИИ в маркетинге. Собирает рабочие связки нейросетей для тех, кто только входит в digital.

Следующий шаг

Распознавание - только один кирпичик

Заберите бесплатный мини-курс из 4 видео: чем занимается интернет-маркетолог, какие навыки приносят первые деньги, как собрать портфолио без опыта и где найти первого клиента. Бесплатно, в Telegram, без созвонов.

Забрать 4 видео в Telegram Бесплатно. Доход не гарантируем, даём инструменты и маршрут.