Нейросеть для распознавания текста с фото: от снимка до готовой таблицы
Поставщик прислал прайс фотографиями листов, клиент - договор снимками с телефона, коллега - скрин таблицы вместо файла. И вы садитесь перепечатывать это руками. Нейросети читают текст с фото давно, но сила не в самом распознавании: бот сразу превращает снимок в таблицу и вытаскивает нужные поля. Разбираем инструменты, промты и границы - включая то, что грузить в чужой сервис нельзя.

- Чем распознавать: таблица инструментов
- Как снять фото, чтобы распозналось с первого раза
- Промты: фото прайса сразу в таблицу
- Что нельзя загружать в чужой сервис
Где это нужно каждый день
Распознавание текста - не задача «для айтишников», а ежедневная рутина любого, кто работает с бумагами и скринами. Прайс, конспект, визитка, чек, чужая карточка товара за минуту превращаются в текст, который можно править, искать и считать.
Вот что накапливается за одну неделю у обычной кофейни или небольшого магазина:
- Прайс от поставщика - фотографии листов или PDF из сканов, где текст не выделяется мышкой.
- Скрин таблицы - коллега прислал отчёт картинкой вместо файла.
- Визитки с выставки - пачка картонок, из которой нужен список контактов.
- Конспект от руки - записи с обучения или планёрки надо перевести в задачи.
- Чеки и накладные - раз в месяц сводятся в таблицу расходов.
- Договор в фотографиях - надо найти в нём конкретный пункт про сроки.
- Чужая карточка товара - разобрать её структуру, как в статье про ИИ для интернет-магазина.
Раньше на это уходили часы набора или платная программа. Сейчас почти всё закрывается бесплатными инструментами, которые уже стоят у вас в телефоне.
Как работает и почему рукопись сложнее
Классическое распознавание разбирает картинку на строки и символы и сравнивает их с образцами букв. Нейросети читают строку целиком и достраивают смысл по контексту - точнее, но с побочным эффектом: непонятное слово они заменяют правдоподобным. Поэтому вычитка обязательна, а для рукописи - вдвойне.
Технология называется OCR - оптическое распознавание символов. Старый подход работал механически: найти блоки текста, разбить на строки, строки на символы, каждый сопоставить с эталоном, а поверх наложить словарь языка. Когда буква была нечёткой, программа честно выдавала абракадабру - и вы сразу видели сбой.
Современные модели смотрят на строку и на весь лист сразу и понимают не только форму букв, но и смысл. За счёт этого они справляются с наклонным кадром, плохим светом и таблицами в несколько колонок. Обратная сторона: если слово нечитаемо, нейросеть подставит подходящее по контексту. В прайсе такая ошибка выглядит невинно и доезжает до заказа.
Рукопись сложнее по трём причинам: у печатной буквы одна форма на весь документ, у рукописной - своя в каждом слове; буквы слиты, и модель должна ещё угадать границы; плюс личные сокращения и пометки на полях. Работает то же правило, что и с расшифровкой аудио: черновик машина делает за минуту, ответственность за точность остаётся на человеке.
Чем распознавать: таблица инструментов
Четыре группы: встроенное распознавание в телефоне, сервисы Яндекса и Сбера, универсальные чат-боты с загрузкой картинки и программы для документов на компьютере. Для фразы с вывески хватит телефона, для прайса в таблицу нужен чат-бот, для пачки договоров - программа.
Встроенное в телефон. На iPhone это «Живой текст»: открываете снимок в приложении «Фото», зажимаете текст и копируете как обычный. На Android то же делает «Google Объектив» - через камеру или галерею. Ноль установок и секунды на выделение фразы, но результат вы получаете как есть, без структуры.
Сервисы Яндекса и Сбера. Яндекс Переводчик читает текст с фотографии и сразу переводит - удобно для этикеток, меню и инструкций (подробнее - в статье про нейросети для перевода). Алиса AI принимает фото и разбирает не только текст, но и таблицы, схемы и формулы. GigaChat умеет то же самое и заявлен как распознающий и печатный, и рукописный текст. Полезная мелочь: Яндекс Диск ищет фотографии по словам, которые на них написаны, - так находится снимок визитки среди тысяч кадров.
Универсальные чат-боты. ChatGPT, Gemini, Claude, DeepSeek, Kimi принимают картинку прямо в диалог. Их преимущество не в распознавании, а в том, что следующим сообщением вы просите привести данные в порядок. Оговорка по доступности: у части зарубежных сервисов регистрация из России проходит не всегда, а российские карты для оплаты платных тарифов не принимаются - это разные ограничения, и проверять их стоит заранее. Что под какие задачи брать, сравнивали в обзоре бесплатных нейросетей.
Программы для компьютера. Когда документов десятки и нужен аккуратный экспорт в Word или Excel с сохранением колонок, чат-бот проигрывает специализированной программе. Прежний ABBYY FineReader в России официально не продаётся, его прямой преемник - ContentReader PDF: это тот же продукт под новым именем, права на который остались за выделенным в 2022 году российским подразделением ABBYY, теперь оно называется Content AI. Программа платная, условия смотрите на сайте разработчика. Главный плюс - файл не уходит в чужое облако; про такой подход в целом - в статье про нейросети локально на компьютере.
| Инструмент | Что распознаёт | Язык | Бесплатно | Из России |
|---|---|---|---|---|
| Живой текст (iPhone), Google Объектив (Android) | Печатный текст на фото и на экране | Русский и десятки других | Да, встроено | Работает |
| Яндекс Переводчик | Печатный текст + сразу перевод | Многоязычный | Да | Российский сервис |
| Алиса AI | Текст, таблицы, схемы, формулы | Русский | Да, с лимитами | Российский сервис |
| GigaChat | Печатный и рукописный текст, таблицы, графики | Русский | Да, с лимитами | Российский сервис |
| ChatGPT, Gemini, Claude, Kimi | Текст + структурирование по запросу | Многоязычные | Есть бесплатные режимы | Есть ограничения регистрации и оплаты |
| DeepSeek | Текст + структурирование по запросу | Понимает русский | Да | Открывается |
| ContentReader PDF и подобные | Многостраничные документы, экспорт в Word и Excel | Русский и другие | Нет, платно | Российский разработчик |
Такие связки экономят часы каждую неделю
В 4 бесплатных видео разбираем вход в маркетинг: какие навыки приносят деньги быстрее всего, как собрать портфолио и где найти первого клиента.
Как снять, чтобы распозналось
Свет, отсутствие бликов и ровный кадр решают больше, чем выбор сервиса. Длинный документ снимайте по частям, а если есть исходный файл или скан - берите его вместо фотографии. И всегда вычитывайте цифры: именно на них распознавание ошибается чаще всего.
- Дневной или яркий рассеянный свет. Вспышка почти всегда даёт блик посередине листа.
- Камера строго над документом. Наклон превращает прямоугольник в трапецию, и строки по краям плывут.
- Никакой тени от руки. Свет должен падать сбоку, а не из-за вашей спины.
- Глянец - под небольшим углом. Ламинированное меню и экран монитора бликуют; экран лучше снимать, подняв его яркость.
- Снимайте по частям. Два кадра по половине листа дают вдвое более крупный шрифт. Ориентир простой: на готовом снимке мелкая строка должна читаться без увеличения.
- Скан или исходный файл лучше фото. Если поставщик может прислать PDF, просите PDF.
- Проверьте резкость до отправки. Если вы сами не читаете мелкую строку, нейросеть тоже её не прочтёт, а сообщит об этом не всегда.
Ошибки русского распознавания предсказуемы, и это хорошая новость - их легко ловить поиском. Путаются похожие символы: «о» и ноль, «З» и тройка, «б» и шестёрка, «и» и «н», «л» и «п», «г» и «т». Отдельная беда - латинские буквы внутри русских слов: «с», «е», «о», «а», «р» выглядят одинаково в двух раскладках, и поиск по такому слову потом не работает. В таблицах слипаются соседние колонки и теряются пробелы в разрядах чисел.
Вычитка на две минуты: пробегитесь по всем цифрам, сложите итог по столбцу и сверьте с итогом на фото, проверьте фамилии и названия брендов, а в конце попросите бота отдельным сообщением перечитать результат на типичные ошибки распознавания. Полностью доверять машине нельзя: она не знает, что в прайсе стояло 1 490, а распозналось 149 с потерянной цифрой.
Распознал - и сразу обработал: промты
Сила чат-ботов не в самом распознавании, а в следующем шаге. Одним запросом фото прайса становится таблицей, пачка визиток - списком контактов, два прайса - сравнением с разницей в процентах. Главное правило промта: не додумывать, а помечать нечитаемое.
Обычное распознавание отдаёт простыню текста, которую всё равно надо руками раскладывать по колонкам. Чат-бот делает это сам. Как формулировать запросы в принципе - в статье о том, как составить промт, ниже - готовые заготовки.
Промт 1: фото прайса сразу в таблицу
«На фото - прайс поставщика. Распознай его и верни таблицей с колонками: наименование, артикул, единица измерения, цена. Правила: цены сохраняй ровно как в оригинале, включая копейки; ничего не додумывай, нечитаемую ячейку помечай словом «неразборчиво»; порядок строк не меняй; в конце напиши, сколько позиций распознал».
Промт 2: сравнить два прайса
«Вот два прайса разных поставщиков в виде фото. Распознай оба и собери одну таблицу: наименование, цена поставщика А, цена поставщика Б, разница в рублях, разница в процентах. Сопоставляй позиции по смыслу названия, а не буква в букву. Позиции, которые есть только у одного, вынеси в список внизу».
Промт 3: вытащить только нужные поля
«На фото - визитки. Достань только нужные поля и верни списком через точку с запятой: имя; должность; компания; телефон; почта; сайт. Телефоны приведи к формату +7 (XXX) XXX-XX-XX. Если поля нет - ставь прочерк, ничего не подставляй от себя. В конце перечисли карточки, которые распознались плохо».
Готовую таблицу переносите в редактор простым копированием. Формулы, сортировка и сводные - в статье про нейросети для таблиц Excel.
Приватность и закон
Свои документы грузите куда хотите, чужие персональные данные - нет. Паспорта, договоры с фамилиями, медицинские справки и базы клиентов в сторонний сервис без правового основания отправлять нельзя. Выход: закрыть чувствительные поля, распознавать локальной программой или работать в корпоративном сервисе.
Это самый пропускаемый раздел в статьях про распознавание и самый важный для тех, кто работает с клиентами. Обработка персональных данных в России регулируется законом 152-ФЗ, и загрузка чужого паспорта в публичный чат-бот - именно обработка, причём с передачей третьему лицу. Ответственность лежит на том, кто данные собрал. Конкретные санкции зависят от состава нарушения, и уточнять их стоит в актуальной редакции закона, а не в статьях в интернете.
- Разделяйте документы. Прайс, меню, чек, чужая карточка товара, свой конспект - персональных данных там нет, грузите спокойно.
- Обезличивайте. Нужен только пункт договора про сроки - закройте фамилии, реквизиты и подписи до съёмки.
- Чувствительное - локально. Паспорта, медицинские документы и списки клиентов распознавайте программой на своём компьютере. В справке сервиса обычно написано, обрабатывается снимок на устройстве или уходит в облако - проверьте это один раз.
- Читайте условия про обучение. Часть сервисов использует загруженное для улучшения моделей, иногда это отключается в настройках.
- В компании - через договорённости. Если распознавание становится частью процесса, вопрос решается корпоративным сервисом и оформленными отношениями по обработке данных.
Кейс: прайс в таблицу за 15 минут
Прайс кофейни на 4 листах, снятый телефоном, превращается в таблицу для заказа примерно за 15 минут вместо часа набора. Основное время уходит не на распознавание, а на съёмку по частям и вычитку цифр - и сокращать именно вычитку не стоит.
Поставщик кофе прислал обновлённый прайс фотографиями распечатки, а заказ надо собрать сегодня:
- Съёмка, 3 минуты. Листы на столе у окна, каждый снимаем двумя кадрами - верх и низ. Восемь снимков вместо четырёх, зато шрифт крупный.
- Распознавание, 4 минуты. Загружаем кадры в чат-бота по одному и применяем промт 1. По одному принципиально: пачкой модель чаще путает строки между листами.
- Сборка, 3 минуты. «Объедини таблицы из предыдущих сообщений в одну, шапку оставь один раз, порядок позиций сохрани».
- Вычитка, 4 минуты. Сверяем цены по фото - единственный шаг, который нельзя ускорить. Отдельно смотрим строки с пометкой «неразборчиво».
- Заказ, 1 минута. Копируем таблицу в редактор, проставляем количество, считаем сумму формулой.
Честная оговорка: так гладко выходит с печатным прайсом на белой бумаге. Скан плохого качества, помятый лист или мелкий шрифт в четыре колонки съедят больше времени, а вычитывать придётся построчно. И если позиций несколько сотен, а прайс приходит еженедельно, разумнее один раз выпросить у поставщика файл. Нейросеть отлично закрывает разовую боль, но не заменяет нормальный обмен данными.
Частые вопросы
Какая нейросеть распознаёт текст с фото бесплатно?
Проще всего начать с того, что уже под рукой: на iPhone это «Живой текст» в приложении «Фото», на Android - «Google Объектив», а Яндекс Переводчик читает текст с картинки и сразу переводит. Если нужен не сырой текст, а приведённый в порядок результат, бесплатно работают Алиса AI от Яндекса и GigaChat от Сбера: оба принимают фото и разбирают текст, таблицы и формулы. У бесплатных режимов бывают ограничения по числу запросов, и площадки меняют их без объявления - актуальные лимиты смотрите в справке сервиса. Платные программы нужны, только когда документов много и требуется точный экспорт в Word или Excel.
Можно ли распознать рукописный текст на фото?
Да, но качество ниже, чем у печатного, и результат всегда нужно вычитывать. Аккуратный разборчивый почерк с раздельными буквами современные модели читают неплохо: GigaChat, например, заявлен как распознающий и печатный, и рукописный текст. Слитную скоропись, личные сокращения и записи по диагонали ИИ разбирает с ошибками, причём ошибки правдоподобные - вместо мусора он подставит похожее по смыслу слово. Поэтому рукопись распознают по одной странице за раз и сверяют глазами все цифры, фамилии и термины.
Как повысить точность распознавания текста с фото?
Главное - свет и ровный кадр: снимайте при дневном или ярком рассеянном свете и держите камеру строго над листом, без наклона и без тени от руки. Убирайте блики: глянцевую бумагу и экран монитора лучше снимать под небольшим углом к источнику света, а не со вспышкой. Длинный документ снимайте по частям, чтобы буквы были крупными: на готовом снимке мелкая строка должна читаться без увеличения. И если есть выбор между фотографией и сканом или исходным PDF, берите файл - он распознаётся точнее.
Можно ли загружать паспорт или договор в нейросеть?
Свои документы вы вправе загружать куда захотите, а вот чужие персональные данные - паспорта клиентов, договоры с фамилиями, медицинские справки - в сторонний сервис так просто отправлять нельзя: обработка персональных данных в России регулируется законом 152-ФЗ и требует правового основания, а ответственность лежит на том, кто данные собрал. Безопасный путь: закрыть чувствительные поля до загрузки, распознавать программой на своём компьютере или работать в корпоративном сервисе, с которым у компании оформлены отношения. Отдельно посмотрите в условиях, использует ли сервис загруженное для обучения моделей. На прайс, меню или чужую карточку товара эти ограничения не распространяются.
Как превратить фото прайса в таблицу Excel?
Снимите прайс по частям, загрузите первый кусок в чат-бота и попросите не просто распознать, а вернуть данные таблицей с колонками: наименование, артикул, единица измерения, цена. Обязательно добавьте правило: не додумывать значения, а помечать нечитаемые ячейки словом «неразборчиво». Таблицу скопируйте в редактор и проверьте выборочно 5-10 строк по фото плюс все цены с копейками - именно на цифрах распознавание ошибается чаще всего. На прайс в 3-4 листа уходит около 15 минут вместо часа ручного набора.
Распознавание - только один кирпичик
Заберите бесплатный мини-курс из 4 видео: чем занимается интернет-маркетолог, какие навыки приносят первые деньги, как собрать портфолио без опыта и где найти первого клиента. Бесплатно, в Telegram, без созвонов.
АМ