Обучаем интернет-маркетингу с 2022 года
ИИ в маркетинге

Как обучить нейросеть на своих данных: три способа без кода

Запрос «обучить нейросеть на своих данных» почти всегда означает другое: нужно, чтобы модель отвечала по вашим документам - прайсу, регламенту, переписке с покупателями. Настоящее обучение для этого требуется редко и часто ломает больше, чем чинит. Разберём три уровня: файл прямо в чат, своя база знаний и дообучение. И отдельно - что в облако грузить нельзя.

Папка с документами, поток данных в узловую сеть нейросети, рядом замок-щит
Что узнаете из статьи
  • Чем «база знаний» отличается от дообучения и почему второе вам, скорее всего, не нужно
  • Точные лимиты и форматы: сколько влезает в чат, сколько документов держит проект
  • Чек-лист подготовки файлов и готовый шаблон инструкции для помощника
  • Что нельзя загружать в облако: 152-ФЗ, штрафы с 30 мая 2025 года и статья УК
Разобраться за 14 мин Разбор по шагам Уровень: Новичок

«Обучить» - обычно не то слово

Коротко

Три уровня: файлы в контекст (пять минут, бесплатно), своя база знаний по вашим документам (час-два на сборку) и дообучение (датасет от тысячи примеров). Девять задач из десяти закрывает второй уровень, а не третий.

Начнём с главного, от этого зависит весь дальнейший выбор. Когда «обучить нейросеть» говорит разработчик, он имеет в виду процесс, при котором меняются внутренние веса модели: ей показывают тысячи пар «запрос - эталонный ответ». Когда то же самое говорит маркетолог или владелец бизнеса, он имеет в виду другое: «хочу, чтобы нейросеть отвечала по моему прайсу и писала в моём стиле».

Это две разные задачи. Хорошая новость: вторая почти наверняка решается за вечер, без кода и без бюджета. Плохая: почти вся выдача по запросу отвечает на первую - теория машинного обучения, эпохи, валидация, примеры на Python. Новичку с папкой договоров это не помогает.

Три уровня, между которыми на самом деле выбирают

УровеньЧто происходитСколько времениКогда это ваш вариант
1. Файлы в контекстДокумент кладётся прямо в переписку, модель видит его целиком, пока идёт диалог5 минутРазовая задача: разобрать договор, пересказать отчёт, вытащить факты из выгрузки
2. Своя база знанийФайлы лежат в проекте постоянно, сервис ищет по ним нужный кусок и отвечает строго по нему1-2 часа на сборкуПостоянная работа с одним массивом: один клиент, один продукт, свои регламенты
3. ДообучениеМеняются веса модели: она перенимает манеру, формат и разметку ответаОт суток, с подготовкой данных - неделиНужен стабильный стиль или разбор потока однотипных текстов

Главное из этой таблицы: база знаний даёт факты, дообучение даёт манеру. Если нужно, чтобы помощник знал ваш прайс и не путал условия доставки, дообучение не поможет: вы потратите недели и получите модель, которая по-прежнему сочиняет цены, зато в вашем фирменном тоне.

Вторая мысль неприятнее: модель ничего не запоминает сама. Она не хранит файл после диалога и не накапливает опыт от долгого общения. Всё, что выглядит как память, - это либо файл в проекте, либо инструкция, которую сервис подставляет перед каждым сообщением.

Уровень 1: файлы прямо в чат

Коротко

Самый быстрый способ: положить документ в диалог и спрашивать по нему. У ГигаЧата TXT до 1 МБ, PDF до 20 МБ или первые 50 страниц, и каждый загруженный файл открывает новый чат. Минус - память живёт только внутри этого диалога.

С этого стоит начинать всем: ни настройки, ни оплаты, результат виден через минуту. Вы открываете чат, прикрепляете файл и задаёте вопрос по нему. Модель видит документ как часть вашего сообщения и отвечает с учётом него.

Работает это через контекстное окно - объём текста, который модель удерживает одновременно. У моделей GigaChat поколения 2.0 контекст заявлен в 128 тысяч токенов, а токен русского текста - это примерно 2-3 символа. То есть в контекст помещается порядка 150-200 страниц А4: файл на двадцать страниц влезает с запасом. Подробнее про эту единицу измерения - в отдельном материале про токены.

Что важно знать до загрузки

Ограничения конкретные, и лучше узнать о них заранее. У ГигаЧата, по документации Сбера: файл TXT - до 1 МБ, PDF - до 20 МБ либо первые 50 страниц, что наступит раньше. Документ больше - режьте на части до загрузки, сервис сам не разберётся.

Второй нюанс: загрузка файла в ГигаЧат открывает новый диалог, один файл - один чат. Нужно сравнить два документа - сведите их в один файл заранее.

Как спрашивать, чтобы был толк

Разница между «нейросеть бесполезна» и «нейросеть сэкономила два часа» лежит в формулировке запроса. Рабочий порядок:

  1. Первым сообщением - роль и правила: «Работай только с приложенным документом. Если ответа в нём нет, так и напиши. Не додумывай».
  2. Вторым - конкретную задачу: не «расскажи про документ», а «выпиши все сроки и суммы штрафов таблицей: пункт договора, срок, сумма».
  3. Третьим - проверку: «процитируй фрагмент, из которого ты взял третью строку таблицы».

Третий шаг новички пропускают, а он самый ценный: цитата сразу показывает, где модель нашла факт, а где достроила его сама.

Где способ ломается

  • Всё исчезает вместе с диалогом. Завтра для той же задачи файл придётся грузить заново. Для повторяющейся работы это утомительно - оттуда и растёт потребность во втором уровне.
  • Длинные документы читаются неравномерно. Чем больше текста, тем выше шанс, что модель помнит начало и конец, а середину проскочит.
  • Таблицы разбираются хуже текста. Нужен разбор статистики - сверните её в сводку на два десятка строк и только потом загружайте.

Уровень 2: своя база знаний

Коротко

База знаний работает так: сервис сначала ищет нужный фрагмент в ваших файлах, а потом пишет ответ строго по найденному. По-английски это RAG. Обновление - заменой файла, а не переобучением модели, в этом вся выгода.

Это и есть то, что имеет в виду большинство, задавая вопрос про обучение на своих данных. Вы один раз собираете папку документов, и дальше помощник отвечает по ним - сегодня, завтра и через месяц, без повторной загрузки.

Технология называется RAG, по-русски - «генерация с поиском по своим данным». Механика простая. Ваши файлы режутся на небольшие фрагменты и раскладываются по смыслу. Когда вы задаёте вопрос, система сначала находит подходящие фрагменты, подкладывает их модели и только потом просит написать ответ. Сама модель не меняется ни на грамм - меняется то, что ей показали перед ответом.

Отсюда три следствия:

  • Обновление стоит ноль. Поменялся прайс - вы заменили один файл, а не «переобучили модель».
  • Видно источник. Хорошие сервисы показывают, из какого документа взят ответ, и проверка занимает тридцать секунд.
  • Фантазий заметно меньше. Когда модели подложили конкретный кусок текста, ей проще опереться на него, чем сочинять. Меньше - не значит «нет», об этом ниже.

Что для этого доступно из России

Яндекс Нейроэксперт. Возможности сервиса живут внутри Алисы Про: вы создаёте проект, загружаете файлы и ссылки на alicepro.yandex.ru и дальше спрашиваете по ним обычными словами. Принимает документы, таблицы, презентации, изображения, аудио и видео, а также ссылки на страницы сайтов. Работает из России без оговорок. Лимиты бесплатного режима и порядок сборки проекта разобраны в отдельной статье.

ГигаЧат. Подходит, когда база небольшая и укладывается в один-два документа: собираете сводный файл, задаёте роль в начале диалога и работаете. Настраиваемые помощники с базой знаний у Сбера вынесены в корпоративную платформу GigaChat Enterprise - это про внедрение в компании, а не про вечер самостоятельной настройки.

Локальная модель на своём компьютере. Единственный вариант, при котором файл физически не покидает вашу машину. Требует видеокарты и терпения, зато снимает вопрос конфиденциальности целиком: что нужно от компьютера и какие модели скачивать, мы разбирали отдельно.

Зарубежные сервисы вроде ChatGPT, Claude и Gemini официально из России недоступны - учитывайте это, чтобы не строить рабочий процесс на инструменте без стабильного доступа.

Честно про слабые места

Хуже всего она обращается с числами: может уверенно назвать сумму, которой в документе нет, или подтянуть значение из соседней строки таблицы. Второе слабое место - кто что сказал: в расшифровке созвона реплики приписываются не тому участнику. Третье - даты: «до конца месяца» из письма трёхмесячной давности превращается в актуальный срок.

Рабочее правило: найденное моделью - подсказка, где смотреть, а не факт. Любую цифру, которая пойдёт в отчёт или расчёт бюджета, сверяйте с исходным файлом.

Чек-лист подготовки данных

Коротко

Качество ответов определяется не моделью, а тем, что вы в неё положили. Один файл - одна тема, текст вместо сканов, актуальные версии вместо архива и обязательный служебный вопрос «перечисли, что ты прочитал» перед началом работы.

Этот раздел объясняет большинство случаев «нейросеть отвечает ерунду»: дело не в модели, а в том, что в неё положили.

  1. Один проект - одна тема. Если свалить в одну папку материалы трёх бизнесов, ответы начнут смешиваться: система не понимает, что прайс из одного файла не относится к услугам из другого.
  2. Текст, а не картинки. Скан договора и фото прайса распознаются с ошибками, хуже всего в цифрах. Есть исходник в DOCX или таблице - грузите его.
  3. Один файл - одна тема внутри проекта. Не «всё про компанию.pdf» на восемьдесят страниц, а «услуги и цены», «условия доставки», «частые вопросы покупателей». Поиск по смыслу работает точнее, когда фрагменты не перемешаны.
  4. Говорящие имена файлов. «Прайс услуг, действует с 01.08.2026» вместо «doc_final_2(1)»: модель видит название и опирается на него.
  5. Дата внутри документа. Первой строкой: «Актуально на 1 августа 2026 года». Лечит самую частую ошибку - ответ по устаревшему прайсу.
  6. Никакого архива. Две редакции договора в одной папке гарантированно дадут ответ по неправильной.
  7. Уберите персональные данные. Имена, телефоны и почты покупателей вычищаются до загрузки. Почему это не формальность - в разделе про закон.
  8. Сначала проверка, потом работа. Первый вопрос к базе всегда служебный.

Служебный вопрос, с которого начинается работа

Скопируйте и задайте его сразу после загрузки файлов:

Перечисли все документы, которые ты видишь: название файла и одна строка о том, что внутри. Отдельно укажи, какие файлы ты не смог прочитать полностью и почему.

Полминуты - и вы узнаёте про нераспознанный скан сейчас, а не после десяти ответов на дырке.

Шаблон инструкции для помощника

Второе, что вставляют в начало работы, - правила поведения. Готовый текст, замените то, что в квадратных скобках:

Ты помощник по проекту [название]. Отвечай только по загруженным документам. Если ответа в них нет, пиши: «в документах этого нет» - и не предлагай общие соображения вместо ответа. К каждому ответу указывай, из какого файла взята информация. Цифры и суммы приводи ровно так, как они написаны в документе, без округления. Отвечай короткими абзацами, без вступлений.

Основную работу тут делают три фразы: запрет отвечать вне документов, требование указывать источник и запрет округлять цифры. Уберёте их - вернётся вежливое сочинительство.

Бесплатно · Telegram

Порядок в данных заказчика - половина работы маркетолога

Собирать базу знаний имеет смысл, когда есть чей-то бизнес и чьи-то документы. В 4 бесплатных видео разбираем вход в интернет-маркетинг: с каких задач начинают, что за них платят и как собрать первые примеры работ без опыта.

Смотреть 4 видео Открывается в Telegram

Уровень 3: настоящее дообучение

Коротко

Дообучение меняет манеру, а не знания. В Yandex AI Studio дообучают YandexGPT Lite методом LoRA: рекомендованный датасет - от тысячи примеров, формат JSON Lines, обучение занимает от часа до суток. Ради «чтобы знал мой прайс» это делать бессмысленно.

Теперь про то, о чём написана вся техническая выдача по этому запросу. Дообучение - это когда модели показывают много пар «запрос - эталонный ответ», и она подстраивает часть параметров. С нуля давно никто не обучает: берут готовую модель и донастраивают.

Что для этого требуется на самом деле

Возьмём доступный из России вариант - Yandex AI Studio. Дообучение там делается методом LoRA, который меняет не всю модель, а небольшую часть параметров. По документации сервиса:

  • дообучать можно модель генерации текста YandexGPT Lite и классификаторы на её основе;
  • датасет рекомендуется от 1 000 примеров, а для классификаторов - не менее 100 примеров на каждый класс;
  • формат - JSON Lines, где каждый пример представляет собой диалог с ролями system, user и assistant;
  • максимальная длина запроса - 8 000 токенов, эталонного ответа - 2 000 токенов;
  • обучение занимает от часа до суток в зависимости от объёма данных и загрузки сервиса.

Второй пункт стоит прочитать дважды. Тысяча примеров - это не «выгрузить папку с документами», а тысяча пар, где для каждого запроса написан правильный ответ. Собрать такой массив вручную - работа на недели, а наспех бессмысленно: на грязных данных модель учится ошибкам так же прилежно, как верным ответам.

Почему опытные разработчики отговаривают

Показательная деталь: на профильных площадках на вопрос «как дообучить модель на своей переписке» самый частый ответ - не инструкция, а предупреждение. На небольшом личном массиве дообучение обычно ухудшает общие способности модели: рассуждать она начинает хуже, зато копирует интонацию. Совет там же один - сначала база знаний, и только если её не хватит, думать про обучение.

Когда дообучение всё-таки оправдано

Три ситуации, где оно решает задачу, а база знаний нет:

  • Жёсткий формат на потоке. Из тысячи писем в день должна выходить одинаково размеченная карточка. Инструкцией это держится нестабильно.
  • Классификация. Разложить обращения по десяти категориям с предсказуемой точностью. Тут и датасет собирается сам: у вас уже есть размеченный архив.
  • Устойчивая манера письма. Когда стиль - часть продукта и описать его словами в инструкции не выходит.

Отдельный случай: обучение на своих фотографиях

С картинками порог входа действительно низкий. Тот же метод LoRA применяют к моделям генерации изображений, чтобы научить их конкретному лицу, продукту или стилю. Наборы тут крошечные: в руководствах по обучению LoRA на своём лице советуют 15-30 фотографий с разными ракурсами и фонами.

Этот сценарий давно упакован в готовые приложения-аватары: вы загружаете десяток своих фотографий, сервис обучает модель под ваше лицо, а дальше остаётся выбрать стиль. Внутри там ровно то самое дообучение, просто технические шаги спрятаны. Перед загрузкой посмотрите, кому принадлежит приложение и что написано в его соглашении: свои фотографии вы отдаёте туда так же, как любой другой файл.

Вывод: задача про факты и документы - третий уровень не нужен. Про стиль изображений - доступен сразу. Про формат текста на потоке - считайте стоимость сбора датасета до старта.

Что нельзя загружать в облако

Коротко

Персональные данные покупателей и клиентов в чужое облако не отправляют. С 30 мая 2025 года штрафы за утечки резко выросли, а с декабря 2024 действует отдельная статья Уголовного кодекса. Отвечает тот, кто передал данные, а не сервис.

Этого раздела нет в технических статьях про дообучение, а в работе он важнее остального. Как только вы берёте файлы клиента и грузите их в облако, вы передаёте чужую информацию третьему лицу. Юридически это ваше действие и ваша ответственность.

Что изменилось в законе

Обработка персональных данных регулируется законом 152-ФЗ. В конце 2024 года и в 2025-м ответственность ужесточили:

  • С 11 декабря 2024 года действует статья 272.1 Уголовного кодекса - за незаконные использование, передачу, сбор и хранение компьютерной информации с персональными данными. По основному составу наказание доходит до лишения свободы, а для данных несовершеннолетних и биометрии санкции строже.
  • С 30 мая 2025 года работают поправки закона 420-ФЗ: штрафы по статье 13.11 КоАП выросли, размер штрафа за утечку привязали к объёму утёкших данных, а за повторное нарушение ввели оборотные штрафы - для компаний верхняя планка доходит до сотен миллионов рублей.

Простое правило разделения

Можно грузить спокойноТолько после обезличиванияНе грузить в чужое облако
Тексты вашего сайта, публичный прайс, описания услугОтзывы и переписка с покупателямиВыгрузка базы клиентов с телефонами и почтами
Открытые обзоры рынка, статьи конкурентовРасшифровки созвоновПаспортные и платёжные данные, медицинские сведения
Ваши собственные черновики и заметкиВнутренние регламенты без имён сотрудниковДоговоры с реквизитами и подписантами, если нет согласия сторон

Обезличивание в бытовом смысле - замена имён и контактов на метки: «Клиент 1», «Менеджер А», «телефон скрыт». Пятнадцать минут поиском и заменой в редакторе. Смысл материала не теряется: чтобы вытащить из отзывов язык покупателя, имена не нужны.

Куда уходят данные у популярных сервисов

Условия у сервисов разные и меняются, читать придётся самому. Ориентир: у DeepSeek данные обрабатываются и хранятся в Китае, а переписки по умолчанию могут идти на улучшение моделей. Отключается в настройках профиля: в разделе управления данными есть переключатель об улучшении модели для всех, его переводят в выключенное положение. Он влияет на будущее использование, а не отменяет уже отправленное.

У российских сервисов данные остаются внутри страны, но соглашение всё равно придётся прочитать - особенно если работаете с чужими документами по договору.

Самый надёжный ответ на «а точно ли не утечёт» - локальный запуск модели: там файл никуда не отправляется, потому что отправлять некуда.

Пять ошибок новичка

Эти пять случаев дают почти все жалобы «попробовал, не работает». Каждый лечится за пять минут.

1. Всё свалено в один проект

В папке лежат материалы трёх клиентов, и модель отвечает про доставку одного бизнеса ценами другого. Признак: ответы правдоподобны, но при проверке относятся не к тому документу. Лечение - отдельный проект на каждую тему.

2. Загружены сканы вместо текста

Фото прайса и скан договора распознаются с ошибками, цифры страдают первыми. Признак: модель называет суммы, которых в документе нет, или путает разряды. Лечение - искать исходник в DOCX, XLSX или PDF с текстовым слоем.

3. Ожидание, что модель запомнит между чатами

Вчера человек объяснял нейросети специфику бизнеса, сегодня открыл новый диалог и ждёт, что она помнит. Лечение - переносить постоянные вводные либо в файл проекта, либо в инструкцию, которую вы вставляете первым сообщением.

4. Загружена выгрузка на тысячи строк

Статистика из рекламного кабинета целиком, обращения за год одним файлом. Признак: ответы про начало и конец таблицы точные, про середину - выдуманные. Лечение - свернуть данные в сводку до загрузки: двадцать осмысленных строк работают лучше пяти тысяч сырых.

5. Цифры из ответа идут в отчёт без проверки

Самая дорогая ошибка, потому что обнаруживается у заказчика. Признака нет, в этом и проблема: ответ выглядит уверенно. Лечение - привычка добавлять «процитируй фрагмент, откуда взята эта цифра» и сверять с исходником всё, что уйдёт наружу.

Что выбрать под свою задачу

Сведём всё в таблицу, чтобы не перечитывать статью, когда дойдёт до дела.

Ваша задачаУровеньЧто делать
Разобрать один документ, отчёт, расшифровку1Файл в чат, роль первым сообщением, проверка цитатой
Помощник по одному клиенту или продукту на постоянной основе2Проект с базой знаний, 5-15 подготовленных файлов
Ответы по внутренним регламентам для команды2База знаний плюс инструкция с запретом отвечать вне документов
Документы, которые нельзя отдавать в облако2Локальная модель на своём компьютере
Одинаково размеченные карточки из потока писем3Датасет из размеченного архива, дообучение по документации сервиса
Изображения в своём стиле или со своим лицом3Готовый сервис аватаров либо обучение LoRA на 15-30 фото

План на первый вечер

  1. Выберите одну задачу, которая повторяется каждую неделю. Не «попробовать нейросеть», а «отвечать на вопросы по условиям доставки».
  2. Соберите под неё 5-10 файлов по чек-листу выше. Час работы, не больше.
  3. Создайте проект в сервисе с базой знаний, загрузите файлы и задайте служебный вопрос «перечисли, что ты прочитал».
  4. Вставьте шаблон инструкции, поправьте под себя.
  5. Задайте десять настоящих рабочих вопросов и по каждому проверьте источник. После них вы будете знать, где инструменту можно доверять, а где нет.

После этого вопрос про обучение обычно снимается сам: видно, что задача была про порядок в документах и точность формулировок.

Честная оговорка в конце: всё описанное - инструменты и маршрут, а не гарантия результата. Сервисы меняют лимиты и условия, поэтому перед тем как строить на них рабочий процесс, сверяйтесь с текущей документацией.

Частые вопросы

Можно ли обучить нейросеть на своих данных бесплатно?

Первый и второй уровни - да. Положить файл в чат и собрать проект с базой знаний можно на бесплатных тарифах российских сервисов: упрётесь вы в лимиты по числу запросов и документов, а не в оплату. Настоящее дообучение бесплатным не бывает - там нужны вычислительные мощности.

Нейросеть запомнит мои файлы навсегда?

Нет. Модель ничего не запоминает от разговора с вами. В обычном чате файл живёт до конца диалога, в проекте с базой знаний он лежит в вашем хранилище и подставляется при каждом запросе. Удалите файл из проекта - помощник перестанет о нём знать.

Сколько данных нужно, чтобы дообучить модель?

Для текста - много. В документации Yandex AI Studio датасет рекомендуют собирать от 1 000 примеров, а для классификаторов - не менее 100 на каждый класс, причём пример это пара «запрос и эталонный ответ», а не просто документ. Для изображений порог низкий: в руководствах по обучению LoRA на своём лице берут 15-30 фотографий.

Что лучше: база знаний или дообучение?

Если вопрос про факты - база знаний, почти без вариантов: она даёт модели ваши документы, обновляется заменой файла и показывает источник. Дообучение отвечает за манеру и формат - оно не научит модель знать ваш прайс, зато даст стабильную структуру ответа.

Безопасно ли загружать документы компании в нейросеть?

Зависит от того, что внутри. Публичный прайс и тексты сайта - да. Персональные данные покупателей и сотрудников - нет: с 30 мая 2025 года штрафы за утечки выросли, а с декабря 2024 действует статья 272.1 Уголовного кодекса, и отвечает тот, кто передал данные. Имена и контакты убирайте до загрузки, а совсем закрытые документы разбирайте на своём компьютере.

Ануфриев МихаилАМ
Автор

Специалист SkillMagnet, отвечает за внедрение ИИ в маркетинг. Собирает рабочие связки нейросетей для тех, кто только входит в digital.

Следующий шаг

Разбираться в данных - прикладной навык, и он нужен не сам по себе

Базы знаний собирают под конкретный бизнес: под его прайс, его покупателей и его задачи. В 4 бесплатных видео показываем, как войти в интернет-маркетинг с нуля - какие навыки первыми приносят оплату, как собрать примеры работ без заказчиков и где искать первые заявки.

Забрать 4 видео в Telegram Бесплатно. Доход не гарантируем, даём инструменты и маршрут.