Как обучить нейросеть на своих данных: три способа без кода
Запрос «обучить нейросеть на своих данных» почти всегда означает другое: нужно, чтобы модель отвечала по вашим документам - прайсу, регламенту, переписке с покупателями. Настоящее обучение для этого требуется редко и часто ломает больше, чем чинит. Разберём три уровня: файл прямо в чат, своя база знаний и дообучение. И отдельно - что в облако грузить нельзя.

- Чем «база знаний» отличается от дообучения и почему второе вам, скорее всего, не нужно
- Точные лимиты и форматы: сколько влезает в чат, сколько документов держит проект
- Чек-лист подготовки файлов и готовый шаблон инструкции для помощника
- Что нельзя загружать в облако: 152-ФЗ, штрафы с 30 мая 2025 года и статья УК
«Обучить» - обычно не то слово
Три уровня: файлы в контекст (пять минут, бесплатно), своя база знаний по вашим документам (час-два на сборку) и дообучение (датасет от тысячи примеров). Девять задач из десяти закрывает второй уровень, а не третий.
Начнём с главного, от этого зависит весь дальнейший выбор. Когда «обучить нейросеть» говорит разработчик, он имеет в виду процесс, при котором меняются внутренние веса модели: ей показывают тысячи пар «запрос - эталонный ответ». Когда то же самое говорит маркетолог или владелец бизнеса, он имеет в виду другое: «хочу, чтобы нейросеть отвечала по моему прайсу и писала в моём стиле».
Это две разные задачи. Хорошая новость: вторая почти наверняка решается за вечер, без кода и без бюджета. Плохая: почти вся выдача по запросу отвечает на первую - теория машинного обучения, эпохи, валидация, примеры на Python. Новичку с папкой договоров это не помогает.
Три уровня, между которыми на самом деле выбирают
| Уровень | Что происходит | Сколько времени | Когда это ваш вариант |
|---|---|---|---|
| 1. Файлы в контекст | Документ кладётся прямо в переписку, модель видит его целиком, пока идёт диалог | 5 минут | Разовая задача: разобрать договор, пересказать отчёт, вытащить факты из выгрузки |
| 2. Своя база знаний | Файлы лежат в проекте постоянно, сервис ищет по ним нужный кусок и отвечает строго по нему | 1-2 часа на сборку | Постоянная работа с одним массивом: один клиент, один продукт, свои регламенты |
| 3. Дообучение | Меняются веса модели: она перенимает манеру, формат и разметку ответа | От суток, с подготовкой данных - недели | Нужен стабильный стиль или разбор потока однотипных текстов |
Главное из этой таблицы: база знаний даёт факты, дообучение даёт манеру. Если нужно, чтобы помощник знал ваш прайс и не путал условия доставки, дообучение не поможет: вы потратите недели и получите модель, которая по-прежнему сочиняет цены, зато в вашем фирменном тоне.
Вторая мысль неприятнее: модель ничего не запоминает сама. Она не хранит файл после диалога и не накапливает опыт от долгого общения. Всё, что выглядит как память, - это либо файл в проекте, либо инструкция, которую сервис подставляет перед каждым сообщением.
Уровень 1: файлы прямо в чат
Самый быстрый способ: положить документ в диалог и спрашивать по нему. У ГигаЧата TXT до 1 МБ, PDF до 20 МБ или первые 50 страниц, и каждый загруженный файл открывает новый чат. Минус - память живёт только внутри этого диалога.
С этого стоит начинать всем: ни настройки, ни оплаты, результат виден через минуту. Вы открываете чат, прикрепляете файл и задаёте вопрос по нему. Модель видит документ как часть вашего сообщения и отвечает с учётом него.
Работает это через контекстное окно - объём текста, который модель удерживает одновременно. У моделей GigaChat поколения 2.0 контекст заявлен в 128 тысяч токенов, а токен русского текста - это примерно 2-3 символа. То есть в контекст помещается порядка 150-200 страниц А4: файл на двадцать страниц влезает с запасом. Подробнее про эту единицу измерения - в отдельном материале про токены.
Что важно знать до загрузки
Ограничения конкретные, и лучше узнать о них заранее. У ГигаЧата, по документации Сбера: файл TXT - до 1 МБ, PDF - до 20 МБ либо первые 50 страниц, что наступит раньше. Документ больше - режьте на части до загрузки, сервис сам не разберётся.
Второй нюанс: загрузка файла в ГигаЧат открывает новый диалог, один файл - один чат. Нужно сравнить два документа - сведите их в один файл заранее.
Как спрашивать, чтобы был толк
Разница между «нейросеть бесполезна» и «нейросеть сэкономила два часа» лежит в формулировке запроса. Рабочий порядок:
- Первым сообщением - роль и правила: «Работай только с приложенным документом. Если ответа в нём нет, так и напиши. Не додумывай».
- Вторым - конкретную задачу: не «расскажи про документ», а «выпиши все сроки и суммы штрафов таблицей: пункт договора, срок, сумма».
- Третьим - проверку: «процитируй фрагмент, из которого ты взял третью строку таблицы».
Третий шаг новички пропускают, а он самый ценный: цитата сразу показывает, где модель нашла факт, а где достроила его сама.
Где способ ломается
- Всё исчезает вместе с диалогом. Завтра для той же задачи файл придётся грузить заново. Для повторяющейся работы это утомительно - оттуда и растёт потребность во втором уровне.
- Длинные документы читаются неравномерно. Чем больше текста, тем выше шанс, что модель помнит начало и конец, а середину проскочит.
- Таблицы разбираются хуже текста. Нужен разбор статистики - сверните её в сводку на два десятка строк и только потом загружайте.
Уровень 2: своя база знаний
База знаний работает так: сервис сначала ищет нужный фрагмент в ваших файлах, а потом пишет ответ строго по найденному. По-английски это RAG. Обновление - заменой файла, а не переобучением модели, в этом вся выгода.
Это и есть то, что имеет в виду большинство, задавая вопрос про обучение на своих данных. Вы один раз собираете папку документов, и дальше помощник отвечает по ним - сегодня, завтра и через месяц, без повторной загрузки.
Технология называется RAG, по-русски - «генерация с поиском по своим данным». Механика простая. Ваши файлы режутся на небольшие фрагменты и раскладываются по смыслу. Когда вы задаёте вопрос, система сначала находит подходящие фрагменты, подкладывает их модели и только потом просит написать ответ. Сама модель не меняется ни на грамм - меняется то, что ей показали перед ответом.
Отсюда три следствия:
- Обновление стоит ноль. Поменялся прайс - вы заменили один файл, а не «переобучили модель».
- Видно источник. Хорошие сервисы показывают, из какого документа взят ответ, и проверка занимает тридцать секунд.
- Фантазий заметно меньше. Когда модели подложили конкретный кусок текста, ей проще опереться на него, чем сочинять. Меньше - не значит «нет», об этом ниже.
Что для этого доступно из России
Яндекс Нейроэксперт. Возможности сервиса живут внутри Алисы Про: вы создаёте проект, загружаете файлы и ссылки на alicepro.yandex.ru и дальше спрашиваете по ним обычными словами. Принимает документы, таблицы, презентации, изображения, аудио и видео, а также ссылки на страницы сайтов. Работает из России без оговорок. Лимиты бесплатного режима и порядок сборки проекта разобраны в отдельной статье.
ГигаЧат. Подходит, когда база небольшая и укладывается в один-два документа: собираете сводный файл, задаёте роль в начале диалога и работаете. Настраиваемые помощники с базой знаний у Сбера вынесены в корпоративную платформу GigaChat Enterprise - это про внедрение в компании, а не про вечер самостоятельной настройки.
Локальная модель на своём компьютере. Единственный вариант, при котором файл физически не покидает вашу машину. Требует видеокарты и терпения, зато снимает вопрос конфиденциальности целиком: что нужно от компьютера и какие модели скачивать, мы разбирали отдельно.
Зарубежные сервисы вроде ChatGPT, Claude и Gemini официально из России недоступны - учитывайте это, чтобы не строить рабочий процесс на инструменте без стабильного доступа.
Честно про слабые места
Хуже всего она обращается с числами: может уверенно назвать сумму, которой в документе нет, или подтянуть значение из соседней строки таблицы. Второе слабое место - кто что сказал: в расшифровке созвона реплики приписываются не тому участнику. Третье - даты: «до конца месяца» из письма трёхмесячной давности превращается в актуальный срок.
Рабочее правило: найденное моделью - подсказка, где смотреть, а не факт. Любую цифру, которая пойдёт в отчёт или расчёт бюджета, сверяйте с исходным файлом.
Чек-лист подготовки данных
Качество ответов определяется не моделью, а тем, что вы в неё положили. Один файл - одна тема, текст вместо сканов, актуальные версии вместо архива и обязательный служебный вопрос «перечисли, что ты прочитал» перед началом работы.
Этот раздел объясняет большинство случаев «нейросеть отвечает ерунду»: дело не в модели, а в том, что в неё положили.
- Один проект - одна тема. Если свалить в одну папку материалы трёх бизнесов, ответы начнут смешиваться: система не понимает, что прайс из одного файла не относится к услугам из другого.
- Текст, а не картинки. Скан договора и фото прайса распознаются с ошибками, хуже всего в цифрах. Есть исходник в DOCX или таблице - грузите его.
- Один файл - одна тема внутри проекта. Не «всё про компанию.pdf» на восемьдесят страниц, а «услуги и цены», «условия доставки», «частые вопросы покупателей». Поиск по смыслу работает точнее, когда фрагменты не перемешаны.
- Говорящие имена файлов. «Прайс услуг, действует с 01.08.2026» вместо «doc_final_2(1)»: модель видит название и опирается на него.
- Дата внутри документа. Первой строкой: «Актуально на 1 августа 2026 года». Лечит самую частую ошибку - ответ по устаревшему прайсу.
- Никакого архива. Две редакции договора в одной папке гарантированно дадут ответ по неправильной.
- Уберите персональные данные. Имена, телефоны и почты покупателей вычищаются до загрузки. Почему это не формальность - в разделе про закон.
- Сначала проверка, потом работа. Первый вопрос к базе всегда служебный.
Служебный вопрос, с которого начинается работа
Скопируйте и задайте его сразу после загрузки файлов:
Перечисли все документы, которые ты видишь: название файла и одна строка о том, что внутри. Отдельно укажи, какие файлы ты не смог прочитать полностью и почему.
Полминуты - и вы узнаёте про нераспознанный скан сейчас, а не после десяти ответов на дырке.
Шаблон инструкции для помощника
Второе, что вставляют в начало работы, - правила поведения. Готовый текст, замените то, что в квадратных скобках:
Ты помощник по проекту [название]. Отвечай только по загруженным документам. Если ответа в них нет, пиши: «в документах этого нет» - и не предлагай общие соображения вместо ответа. К каждому ответу указывай, из какого файла взята информация. Цифры и суммы приводи ровно так, как они написаны в документе, без округления. Отвечай короткими абзацами, без вступлений.
Основную работу тут делают три фразы: запрет отвечать вне документов, требование указывать источник и запрет округлять цифры. Уберёте их - вернётся вежливое сочинительство.
Порядок в данных заказчика - половина работы маркетолога
Собирать базу знаний имеет смысл, когда есть чей-то бизнес и чьи-то документы. В 4 бесплатных видео разбираем вход в интернет-маркетинг: с каких задач начинают, что за них платят и как собрать первые примеры работ без опыта.
Уровень 3: настоящее дообучение
Дообучение меняет манеру, а не знания. В Yandex AI Studio дообучают YandexGPT Lite методом LoRA: рекомендованный датасет - от тысячи примеров, формат JSON Lines, обучение занимает от часа до суток. Ради «чтобы знал мой прайс» это делать бессмысленно.
Теперь про то, о чём написана вся техническая выдача по этому запросу. Дообучение - это когда модели показывают много пар «запрос - эталонный ответ», и она подстраивает часть параметров. С нуля давно никто не обучает: берут готовую модель и донастраивают.
Что для этого требуется на самом деле
Возьмём доступный из России вариант - Yandex AI Studio. Дообучение там делается методом LoRA, который меняет не всю модель, а небольшую часть параметров. По документации сервиса:
- дообучать можно модель генерации текста YandexGPT Lite и классификаторы на её основе;
- датасет рекомендуется от 1 000 примеров, а для классификаторов - не менее 100 примеров на каждый класс;
- формат - JSON Lines, где каждый пример представляет собой диалог с ролями system, user и assistant;
- максимальная длина запроса - 8 000 токенов, эталонного ответа - 2 000 токенов;
- обучение занимает от часа до суток в зависимости от объёма данных и загрузки сервиса.
Второй пункт стоит прочитать дважды. Тысяча примеров - это не «выгрузить папку с документами», а тысяча пар, где для каждого запроса написан правильный ответ. Собрать такой массив вручную - работа на недели, а наспех бессмысленно: на грязных данных модель учится ошибкам так же прилежно, как верным ответам.
Почему опытные разработчики отговаривают
Показательная деталь: на профильных площадках на вопрос «как дообучить модель на своей переписке» самый частый ответ - не инструкция, а предупреждение. На небольшом личном массиве дообучение обычно ухудшает общие способности модели: рассуждать она начинает хуже, зато копирует интонацию. Совет там же один - сначала база знаний, и только если её не хватит, думать про обучение.
Когда дообучение всё-таки оправдано
Три ситуации, где оно решает задачу, а база знаний нет:
- Жёсткий формат на потоке. Из тысячи писем в день должна выходить одинаково размеченная карточка. Инструкцией это держится нестабильно.
- Классификация. Разложить обращения по десяти категориям с предсказуемой точностью. Тут и датасет собирается сам: у вас уже есть размеченный архив.
- Устойчивая манера письма. Когда стиль - часть продукта и описать его словами в инструкции не выходит.
Отдельный случай: обучение на своих фотографиях
С картинками порог входа действительно низкий. Тот же метод LoRA применяют к моделям генерации изображений, чтобы научить их конкретному лицу, продукту или стилю. Наборы тут крошечные: в руководствах по обучению LoRA на своём лице советуют 15-30 фотографий с разными ракурсами и фонами.
Этот сценарий давно упакован в готовые приложения-аватары: вы загружаете десяток своих фотографий, сервис обучает модель под ваше лицо, а дальше остаётся выбрать стиль. Внутри там ровно то самое дообучение, просто технические шаги спрятаны. Перед загрузкой посмотрите, кому принадлежит приложение и что написано в его соглашении: свои фотографии вы отдаёте туда так же, как любой другой файл.
Вывод: задача про факты и документы - третий уровень не нужен. Про стиль изображений - доступен сразу. Про формат текста на потоке - считайте стоимость сбора датасета до старта.
Что нельзя загружать в облако
Персональные данные покупателей и клиентов в чужое облако не отправляют. С 30 мая 2025 года штрафы за утечки резко выросли, а с декабря 2024 действует отдельная статья Уголовного кодекса. Отвечает тот, кто передал данные, а не сервис.
Этого раздела нет в технических статьях про дообучение, а в работе он важнее остального. Как только вы берёте файлы клиента и грузите их в облако, вы передаёте чужую информацию третьему лицу. Юридически это ваше действие и ваша ответственность.
Что изменилось в законе
Обработка персональных данных регулируется законом 152-ФЗ. В конце 2024 года и в 2025-м ответственность ужесточили:
- С 11 декабря 2024 года действует статья 272.1 Уголовного кодекса - за незаконные использование, передачу, сбор и хранение компьютерной информации с персональными данными. По основному составу наказание доходит до лишения свободы, а для данных несовершеннолетних и биометрии санкции строже.
- С 30 мая 2025 года работают поправки закона 420-ФЗ: штрафы по статье 13.11 КоАП выросли, размер штрафа за утечку привязали к объёму утёкших данных, а за повторное нарушение ввели оборотные штрафы - для компаний верхняя планка доходит до сотен миллионов рублей.
Простое правило разделения
| Можно грузить спокойно | Только после обезличивания | Не грузить в чужое облако |
|---|---|---|
| Тексты вашего сайта, публичный прайс, описания услуг | Отзывы и переписка с покупателями | Выгрузка базы клиентов с телефонами и почтами |
| Открытые обзоры рынка, статьи конкурентов | Расшифровки созвонов | Паспортные и платёжные данные, медицинские сведения |
| Ваши собственные черновики и заметки | Внутренние регламенты без имён сотрудников | Договоры с реквизитами и подписантами, если нет согласия сторон |
Обезличивание в бытовом смысле - замена имён и контактов на метки: «Клиент 1», «Менеджер А», «телефон скрыт». Пятнадцать минут поиском и заменой в редакторе. Смысл материала не теряется: чтобы вытащить из отзывов язык покупателя, имена не нужны.
Куда уходят данные у популярных сервисов
Условия у сервисов разные и меняются, читать придётся самому. Ориентир: у DeepSeek данные обрабатываются и хранятся в Китае, а переписки по умолчанию могут идти на улучшение моделей. Отключается в настройках профиля: в разделе управления данными есть переключатель об улучшении модели для всех, его переводят в выключенное положение. Он влияет на будущее использование, а не отменяет уже отправленное.
У российских сервисов данные остаются внутри страны, но соглашение всё равно придётся прочитать - особенно если работаете с чужими документами по договору.
Самый надёжный ответ на «а точно ли не утечёт» - локальный запуск модели: там файл никуда не отправляется, потому что отправлять некуда.
Пять ошибок новичка
Эти пять случаев дают почти все жалобы «попробовал, не работает». Каждый лечится за пять минут.
1. Всё свалено в один проект
В папке лежат материалы трёх клиентов, и модель отвечает про доставку одного бизнеса ценами другого. Признак: ответы правдоподобны, но при проверке относятся не к тому документу. Лечение - отдельный проект на каждую тему.
2. Загружены сканы вместо текста
Фото прайса и скан договора распознаются с ошибками, цифры страдают первыми. Признак: модель называет суммы, которых в документе нет, или путает разряды. Лечение - искать исходник в DOCX, XLSX или PDF с текстовым слоем.
3. Ожидание, что модель запомнит между чатами
Вчера человек объяснял нейросети специфику бизнеса, сегодня открыл новый диалог и ждёт, что она помнит. Лечение - переносить постоянные вводные либо в файл проекта, либо в инструкцию, которую вы вставляете первым сообщением.
4. Загружена выгрузка на тысячи строк
Статистика из рекламного кабинета целиком, обращения за год одним файлом. Признак: ответы про начало и конец таблицы точные, про середину - выдуманные. Лечение - свернуть данные в сводку до загрузки: двадцать осмысленных строк работают лучше пяти тысяч сырых.
5. Цифры из ответа идут в отчёт без проверки
Самая дорогая ошибка, потому что обнаруживается у заказчика. Признака нет, в этом и проблема: ответ выглядит уверенно. Лечение - привычка добавлять «процитируй фрагмент, откуда взята эта цифра» и сверять с исходником всё, что уйдёт наружу.
Что выбрать под свою задачу
Сведём всё в таблицу, чтобы не перечитывать статью, когда дойдёт до дела.
| Ваша задача | Уровень | Что делать |
|---|---|---|
| Разобрать один документ, отчёт, расшифровку | 1 | Файл в чат, роль первым сообщением, проверка цитатой |
| Помощник по одному клиенту или продукту на постоянной основе | 2 | Проект с базой знаний, 5-15 подготовленных файлов |
| Ответы по внутренним регламентам для команды | 2 | База знаний плюс инструкция с запретом отвечать вне документов |
| Документы, которые нельзя отдавать в облако | 2 | Локальная модель на своём компьютере |
| Одинаково размеченные карточки из потока писем | 3 | Датасет из размеченного архива, дообучение по документации сервиса |
| Изображения в своём стиле или со своим лицом | 3 | Готовый сервис аватаров либо обучение LoRA на 15-30 фото |
План на первый вечер
- Выберите одну задачу, которая повторяется каждую неделю. Не «попробовать нейросеть», а «отвечать на вопросы по условиям доставки».
- Соберите под неё 5-10 файлов по чек-листу выше. Час работы, не больше.
- Создайте проект в сервисе с базой знаний, загрузите файлы и задайте служебный вопрос «перечисли, что ты прочитал».
- Вставьте шаблон инструкции, поправьте под себя.
- Задайте десять настоящих рабочих вопросов и по каждому проверьте источник. После них вы будете знать, где инструменту можно доверять, а где нет.
После этого вопрос про обучение обычно снимается сам: видно, что задача была про порядок в документах и точность формулировок.
Честная оговорка в конце: всё описанное - инструменты и маршрут, а не гарантия результата. Сервисы меняют лимиты и условия, поэтому перед тем как строить на них рабочий процесс, сверяйтесь с текущей документацией.
Частые вопросы
Можно ли обучить нейросеть на своих данных бесплатно?
Первый и второй уровни - да. Положить файл в чат и собрать проект с базой знаний можно на бесплатных тарифах российских сервисов: упрётесь вы в лимиты по числу запросов и документов, а не в оплату. Настоящее дообучение бесплатным не бывает - там нужны вычислительные мощности.
Нейросеть запомнит мои файлы навсегда?
Нет. Модель ничего не запоминает от разговора с вами. В обычном чате файл живёт до конца диалога, в проекте с базой знаний он лежит в вашем хранилище и подставляется при каждом запросе. Удалите файл из проекта - помощник перестанет о нём знать.
Сколько данных нужно, чтобы дообучить модель?
Для текста - много. В документации Yandex AI Studio датасет рекомендуют собирать от 1 000 примеров, а для классификаторов - не менее 100 на каждый класс, причём пример это пара «запрос и эталонный ответ», а не просто документ. Для изображений порог низкий: в руководствах по обучению LoRA на своём лице берут 15-30 фотографий.
Что лучше: база знаний или дообучение?
Если вопрос про факты - база знаний, почти без вариантов: она даёт модели ваши документы, обновляется заменой файла и показывает источник. Дообучение отвечает за манеру и формат - оно не научит модель знать ваш прайс, зато даст стабильную структуру ответа.
Безопасно ли загружать документы компании в нейросеть?
Зависит от того, что внутри. Публичный прайс и тексты сайта - да. Персональные данные покупателей и сотрудников - нет: с 30 мая 2025 года штрафы за утечки выросли, а с декабря 2024 действует статья 272.1 Уголовного кодекса, и отвечает тот, кто передал данные. Имена и контакты убирайте до загрузки, а совсем закрытые документы разбирайте на своём компьютере.
Разбираться в данных - прикладной навык, и он нужен не сам по себе
Базы знаний собирают под конкретный бизнес: под его прайс, его покупателей и его задачи. В 4 бесплатных видео показываем, как войти в интернет-маркетинг с нуля - какие навыки первыми приносят оплату, как собрать примеры работ без заказчиков и где искать первые заявки.
АМ