Коротко: как обучить бота на базе знаний за 5 шагов
Чтобы обучить чат-бота базе знаний, не нужно программировать модель. Нужно дать ей ваши данные и настроить поиск по ним. Пять шагов:
- Собрать источники — FAQ, прайс, каталог, скрипты продаж, регламенты.
- Чанкинг — разрезать тексты на смысловые блоки (чанки).
- Векторизация — превратить чанки в эмбеддинги (числовые векторы смысла).
- Векторная база — сложить векторы в векторную базу данных для семантического поиска.
- RAG-поиск и тест — на вопрос бот находит нужные блоки и отвечает строго по ним.
Это и есть RAG (Retrieval-Augmented Generation). Дальше — детали, честно про грабли и цифры.
Что такое база знаний ИИ и чем «обучение» отличается от классической БЗ
База знаний для бота — это не набор статичных статей для человека, а источник, из которого модель извлекает факты в момент ответа. Здесь важно развести два разных процесса.
Дообучение модели (fine-tuning) меняет саму нейросеть — это дорого и медленно. Загрузка данных для RAG ничего в модели не меняет: вы просто наполняете хранилище файлами, а модель читает их на лету. Отсюда главный вывод: базу не программируют, её наполняют. Обновить прайс — значит загрузить новый файл, а не переучивать бота.
Какие данные нужны и как их подготовить
Для бота на своих данных годится почти всё, что уже есть в компании: FAQ, прайс-листы, каталоги, документация, скрипты продаж, регламенты возврата и доставки.
Подготовка решает качество. Что делаем:
- Приводим к формату вопрос — ответ, добавляем вариативность формулировок («сколько стоит», «какая цена», «прайс»).
- Проставляем метаданные и теги (категория, бренд, регион) — это повышает точность поиска.
- Удаляем дубли и устаревшие данные: старая цена в базе — это будущая жалоба клиента.
RAG, fine-tuning или готовая платформа: как выбрать в 2026
Три пути. Коротко о том, кому что.
| Подход | Обновление данных | Стоимость старта | Когда брать |
|---|---|---|---|
| RAG (база + поиск) | Загрузил новый файл | Низкая | FAQ, прайс, каталог — 90% задач |
| Fine-tuning | Переобучение модели | Высокая | Особый стиль/тон, узкий домен |
| Готовая платформа | Через интерфейс | Подписка | Быстрый старт без разработки |
Для обучения ИИ-бота на FAQ и прайсе почти всегда выигрывает RAG: дешевле fine-tuning и обновляется загрузкой файла. Расход токенов регулируется числом блоков в ответе — обычно 3–6 чанков. Меньше блоков — дешевле и меньше шума; больше — полнее контекст. Галлюцинации гасим правилом «отвечай только по найденным блокам».
Чанкинг прайса и каталога: табличные данные
Про PDF и FAQ пишут все, а вот таблицы ломают большинство ботов. Правило простое: одна строка-товар = один осмысленный чанк. Не режьте таблицу по строкам вслепую — каждый чанк должен содержать название, SKU, цену и ключевые характеристики, иначе бот найдёт цену без товара.
Цены и остатки лучше не хранить в тексте намертво, а тянуть автосинком из выгрузки или CRM. Тогда не будет ручной перезагрузки файла каждое утро.
Русские LLM и 152-ФЗ: GigaChat, YandexGPT и грабли
Под 152-ФЗ данные должны оставаться в РФ, поэтому в проде мы берём GigaChat или YandexGPT и держим базу на локальном хостинге.
Честно про грабли: GigaChat слабо слушается промпт. Инструкция «не выдумывай цены, отвечай только по базе» соблюдается не всегда. Поэтому критичное поведение мы делаем детерминированным кодом-гардами, а не только текстом промпта: если в базе нет точного совпадения по цене — код не даёт модели назвать число вовсе. Промпт задаёт тон, код гарантирует безопасность.