Коротко: из чего складывается счёт
Ежемесячная стоимость ИИ-агента — это не одна цифра, а три слоя: плата за обращения к языковой модели (токены), хостинг и интеграции, поддержка и обновление базы знаний. Для малого бизнеса с сотнями диалогов в месяц расход на саму модель обычно самая маленькая из трёх строк — и именно её чаще всего боятся зря.
Пугает людей непредсказуемость: тариф считается не за диалоги, а за объём текста. Разберём, как этот объём образуется и чем управляется.
Что такое токены и почему считают их
Языковая модель тарифицируется по токенам — кусочкам текста примерно в 3–4 символа для русского языка. Платится и то, что модель прочитала (запрос вместе с найденными кусками базы знаний), и то, что она написала в ответ.
Отсюда неочевидный вывод: длина ответа влияет на счёт меньше, чем объём контекста, который вы подсовываете модели на каждом шаге. Если агенту в каждый запрос кладут весь прайс целиком — платите вы именно за это, а не за диалог с клиентом.
От чего реально растёт расход
- Размер передаваемой базы знаний. Поиск по документам должен отдавать 3–5 релевантных фрагментов, а не весь регламент.
- Длина истории диалога. Если тащить всю переписку в каждый запрос, стоимость растёт квадратично к длине разговора.
- Количество шагов на один ответ. Агент, который перед ответом сходил в CRM, уточнил остаток и переформулировал — это несколько обращений к модели, а не одно.
- Класс модели. Разница между лёгкой и флагманской моделью — в разы, и не всякую задачу надо решать флагманом.
- Нецелевой трафик. Спам и «привет-как дела» тоже тратят токены, если их не отсекает сценарий.
Как прикинуть свой расход
Простая оценка без формул: возьмите среднее число обращений в месяц, умножьте на среднее число сообщений в диалоге и заложите, что каждый ответ агента — это пара тысяч токенов вместе с контекстом. Для типичного малого бизнеса (300–800 диалогов в месяц) речь идёт о сумме, сопоставимой с парой часов работы менеджера, а не с его зарплатой.
| Строка расхода | От чего зависит | Чем управляется |
|---|---|---|
| Обращения к модели | Объём диалогов и контекста | Умный поиск по базе, короткая история |
| Хостинг и интеграции | Каналы, CRM, телефония | Фиксированная часть, не растёт от трафика |
| Поддержка и база знаний | Как часто меняется прайс и регламенты | Регулярность обновлений |
Российские модели (GigaChat, YandexGPT) считают по своим тарифам и в рублях, без валютных сюрпризов — это отдельный практический аргумент. Сравнение с зарубежными вариантами — в материале GigaChat или GPT для бота.
На чём экономят правильно
- Гибридная схема. Типовые вопросы закрывает сценарий, до модели доходит только живой диалог. Подробно — в статье сценарный бот, ИИ-агент или гибрид.
- Нормальный поиск по базе. Отдавать модели пять релевантных абзацев вместо ста страниц — самая большая экономия из возможных.
- Разные модели под разные шаги. Классификация обращения — лёгкой моделью, финальный ответ клиенту — сильной.
- Ограничение длины ответа. Клиенту всё равно не нужен реферат на две страницы.
На чём экономить нельзя: на качестве базы знаний и на тестах. Сэкономленные копейки на токенах не окупят одного клиента, которому агент выдумал скидку. Об этом — разбор про галлюцинации.
Как тарифицирует подрядчик и что спросить
Три вопроса, которые снимают большинство неприятных сюрпризов:
- Расход на модель включён в абонентскую плату или выставляется отдельно по факту?
- Что происходит при всплеске обращений — есть ли лимит и предупреждение?
- Видите ли вы статистику расхода, или это чёрный ящик?
У нас внедрение под ключ стоит от 49 990 ₽ и занимает 14–21 день, а эксплуатационная часть считается прозрачно: вы видите объём диалогов и расход, а не «примерно столько». Разбор бюджета проекта целиком — в статье сколько стоит внедрить ИИ-бота.
Хотите прикинуть свой объём диалогов? Откройте демо ИИ-агента в Telegram — по нескольким сценариям видно, сколько шагов реально занимает ваш типичный разговор с клиентом.
FAQ
Сколько стоит API нейросети для небольшого бизнеса?
При объёме в несколько сотен диалогов в месяц расход на саму модель обычно заметно меньше остальных статей проекта. Точная сумма зависит от длины диалогов и объёма базы знаний.
Можно ли уложиться в фиксированный бюджет?
Да, через лимиты и гибридную схему: жёсткий сценарий на типовых запросах плюс потолок расхода с уведомлением при приближении к нему.
Что дороже — GigaChat или зарубежная модель?
Сравнивать нужно на своей задаче: разница в тарифах есть, но чаще итог определяет архитектура — сколько текста вы отправляете в модель на каждом шаге.
Растёт ли счёт от числа каналов?
Сам по себе канал расход не увеличивает — увеличивает поток обращений. Подключение сайта, Telegram и WhatsApp относится к фиксированной части проекта.