Коротко: из чего складывается счёт
Ежемесячная стоимость ИИ-агента — это не одна цифра, а три слоя: плата за обращения к языковой модели (токены), хостинг и интеграции, поддержка и обновление базы знаний. Для малого бизнеса с сотнями диалогов в месяц расход на саму модель обычно самая маленькая из трёх строк — и именно её чаще всего боятся зря.
Пугает людей непредсказуемость: тариф считается не за диалоги, а за объём текста. Разберём, как этот объём образуется и чем управляется.
Что такое токены и почему считают их
Языковая модель тарифицируется по токенам — кусочкам текста примерно в 3–4 символа для русского языка. Платится и то, что модель прочитала (запрос вместе с найденными кусками базы знаний), и то, что она написала в ответ.
Отсюда неочевидный вывод: длина ответа влияет на счёт меньше, чем объём контекста, который вы подсовываете модели на каждом шаге. Если агенту в каждый запрос кладут весь прайс целиком — платите вы именно за это, а не за диалог с клиентом.
От чего реально растёт расход
- Размер передаваемой базы знаний. Поиск по документам должен отдавать 3–5 релевантных фрагментов, а не весь регламент.
- Длина истории диалога. Если тащить всю переписку в каждый запрос, стоимость растёт квадратично к длине разговора.
- Количество шагов на один ответ. Агент, который перед ответом сходил в CRM, уточнил остаток и переформулировал — это несколько обращений к модели, а не одно.
- Класс модели. Разница между лёгкой и флагманской моделью — в разы, и не всякую задачу надо решать флагманом.
- Нецелевой трафик. Спам и «привет-как дела» тоже тратят токены, если их не отсекает сценарий.
Как прикинуть свой расход
Простая оценка без формул: возьмите среднее число обращений в месяц, умножьте на среднее число сообщений в диалоге и заложите, что каждый ответ агента — это пара тысяч токенов вместе с контекстом. Для типичного малого бизнеса (300–800 диалогов в месяц) речь идёт о сумме, сопоставимой с парой часов работы менеджера, а не с его зарплатой.
| Строка расхода | От чего зависит | Чем управляется |
|---|---|---|
| Обращения к модели | Объём диалогов и контекста | Умный поиск по базе, короткая история |
| Хостинг и интеграции | Каналы, CRM, телефония | Фиксированная часть, не растёт от трафика |
| Поддержка и база знаний | Как часто меняется прайс и регламенты | Регулярность обновлений |
Российские модели (GigaChat, YandexGPT) считают по своим тарифам и в рублях, без валютных сюрпризов — это отдельный практический аргумент. Сравнение с зарубежными вариантами — в материале GigaChat или GPT для бота.