Сервисы на базе генеративного искусственного интеллекта, стоимость которых рассчитывается исходя из объема обработанных данных (токенов), становятся серьезной статьей расходов для бизнеса. Это вынуждает ИТ-директоров искать новые способы снижения потребления токенов для экономии бюджетов. Популярность нейросетей привела к резкому росту затрат: бесконтрольное использование технологий уже обернулось для одной из компаний неожиданным счетом в 500 миллионов долларов.
Переход на экономичные модели
Одним из основных способов сокращения затрат эксперты называют перенаправление задач на более дешевые языковые модели. Например, в Google отмечают, что использование модели Gemini 3.5 Flash обходится более чем в два раза дешевле по сравнению с флагманскими решениями при сохранении высокого уровня производительности. По словам обозревателей рынка, для многих корпоративных задач не требуются избыточные возможности нейросетей, обученных на огромных массивах классической литературы и сложных текстах.
В отчетах аналитической компании Gartner подчеркивается, что бизнесу зачастую достаточно «разумной достаточности». Использование специализированных и менее масштабных моделей позволяет получать качественные результаты, значительно снижая стоимость каждого запроса.
Оптимизация программного и аппаратного обеспечения
Специалисты сравнивают текущую ситуацию на рынке ИИ с периодом появления облачных вычислений и виртуализации, когда компаниям пришлось упорядочивать хаотичное использование ресурсов. Для решения проблемы «токенного кризиса» предлагаются следующие технические подходы:
- Создание промежуточных слоев памяти между ИИ-агентами и основными источниками данных (такими как ERP-системы).
- Кэширование ответов на типичные запросы, что позволяет не обращаться к нейросети повторно.
- Использование стандартных центральных процессоров (CPU) вместо дорогостоящих графических чипов (GPU) для простых операций.
- Предварительное построение карты сети или структуры данных с помощью обычных алгоритмов, чтобы передавать в ИИ только ключевую информацию.
Эффективность промптов и локальные решения
Важным фактором экономии становится грамотное составление запросов (промптов). В качестве примера приводится опыт компании ManpowerGroup, где обучение сотрудников позволило сократить количество уточняющих вопросов к системе в среднем с десяти до четырех. Это напрямую снизило объем потребляемых токенов и ускорило получение конечного результата.
Параллельно развивается тренд на «локальный ИИ». Компании Microsoft и Nvidia представили проект RTX Spark — концепцию рабочих станций, способных запускать сложные модели с параметрами до 120 миллиардов единиц непосредственно на Windows-ПК. Такой подход обеспечивает «безлимитный» доступ к интеллектуальным функциям без оплаты облачного трафика.
Изменение метрик успеха
В экспертной среде прогнозируют трансформацию модели оплаты ИИ-услуг. Ожидается, что рынок постепенно перейдет от тарификации за токены (фрагменты слов) к оплате за конкретный результат. В обзорах отмечается, что как только бизнес осознает реальную стоимость каждого токена, эффективность их использования станет ключевым показателем эффективности ИТ-отделов.
Для внедрения таких стратегий компании все чаще привлекают профильных инженеров, которые проектируют архитектуру систем с учетом бюджетных ограничений. По мнению специалистов, высокие затраты на ИИ допустимы только в том случае, если они напрямую способствуют росту доходов и операционной эффективности предприятия.