Борьба за токены: как бизнес оптимизирует расходы на искусственный интеллект

Борьба за токены: как бизнес оптимизирует расходы на искусственный интеллект

Сервисы на базе генеративного искусственного интеллекта, стоимость которых рассчитывается исходя из объема обработанных данных (токенов), становятся серьезной статьей расходов для бизнеса. Это вынуждает ИТ-директоров искать новые способы снижения потребления токенов для экономии бюджетов. Популярность нейросетей привела к резкому росту затрат: бесконтрольное использование технологий уже обернулось для одной из компаний неожиданным счетом в 500 миллионов долларов.

Переход на экономичные модели

Одним из основных способов сокращения затрат эксперты называют перенаправление задач на более дешевые языковые модели. Например, в Google отмечают, что использование модели Gemini 3.5 Flash обходится более чем в два раза дешевле по сравнению с флагманскими решениями при сохранении высокого уровня производительности. По словам обозревателей рынка, для многих корпоративных задач не требуются избыточные возможности нейросетей, обученных на огромных массивах классической литературы и сложных текстах.

В отчетах аналитической компании Gartner подчеркивается, что бизнесу зачастую достаточно «разумной достаточности». Использование специализированных и менее масштабных моделей позволяет получать качественные результаты, значительно снижая стоимость каждого запроса.

Оптимизация программного и аппаратного обеспечения

Специалисты сравнивают текущую ситуацию на рынке ИИ с периодом появления облачных вычислений и виртуализации, когда компаниям пришлось упорядочивать хаотичное использование ресурсов. Для решения проблемы «токенного кризиса» предлагаются следующие технические подходы:

  • Создание промежуточных слоев памяти между ИИ-агентами и основными источниками данных (такими как ERP-системы).
  • Кэширование ответов на типичные запросы, что позволяет не обращаться к нейросети повторно.
  • Использование стандартных центральных процессоров (CPU) вместо дорогостоящих графических чипов (GPU) для простых операций.
  • Предварительное построение карты сети или структуры данных с помощью обычных алгоритмов, чтобы передавать в ИИ только ключевую информацию.

Эффективность промптов и локальные решения

Важным фактором экономии становится грамотное составление запросов (промптов). В качестве примера приводится опыт компании ManpowerGroup, где обучение сотрудников позволило сократить количество уточняющих вопросов к системе в среднем с десяти до четырех. Это напрямую снизило объем потребляемых токенов и ускорило получение конечного результата.

Параллельно развивается тренд на «локальный ИИ». Компании Microsoft и Nvidia представили проект RTX Spark — концепцию рабочих станций, способных запускать сложные модели с параметрами до 120 миллиардов единиц непосредственно на Windows-ПК. Такой подход обеспечивает «безлимитный» доступ к интеллектуальным функциям без оплаты облачного трафика.

Изменение метрик успеха

В экспертной среде прогнозируют трансформацию модели оплаты ИИ-услуг. Ожидается, что рынок постепенно перейдет от тарификации за токены (фрагменты слов) к оплате за конкретный результат. В обзорах отмечается, что как только бизнес осознает реальную стоимость каждого токена, эффективность их использования станет ключевым показателем эффективности ИТ-отделов.

Для внедрения таких стратегий компании все чаще привлекают профильных инженеров, которые проектируют архитектуру систем с учетом бюджетных ограничений. По мнению специалистов, высокие затраты на ИИ допустимы только в том случае, если они напрямую способствуют росту доходов и операционной эффективности предприятия.