Эффективность современных систем искусственного интеллекта при выполнении сложных задач часто ограничивается их программной «обвязкой» (harness). Это промежуточный слой программного обеспечения, который соединяет нейросеть с внешней средой. На сегодняшний день такие структуры создаются вручную и остаются статичными, не развиваясь в процессе работы. Для решения этой проблемы исследователи компании Xiaomi представили HarnessX — фреймворк, который воспринимает программную среду как модульный объект и автоматически улучшает её код.
Основные сложности разработки программных сред
Программная обвязка служит операционным слоем, преобразующим «сырые» ответы модели в структурированные действия агента. Она включает в себя шаблоны промптов (инструкций), интеграцию со сторонними инструментами, управление памятью и логику контроля. Несмотря на важность этого компонента, его разработка сталкивается с тремя серьезными препятствиями:
- Статичность: любая смена базовой модели или внедрение новых инструментов требует ручного переписывания кода.
- Архитектурная запутанность: компоненты управления памятью и шаблоны инструкций часто жестко связаны между собой, из-за чего изменение одного элемента может нарушить работу всей системы.
- Изолированная оптимизация: данные о работе агента редко используются для одновременного улучшения и модели, и её программного окружения.
Принципы работы HarnessX
Система HarnessX предлагает концепцию «унифицированного литейного цеха» для ИИ-агентов. Главная инновация заключается в представлении обвязки как независимого, модульного и заменяемого объекта. Это позволяет инженерам менять конфигурации среды, не затрагивая саму нейросеть.
Для автоматизации процесса оптимизации используется движок эволюции AEGIS. Он рассматривает адаптацию среды как задачу обучения с подкреплением. Чтобы система не пыталась найти «обходные пути» для получения фиктивно высоких результатов, разработчики внедрили четырехэтапный конвейер:
- Анализатор (Digester): сжимает логи выполнения для выявления причин сбоев.
- Планировщик (Planner): анализирует данные для внесения структурных изменений в код.
- Эволютор (Evolver): генерирует правки кода и тестирует их перед внедрением.
- Критик и фильтр (Critic and gate): проверяет правки на корректность и блокирует обновления, которые могут ухудшить выполнение уже освоенных задач.
Совместная эволюция модели и среды
В обзоре отмечается, что одностороннее улучшение либо модели, либо среды быстро достигает предела эффективности. HarnessX внедряет метод совместной эволюции, используя алгоритм GRPO (Group Relative Policy Optimization) — ту же технологию, которая применялась при обучении известной модели DeepSeek-R1. Пока среда адаптируется к задачам, нейросеть одновременно учится более эффективно использовать новые инструменты и стратегии.
Результаты тестирования и практическая польза
Эффективность HarnessX была проверена на пяти различных бенчмарках, включая программирование, обслуживание клиентов и навигацию в веб-пространстве. В ходе тестов использовались различные модели, включая Claude и Qwen с открытыми весами.
По данным исследования, HarnessX показал улучшение производительности в 14 из 15 комбинаций моделей и тестов. Средний прирост эффективности составил +14,5%. Наиболее впечатляющие результаты продемонстрировали небольшие модели: например, Qwen3.5-9B при планировании действий в симулированной среде показала рост показателей на 44%.
В качестве примера практического применения приводится случай с инструментом для поиска данных в Википедии. Когда стандартный браузерный скрипт агента не справлялся с тяжелым интерфейсом сайта, HarnessX самостоятельно проанализировал ошибки и написал новый инструмент для прямого обращения к API энциклопедии, что мгновенно решило проблему.
Ограничения технологии
Несмотря на успех, эксперты выделяют ряд ограничений. В настоящее время для работы системы в качестве «мета-агента», пишущего код для обвязки, требуются наиболее мощные закрытые модели. Кроме того, если базовая модель изначально слишком слаба для выполнения сложных алгоритмов, даже идеальная программная среда не сможет компенсировать недостаток её вычислительной логики.
Тем не менее, HarnessX доказывает, что оптимизация программного окружения является мощным рычагом развития ИИ, который может быть эффективнее простого увеличения масштаба нейросетей. Разработчики планируют опубликовать исходный код проекта в ближайшем будущем.