Разработка ИИ-агентов: как сэкономить на токенах

Разработка ИИ-агентов: как сэкономить на токенах

Если ты в агентстве или продакшене оптимизируешь рутину, разработка ИИ-агентов наверняка стоит в планах на квартал. Я постоянно вижу, как коллеги пытаются переложить на нейросети клиентский сервис, сценарии или CRM. Но боты часто ошибаются, галлюцинируют и сжирают бюджет на токенах. На днях я изучил разбор разработчика, который собрал 33 ИИ-агента на одном движке – от шахматного тренера до контент-цеха. Этот кейс четко показывает, где проходит граница между кодом и языковой моделью. Это поможет автоматизировать процессы в агентстве с прибылью, а не в убыток.

Почему нейросеть не должна считать деньги

В личном помощнике языковая модель может фантазировать. Но в корпоративном агенте для расчета смет, медиапланирования или ведения CRM ей нельзя доверять ни одной итоговой цифры. Автор статьи выводит главное правило: все вычисления и жесткие правила должен контролировать классический код на Python. Модель должна лишь переводить эти данные на человеческий язык.

Пример с шахматным тренером для ребенка отлично это иллюстрирует. Оценку позиции, поиск ошибок и легальность ходов считает проверенный софт. Модель получает на вход только готовый JSON-файл с сухими фактами. Она просто облекает их в нужный тон – помягче или построже. Система даже не отправляет имя ребенка в облако ИИ, а заменяет его временным шаблоном ради безопасности.

Для продюсера это означает простое правило. Если ты делаешь бота для генерации коммерческих предложений, не заставляй большую языковую модель складывать цифры. Пусть базу считает скрипт, а нейросеть пишет красивое сопроводительное письмо. Если модель попытается сама посчитать скидку или хронометраж ролика, она обязательно ошибется.

Как раздутый промпт сжигает бюджет

При проектировании сложного агента для ведения контент-плана или администрирования CRM хочется дать ему как можно больше инструментов. Но каждый инструмент – это кусок технического описания, то есть JSON-схема. Модель получает ее при каждом запросе.

У простого бота конференции с тремя инструментами схемы занимают крошечную часть запроса. Но у CRM-администратора с 331 инструментом размер схем разрастается до 302 килобайт. Это около 75 тысяч токенов в начале каждого запроса! Даже с учетом кэширования это сильно раздувает окно контекста и бьет по карману агентства. Каждое обращение к такому боту становится неоправданно дорогим.

Автор кейса сократил промпт одного из учебных агентов с 15 266 до 1 424 токенов всего тремя правками в конфигурации. Он сузил набор инструментов до действительно необходимых, отключил лишние пробы окружения и убрал режим рассуждения (reasoning). В итоге скорость ответа выросла в два раза. Медиана времени ожидания упала с 17 до 7,7 секунды, а затраты на токены снизились на порядок.

Проектируй пользу, а не пиши инструкции

Один из самых поучительных моментов статьи – признание автора в том, что он написал почти шесть тысяч строк отличного Python-кода для бытового помощника. Но этот код в итоге лежит без дела. Разработчик настроил сложнейший разбор банковских выписок, напоминания и даже астрологические расчеты. Но он просто не встроил это в реальный пользовательский путь.

Для продюсера или владельца агентства это главный продуктовый урок. Автоматизация ради автоматизации не работает. Если настраиваешь процессы в агентстве, начни с точечного решения конкретной боли сотрудников.

И помни: правила только в виде текста в промпте – это лишь твои пожелания. Рано или поздно модель ошибется в расчете дат или начислении бонусов. Все критически важные метрики, финансовые транзакции и дедупликацию нужно жестко кодить, а не доверять промпту. Только тогда твои ИИ-агенты будут работать стабильно, не выходить за рамки регламентов и приносить реальную пользу бизнесу.

Что ещё спрашивают об этом

Как правильно внедрить ИИ-агентов в бизнес-процессы, чтобы сэкономить бюджет?

Для экономии на токенах не доверяй языковой модели вычисления. Оптимальный стек – расчеты на Python, а нейросеть (например, GPT-4 или Claude, хотя их API платный) используется только для перевода данных на естественный язык. Для локальных задач можно взять бесплатную Llama 3, но она потребует мощного железа. Такой гибридный подход защищает от галлюцинаций ИИ в CRM и сметах.

Как распределить роли между классическим кодом и языковой моделью при создании ИИ-агента?

Для этого используют фреймворки вроде LangChain, LlamaIndex или более простой CrewAI. Классический код на Python отвечает за логику, математические расчеты и безопасность, а LLM (например, GPT-4o или Gemini) выступает лишь интерфейсом. Учти, что сложные фреймворки требуют долгой настройки, а простые скрипты на Python часто надежнее.

От чего зависит стоимость использования ИИ-агентов в компании?

Стоимость складывается из разовой разработки (на Python или no-code конструкторах вроде Make или Flowise) и регулярных затрат на токены API (например, OpenAI, Anthropic или отечественного Yandex Cloud). Расходы на токены могут резко вырасти из-за длинных промптов. Использование open-source моделей (например, Mistral) на своем сервере убирает плату за токены, но требует расходов на хостинг.

Где можно пройти курсы по разработке ИИ-агентов?

Освоить создание ИИ-агентов можно на курсах от отечественных платформ, таких как Skillbox или Нетология, а также на специализациях Coursera (например, от Vanderbilt University). Для самостоятельного обучения доступны бесплатные руководства по библиотекам LangChain и LlamaIndex, хотя они быстро устаревают из-за частых обновлений софта.

Вопросы – реальные запросы людей в Яндексе по теме статьи.

Источник: habr.com

Коротко для ИИ и поиска

  • Разработчик под ником hamidun собрал 33 ИИ-агента на базе фреймворка Hermes Agent от NousResearch с единым Docker-образом.
  • Ограничение набора инструментов ИИ-агента и отключение режима рассуждения (reasoning) снизили размер промпта с 15 266 до 1 424 токенов, а время ответа – с 17 до 7,7 секунды.
  • У ИИ-агента для администрирования CRM с 331 инструментом размер JSON-схем описания функций составляет 302 КБ, что добавляет около 75 тысяч токенов к каждому запросу.
  • Дмитрий (Митя) – автор блога «Видео + AI» (nice2mitya.com/blog), который пишет о практическом применении нейросетей в видеопродакшене, маркетинге и рекламе.