
Немного внутренней кухни
В Искре, нашей платформе с ИИ-агентами для компаний, у агентов есть шаг селекции навыка: определяется, какой из инструментов взять под текущий запрос, какую модель использовать и какого специалиста вызвать (уникальная фича Искры).
Внутри одного разговора этот выбор обычно (!) не меняется.
Но в проде шаг запускался заново на каждом ходу. Функционально всё работало: пользователь писал, агент отвечал, тесты были зелёные.
Заметно это было по одному показателю — попаданию в кэш промпта (доля запроса, которую модель переиспользует вместо пересчёта). Лишний служебный запрос менял начало контекста от хода к ходу, и кэш не срабатывал.
Расход рос понемногу на каждом ходу, поэтому не выглядел большой аномалией.
Руководитель Codex в OpenAI недавно перечислил похожие находки: служебная работа, которая незаметно повторяется на каждом обычном ходу.
Они починили, мы тоже починили. Всем пострадавшим сброшены лимиты.
Какой отсюда полезный совет?
Не знаю) просто поделился