OpenAI представила подробный технический анализ Codex CLI, нового локального инструмента для разработки, который позволяет пользователям работать с кодом непосредственно на их устройствах. Эта информация будет особенно полезна разработчикам, создающим собственные агенты или стремящимся оптимизировать затраты на инференс и обработку контекста.
Codex CLI основан на классическом цикле агента. Пользователь формулирует запрос, и система генерирует обширный промпт с указаниями к проекту. Во время инференса модель может либо предоставить текстовый ответ, либо вызвать необходимые инструменты. Выполненная команда возвращает результат в контекст, и цикл продолжается до завершения задачи, с важным ограничением: все инструкции в AGENTS.md и корневых директориях складываются в один JSON размером не более 32 Кб.
Особое внимание уделено вопросам стоимости контекста. История диалога обрастает данными, что потенциально ведет к удорожанию процессов. Тем не менее, для уменьшения затрат используется кэширование промптов: при неизменном префиксе запросов инференс остается финансово обоснованным, но малейшие изменения могут привести к сбою кэша и росту цен.
Изменения также коснулись архитектуры API. Codex CLI полностью перешел на безстатусную модель работы, убрав параметр previous_response_id для поддержки режимов Zero Data Retention. Провайдер не хранит состояние диалога, а данные передаются в зашифрованном виде.
При заполнении контекстного окна включается механизм компакции, который превращает старые сообщения в компактный блок, сохраняющий их суть, что автоматизируется при достижении лимита auto_compact_limit.
OpenAI также напомнила, что Codex CLI может работать не только с их серверами, но и с локальными моделями через Ollama или LM Studio с использованием флага –oss. В будущих публикациях компания планирует подробнее освещать архитектуру CLI, инструменты и модель песочницы Codex. Не упустите возможность делегировать рутинные задачи с BotHub, получив 100 000 бесплатных токенов для работы с нейросетями!