Build Hour: «Valuemaxxing» с GPT-5.6 — как извлекать максимум из каждого токена
В рамках свежего выпуска Build Hour специалисты OpenAI и стартапа Ploy обсудили переход от бездумного сжигания токенов к стратегии «valuemaxxing» (максимизации ценности). В центре внимания — новая линейка моделей GPT-5.6, а также конкретные методы оптимизации стоимости и производительности ИИ-агентов в продакшене.
🚀 От Tokenmaxxing к Valuemaxxing: смена парадигмы 2:50
Чарли Го (DevEx OpenAI) констатирует важный сдвиг в индустрии ИИ. Если в начале года доминировал подход «tokenmaxxing», когда успех измерялся объемом потребления — количеством промптов, токенов и активных агентов , то к середине года ситуация изменилась. Многие компании обнаружили, что их годовой бюджет на ИИ испарился за несколько месяцев .
На смену пришел «valuemaxxing». По определению Чарли Го, это измерение прогресса не количеством использованного ИИ, а реальными результатами: сэкономленным временем, улучшением качества кода и выполненной работой . Основной вопрос теперь звучит так: «Если вы удвоите траты на токены завтра, как вы поймете, что это того стоило?» .
🛠 Линейка GPT-5.6 и работа в Codex 7:11
Для реализации стратегии максимизации ценности OpenAI представила семейство GPT-5.6, разделенное по сценариям использования:
- GPT-5.6 Sol: Флагманская модель для самых сложных задач программирования и профессиональных кейсов .
- GPT-5.6 Terra: Сбалансированная модель («daily driver»), когда важны и интеллект, и латентность, и стоимость .
- GPT-5.6 Luna: Решение для высокообъемных нагрузок, где критична скорость и низкая цена .
Чарли Го представил «лабораторию оптимизации» (Optimization Lab), где наглядно продемонстрировал, что даже легкие модели (Luna) при повышении уровня рассуждений (reasoning levels) могут выдавать высококачественные результаты, сопоставимые с более мощными аналогами .
Практические советы от OpenAI по использованию Codex:
- Начинайте с Sol на среднем уровне (Medium). Чарли Го призывает разработчиков не использовать режим «Extra High» по умолчанию — для большинства ежедневных задач среднего уровня достаточно .
- Fast Mode. Режим, позволяющий ускорить генерацию в 1.5 раза в обмен на более быстрое исчерпание лимитов использования .
- Auto Approval. Рекомендуемый режим вместо полного доступа, где другая модель проверяет безопасность кода перед выполнением .
- Chronicle. Новая функция, позволяющая Codex «запоминать» контекст текущей задачи через запись экрана и историю, что делает ИИ умнее в рамках конкретного рабочего процесса .
🦾 Оптимизация ИИ-агентов: инструменты и фишки API 15:16
Чарли Го выделил четыре ключевые технологии, которые помогают экономить ресурсы при построении сложных систем:
- Programmatic Tool Calling: Модель получает доступ к JavaScript-песочнице. Она пишет код, который выполняется внутри песочницы для вызова инструментов или расчетов. Это исключает лишние итерации «модель — сервер — пользователь — модель» . В демо-примере это позволило сократить входные токены на 24% .
- Prompt Caching: Возможность кэшировать части промптов. Совет: динамическую информацию (например, текущую дату) нужно ставить в самый конец промпта, чтобы не «ломать» кэш всей остальной статичной части (системные инструкции, примеры кода) . Экономия на входных токенах в примерах достигала 90% .
- Persistent Reasoning: Сохранение цепочек рассуждений между ходами. Это улучшает последовательность ответов и повышает эффективность кэширования .
- Compaction (Уплотнение): Автоматическое или ручное сжатие истории диалога. В демонстрации Чарли Го уплотнение сократило количество входных токенов с 24 000 до 4 000 (на 82%) без потери качества ответа .
📈 Кейс Ploy: Миграция ИИ-агента в продакшене 23:48
Брайант Чоу (Ploy) и Лоренцо Джентиле поделились опытом перевода своего маркетингового движка на GPT-5.6. Ploy позволяет автоматически превращать сайты в «дизайн-системы» и запускать автономные воронки продаж .
Лоренцо Джентиле подробно разобрал работу с KV-caching (кэшированием ключей-значений). Главная проблема — кэш работает только при добавлении в конец (append-only) . Если вы вставляете динамическое время в начало системного промпта, кэш сбрасывается.
Инженерные решения Ploy:
- On-demand Tools: Вместо того чтобы грузить все инструменты сразу, Ploy разделила их на основные (используются в 70% случаев) и нишевые, которые подгружаются динамически в конец контекстного окна . Это снизило стоимость на 33% .
- Брейкпоинты (Breakpoints): Установка меток кэширования после системного промпта и после «рабочей памяти» (workspace memory). Это дало снижение стоимости первого сообщения в новом чате на 89% .
- Пакетный вызов инструментов (Batching): Вместо последовательного вызова «прочитать файл А», «прочитать файл Б», агент инструктируется делать это в один шаг. Это экономит не только токены, но и время на «обдумывание» (thinking tokens) .
- Оптимизация выдачи инструментов: Лоренцо привел пример с поисковиком Exa. Использование функции
highlights(выжимка самого важного) вместо полного текста страниц сократило объем ответа на 70%, что экономит компании около $37,000 в год .
❓ Вопросы и ответы: Субагенты и режимы Ultra 39:57
В финальной части Чарли Го разъяснил путаницу в новых режимах GPT-5.6 :
- Standard vs Pro: Режим Pro тратит значительно больше токенов и времени для достижения качества, сравнимого с Pro-версией в ChatGPT .
- Max Reasoning: Снимает ограничения с модели, позволяя ей тратить столько токенов на рассуждения, сколько она считает нужным .
- Ultra Mode: Это надстройка над Max, которая меняет системный промпт, заставляя GPT-5.6 активнее использовать субагентов .
На вопрос о том, получают ли субагенты полный контекст, Чарли ответил, что им передается только необходимая информация, выделенная основным агентом-оркестратором . Лоренцо добавил, что передача задач между моделями (например, от Sol к Terra или Luna) может быть «потерянной» (lossy), поэтому стоит быть осторожным с глубокой иерархией субагентов .
Также эксперты обсудили выбор между «новым чатом» и «уплотнением» (compaction). Лоренцо отметил интересную UX-проблему: стоит ли давать пользователю самому решать, когда сменять тему, или поручить это ИИ, чтобы избежать замусоривания контекста и лишней траты токенов на нерелевантные задачи .