# OpenAI о Valuemaxxing: Как GPT-5.6 Sol и Terra меняют экономику ИИ-стартапов

Источник: https://www.youtube.com/watch?v=jyuyY86GJnA
Канал: OpenAI
Опубликовано: 24.07.2026

---

# Build Hour: «Valuemaxxing» с GPT-5.6 — как извлекать максимум из каждого токена

В рамках свежего выпуска Build Hour специалисты OpenAI и стартапа Ploy обсудили переход от бездумного сжигания токенов к стратегии «valuemaxxing» (максимизации ценности). В центре внимания — новая линейка моделей GPT-5.6, а также конкретные методы оптимизации стоимости и производительности ИИ-агентов в продакшене.

## 🚀 От Tokenmaxxing к Valuemaxxing: смена парадигмы
[[JUMP:02:50]]

Чарли Го (DevEx OpenAI) констатирует важный сдвиг в индустрии ИИ. Если в начале года доминировал подход **«tokenmaxxing»**, когда успех измерялся объемом потребления — количеством промптов, токенов и активных агентов [02:51], то к середине года ситуация изменилась. Многие компании обнаружили, что их годовой бюджет на ИИ испарился за несколько месяцев [03:29].

На смену пришел **«valuemaxxing»**. По определению Чарли Го, это измерение прогресса не количеством использованного ИИ, а реальными результатами: сэкономленным временем, улучшением качества кода и выполненной работой [03:56]. Основной вопрос теперь звучит так: «Если вы удвоите траты на токены завтра, как вы поймете, что это того стоило?» [04:23].

## 🛠 Линейка GPT-5.6 и работа в Codex
[[JUMP:07:11]]

Для реализации стратегии максимизации ценности OpenAI представила семейство GPT-5.6, разделенное по сценариям использования:

*   **GPT-5.6 Sol**: Флагманская модель для самых сложных задач программирования и профессиональных кейсов [07:34].
*   **GPT-5.6 Terra**: Сбалансированная модель («daily driver»), когда важны и интеллект, и латентность, и стоимость [07:44].
*   **GPT-5.6 Luna**: Решение для высокообъемных нагрузок, где критична скорость и низкая цена [07:54].

Чарли Го представил «лабораторию оптимизации» (Optimization Lab), где наглядно продемонстрировал, что даже легкие модели (Luna) при повышении уровня рассуждений (reasoning levels) могут выдавать высококачественные результаты, сопоставимые с более мощными аналогами [11:06].

**Практические советы от OpenAI по использованию Codex:**

1.  **Начинайте с Sol на среднем уровне (Medium)**. Чарли Го призывает разработчиков не использовать режим «Extra High» по умолчанию — для большинства ежедневных задач среднего уровня достаточно [12:47].
2.  **Fast Mode**. Режим, позволяющий ускорить генерацию в 1.5 раза в обмен на более быстрое исчерпание лимитов использования [13:41].
3.  **Auto Approval**. Рекомендуемый режим вместо полного доступа, где другая модель проверяет безопасность кода перед выполнением [13:55].
4.  **Chronicle**. Новая функция, позволяющая Codex «запоминать» контекст текущей задачи через запись экрана и историю, что делает ИИ умнее в рамках конкретного рабочего процесса [14:22].

## 🦾 Оптимизация ИИ-агентов: инструменты и фишки API
[[JUMP:15:16]]

Чарли Го выделил четыре ключевые технологии, которые помогают экономить ресурсы при построении сложных систем:

*   **Programmatic Tool Calling**: Модель получает доступ к JavaScript-песочнице. Она пишет код, который выполняется внутри песочницы для вызова инструментов или расчетов. Это исключает лишние итерации «модель — сервер — пользователь — модель» [15:57]. В демо-примере это позволило сократить входные токены на 24% [20:41].
*   **Prompt Caching**: Возможность кэшировать части промптов. Совет: динамическую информацию (например, текущую дату) нужно ставить в самый конец промпта, чтобы не «ломать» кэш всей остальной статичной части (системные инструкции, примеры кода) [17:02]. Экономия на входных токенах в примерах достигала 90% [19:26].
*   **Persistent Reasoning**: Сохранение цепочек рассуждений между ходами. Это улучшает последовательность ответов и повышает эффективность кэширования [17:39].
*   **Compaction (Уплотнение)**: Автоматическое или ручное сжатие истории диалога. В демонстрации Чарли Го уплотнение сократило количество входных токенов с 24 000 до 4 000 (на 82%) без потери качества ответа [22:02].

## 📈 Кейс Ploy: Миграция ИИ-агента в продакшене
[[JUMP:23:48]]

Брайант Чоу (Ploy) и Лоренцо Джентиле поделились опытом перевода своего маркетингового движка на GPT-5.6. Ploy позволяет автоматически превращать сайты в «дизайн-системы» и запускать автономные воронки продаж [25:50].

Лоренцо Джентиле подробно разобрал работу с **KV-caching** (кэшированием ключей-значений). Главная проблема — кэш работает только при добавлении в конец (append-only) [31:06]. Если вы вставляете динамическое время в начало системного промпта, кэш сбрасывается.

**Инженерные решения Ploy:**

*   **On-demand Tools**: Вместо того чтобы грузить все инструменты сразу, Ploy разделила их на основные (используются в 70% случаев) и нишевые, которые подгружаются динамически в конец контекстного окна [32:38]. Это снизило стоимость на 33% [33:07].
*   **Брейкпоинты (Breakpoints)**: Установка меток кэширования после системного промпта и после «рабочей памяти» (workspace memory). Это дало снижение стоимости первого сообщения в новом чате на 89% [35:48].
*   **Пакетный вызов инструментов (Batching)**: Вместо последовательного вызова «прочитать файл А», «прочитать файл Б», агент инструктируется делать это в один шаг. Это экономит не только токены, но и время на «обдумывание» (thinking tokens) [36:54].
*   **Оптимизация выдачи инструментов**: Лоренцо привел пример с поисковиком Exa. Использование функции `highlights` (выжимка самого важного) вместо полного текста страниц сократило объем ответа на 70%, что экономит компании около $37,000 в год [38:28].

## ❓ Вопросы и ответы: Субагенты и режимы Ultra
[[JUMP:39:57]]

В финальной части Чарли Го разъяснил путаницу в новых режимах GPT-5.6 [42:13]:

*   **Standard vs Pro**: Режим Pro тратит значительно больше токенов и времени для достижения качества, сравнимого с Pro-версией в ChatGPT [43:07].
*   **Max Reasoning**: Снимает ограничения с модели, позволяя ей тратить столько токенов на рассуждения, сколько она считает нужным [42:26].
*   **Ultra Mode**: Это надстройка над Max, которая меняет системный промпт, заставляя GPT-5.6 активнее использовать субагентов [43:47].

На вопрос о том, получают ли субагенты полный контекст, Чарли ответил, что им передается только необходимая информация, выделенная основным агентом-оркестратором [44:51]. Лоренцо добавил, что передача задач между моделями (например, от Sol к Terra или Luna) может быть «потерянной» (lossy), поэтому стоит быть осторожным с глубокой иерархией субагентов [47:36].

Также эксперты обсудили выбор между «новым чатом» и «уплотнением» (compaction). Лоренцо отметил интересную UX-проблему: стоит ли давать пользователю самому решать, когда сменять тему, или поручить это ИИ, чтобы избежать замусоривания контекста и лишней траты токенов на нерелевантные задачи [50:16].