# Эволюция ИИ-харнесов: от простой обвязки к самосовершенствующимся агентам

Источник: https://www.youtube.com/watch?v=n9xKblqyQ28
Канал: Y Combinator
Опубликовано: 07.09.2026

---

## 🛠️ Эволюция агентских обвязок: как харнесы меняют производительность языковых моделей
[[JUMP:00:00]]

Долгое время обвязки (harnesses) и каркасы для языковых моделей воспринимались скептиками как тривиальное «промпт-инженерное баловство» и простая вспомогательная инфраструктура. Однако практика показывает обратное: те же самые веса моделей, которые демонстрируют скромные 30% на бенчмарках вроде ARC-AGI, при использовании качественного харнеса достигают 95% и даже 100% эффективности. 

На тематической встрече Y Combinator ведущие исследователи и создатели передовых агентских систем обсудили эволюцию харнесов, переход от статических конструкций к самосовершенствующимся агентам, а также практический опыт внедрения локальных и корпоративных ИИ-инструментов.

## 📈 Краткая история харнесов: от V0 до самосовершенствующихся систем
[[JUMP:07:13]]

Эволюция обвязок прошла путь от простейших циклов генерации текста до сложных автономных экосистем со встроенной долгосрочной памятью и способностью к самомодификации:

*   **V0 (2019 год):** Базовый цикл генерации с выборкой Top-P, системным промптом и фиксированной контекстной последовательностью без вызова внешних инструментов.
*   **Эпоха контекстных инноваций (2020–2023):** Появление Few-shot примеров, цепочек размышлений (Chain-of-Thought), а также интеграция внешних API через инструменты вроде Toolformer и WebGPT.
*   **Динамическая память и навыки (Voyager, Intercode):** Модели научились читать и записывать данные в собственный контекст, объединять инструменты в цепочки навыков и выполнять код «на лету».
*   **Статические харнесы (V1):** Многоагентные архитектуры с рефлексией, где оркестратор управляет подзадачами, проверяет результаты через внутренние эвристики и удерживает фиксированный набор инструментов.
*   **Самосовершенствующиеся харнесы (последние 6 месяцев):** Системы на базе DSPY и Darwin machines, способные автономно оптимизировать системные промпты через генетическое программирование и модифицировать собственный управляющий код.

## 🧠 Prime Agent: рекурсивные языковые модели и долгосрочная производительность
[[JUMP:18:35]]

Сет Картен, исследователь из Princeton и Prime Intellect, представил **Prime Agent** — самосовершенствующийся харнес на базе концепции рекурсивных языковых моделей (RLM). По словам Картена, современный подход требует отхода от жестких паттернов вроде классических циклов Plan-Act-Critique в пользу максимальной экспрессивности.

*   **Архитектура памяти (L1–L3 кэш):** Самый быстрый уровень — веса модели (L1). Активный контекст и компакция выполняют роль L2, тогда как долгосрочное хранение данных, файлы и IPython-окружения в оперативной памяти выступают в роли L3.
*   **Межъядерная коммуникация:** Агенты могут свободно общаться между собой внутри семейной структуры (родители, дети, сиблинги), обмениваясь контекстом для решения сложных инженерных задач.
*   **Оценка на ARC-AGI и Emulator Bench:** Использование Prime Agent в связке с моделями уровня Claude Opus позволило достичь 95.5% на ARC-AGI, а также продемонстрировать высокую эффективность в создании эмуляторов (например, Game Boy Color) и оптимизации GPU-ядер.

## 💻 OpenJarvis: перенос персонального ИИ на локальные устройства
[[JUMP:37:30]]

Джон Саад-Фалкон из Стэнфорда презентовал проект **OpenJarvis**, нацеленный на перенос стека персонального ИИ с облачных серверов на локальные ноутбуки и рабочие станции. Облачные решения сопряжены с высокими финансовыми затратами, проблемами конфиденциальности и колоссальным энергопотреблением.

*   **Достижения локальных моделей:** Современные локальные открытые решения (например, Qwen 3.8 27B) демонстрируют производительность, сопоставимую с флагманскими облачными моделями полугодичной давности, а разрыв в качестве стремительно сокращается.
*   **Пять примитивов OpenJarvis:** Интерфейс пользователя, агентская логика композитных рассуждений, языковая модель в качестве движка, локальный инференс-движок (Ollama, Llama.cpp, vLLM) и стандартизированный протокол инструментов MCP.
*   **Облачная оптимизация локального стека:** Команда предложила изящное решение: использовать мощные облачные модели (вроде Claude Opus или GPT-5.6) для автоматической диагностики, настройки и оптимизации локальных конфигураций OpenJarvis, что позволяет снизить затраты на инференс до 800 раз без потери качества.

## 🏢 QM: внутренний агентский харнес Y Combinator для работы
[[JUMP:45:58]]

Джош Франс и Реган Белл рассказали об эволюции корпоративных агентов в Y Combinator и создании **QM** — универсального открытого харнеса для автоматизации работы сотрудников. Система предоставляет каждому сотруднику YC настраиваемого ассистента в Slack и через веб-интерфейс.

*   **Эволюция внутренних систем:** Проект вырос из простого общего агента (январь 2025), виртуальных машин для код-ревью (июнь 2025) и парка из более чем 50 изолированных инстансов Hermes agents, администрирование которых оказалось слишком трудоемким.
*   **Централизация и песочницы:** В отличие от ранних подходов, где мозг агента был «заперт» внутри отдельного компьютера, QM хранит всю историю взаимодействий в базе данных Postgres, а песочницы используются как гибкие подключаемые ресурсы.
*   **Инструмент принудительного упорства (Grind tool):** Чтобы агенты не сдавались раньше времени при решении сложных задач, разработчики внедрили инструмент бюджетирования по времени и токенам (clock time и token spend), что позволяет успешно выполнять многочасовые исследовательские задачи.
*   **Проблема социального контекста:** Главным ограничением остается отсутствие у агентов интуитивного понимания корпоративных границ и социальных контекстов, из-за чего конфиденциальная информация может непреднамеренно утекать в чужие рабочие ветки.