🛠️ Эволюция агентских обвязок: как харнесы меняют производительность языковых моделей 0:00
Долгое время обвязки (harnesses) и каркасы для языковых моделей воспринимались скептиками как тривиальное «промпт-инженерное баловство» и простая вспомогательная инфраструктура. Однако практика показывает обратное: те же самые веса моделей, которые демонстрируют скромные 30% на бенчмарках вроде ARC-AGI, при использовании качественного харнеса достигают 95% и даже 100% эффективности.
На тематической встрече Y Combinator ведущие исследователи и создатели передовых агентских систем обсудили эволюцию харнесов, переход от статических конструкций к самосовершенствующимся агентам, а также практический опыт внедрения локальных и корпоративных ИИ-инструментов.
📈 Краткая история харнесов: от V0 до самосовершенствующихся систем 7:13
Эволюция обвязок прошла путь от простейших циклов генерации текста до сложных автономных экосистем со встроенной долгосрочной памятью и способностью к самомодификации:
- V0 (2019 год): Базовый цикл генерации с выборкой Top-P, системным промптом и фиксированной контекстной последовательностью без вызова внешних инструментов.
- Эпоха контекстных инноваций (2020–2023): Появление Few-shot примеров, цепочек размышлений (Chain-of-Thought), а также интеграция внешних API через инструменты вроде Toolformer и WebGPT.
- Динамическая память и навыки (Voyager, Intercode): Модели научились читать и записывать данные в собственный контекст, объединять инструменты в цепочки навыков и выполнять код «на лету».
- Статические харнесы (V1): Многоагентные архитектуры с рефлексией, где оркестратор управляет подзадачами, проверяет результаты через внутренние эвристики и удерживает фиксированный набор инструментов.
- Самосовершенствующиеся харнесы (последние 6 месяцев): Системы на базе DSPY и Darwin machines, способные автономно оптимизировать системные промпты через генетическое программирование и модифицировать собственный управляющий код.
🧠 Prime Agent: рекурсивные языковые модели и долгосрочная производительность 18:35
Сет Картен, исследователь из Princeton и Prime Intellect, представил Prime Agent — самосовершенствующийся харнес на базе концепции рекурсивных языковых моделей (RLM). По словам Картена, современный подход требует отхода от жестких паттернов вроде классических циклов Plan-Act-Critique в пользу максимальной экспрессивности.
- Архитектура памяти (L1–L3 кэш): Самый быстрый уровень — веса модели (L1). Активный контекст и компакция выполняют роль L2, тогда как долгосрочное хранение данных, файлы и IPython-окружения в оперативной памяти выступают в роли L3.
- Межъядерная коммуникация: Агенты могут свободно общаться между собой внутри семейной структуры (родители, дети, сиблинги), обмениваясь контекстом для решения сложных инженерных задач.
- Оценка на ARC-AGI и Emulator Bench: Использование Prime Agent в связке с моделями уровня Claude Opus позволило достичь 95.5% на ARC-AGI, а также продемонстрировать высокую эффективность в создании эмуляторов (например, Game Boy Color) и оптимизации GPU-ядер.
💻 OpenJarvis: перенос персонального ИИ на локальные устройства 37:30
Джон Саад-Фалкон из Стэнфорда презентовал проект OpenJarvis, нацеленный на перенос стека персонального ИИ с облачных серверов на локальные ноутбуки и рабочие станции. Облачные решения сопряжены с высокими финансовыми затратами, проблемами конфиденциальности и колоссальным энергопотреблением.
- Достижения локальных моделей: Современные локальные открытые решения (например, Qwen 3.8 27B) демонстрируют производительность, сопоставимую с флагманскими облачными моделями полугодичной давности, а разрыв в качестве стремительно сокращается.
- Пять примитивов OpenJarvis: Интерфейс пользователя, агентская логика композитных рассуждений, языковая модель в качестве движка, локальный инференс-движок (Ollama, Llama.cpp, vLLM) и стандартизированный протокол инструментов MCP.
- Облачная оптимизация локального стека: Команда предложила изящное решение: использовать мощные облачные модели (вроде Claude Opus или GPT-5.6) для автоматической диагностики, настройки и оптимизации локальных конфигураций OpenJarvis, что позволяет снизить затраты на инференс до 800 раз без потери качества.
🏢 QM: внутренний агентский харнес Y Combinator для работы 45:58
Джош Франс и Реган Белл рассказали об эволюции корпоративных агентов в Y Combinator и создании QM — универсального открытого харнеса для автоматизации работы сотрудников. Система предоставляет каждому сотруднику YC настраиваемого ассистента в Slack и через веб-интерфейс.
- Эволюция внутренних систем: Проект вырос из простого общего агента (январь 2025), виртуальных машин для код-ревью (июнь 2025) и парка из более чем 50 изолированных инстансов Hermes agents, администрирование которых оказалось слишком трудоемким.
- Централизация и песочницы: В отличие от ранних подходов, где мозг агента был «заперт» внутри отдельного компьютера, QM хранит всю историю взаимодействий в базе данных Postgres, а песочницы используются как гибкие подключаемые ресурсы.
- Инструмент принудительного упорства (Grind tool): Чтобы агенты не сдавались раньше времени при решении сложных задач, разработчики внедрили инструмент бюджетирования по времени и токенам (clock time и token spend), что позволяет успешно выполнять многочасовые исследовательские задачи.
- Проблема социального контекста: Главным ограничением остается отсутствие у агентов интуитивного понимания корпоративных границ и социальных контекстов, из-за чего конфиденциальная информация может непреднамеренно утекать в чужие рабочие ветки.