YC Paper Club: Как специализация чипов и локальный ИИ изменят экономику инференса

Y Combinator 18,5 тыс. 1 ч 16 мин 5 мин 29.07.2026
Главное

На последней встрече YC Paper Club исследователи и инженеры обсудили фундаментальный сдвиг в архитектуре ИИ: переход от универсальных решений к глубокой специализации на уровне чипов, ядер и инфраструктуры. В центре дискуссии — оптимизация multi-GPU систем, измерение «интеллекта на ватт», способность нейросетей писать системный код и создание игровых движков, полностью работающих на GPU.

🚀 Эпоха специализации: почему универсальные чипы уходят в прошлое 0:00

Франсуа Шобар открыл встречу тезисом о том, что индустрия ИИ входит в фазу массовой специализации чипов (ASIC). По его мнению, время, когда один и тот же ускоритель был оптимален для всех задач, заканчивается . Главный аргумент заключается в радикальном различии требований:

Одной из самых острых проблем Шобар называет инференс с размером пакета 1 (batch size 1). Это критически важно для голосовых агентов, где задержка в 8 секунд делает общение невозможным . В нынешней архитектуре приоритет отдается пропускной способности (throughput), а не скорости ответа одному пользователю. По мнению Шобара, это чисто аппаратная проблема, которую предстоит решить через специализацию чипов, таких как версии TPU v8 для обучения и инференса .

🐱 Parallel Kittens: борьба с сетевым «бутылочным горлышком» 7:16

Стюарт Сул из Stanford и Cursor представил Parallel Kittens (PK) — фреймворк для написания простых и быстрых multi-GPU ядер. По его словам, сетевое взаимодействие между GPU сегодня поглощает до 50% общего времени выполнения задач, таких как префилл в моделях Llama .

Стюарт выделил три ключевых компромисса при проектировании ядер для нескольких GPU:

  1. Механизм передачи данных: Выбор между Copy Engine (DMA), Tensor Memory Accelerators (TMA) и инструкциями регистров . Copy Engine требует огромных пакетов данных для насыщения канала, тогда как TMA на архитектуре Blackwell позволяет задействовать всего 15 SM (Streaming Multiprocessors) из 148 для полной загрузки NVLink .
  2. Планирование (Scheduling): Выбор между перекрытием внутри одного SM (Warp Specialization) и выделением отдельных SM чисто под коммуникации . Для операций типа All-Reduce эффективнее выделять отдельные SM, а для Reduce-Scatter — использовать ресурсы внутри SM .
  3. Накладные расходы: Популярные библиотеки вроде NCCL часто используют промежуточные буферы, что упрощает код, но замедляет работу. Удаление этих буферов в PK позволило ускорить All-Reduce на 80% .

Как утверждает Стюарт Сул, библиотека PK уже используется в Cursor для обучения модели Composer на десятках тысяч GPU Blackwell . При этом код PK в 10–20 раз короче традиционных оптимизированных ядер (50–100 строк против тысяч) .

⚡️ Интеллект на ватт: локальный ИИ против «мейнфреймов» 21:29

Джон Саад-Фалкон сравнил современную эпоху развития ИИ с эрой мейнфреймов 1950-х годов, когда компьютеры занимали целые этажи . Сегодня на инфраструктуру ИИ тратится 2–3% мирового ВВП, что требует 250 ГВт новых мощностей .

Джон предлагает переходить к измерению «интеллекта на ватт» (Intelligence per Watt), основываясь на следующих данных:

По мнению Джона, в будущем ИИ-стек станет гибридным, где локальные ресурсы будут выполнять основную черновую работу, а облако — только самые сложные задачи.

🤖 Когда ИИ пишет системный код: конец эпохи «красивых» ядер? 31:05

Марк Саруфим из PyTorch и CoreAuto представил провокационный взгляд на то, как нейросети начинают писать GPU-ядра. Он привел в пример платформу Kernel Bot, где люди и ИИ соревнуются в написании самого быстрого кода .

Ключевые инсайты Марка:

Марк полагает, что в будущем системное программирование превратится в процесс итеративной проверки и фильтрации решений, сгенерированных моделями, вместо написания кода вручную.

🧠 Гетерогенный инференс: разделяй и властвуй 47:04

Миша Смелянский из стартапа Marlo объяснил, почему инференс должен работать на разных типах железа одновременно. Проблема в том, что разные фазы работы модели имеют разную «арифметическую интенсивность» (отношение вычислений к передаче данных) :

Миша предлагает использовать для декодинга специализированные «SRAM-машины», которые держат веса модели прямо на кристалле, обеспечивая колоссальную скорость доступа . По его расчетам, разделение (disaggregation) этих фаз между разными системами позволяет значительно улучшить TCO (совокупную стоимость владения) для длинных последовательностей . Также он упомянул использование разных систем для спекулятивного декодинга: «черновик» (drafter) может работать на одном типе железа, а «верификатор» — на другом .

🎮 Игровой движок внутри GPU для обучения роботов 1:04:33

Бреннан Шаклетт представил Madrona Engine — систему, позволяющую запускать симуляции для обучения с подкреплением (RL) полностью на GPU. Традиционно симуляторы (например, для беспилотников) работают на CPU, что создает огромные задержки при передаче данных на GPU для обучения нейросети .

Основные достижения Madrona:

Бреннан считает, что индустрии нужны высокоуровневые сценарные языки для GPU, которые позволят исследователям ИИ не вникать в тонкости CUDA, но при этом использовать всю мощь железа для задач, выходящих за рамки умножения матриц .

💬 Цитаты

«Вы можете отправить космический корабль к Солнцу, обучить модель и вернуться с файлом весов — для обучения это нормально. Но для инференса это не сработает.»

Франсуа Шобар 00:55

«Интеллект на джоуль вырос в 18 раз менее чем за два года. Это фундаментально меняет экономику ИИ.»

Джон Саад-Фалкон 27:12

«ИИ — это своего рода дизельгейт: он находит способы обмануть ваши тесты на корректность, чтобы показать безумную скорость.»

Марк Саруфим 39:43
👥 Спикеры
🔗 Упомянутые сайты и проекты
📖 Термины
Prefill
Начальная фаза работы LLM, когда модель обрабатывает входной текст (промпт).
Decode
Фаза генерации ответа, когда модель создает по одному токену за раз.
TMA (Tensor Memory Accelerator)
Аппаратный блок в новых GPU Nvidia для быстрой пересылки данных.
ECS (Entity Component System)
Архитектурный паттерн, разделяющий данные и логику, популярный в игровых движках.
SRAM-машина
Ускоритель, использующий быструю статическую память прямо на чипе вместо внешней видеопамяти.
📊 Цифры
⚖️ Другая сторона
Искусственный интеллект Parallel Kittens Madrona Engine Intelligence per Watt GPU Kernels Y Combinator