На заре новой эры искусственного интеллекта акцент смещается с создания сверхбыстрых чат-ботов на разработку автономных фоновых агентов, способных работать днями и неделями. Нил Мовва (Neil Movva), сооснователь Sail Research и выходец из NVIDIA, утверждает, что ключом к этой трансформации станет радикальное удешевление «токенов» (единиц информации AI) в тысячи раз за счет переосмысления всей инфраструктуры — от архитектуры чипов до стратегии энергопотребления.
🏭 Sail Research: концепция «фабрики токенов» 0:38
Нил Мовва определяет свою компанию Sail Research как «фабрику токенов» . В отличие от конкурентов, таких как Together или Fireworks, которые сосредоточены на минимизации задержки (low latency) для интерактивных чатов, Sail делает ставку на избыточность и максимальную дешевизну вычислений.
Ключевые тезисы стратегии изобилия:
- Новая категория продуктов: Нил считает, что удешевление чего-либо в 10 раз всегда создает новую категорию продуктов, и ИИ не станет исключением .
- Фоновые агенты: Sail предоставляет «песочницы» — виртуальные машины для агентов, которые выполняют задачи в течение часов, дней или недель, где скорость выдачи токенов не критична (10 токенов в секунду вместо 100) .
- Метрика успеха: Главным ориентиром (North Star) для компании является самая низкая стоимость токена в индустрии .
- Смена парадигмы: В будущем 90% вычислительной нагрузки ИИ будет приходиться на фоновые задачи и только 10% — на работу в режиме реального времени .
🏎️ Уроки NVIDIA и погоня за «скоростью света» 13:09
Работая в NVIDIA инженером по разработке ядер (kernels) в 2016 году, Нил Мовва стал свидетелем того, как компания переориентировалась с графики на нейросети. Он вспоминает, что в то время NVIDIA была крайне бережливой компанией: сотрудники даже платили по доллару в месяц в «молочный клуб», чтобы иметь молоко для кофе .
Нил выделяет культурный код NVIDIA — принцип «скорости света» (speed of light):
- Инженеры стремятся достичь теоретического предела производительности железа, игнорируя показатели конкурентов и фокусируясь на абсолютных возможностях чипа .
- Тензорные ядра (specialized units) получили право на существование, занимая лишь 5–10% площади кристалла в первых итерациях, после того как руководство заметило, что студенты используют игровые GPU для обучения глубоких моделей .
- GPU — это «машина пропускной способности», которая наиболее эффективна при больших пакетах данных, что противоречит современной моде на чат-ботов, требующих мгновенной реакции .
🧠 Проблема памяти: SRAM против DRAM и архитектура Transformers 23:27
Разрыв между вычислительной мощностью и скоростью доступа к памяти является, по мнению Нила, «первородным грехом» архитектуры Transformers . Трансформеры сочетают в себе слои MLP (где хранятся знания), которые требуют вычислений, и слои внимания (attention), которые критически зависят от памяти.
Технический анализ памяти от Нила Мовва:
- SRAM (статическая память): Находится прямо на кристалле, невероятно быстрая (петабайты в секунду), но занимает много места. Чип Blackwell от NVIDIA имеет около 500 МБ SRAM .
- DRAM / HBM (динамическая память): Находится вне кристалла, имеет огромную плотность (сотни ГБ), но в разы медленнее SRAM.
- Кэш KV (Key-Value): Это «динамическая память» диалога. Чем длиннее контекст, тем больше места он занимает, часто превышая размер самих весов модели .
- Спор о Cerebras: Компании вроде Cerebras создают гигантские чипы размером с целую кремниевую пластину, чтобы уместить больше SRAM. Нил считает их отличными ускорителями, но полагает, что будущее за гибридными системами, где MLP обрабатывается на быстрых чипах (как Cerebras или Groq), а слои внимания — на классических GPU с большим объемом HBM .
📈 Будущее данных: от интернета к «тренажерным залам» RL 36:14
Нил Мовва называет интернет «разовой субсидией» на данные . Модели уже изучили почти весь качественный текст (около 30–300 триллионов токенов), и дальнейшее использование случайных данных из сети не приносит пользы.
Новая стратегия работы с данными:
- Отказ от обратной связи обывателей: Мнение среднего пользователя больше не улучшает модель, так как ИИ уже превзошел «среднего Джо» .
- Среды обучения (RL Gyms): Модели должны обучаться в изолированных средах на верифицируемых задачах (математика, код), где они могут сами оценивать свой прогресс .
- Специфические агенты: Общий интеллект (AGI) будет достигнут путем объединения множества узкоспециализированных интеллектов, отточенных в таких «залах» .
🔌 «Стратегия мусорщика»: децентрализованные дата-центры и дешевая энергия 52:44
Самый радикальный тезис Нила Мовва касается инфраструктуры. Он утверждает, что для фоновых агентов не нужны сверхнадежные дата-центры стоимостью в миллиарды долларов.
Инвестиционный тезис «Стервятника» (Scavenger Strategy):
- Покупка любых чипов: Нил готов покупать любые чипы (AMD, TPU, Trainium, старые поколения NVIDIA), если цена за флопс (единицу вычислений) достаточно низка . «Плохих чипов не бывает, бывает плохая цена» .
- Отказ от надежности: Sail Research готова работать в дата-центрах с аптаймом 95% или даже 80%, без дизель-генераторов и резервных каналов связи . Если один чип в маленьком дата-центре на 1 МВт «упадет», система просто перекинет задачу на другой .
- Использование солнечной и ветровой энергии: Вместо дорогой стабильной энергии Нил планирует использовать дешевую прерывистую энергию (солнце, ветер). Если солнца нет, выполнение задачи фонового агента просто замедлится или приостановится, что допустимо для задач, длящихся днями .
🔓 Открытость против закрытости: неизбежность диффузии 1:10:10
Нил Мовва считает, что закрытые лаборатории (OpenAI, Anthropic) платят огромную премию за то, чтобы быть на 3–6 месяцев впереди рынка, но этот разрыв будет сокращаться .
Его взгляд на рынок моделей:
- Дистилляция неизбежна: Даже если не копировать модели напрямую, интернет наполняется их ответами. Новые модели неизбежно будут обучаться на синтетических данных от лучших закрытых систем .
- Кастомизация через контекст: Будущее не за дообучением весов (fine-tuning), а за обучением в контексте (in-context learning) на базе сверхдешевых токенов .
- Спрос на интеллект бесконечен: Нил отвергает идею о том, что рынку не нужно столько вычислений. Он верит, что как только стоимость триллиона токенов упадет с миллионов долларов до десятков тысяч, возникнут сценарии использования, о которых мы сегодня даже не догадываемся .