# Экс-инженер NVIDIA Нил Мовва: почему ИИ станет в 1000 раз дешевле и как работает «фабрика токенов»

Источник: https://www.youtube.com/watch?v=uyzqxIoiobU
Канал: Invest Like The Best
Опубликовано: 25.08.2026

---

На заре новой эры искусственного интеллекта акцент смещается с создания сверхбыстрых чат-ботов на разработку автономных фоновых агентов, способных работать днями и неделями. Нил Мовва (Neil Movva), сооснователь Sail Research и выходец из NVIDIA, утверждает, что ключом к этой трансформации станет радикальное удешевление «токенов» (единиц информации AI) в тысячи раз за счет переосмысления всей инфраструктуры — от архитектуры чипов до стратегии энергопотребления.

## 🏭 Sail Research: концепция «фабрики токенов»
[[JUMP:00:38]]

Нил Мовва определяет свою компанию Sail Research как «фабрику токенов» [00:50]. В отличие от конкурентов, таких как Together или Fireworks, которые сосредоточены на минимизации задержки (low latency) для интерактивных чатов, Sail делает ставку на избыточность и максимальную дешевизну вычислений.

Ключевые тезисы стратегии изобилия:

*   **Новая категория продуктов:** Нил считает, что удешевление чего-либо в 10 раз всегда создает новую категорию продуктов, и ИИ не станет исключением [01:37].
*   **Фоновые агенты:** Sail предоставляет «песочницы» — виртуальные машины для агентов, которые выполняют задачи в течение часов, дней или недель, где скорость выдачи токенов не критична (10 токенов в секунду вместо 100) [01:11].
*   **Метрика успеха:** Главным ориентиром (North Star) для компании является самая низкая стоимость токена в индустрии [02:02].
*   **Смена парадигмы:** В будущем 90% вычислительной нагрузки ИИ будет приходиться на фоновые задачи и только 10% — на работу в режиме реального времени [06:21].

## 🏎️ Уроки NVIDIA и погоня за «скоростью света»
[[JUMP:13:09]]

Работая в NVIDIA инженером по разработке ядер (kernels) в 2016 году, Нил Мовва стал свидетелем того, как компания переориентировалась с графики на нейросети. Он вспоминает, что в то время NVIDIA была крайне бережливой компанией: сотрудники даже платили по доллару в месяц в «молочный клуб», чтобы иметь молоко для кофе [17:49].

Нил выделяет культурный код NVIDIA — принцип «скорости света» (speed of light):

*   Инженеры стремятся достичь теоретического предела производительности железа, игнорируя показатели конкурентов и фокусируясь на абсолютных возможностях чипа [16:31].
*   Тензорные ядра (specialized units) получили право на существование, занимая лишь 5–10% площади кристалла в первых итерациях, после того как руководство заметило, что студенты используют игровые GPU для обучения глубоких моделей [15:03].
*   GPU — это «машина пропускной способности», которая наиболее эффективна при больших пакетах данных, что противоречит современной моде на чат-ботов, требующих мгновенной реакции [18:14].

## 🧠 Проблема памяти: SRAM против DRAM и архитектура Transformers
[[JUMP:23:27]]

Разрыв между вычислительной мощностью и скоростью доступа к памяти является, по мнению Нила, «первородным грехом» архитектуры Transformers [31:44]. Трансформеры сочетают в себе слои MLP (где хранятся знания), которые требуют вычислений, и слои внимания (attention), которые критически зависят от памяти.

Технический анализ памяти от Нила Мовва:

*   **SRAM (статическая память):** Находится прямо на кристалле, невероятно быстрая (петабайты в секунду), но занимает много места. Чип Blackwell от NVIDIA имеет около 500 МБ SRAM [26:12].
*   **DRAM / HBM (динамическая память):** Находится вне кристалла, имеет огромную плотность (сотни ГБ), но в разы медленнее SRAM.
*   **Кэш KV (Key-Value):** Это «динамическая память» диалога. Чем длиннее контекст, тем больше места он занимает, часто превышая размер самих весов модели [29:18].
*   **Спор о Cerebras:** Компании вроде Cerebras создают гигантские чипы размером с целую кремниевую пластину, чтобы уместить больше SRAM. Нил считает их отличными ускорителями, но полагает, что будущее за гибридными системами, где MLP обрабатывается на быстрых чипах (как Cerebras или Groq), а слои внимания — на классических GPU с большим объемом HBM [32:23].

## 📈 Будущее данных: от интернета к «тренажерным залам» RL
[[JUMP:36:14]]

Нил Мовва называет интернет «разовой субсидией» на данные [36:20]. Модели уже изучили почти весь качественный текст (около 30–300 триллионов токенов), и дальнейшее использование случайных данных из сети не приносит пользы.

Новая стратегия работы с данными:

1.  **Отказ от обратной связи обывателей:** Мнение среднего пользователя больше не улучшает модель, так как ИИ уже превзошел «среднего Джо» [37:10].
2.  **Среды обучения (RL Gyms):** Модели должны обучаться в изолированных средах на верифицируемых задачах (математика, код), где они могут сами оценивать свой прогресс [38:37].
3.  **Специфические агенты:** Общий интеллект (AGI) будет достигнут путем объединения множества узкоспециализированных интеллектов, отточенных в таких «залах» [38:24].

## 🔌 «Стратегия мусорщика»: децентрализованные дата-центры и дешевая энергия
[[JUMP:52:44]]

Самый радикальный тезис Нила Мовва касается инфраструктуры. Он утверждает, что для фоновых агентов не нужны сверхнадежные дата-центры стоимостью в миллиарды долларов.

Инвестиционный тезис «Стервятника» (Scavenger Strategy):

*   **Покупка любых чипов:** Нил готов покупать любые чипы (AMD, TPU, Trainium, старые поколения NVIDIA), если цена за флопс (единицу вычислений) достаточно низка [46:25]. «Плохих чипов не бывает, бывает плохая цена» [46:13].
*   **Отказ от надежности:** Sail Research готова работать в дата-центрах с аптаймом 95% или даже 80%, без дизель-генераторов и резервных каналов связи [57:22]. Если один чип в маленьком дата-центре на 1 МВт «упадет», система просто перекинет задачу на другой [57:47].
*   **Использование солнечной и ветровой энергии:** Вместо дорогой стабильной энергии Нил планирует использовать дешевую прерывистую энергию (солнце, ветер). Если солнца нет, выполнение задачи фонового агента просто замедлится или приостановится, что допустимо для задач, длящихся днями [59:20].

## 🔓 Открытость против закрытости: неизбежность диффузии
[[JUMP:1:10:10]]

Нил Мовва считает, что закрытые лаборатории (OpenAI, Anthropic) платят огромную премию за то, чтобы быть на 3–6 месяцев впереди рынка, но этот разрыв будет сокращаться [1:10:25].

Его взгляд на рынок моделей:

*   **Дистилляция неизбежна:** Даже если не копировать модели напрямую, интернет наполняется их ответами. Новые модели неизбежно будут обучаться на синтетических данных от лучших закрытых систем [1:11:31].
*   **Кастомизация через контекст:** Будущее не за дообучением весов (fine-tuning), а за обучением в контексте (in-context learning) на базе сверхдешевых токенов [1:13:14].
*   **Спрос на интеллект бесконечен:** Нил отвергает идею о том, что рынку не нужно столько вычислений. Он верит, что как только стоимость триллиона токенов упадет с миллионов долларов до десятков тысяч, возникнут сценарии использования, о которых мы сегодня даже не догадываемся [1:15:38].