# Лин Цяо и Дмитрий Ивченко из Fireworks AI: Как сделать инференс ИИ быстрым, дешевым и качественным

Источник: https://www.youtube.com/watch?v=KVlEYLULbss
Канал: The Cognitive Revolution
Опубликовано: 20.04.2024

---

В новом эпизоде подкаста [The Cognitive Revolution](https://ROGO.com) основатели стартапа **Fireworks AI** — **Лин Цяо (Lin Qiao)** и **Дмитрий Ивченко (Dmytro Ivchenko)** — рассказывают о том, как их опыт создания PyTorch в Meta помог построить одну из самых производительных платформ для инференса ИИ в мире. Разговор заходит о «войне за токены», скрытых субсидиях на рынке облачных вычислений и о том, почему специализация на малых моделях и тонкой настройке (fine-tuning) станет ключом к победе над гигантами вроде OpenAI.

## 🚀 Fireworks AI: Миссия и борьба с «рыночным пузырём» инференса
[[JUMP:07:22]]

Рынок облачного инференса сегодня перегружен игроками, однако Лин Цяо предупреждает: многие из них используют модель «субсидированного роста», подобную раннему Uber [08:02]. Цены на токены у некоторых провайдеров искусственно занижены и не покрывают реальных затрат на оборудование и электроэнергию.

По мнению Лин Цяо, выбор провайдера только по принципу «самый дешевый» опасен: когда у таких стартапов закончатся венчурные деньги, их клиенты останутся без инфраструктуры [08:15]. Fireworks AI выбирает другой путь:

*   **Фокус на TCO (Total Cost of Ownership):** Снижение совокупной стоимости владения достигается не за счёт сжигания инвестиций, а через глубокую техническую оптимизацию [10:02].
*   **Скорость как продукт:** Для B2C-приложений критически важна интерактивность. Fireworks AI делает ставку на сверхнизкую задержку (low latency), без которой современные ИИ-продукты нежизнеспособны [08:54].
*   **Эволюция железа:** Дмитрий Ивченко отмечает, что индустрия уходит от воздушного охлаждения к жидкостному и иммерсионному (погружение GPU в масло), что радикально меняет экономику дата-центров [09:46].

## 🛠 От PyTorch до Fireworks: Уроки масштабирования в Meta
[[JUMP:19:52]]

Основатели провели более пяти лет в Meta, работая над **PyTorch** — фреймворком, который сегодня является стандартом в индустрии. Этот опыт сформировал архитектурную философию Fireworks AI.

Лин Цяо вспоминает провал проекта под кодовым названием **Zipper** [21:25]. В 2018 году команда пыталась объединить фронтенд PyTorch с бэкендом Caffe2. Идея «состегнуть» две системы через переходный слой провалилась: накладные расходы на интеграцию оказались выше, чем написание нового фреймворка с нуля [21:51].

Ключевые выводы из работы в Meta:

1.  **UX для разработчика превыше всего:** В PyTorch 2.0 появилась функция `torch.compile` [22:30]. Это автоматизировало оптимизацию кода, избавив разработчиков от необходимости вручную размечать скрипты [22:44].
2.  **Инференс — это не просто библиотека:** В Meta система обслуживала более **50 триллионов запросов в день** в 50 дата-центрах [23:35]. Это требовало создания целой экосистемы: новых загрузчиков данных, распределенных очередей и кастомных сервисов.
3.  **Сжатие циклов:** То, что в Meta занимало 5 лет, Fireworks AI стремится внедрять для своих клиентов за 5 недель или даже 5 дней [23:47].

## 🧠 Качество моделей: Почему Open Source догонит OpenAI
[[JUMP:30:57]]

Лин Цяо утверждает, что их реальными конкурентами являются не другие провайдеры инфраструктуры, а **OpenAI и Anthropic** [28:21]. Она выдвигает гипотезу «конвергенции малых моделей»:

*   Возможности моделей до 16-20 млрд параметров скоро сравняются, независимо от того, открытые они или закрытые [31:52].
*   У малых моделей есть верхний предел знаний и логики, определяемый их размером и доступным объемом тренировочных данных [32:05].
*   **Преимущество экосистемы:** Открытые модели (Llama 3, Mistral) выигрывают за счет огромного сообщества, которое постоянно улучшает их через дообучение [32:19].

Для бизнеса не всегда нужен уровень интеллекта GPT-4. Чаще требуются узкоспециализированные навыки: классификация интентов, извлечение данных из чеков или маршрутизация запросов к агентам [34:21]. Fireworks AI делает ставку на то, что компаниям проще «натренировать» малую модель под одну конкретную задачу, чем пытаться заставить универсальный гигантский ИИ работать без ошибок [35:39].

## ⚡️ Глубокая оптимизация: Технологии под капотом
[[JUMP:48:48]]

Дмитрий Ивченко погружает в технические детали работы с GPU. По его словам, в архитектуре Transformer критически важны только две операции: матричное умножение (MatMul) и Attention [50:17].

Проблема инференса разделяется на две фазы:

1.  **Prefill (ввод данных):** Процесс вычисления первого токена. Это задача, ограниченная вычислительной мощностью (compute-bound), так как нужно обработать весь контекст сразу [51:10].
2.  **Decoding (генерация):** Потоковая выдача последующих токенов. Эта задача ограничена пропускной способностью памяти (memory-bound), так как веса модели нужно постоянно перекачивать из HBM в регистры GPU для генерации каждой буквы [51:24].

**Технологические рычаги Fireworks AI:**

*   **Лора (LoRA):** Технология «низкоранговой адаптации». Вместо того чтобы менять все веса модели при дообучении, команда Fireworks внедряет крошечные адаптеры [42:18]. Это позволяет хранить одну базовую модель в памяти и «навешивать» на неё сотни кастомных адаптеров для разных клиентов на одном GPU, экономя затраты в 100 раз [45:28].
*   **Сверхнизкая точность:** Дмитрий отмечает переход от 16-битных вычислений (FP16) к 8-битным (FP8), а в перспективе — к 1.58-битным моделям [1:04:41]. Это позволит заменить дорогое умножение простым сложением, радикально ускорив генерацию [1:05:20].
*   **Параллелизм:** Использование **Tensor Parallelism** (разделение весов по GPU) и **Pipeline Parallelism** (разделение слоев модели между ускорителями) для обработки сверхдлинных контекстов [1:16:25].

## 🖼 Эксклюзив со Stability AI и будущее мультимодальности
[[JUMP:1:28:51]]

Fireworks AI стал эксклюзивным партнером по запуску **Stable Diffusion 3** [1:29:04]. Это знаковое событие: Stability AI (исследователи) делегировали инференс Fireworks (инженерам-практикам), создав новый симбиоз в индустрии [1:30:12].

Особенности работы с изображениями в отличие от текста [1:33:20]:

*   В 이미지-генерации нет фазы «декодинга» токен за токеном. Это ближе к фазе prefill в тексте: вся картинка обрабатывается целиком.
*   Процесс диффузии требует 50 последовательных проходов через трансформер (в случае SD3) для очистки «шума» до финального изображения [1:35:06].
*   Любой артефакт в весах (например, при агрессивном квантовании) сразу заметен глазу как визуальный «глюк», поэтому оптимизация нейросетей для картинок требует ювелирной точности [1:40:14].

---