Лин Цяо и Дмитрий Ивченко из Fireworks AI: Как сделать инференс ИИ быстрым, дешевым и качественным

The Cognitive Revolution 2,8 тыс. 1 ч 42 мин 4 мин 20.04.2024
Главное

В новом эпизоде подкаста The Cognitive Revolution основатели стартапа Fireworks AIЛин Цяо (Lin Qiao) и Дмитрий Ивченко (Dmytro Ivchenko) — рассказывают о том, как их опыт создания PyTorch в Meta помог построить одну из самых производительных платформ для инференса ИИ в мире. Разговор заходит о «войне за токены», скрытых субсидиях на рынке облачных вычислений и о том, почему специализация на малых моделях и тонкой настройке (fine-tuning) станет ключом к победе над гигантами вроде OpenAI.

🚀 Fireworks AI: Миссия и борьба с «рыночным пузырём» инференса 7:22

Рынок облачного инференса сегодня перегружен игроками, однако Лин Цяо предупреждает: многие из них используют модель «субсидированного роста», подобную раннему Uber . Цены на токены у некоторых провайдеров искусственно занижены и не покрывают реальных затрат на оборудование и электроэнергию.

По мнению Лин Цяо, выбор провайдера только по принципу «самый дешевый» опасен: когда у таких стартапов закончатся венчурные деньги, их клиенты останутся без инфраструктуры . Fireworks AI выбирает другой путь:

🛠 От PyTorch до Fireworks: Уроки масштабирования в Meta 19:52

Основатели провели более пяти лет в Meta, работая над PyTorch — фреймворком, который сегодня является стандартом в индустрии. Этот опыт сформировал архитектурную философию Fireworks AI.

Лин Цяо вспоминает провал проекта под кодовым названием Zipper . В 2018 году команда пыталась объединить фронтенд PyTorch с бэкендом Caffe2. Идея «состегнуть» две системы через переходный слой провалилась: накладные расходы на интеграцию оказались выше, чем написание нового фреймворка с нуля .

Ключевые выводы из работы в Meta:

  1. UX для разработчика превыше всего: В PyTorch 2.0 появилась функция torch.compile . Это автоматизировало оптимизацию кода, избавив разработчиков от необходимости вручную размечать скрипты .
  2. Инференс — это не просто библиотека: В Meta система обслуживала более 50 триллионов запросов в день в 50 дата-центрах . Это требовало создания целой экосистемы: новых загрузчиков данных, распределенных очередей и кастомных сервисов.
  3. Сжатие циклов: То, что в Meta занимало 5 лет, Fireworks AI стремится внедрять для своих клиентов за 5 недель или даже 5 дней .

🧠 Качество моделей: Почему Open Source догонит OpenAI 30:57

Лин Цяо утверждает, что их реальными конкурентами являются не другие провайдеры инфраструктуры, а OpenAI и Anthropic . Она выдвигает гипотезу «конвергенции малых моделей»:

Для бизнеса не всегда нужен уровень интеллекта GPT-4. Чаще требуются узкоспециализированные навыки: классификация интентов, извлечение данных из чеков или маршрутизация запросов к агентам . Fireworks AI делает ставку на то, что компаниям проще «натренировать» малую модель под одну конкретную задачу, чем пытаться заставить универсальный гигантский ИИ работать без ошибок .

⚡️ Глубокая оптимизация: Технологии под капотом 48:48

Дмитрий Ивченко погружает в технические детали работы с GPU. По его словам, в архитектуре Transformer критически важны только две операции: матричное умножение (MatMul) и Attention .

Проблема инференса разделяется на две фазы:

  1. Prefill (ввод данных): Процесс вычисления первого токена. Это задача, ограниченная вычислительной мощностью (compute-bound), так как нужно обработать весь контекст сразу .
  2. Decoding (генерация): Потоковая выдача последующих токенов. Эта задача ограничена пропускной способностью памяти (memory-bound), так как веса модели нужно постоянно перекачивать из HBM в регистры GPU для генерации каждой буквы .

Технологические рычаги Fireworks AI:

🖼 Эксклюзив со Stability AI и будущее мультимодальности 1:28:51

Fireworks AI стал эксклюзивным партнером по запуску Stable Diffusion 3 . Это знаковое событие: Stability AI (исследователи) делегировали инференс Fireworks (инженерам-практикам), создав новый симбиоз в индустрии .

Особенности работы с изображениями в отличие от текста :


💬 Цитаты

«Низкая стоимость владения (TCO) — это побочный продукт нашей высокой производительности.»

«Малые модели в конечном итоге сойдутся в своих возможностях, будь они с открытым или закрытым кодом.»

«Программирование GPU становится настолько сложным, что иногда проще писать на ассемблере, чем на C++.»

Дмитрий Ивченко 1:00:18
👥 Спикеры
🔗 Упомянутые сайты и проекты
📖 Термины
ТCO
Total Cost of Ownership — полная стоимость владения системой, включая аренду серверов и расходы на инженеров.
KV-кэширование
Техника оптимизации, сохраняющая результаты вычислений прошлых токенов, чтобы не пересчитывать их при генерации новых.
Квантование
Перевод весов нейросети из формата высокой точности в низкую (например, из 16 бит в 4 бита) для ускорения работы.
📊 Цифры
🗓 Хронология
  1. 2018 Попытка объединить PyTorch и Caffe2 в проект Zipper.
  2. 2022 Выход PyTorch 2.0 с автоматической компиляцией.
  3. Март 2024 Объявление о партнерстве со Stability AI для запуска Stable Diffusion 3.
⚖️ Другая сторона
Искусственный интеллект Fireworks AI PyTorch Лин Цяо Дмитрий Ивченко Stable Diffusion 3