В новом эпизоде подкаста The Cognitive Revolution основатели стартапа Fireworks AI — Лин Цяо (Lin Qiao) и Дмитрий Ивченко (Dmytro Ivchenko) — рассказывают о том, как их опыт создания PyTorch в Meta помог построить одну из самых производительных платформ для инференса ИИ в мире. Разговор заходит о «войне за токены», скрытых субсидиях на рынке облачных вычислений и о том, почему специализация на малых моделях и тонкой настройке (fine-tuning) станет ключом к победе над гигантами вроде OpenAI.
🚀 Fireworks AI: Миссия и борьба с «рыночным пузырём» инференса 7:22
Рынок облачного инференса сегодня перегружен игроками, однако Лин Цяо предупреждает: многие из них используют модель «субсидированного роста», подобную раннему Uber . Цены на токены у некоторых провайдеров искусственно занижены и не покрывают реальных затрат на оборудование и электроэнергию.
По мнению Лин Цяо, выбор провайдера только по принципу «самый дешевый» опасен: когда у таких стартапов закончатся венчурные деньги, их клиенты останутся без инфраструктуры . Fireworks AI выбирает другой путь:
- Фокус на TCO (Total Cost of Ownership): Снижение совокупной стоимости владения достигается не за счёт сжигания инвестиций, а через глубокую техническую оптимизацию .
- Скорость как продукт: Для B2C-приложений критически важна интерактивность. Fireworks AI делает ставку на сверхнизкую задержку (low latency), без которой современные ИИ-продукты нежизнеспособны .
- Эволюция железа: Дмитрий Ивченко отмечает, что индустрия уходит от воздушного охлаждения к жидкостному и иммерсионному (погружение GPU в масло), что радикально меняет экономику дата-центров .
🛠 От PyTorch до Fireworks: Уроки масштабирования в Meta 19:52
Основатели провели более пяти лет в Meta, работая над PyTorch — фреймворком, который сегодня является стандартом в индустрии. Этот опыт сформировал архитектурную философию Fireworks AI.
Лин Цяо вспоминает провал проекта под кодовым названием Zipper . В 2018 году команда пыталась объединить фронтенд PyTorch с бэкендом Caffe2. Идея «состегнуть» две системы через переходный слой провалилась: накладные расходы на интеграцию оказались выше, чем написание нового фреймворка с нуля .
Ключевые выводы из работы в Meta:
- UX для разработчика превыше всего: В PyTorch 2.0 появилась функция
torch.compile. Это автоматизировало оптимизацию кода, избавив разработчиков от необходимости вручную размечать скрипты . - Инференс — это не просто библиотека: В Meta система обслуживала более 50 триллионов запросов в день в 50 дата-центрах . Это требовало создания целой экосистемы: новых загрузчиков данных, распределенных очередей и кастомных сервисов.
- Сжатие циклов: То, что в Meta занимало 5 лет, Fireworks AI стремится внедрять для своих клиентов за 5 недель или даже 5 дней .
🧠 Качество моделей: Почему Open Source догонит OpenAI 30:57
Лин Цяо утверждает, что их реальными конкурентами являются не другие провайдеры инфраструктуры, а OpenAI и Anthropic . Она выдвигает гипотезу «конвергенции малых моделей»:
- Возможности моделей до 16-20 млрд параметров скоро сравняются, независимо от того, открытые они или закрытые .
- У малых моделей есть верхний предел знаний и логики, определяемый их размером и доступным объемом тренировочных данных .
- Преимущество экосистемы: Открытые модели (Llama 3, Mistral) выигрывают за счет огромного сообщества, которое постоянно улучшает их через дообучение .
Для бизнеса не всегда нужен уровень интеллекта GPT-4. Чаще требуются узкоспециализированные навыки: классификация интентов, извлечение данных из чеков или маршрутизация запросов к агентам . Fireworks AI делает ставку на то, что компаниям проще «натренировать» малую модель под одну конкретную задачу, чем пытаться заставить универсальный гигантский ИИ работать без ошибок .
⚡️ Глубокая оптимизация: Технологии под капотом 48:48
Дмитрий Ивченко погружает в технические детали работы с GPU. По его словам, в архитектуре Transformer критически важны только две операции: матричное умножение (MatMul) и Attention .
Проблема инференса разделяется на две фазы:
- Prefill (ввод данных): Процесс вычисления первого токена. Это задача, ограниченная вычислительной мощностью (compute-bound), так как нужно обработать весь контекст сразу .
- Decoding (генерация): Потоковая выдача последующих токенов. Эта задача ограничена пропускной способностью памяти (memory-bound), так как веса модели нужно постоянно перекачивать из HBM в регистры GPU для генерации каждой буквы .
Технологические рычаги Fireworks AI:
- Лора (LoRA): Технология «низкоранговой адаптации». Вместо того чтобы менять все веса модели при дообучении, команда Fireworks внедряет крошечные адаптеры . Это позволяет хранить одну базовую модель в памяти и «навешивать» на неё сотни кастомных адаптеров для разных клиентов на одном GPU, экономя затраты в 100 раз .
- Сверхнизкая точность: Дмитрий отмечает переход от 16-битных вычислений (FP16) к 8-битным (FP8), а в перспективе — к 1.58-битным моделям . Это позволит заменить дорогое умножение простым сложением, радикально ускорив генерацию .
- Параллелизм: Использование Tensor Parallelism (разделение весов по GPU) и Pipeline Parallelism (разделение слоев модели между ускорителями) для обработки сверхдлинных контекстов .
🖼 Эксклюзив со Stability AI и будущее мультимодальности 1:28:51
Fireworks AI стал эксклюзивным партнером по запуску Stable Diffusion 3 . Это знаковое событие: Stability AI (исследователи) делегировали инференс Fireworks (инженерам-практикам), создав новый симбиоз в индустрии .
Особенности работы с изображениями в отличие от текста :
- В 이미지-генерации нет фазы «декодинга» токен за токеном. Это ближе к фазе prefill в тексте: вся картинка обрабатывается целиком.
- Процесс диффузии требует 50 последовательных проходов через трансформер (в случае SD3) для очистки «шума» до финального изображения .
- Любой артефакт в весах (например, при агрессивном квантовании) сразу заметен глазу как визуальный «глюк», поэтому оптимизация нейросетей для картинок требует ювелирной точности .