Экономика искусственного интеллекта претерпевает фундаментальный сдвиг: открытые модели стремительно догоняют закрытые проприетарные решения по качеству, радикально снижая стоимость владения технологией. В новом выпуске подкаста Lightcone Джеффри Морган, соучредитель и генеральный директор Ollama, рассказывает о том, как его продукт стал связующим звеном между «железом» и разработчиками, и почему будущее ИИ принадлежит оркестрации множества специализированных моделей.
🚀 Взрывной рост открытых моделей: от энтузиастов к корпорациям 1:16
По данным Ollama, использование открытых моделей перестало быть прерогативой только домашних энтузиастов. На текущий момент платформой пользуются 9 миллионов разработчиков, а 85% компаний из списка Fortune 500 внедрили Ollama в свои процессы . Главным драйвером этого процесса Джеффри Морган называет появление «агентов кодинга» (coding agents) и значительное снижение затрат.
На платформе Ollama Cloud с начала года зафиксирован феноменальный 150-кратный рост потребления токенов . Морган выделяет несколько ключевых факторов этого бума:
- Появление качественных открытых моделей: такие проекты, как DeepSeek, Kimi и GLM, продемонстрировали, что открытые веса могут успешно конкурировать с лидерами рынка .
- Увеличение контекстного окна: переход от 128 тысяч до более чем 1 миллиона токенов в открытых моделях позволил передавать агентам огромные объемы данных .
- Смена парадигмы: если раньше открытые модели воспринимались как нечто, требующее обязательной донастройки (fine-tuning), то в текущем году они стали эффективными «из коробки» .
По мнению Моргана, компании выбирают открытость не только ради экономии. Основная цель — контроль над технологическим стеком и возможность глубокой кастомизации под уникальные задачи бизнеса . В качестве примера приводится кейс телекоммуникационного гиганта AT&T, который уже перевел 40% своего потребления токенов на модели с открытым исходным кодом .
🛡️ Где открытый код побеждает Claude и GPT-4 7:27
Существуют области, где проприетарные модели (такие как Claude) намеренно ограничиваются их создателями из соображений безопасности, что открывает нишу для специализированных открытых решений. Одной из таких ниш является кибербезопасность.
Джеффри Морган отмечает, что если разработчик попытается использовать Claude для проведения теста на проникновение (pen-testing) своего продукта, модель, скорее всего, откажется выполнять запрос . В то же время существуют открытые модели, специально обученные для нужд ИБ-исследователей. Они обладают достаточной гибкостью, чтобы атаковать сложные проблемы безопасности, не нарушая этических рамок, если используются во благо .
Более того, для критически важной инфраструктуры критически важен «происхождения» модели. Морган приводит пример из Финляндии, где модель Llama используется на электростанции для анализа скачков напряжения и обеспечения стабильности сети . В таких случаях ИТ-департаментам важно понимать, на каких данных обучена модель и где она исполняется.
🛠️ Ollama как операционная система для ИИ 11:31
Морган сравнивает роль Ollama с уровнем операционной системы в старом мире ИТ. Компания выступает посредником между тремя слоями :
- Слой оборудования: драйверы и оптимизация под конкретные чипы (NVIDIA, Apple Silicon, AMD, Intel).
- Слой инференса: обеспечение скорости и точности работы движка.
- Слой приложения: предоставление разработчикам удобных SDK и API.
Джеффри Морган подчеркивает, что за внешней простотой «вызова API» скрывается сложная инженерная работа. Одной из главных проблем открытых моделей долгое время было отсутствие вертикальной интеграции, которую имеют закрытые лаборатории . Ollama стремится создать для открытого сообщества такой же бесшовный опыт, какой OpenAI предоставляет своим пользователям.
По словам гостя, между моделью и конечным приложением существуют «скрытые слои», которые скоро станут отдельными рынками:
- Слой знаний: привязка контекста компании к модели.
- Слой оркестрации: координация работы множества под-агентов.
- Слой исполнения: решение вычислительных задач в облаке или локально.
💻 Возвращение к локальным вычислениям и «железо» от NVIDIA 23:12
Интересным трендом является конкуренция между облачным и локальным исполнением моделей. В облаке Ollama Cloud сейчас доминируют китайские модели, такие как DeepSeek . Однако на локальных машинах (ноутбуках разработчиков) наблюдается паритет между американскими (Llama, Gemma) и зарубежными разработками .
Морган прогнозирует «ренессанс персональных компьютеров» благодаря новому поколению оборудования:
- Apple Silicon: чипы от Apple позволяют запускать модели уровня 30–40 миллиардов параметров с высокой эффективностью прямо на ноутбуке .
- NVIDIA DGX Spark: Джеффри упоминает новую станцию от NVIDIA, которая по сути является «серверной стойкой на столе» с 128 ГБ объединенной памяти, способной запускать даже самые мощные модели .
По мнению гостя, идеальный рабочий процесс будет гибридным: простые задачи и автодополнение кода выполняются локально (с минимальной задержкой в миллисекунды), а сложные аналитические задачи перенаправляются в облако .
📉 Экономика «бесконечных токенов» и Flash-модели 29:16
Появление моделей класса «Flash» (например, DeepSeek Flash) меняет поведение разработчиков. Эти модели настолько дешевы и быстры, что вопрос стоимости отдельного токена отходит на второй план .
Ключевые тезисы Моргана об экономике моделей:
- 80/90 правило: в будущем 80–90% всех токенов в компаниях будут генерироваться открытыми моделями, хотя на них может тратиться лишь 10–20% бюджета .
- Оркестрация вместо «Божественной модели»: вместо использования одной сверхмощной и дорогой модели для всего, разработчики будут связывать десятки дешевых Flash-моделей в цепочки .
- Конец эпохи дефицита: мы возвращаемся к опыту первых дней ChatGPT, когда пользователь не задумывался о лимитах и просто общался с системой .
🎢 История Ollama: два года «в пустыне» и внезапный успех 37:12
Джеффри Морган и его соучредитель Майкл ранее работали в Docker, где создавали Docker Desktop. Этот опыт помог им понять, как строить инструменты для разработчиков, но путь к Ollama был тернистым.
Компания подалась в Y Combinator в 2021 году с совершенно другой идеей — инструментом для Kubernetes . Однако, по признанию Моргана, они слишком усложняли продукт и «переинженерили» его, не имея истинной страсти к проблеме безопасности Kubernetes .
- Период поиска: команда из 10 человек провела два года, пытаясь найти проблему, которую стоит решать. Морган называет это время «блужданием в лабиринте» .
- Пивот: в 2023 году, после выхода первой Llama, основатели поняли, насколько сложно запустить модель локально. Они дали себе две недели на создание прототипа .
- Взрыв интереса: Ollama набрала 100 000 звезд на GitHub быстрее, чем Docker или Kubernetes . При этом компания долгое время не имела выручки, фокусируясь на росте сообщества .
Джеффри советует даже опытным основателям идти в YC. По его словам, это помогает справиться с одиночеством и получить доступ к прозрачному сообществу, где ошибки обсуждаются открыто . Он также подчеркивает важность работы в командах, которые уже создавали успешные продукты: «Увидеть, как что-то реально работает с самого начала — это знание, которое удваивает ваши шансы на успех» .