Как меняется роль ИИ-исследователя и почему для разработки передовых моделей больше не нужны кластеры GPU, если у вас есть правильные вопросы и обычный процессор. Ведущий канала freeCodeCamp.org представляет детальный разбор архитектуры GLM-5.3-Flash и процесса её создания с нуля.
🚀 Новая эра ИИ-исследований: от кода к идеям 0:00
Современная индустрия искусственного интеллекта переживает фундаментальную трансформацию. По мнению автора видео, роль ИИ-исследователя (AI Researcher) за последние несколько месяцев изменилась: теперь 99% усилий таких компаний, как OpenAI или Anthropic, сосредоточены не на изобретении принципиально новых алгоритмов, а на проектировании данных и сред для обучения . Процесс написания кода всё чаще делегируется автономным ИИ-агентам, таким как Claude или специально обученные кодеры, в то время как человек берет на себя роль стратега, определяющего направление экспериментов .
В качестве примера приводится вакансия от Anthropic, которая описывает 95% современных ролей в этой сфере: понимание архитектур, умение задавать исследовательские вопросы и проектировать среды для обучения с подкреплением (RL). Ведущий подчеркивает, что для обучения модели GLM-5.3-Flash на 25 миллионов параметров достаточно обычного CPU или MacBook . Это позволяет проводить быстрые итерации и учиться «задавать вопросы» нейросети, не тратя миллионы на вычислительные мощности.
🛠 Архитектура GLM-5.3-Flash: Маленькая, но мощная 8:53
Хотя оригинальная модель обладает миллиардами параметров, её учебная версия на 25 млн параметров сохраняет ключевые современные архитектурные решения.
Токенизация и «умная» экономия параметров
В отличие от больших языковых моделей (LLM), использующих BPE-токенизаторы с объемом словаря 150–300 тысяч токенов, в данном проекте используется побайтовая кодировка ASCII . Это критически важно для малых моделей:
- При огромном словаре 95% весов модели уходили бы только на матрицы эмбеддингов и выходной слой .
- Использование словаря из 260 токенов позволяет сфокусировать параметры на логике работы слоев, а не на хранении словаря .
Гиперсвязи и DeepSeek
Модель заимствует концепцию Manifold Constrained Hyperconnections (из наработок DeepSeek) . Вместо одной классической остаточной связи (residual connection), здесь используются множественные «магистрали» данных. Это позволяет трансформеру передавать различные типы информации через слои, не смешивая их преждевременно .
Механизмы внимания и Mixture of Experts (MoE)
Модель использует гибридную систему внимания:
- Linear Attention (линейное внимание): работает как память с фиксированным размером (State-Space Model), эффективно обрабатывая недавние токены при минимальных затратах ресурсов .
- Sparse Attention (разреженное внимание): специальный индексатор ищет наиболее релевантные токены в длинном контексте, что позволяет работать с важными деталями из прошлого без квадратичного роста вычислений .
- MoE (Смесь экспертов): из 288 потенциальных экспертов для каждого токена выбираются только 8, плюс один «общий эксперт» (shared expert), который аккумулирует универсальные знания для всех токенов .
👁 Зрительное восприятие: Добавление Vision-модуля 23:06
GLM-5.3-Flash является мультимодальной моделью. Изображение разбивается на патчи (фрагменты), которые преобразуются в векторы эмбеддингов .
- Для картинки 32x32 пикселя создаются патчи 8x8, которые затем объединяются в 16 токенов .
- В контекстное окно добавляются специальные маркеры «начало изображения» и «конец изображения» .
- Для обучения использовалась задача распознавания рукописных цифр: модель успешно научилась определять цифру «7», просто анализируя последовательность визуальных токенов .
🧠 Обучение с подкреплением (RL) и алгоритм GRPO 30:27
Если на этапе предварительного обучения (Pre-training) модель просто имитирует текст, то пост-обучение через Reinforcement Learning учит её «думать» и выдавать правильные ответы . В ходе эксперимента модель подняла точность выполнения простых задач на Python (например, «умножь X на 2») с 4% до 45% .
Автор выделяет особенности настройки RL:
- Скрытые тесты: Результаты тестов нельзя показывать модели во время обучения, иначе она прибегнет к «reward hacking» — взлому системы вознаграждения вместо решения задачи .
- Алгоритм GRPO (Group Relative Policy Optimization): Модель генерирует, например, 16 вариантов ответа на один вопрос. Награда (advantage) вычисляется как разница между успехом конкретного ответа и средним успехом всей группы . Это избавляет от необходимости обучать отдельную модель-критика .
- Замораживание слоев: Чтобы не потерять ранее накопленные знания, обновляются только последние блоки и выходная голова модели .
🧪 Результаты экспериментов и статистическая значимость 39:35
В процессе исследования автор столкнулся с важным уроком для всех ИИ-разработчиков: не все улучшения статистически значимы.
- Эффект семян (seeds): При одном случайном значении (seed) группа из 4 ответов давала лучший результат, чем группа из 16, но при смене значения результат менялся на противоположный .
- Регрессия: Модель, обученная только на узких задачах (инкремент чисел), может начать хуже справляться с задачами, на которых её не тренировали .
- Разнообразие данных: Эксперименты показали, что повторение одних и тех же данных помогает на старте, но в долгосрочной перспективе разнообразие (diversity) всегда выигрывает .
Ведущий заключает, что для начинающего исследователя важнее всего научиться грамотно ставить эксперименты и публиковать результаты в соцсетях еженедельно, развивая научное мышление . Главный секрет успеха в современной ИИ-среде — это не мощность GPU, а умение конструировать обучающие среды и задавать правильные вопросы .