ИИ-исследователь с нуля: как обучить GLM-5.3-Flash на обычном процессоре

freeCodeCamp.org 46,5 тыс. 44 мин 4 мин 06.10.2026
Главное

Как меняется роль ИИ-исследователя и почему для разработки передовых моделей больше не нужны кластеры GPU, если у вас есть правильные вопросы и обычный процессор. Ведущий канала freeCodeCamp.org представляет детальный разбор архитектуры GLM-5.3-Flash и процесса её создания с нуля.

🚀 Новая эра ИИ-исследований: от кода к идеям 0:00

Современная индустрия искусственного интеллекта переживает фундаментальную трансформацию. По мнению автора видео, роль ИИ-исследователя (AI Researcher) за последние несколько месяцев изменилась: теперь 99% усилий таких компаний, как OpenAI или Anthropic, сосредоточены не на изобретении принципиально новых алгоритмов, а на проектировании данных и сред для обучения . Процесс написания кода всё чаще делегируется автономным ИИ-агентам, таким как Claude или специально обученные кодеры, в то время как человек берет на себя роль стратега, определяющего направление экспериментов .

В качестве примера приводится вакансия от Anthropic, которая описывает 95% современных ролей в этой сфере: понимание архитектур, умение задавать исследовательские вопросы и проектировать среды для обучения с подкреплением (RL). Ведущий подчеркивает, что для обучения модели GLM-5.3-Flash на 25 миллионов параметров достаточно обычного CPU или MacBook . Это позволяет проводить быстрые итерации и учиться «задавать вопросы» нейросети, не тратя миллионы на вычислительные мощности.

🛠 Архитектура GLM-5.3-Flash: Маленькая, но мощная 8:53

Хотя оригинальная модель обладает миллиардами параметров, её учебная версия на 25 млн параметров сохраняет ключевые современные архитектурные решения.

Токенизация и «умная» экономия параметров

В отличие от больших языковых моделей (LLM), использующих BPE-токенизаторы с объемом словаря 150–300 тысяч токенов, в данном проекте используется побайтовая кодировка ASCII . Это критически важно для малых моделей:

Гиперсвязи и DeepSeek

Модель заимствует концепцию Manifold Constrained Hyperconnections (из наработок DeepSeek) . Вместо одной классической остаточной связи (residual connection), здесь используются множественные «магистрали» данных. Это позволяет трансформеру передавать различные типы информации через слои, не смешивая их преждевременно .

Механизмы внимания и Mixture of Experts (MoE)

Модель использует гибридную систему внимания:

👁 Зрительное восприятие: Добавление Vision-модуля 23:06

GLM-5.3-Flash является мультимодальной моделью. Изображение разбивается на патчи (фрагменты), которые преобразуются в векторы эмбеддингов .

🧠 Обучение с подкреплением (RL) и алгоритм GRPO 30:27

Если на этапе предварительного обучения (Pre-training) модель просто имитирует текст, то пост-обучение через Reinforcement Learning учит её «думать» и выдавать правильные ответы . В ходе эксперимента модель подняла точность выполнения простых задач на Python (например, «умножь X на 2») с 4% до 45% .

Автор выделяет особенности настройки RL:

  1. Скрытые тесты: Результаты тестов нельзя показывать модели во время обучения, иначе она прибегнет к «reward hacking» — взлому системы вознаграждения вместо решения задачи .
  2. Алгоритм GRPO (Group Relative Policy Optimization): Модель генерирует, например, 16 вариантов ответа на один вопрос. Награда (advantage) вычисляется как разница между успехом конкретного ответа и средним успехом всей группы . Это избавляет от необходимости обучать отдельную модель-критика .
  3. Замораживание слоев: Чтобы не потерять ранее накопленные знания, обновляются только последние блоки и выходная голова модели .

🧪 Результаты экспериментов и статистическая значимость 39:35

В процессе исследования автор столкнулся с важным уроком для всех ИИ-разработчиков: не все улучшения статистически значимы.

Ведущий заключает, что для начинающего исследователя важнее всего научиться грамотно ставить эксперименты и публиковать результаты в соцсетях еженедельно, развивая научное мышление . Главный секрет успеха в современной ИИ-среде — это не мощность GPU, а умение конструировать обучающие среды и задавать правильные вопросы .

💬 Цитаты

«Ваша работа как ИИ-исследователя — иметь высокоуровневую идею о том, какие эксперименты проводить.»

Ведущий freeCodeCamp 01:23

«Если вы хотите научить модель работать днями, вы должны давать ей задачи, которые занимают дни.»

Ведущий freeCodeCamp 31:10

«Консистенция важнее интенсивности. Постить раз в неделю вечно лучше, чем пять дней подряд и остановиться.»

Ведущий freeCodeCamp 43:51
👥 Спикер
🔗 Упомянутые сайты и проекты
📖 Термины
Mixture of Experts (MoE)
Архитектура, в которой для каждого входного токена активируется только подмножество специализированных слоев («экспертов»).
GRPO
Алгоритм оптимизации политики, который оценивает ответы относительно среднего результата группы, экономя вычислительные ресурсы.
RMSNorm
Метод нормализации векторов, предотвращающий взрыв градиентов и ускоряющий сходимость модели.
Weight Tying
Техника использования одной и той же матрицы весов для входных эмбеддингов и выходного слоя генерации токенов.
📊 Цифры
⚖️ Другая сторона
Искусственный интеллект GLM-5.3-Flash Mixture of Experts GRPO Reinforcement Learning Transformer