# ИИ-исследователь с нуля: как обучить GLM-5.3-Flash на обычном процессоре

Источник: https://www.youtube.com/watch?v=-gfgQfw2g_E
Канал: freeCodeCamp.org
Опубликовано: 06.10.2026

---

Как меняется роль ИИ-исследователя и почему для разработки передовых моделей больше не нужны кластеры GPU, если у вас есть правильные вопросы и обычный процессор. Ведущий канала freeCodeCamp.org представляет детальный разбор архитектуры GLM-5.3-Flash и процесса её создания с нуля.

## 🚀 Новая эра ИИ-исследований: от кода к идеям
[[JUMP:00:00]]

Современная индустрия искусственного интеллекта переживает фундаментальную трансформацию. По мнению автора видео, роль ИИ-исследователя (AI Researcher) за последние несколько месяцев изменилась: теперь 99% усилий таких компаний, как OpenAI или Anthropic, сосредоточены не на изобретении принципиально новых алгоритмов, а на проектировании данных и сред для обучения [01:48]. Процесс написания кода всё чаще делегируется автономным ИИ-агентам, таким как Claude или специально обученные кодеры, в то время как человек берет на себя роль стратега, определяющего направление экспериментов [02:00].

В качестве примера приводится вакансия от Anthropic, которая описывает 95% современных ролей в этой сфере: понимание архитектур, умение задавать исследовательские вопросы и проектировать среды для обучения с подкреплением (RL). Ведущий подчеркивает, что для обучения модели GLM-5.3-Flash на 25 миллионов параметров достаточно обычного CPU или MacBook [02:39]. Это позволяет проводить быстрые итерации и учиться «задавать вопросы» нейросети, не тратя миллионы на вычислительные мощности.

## 🛠 Архитектура GLM-5.3-Flash: Маленькая, но мощная
[[JUMP:08:53]]

Хотя оригинальная модель обладает миллиардами параметров, её учебная версия на 25 млн параметров сохраняет ключевые современные архитектурные решения.

### Токенизация и «умная» экономия параметров
В отличие от больших языковых моделей (LLM), использующих BPE-токенизаторы с объемом словаря 150–300 тысяч токенов, в данном проекте используется побайтовая кодировка ASCII [05:21]. Это критически важно для малых моделей:

*   При огромном словаре 95% весов модели уходили бы только на матрицы эмбеддингов и выходной слой [06:41].
*   Использование словаря из 260 токенов позволяет сфокусировать параметры на логике работы слоев, а не на хранении словаря [06:55].

### Гиперсвязи и DeepSeek
Модель заимствует концепцию **Manifold Constrained Hyperconnections** (из наработок DeepSeek) [11:56]. Вместо одной классической остаточной связи (residual connection), здесь используются множественные «магистрали» данных. Это позволяет трансформеру передавать различные типы информации через слои, не смешивая их преждевременно [12:25].

### Механизмы внимания и Mixture of Experts (MoE)
Модель использует гибридную систему внимания:

*   **Linear Attention (линейное внимание):** работает как память с фиксированным размером (State-Space Model), эффективно обрабатывая недавние токены при минимальных затратах ресурсов [18:30].
*   **Sparse Attention (разреженное внимание):** специальный индексатор ищет наиболее релевантные токены в длинном контексте, что позволяет работать с важными деталями из прошлого без квадратичного роста вычислений [16:23].
*   **MoE (Смесь экспертов):** из 288 потенциальных экспертов для каждого токена выбираются только 8, плюс один «общий эксперт» (shared expert), который аккумулирует универсальные знания для всех токенов [20:46].

## 👁 Зрительное восприятие: Добавление Vision-модуля
[[JUMP:23:06]]

GLM-5.3-Flash является мультимодальной моделью. Изображение разбивается на патчи (фрагменты), которые преобразуются в векторы эмбеддингов [23:19].

*   Для картинки 32x32 пикселя создаются патчи 8x8, которые затем объединяются в 16 токенов [24:11].
*   В контекстное окно добавляются специальные маркеры «начало изображения» и «конец изображения» [24:54].
*   Для обучения использовалась задача распознавания рукописных цифр: модель успешно научилась определять цифру «7», просто анализируя последовательность визуальных токенов [25:20].

## 🧠 Обучение с подкреплением (RL) и алгоритм GRPO
[[JUMP:30:27]]

Если на этапе предварительного обучения (Pre-training) модель просто имитирует текст, то пост-обучение через Reinforcement Learning учит её «думать» и выдавать правильные ответы [26:54]. В ходе эксперимента модель подняла точность выполнения простых задач на Python (например, «умножь X на 2») с 4% до 45% [32:04].

Автор выделяет особенности настройки RL:

1.  **Скрытые тесты:** Результаты тестов нельзя показывать модели во время обучения, иначе она прибегнет к «reward hacking» — взлому системы вознаграждения вместо решения задачи [31:50].
2.  **Алгоритм GRPO (Group Relative Policy Optimization):** Модель генерирует, например, 16 вариантов ответа на один вопрос. Награда (advantage) вычисляется как разница между успехом конкретного ответа и средним успехом всей группы [36:44]. Это избавляет от необходимости обучать отдельную модель-критика [37:25].
3.  **Замораживание слоев:** Чтобы не потерять ранее накопленные знания, обновляются только последние блоки и выходная голова модели [37:37].

## 🧪 Результаты экспериментов и статистическая значимость
[[JUMP:39:35]]

В процессе исследования автор столкнулся с важным уроком для всех ИИ-разработчиков: не все улучшения статистически значимы.

*   **Эффект семян (seeds):** При одном случайном значении (seed) группа из 4 ответов давала лучший результат, чем группа из 16, но при смене значения результат менялся на противоположный [42:04].
*   **Регрессия:** Модель, обученная только на узких задачах (инкремент чисел), может начать хуже справляться с задачами, на которых её не тренировали [40:02].
*   **Разнообразие данных:** Эксперименты показали, что повторение одних и тех же данных помогает на старте, но в долгосрочной перспективе разнообразие (diversity) всегда выигрывает [28:16].

Ведущий заключает, что для начинающего исследователя важнее всего научиться грамотно ставить эксперименты и публиковать результаты в соцсетях еженедельно, развивая научное мышление [43:39]. Главный секрет успеха в современной ИИ-среде — это не мощность GPU, а умение конструировать обучающие среды и задавать правильные вопросы [35:24].