Теоретический курс по построению LLM
Описание курса
Теоретический курс по построению LLM — фундаментальная подготовка для работы с архитектурой и принципами создания больших языковых моделей, где базовые концепции машинного обучения переплетаются с инженерными вызовами масштабирования, тонкой настройки и безопасного внедрения ИИ-систем. Под этим понимается не только понимание математических основ трансформеров и механизмов внимания, но и освоение практик предобработки данных, выбора гиперпараметров, оценки качества генераций, а также учёта этических и юридических ограничений при работе с персональными и чувствительными данными — в том числе в контексте требований к информационным системам, интегрируемым с государственными платформами.
Этот курс разработан для тех, кто хочет перейти от поверхностного использования LLM к глубокому пониманию их устройства и научиться проектировать, обучать и адаптировать модели под конкретные задачи, соблюдая отраслевые стандарты надёжности, воспроизводимости и прозрачности ИИ-решений.
Для кого этот курс:
-
Начинающих ML‑инженеров и дата‑сайентистов: которые хотят структурировать знания об архитектуре LLM, освоить типовые пайплайны обучения и дообучения моделей, разобраться в современных фреймворках (Hugging Face, Fairseq, Megatron) и повысить свою конкурентоспособность на рынке.
-
Разработчиков и системных архитекторов: желающих интегрировать LLM в корпоративные и государственные информационные системы, грамотно оценивать требования к инфраструктуре, latency и стоимости эксплуатации, а также проектировать безопасные API и механизмы контроля выходных данных.
-
Специалистов из смежных областей (аналитиков, технических писателей, методологов): которые понимают специфику цифровой трансформации и хотят перейти к проектированию ИИ‑функций, формулировать технические задания для ML‑команд и корректно оценивать возможности и риски применения генеративных моделей в реальных бизнес‑ и государственных сценариях.
Главный результат курса:
В качестве выпускного проекта вы разработаете полный теоретико‑методологический прототип LLM‑решения для конкретной предметной области (например, автоматизация подготовки справок, генерация черновиков нормативных документов или интеллектуальная обработка обращений граждан), включая описание архитектуры модели, схему подготовки и очистки данных, критерии оценки качества ответов, план валидации на репрезентативной выборке, а также перечень мер по обеспечению безопасности и соответствия регуляторным требованиям. Итоговый пакет материалов будет пригоден для включения в портфолио, презентации заказчику или передачи в команду разработки для дальнейшей реализации, в том числе с учётом требований к выгрузке и интеграции с внешними государственными системами. Вы также получите опыт разработки собственной LLM.
Правообладатель
СЭО 3KL Demo
Содержание курса
Программа обучения:
Модуль 1: Фундаментальные основы NLP и архитектура LLM
Изучение базовых концепций обработки естественного языка и внутреннего устройства больших языковых моделей. Разбор механизма внимания, позиционных эмбеддингов и нормализационных слоёв. Сравнение архитектур Encoder/Decoder/Encoder‑Decoder, принципов авторегрессии и ограничений контекстного окна. Практическое знакомство с токенизацией: подсловные токенизаторы, BPE, особенности обработки русскоязычных и смешанных текстов. Настройка демонстрационных примеров в Moodle‑среде для визуализации этапов токенизации и влияния на итоговый вывод модели.
Модуль 2: Подготовка и управление данными для обучения и дообучения
Построение пайплайнов сбора, очистки и анонимизации данных с учётом требований к работе с персональными данными и интеграции с государственными системами. Балансировка датасетов, контроль репрезентативности по доменам и устранение перекосов. Форматирование данных под разные задачи: инструкции, диалоги, структурированные ответы. Валидация на корректность и исключение утечек чувствительной информации. Реализация шаблонов проверки данных в виде Moodle‑форм и чек‑листов для контроля качества входных наборов.
Модуль 3: Методы обучения, дообучения и адаптации моделей
Различие между предобучением и дообучением (fine‑tuning), применение эффективных подходов LoRA и QLoRA при ограниченных вычислительных ресурсах. Выбор гиперпараметров, стратегии регуляризации и методы контроля переобучения. Оценка качества на этапе обучения: перплексия, метрики по целевым задачам, использование валидационных выборок. Практическая отработка настройки параметров и интерпретации метрик с фиксацией результатов в структурированных артефактах для портфолио.
Модуль 4: RAG, retrieval и работа с внешним знанием
Проектирование RAG‑архитектуры: чанкинг, назначение метаданных, семантический и гибридный поиск. Работа с векторными представлениями и базами данных: подбор эмбеддинг‑моделей под русский язык, хранение и индексация. Контроль источников и обеспечение цитирования документов, чтобы исключить «выдумывание» фактов — критично для справок, регламентов и нормативных текстов. Интеграция результатов поиска с шаблонами вывода, пригодными для выгрузки в государственные информационные системы.
Модуль 5: Промпт‑инжиниринг, системные инструкции и управление поведением модели
Структурирование промптов для стабильных и воспроизводимых ответов. Разработка шаблонов системных инструкций, контроль ролей, ограничение домена и формата вывода. Применение техник few‑shot, chain‑of‑thought и структурированного вывода (JSON, схемы) для прямой интеграции с внешними системами. Настройка примеров промптов и валидационных правил в формате, удобном для размещения и тестирования в Moodle.
Результаты обучения
В результате прохождения курса студент будет знать, понимать и уметь применять на практике:
1. Архитектура и принципы работы LLM
Понимание фундаментальных механизмов: способность объяснять устройство трансформерной архитектуры, работу механизма внимания, роль позиционных эмбеддингов и нормализационных слоёв, а также различия между encoder-, decoder- и encoder‑decoder-моделями.
Работа с токенизацией и контекстом: навык выбора и настройки токенизаторов (в т. ч. BPE) с учётом специфики русского языка, понимание влияния токенизации на стоимость и качество генерации, умение оценивать ограничения контекстного окна и проектировать решения с учётом этих ограничений.
2. Подготовка, очистка и управление данными
Построение пайплайнов обработки данных: умение разрабатывать сквозные процессы сбора, очистки, балансировки и валидации данных, включая контроль репрезентативности по доменам и устранение перекосов.
Обеспечение безопасности и соответствия требованиям: навык анонимизации и фильтрации данных для исключения утечек чувствительной и персональной информации, применение практик, соответствующих требованиям при работе с государственными информационными системами.
Структурирование данных под задачи: способность форматировать датасеты для разных сценариев (инструкции, диалоги, структурированные ответы) и реализовывать контрольные механизмы (в т. ч. через Moodle‑формы и чек‑листы) для проверки качества входных данных.
3. Обучение, дообучение и адаптация моделей
Выбор стратегии адаптации: умение различать сценарии предобучения, классического fine‑tuning и эффективных методов дообучения (LoRA, QLoRA), подбирать подход в зависимости от доступных вычислительных ресурсов и целевой задачи.
Настройка и контроль обучения: навык подбора гиперпараметров, применения регуляризации и методов борьбы с переобучением, интерпретации метрик (перплексия, метрики по задачам) и работы с валидационными выборками.
Фиксация и воспроизводимость экспериментов: способность документировать эксперименты, контролировать версии данных и моделей, формировать структурированные артефакты для портфолио и передачи в команду разработки.
4. RAG, работа с внешним знанием и контроль достоверности
Проектирование RAG‑систем: умение проектировать пайплайн RAG, включая чанкинг, назначение метаданных, семантический и гибридный поиск, а также подбор и использование эмбеддинг‑моделей для русского языка.
Контроль источников и предотвращение галлюцинаций: навык настройки механизмов, гарантирующих, что модель опирается на заданные документы и не «придумывает» факты — это критично для задач подготовки справок, выдержек из регламентов и нормативных текстов.
Интеграция с форматами выгрузки: способность формировать выходные данные (в т. ч. структурированные ответы, JSON‑схемы) так, чтобы они были пригодны для прямой интеграции и выгрузки в государственные информационные системы.
5. Промпт‑инжиниринг и управление поведением модели
Создание воспроизводимых промптов: умение структурировать промпты для стабильных результатов, применять техники few‑shot, chain‑of‑thought и ограничивать домен/формат вывода.
Разработка системных инструкций: навык проектирования шаблонов системных инструкций, контроля ролей и правил поведения модели, а также валидации промптов на устойчивость к типовым уязвимостям (prompt injection и др.).
Подготовка шаблонов для Moodle и интеграции: способность оформлять промпты и правила валидации в формате, удобном для размещения и тестирования в Moodle, а также для передачи как части спецификации API.
Компетенции
УК‑1: Способен осуществлять поиск, критический анализ и синтез информации для построения и адаптации LLM‑решений; применять системный подход при проектировании пайплайнов данных, архитектуры модели и механизмов контроля качества; управлять жизненным циклом LLM‑проекта — от формулировки задачи и сбора данных до валидации, деплоя и интеграции с внешними (в том числе государственными) информационными системами.
ОПК‑2: Способен находить, анализировать и обоснованно выбирать современные подходы к построению и адаптации языковых моделей (предобучение, fine‑tuning, LoRA/QLoRA, RAG), фреймворки и инструменты (Hugging Face, vLLM, TGI) и методы оценки качества (перплексия, фактологичность, токсичность и др.) для решения профессиональных задач с учётом ограничений по ресурсам, требованиям к latency и регуляторным нормам.
ОПК‑3: Способен планировать вычислительные и человеческие ресурсы для реализации LLM‑проектов, координировать работу межфункциональной команды (ML‑инженеры, разработчики, специалисты по безопасности, предметные эксперты), выстраивать коммуникацию со стейкхолдерами при согласовании требований к достоверности, безопасности и форматам выгрузки данных, а также обеспечивать контроль качества, сроков и эксплуатационных затрат на всех этапах LLMOps.
Рекомендуемые направления подготовки
09.03.01 Информатика и вычислительная техника
09.03.03 Прикладная информатика