Собственная LLM с нуля: модель на 60M параметров
Павел Кацков обучал русскоязычную языковую модель с нуля. Основная версия содержит 60 млн параметров; эксперимент включал pre-training, SFT и собственную лабораторию обучения.
Понять технологию изнутри.
Основной эксперимент — русскоязычная модель на 60 млн параметров, обученная с нуля. Архитектура собрана из известных блоков. Были и эксперименты с 300 млн параметров, но основное внимание получила меньшая версия.
Данные: Википедия, инструкции и диалоги. Этапы: pre-training и supervised fine-tuning. Основное железо — RTX 4060 Ti с 16 ГБ памяти.
Для обучения я создал лабораторию: смешивание датасетов, управление обучением, чекпоинтами, S3-хранилищем и удалёнными вычислениями.
Модель научилась отвечать в формате чата и извлекать информацию из небольшого контекста — примерно до 1000 токенов. Попытки обучить её рассуждению показали ограничения этого эксперимента.
Главный результат — понимание обучения и границ моделей. Хороший бенчмарк сам по себе не гарантирует хорошую работу в конкретном продукте.
Параметры эксперимента
| Модель | 60 млн параметров; отдельные эксперименты с 300 млн |
|---|---|
| Обучение | С нуля, pre-training и SFT |
| Данные | Русскоязычная Википедия, инструкции, чаты и диалоги |
| Основная видеокарта | RTX 4060 Ti, 16 ГБ |
| Контекст | Примерно до 1000 токенов |
Что этот эксперимент доказывает
Это исследовательский опыт обучения модели и построения инструментов вокруг неё. Он не является заявлением о конкурентоспособности с ведущими универсальными LLM. Численные бенчмарки и открытые веса здесь не представлены.
Обсудим вашу задачу?
Напишите, что строите, где застряли и какого результата хотите.
Telegram @m_katskov_tech ↗admin@katskov.tech