ПАВЕЛ КАЦКОВНаписать в Telegram ↗

Собственная LLM с нуля: модель на 60M параметров

Автор: ·
На основе личного опыта и интервью автора.

Павел Кацков обучал русскоязычную языковую модель с нуля. Основная версия содержит 60 млн параметров; эксперимент включал pre-training, SFT и собственную лабораторию обучения.

Понять технологию изнутри.

Основной эксперимент — русскоязычная модель на 60 млн параметров, обученная с нуля. Архитектура собрана из известных блоков. Были и эксперименты с 300 млн параметров, но основное внимание получила меньшая версия.

Данные: Википедия, инструкции и диалоги. Этапы: pre-training и supervised fine-tuning. Основное железо — RTX 4060 Ti с 16 ГБ памяти.

Для обучения я создал лабораторию: смешивание датасетов, управление обучением, чекпоинтами, S3-хранилищем и удалёнными вычислениями.

Модель научилась отвечать в формате чата и извлекать информацию из небольшого контекста — примерно до 1000 токенов. Попытки обучить её рассуждению показали ограничения этого эксперимента.

Главный результат — понимание обучения и границ моделей. Хороший бенчмарк сам по себе не гарантирует хорошую работу в конкретном продукте.

Параметры эксперимента

Модель60 млн параметров; отдельные эксперименты с 300 млн
ОбучениеС нуля, pre-training и SFT
ДанныеРусскоязычная Википедия, инструкции, чаты и диалоги
Основная видеокартаRTX 4060 Ti, 16 ГБ
КонтекстПримерно до 1000 токенов

Что этот эксперимент доказывает

Это исследовательский опыт обучения модели и построения инструментов вокруг неё. Он не является заявлением о конкурентоспособности с ведущими универсальными LLM. Численные бенчмарки и открытые веса здесь не представлены.

Обсудим вашу задачу?

Напишите, что строите, где застряли и какого результата хотите.

Telegram @m_katskov_tech ↗admin@katskov.tech