Мақалалар

Fine-tune видео және кескін модельдерін кең ауқымда баптау: NVIDIA NeMo Automodel және 🤗 Diffusers

Жасанды интеллект саласындағы видеo мен кескін өңдеу модельдерін жетілдіру маңызды міндеттерінің бірі болып отыр. Бұл технологиялар мәдениет, өнер, білім және өнеркәсіп салаларына серпін беруде, сонымен бірге қолданушы тәжірибесін жаңа деңгейге көтеруде шешуші рөл атқарады. Осы мақалада NVIDIA және Hugging Face бірлесіп дамытқан NeMo Automodel мен 🤗 Diffusers экожүйесінің мүмкіндіктері талданады. Бұл құралдар бейне және кескін модельдерін масштабты баптауға арналған және көптеген мамандар үшін тиімді технологиялық негіз ұсынады.

NeMo Automodel деген не?

NeMo Automodel – ашық бастапқы кодқа ие PyTorch-ға негізделген DTensor табиғи баптау кітапханасы, NVIDIA NeMo экожүйесінің бөлігі. Бұл кітапхана Diffusers моделімен үйлесімді болуға бағытталған екі негізгі қағидаға негізделген. Біріншіден, ол Hugging Face экожүйесіне тікелей интеграцияланған, яғни Hub-тағы кез келген Diffusers моделін pretrained_model_name_or_path параметрі арқылы таңдап алып, бірден баптауды бастауға мүмкіндік бар. Екіншіден, масштабты өзгерту оңай: бір бағдарлама арқылы баптау кез келген көлемде жүзеге асады, ол үшін кодты қайта жазудың қажеті жоқ, тек конфигурацияны өзгертіп, әртүрлі параллелизм режимдерін: FSDP2, tensor, эксперт параллелизмі, контекст және pipeline-ды таңдап пайдалануға болады.

NeMo Automodel қазіргі уақытта тек flow-matching әдісін қолданатын модельдерді қолдайды. Бұл әдіс нақтыlatенттік кеңістікте VAE шығаруларын алдын ала кодтау арқылы жұмыс істейді. Модельді оқытуда көп деңгейлі масштабтау мен пайдалану үшін арнайы bucket-пен өңдеу механизмі қолданылған.

Қолдау көрсетілетін Diffusion модельдері

NeMo Automodel бірнеше танымал ашық Diffusers модельдерін баптау рецептерімен жабдықталған. Олар: Wan 2.1 және 2.2 (мәтіннен видеосы), FLUX.1-dev және FLUX.2-dev (мәтіннен кескін), HunyuanVideo (мәтіннен видеосы) және Qwen-Image (мәтіннен кескін). Модельдердің ауқымы әртүрлі, параметрлері 1,3 миллиардтан 32 миллиардқа дейін жетеді. Кейбір модельдер ЛОРА (LoRA) әдісін қолдай отырып, параметрлерді тиімді баптауға мүмкіндік береді.

Ынтымақтастықтың мүмкіндіктері

Негізгі артықшылықтарының бірі – бұл процедурада чекпоинттарды түрлендірудің қажет еместігі. Hub-тағы pretrained салмақтар бірден қолданылады, ал бапталған чекпоинттар Diffusers pipeline-іне оңай жүктеледі. Бұл жұмыс ағыны құралдардың үйлесімділігін сақтап, әрі қарай кванттау, компиляция немесе LoRA сияқты адаптерлерді қолдануға кедергі келтірмейді.

Жаңа модельдер үшін қолдау енгізу жылдам жүзеге асады: кодтың кішкене бөлігі – деректерді алдын ала өңдеу мен модель адаптері ғана – қосылады да, қалған қуатты баптау механизмдері өзгеріссіз қалады. Бұл жұмыс барысын бірізді әрі ыңғайлы етеді.

Бағдарламада толық масштабты және параметрлерді тиімді баптау (PEFT) қолжетімді. Толық баптау жоғары сапаға бағытталған, ал ЛОРА әдісін қолдану ресурстарды экономды пайдаланып, аз көлемдегі жағдайларда құрылымды баптауға ықпал етеді. Екеуі де бір рецептураның ішінде жүзеге асады.

NeMo Automodel құралдары үлкен модельдерді оқытуға арналған күрделі шардтау схемаларын қамтиды: FSDP2, tensor, pipeline және контекст параллелизмдері, мультинодалық басқару қабілеті (бүгін SLURM қолдауы бар, болашақта Kubernetes), сонымен бірге мультиразмерлік bucket-бөліп қолдану. Бұл мүмкіндік FLUX.1-dev (12 миллиард параметр) және HunyuanVideo (13 миллиард параметр) сияқты ірі модельдерді тиімді оқытуға мүмкіндік береді.

Fine-tuning жұмыс ағымының қадамдары

NeMo Automodel-ді пайдалану үшін ұсынылатын нұсқасы – дайын контейнердегі орнату, ол CUDA оптимизациялы тәуелділіктерін қамтиды (nvcr.io/nvidia/nemo-automodel:26.06). Сонымен қатар, pip арқылы тікелей немесе бастапқы кодтан орнату тәсілдері де бар.

Мысалы, FLUX.1-dev моделін Rider–Waite таро суреттер жинағы негізінде толық трансформер баптау. Жұмыс ағыны YAML конфигурациясында берілген, оған өзге параметрлер кірістірілмей, командалық жолдан баптау параметрлері беріледі.

1. Деректерді алдын ала кодтау

Diffusion рецепті әрбір оқыту қадамы кезінде бастапқы суреттерді қайта өңдемей, алдын ала кодталған VAE латенттері мен мәтіндік ендірулерді пайдаланады. Мысалы, 78 Rider–Waite суреттерін Hugging Face репозиторийінен тікелей ағынға шығарып, ресурстарды бірқалыпты қуаттайтын барлық GPU-де өңдейді. Бұл өңдеу барысында әрбір үлгі тиісті bucket-қа бөлінеді.

2. Оқытуға старт беру

Оқытуды бастау үшін FLUX.yaml конфигурациясы қолданылады. Ол FLUX.1-dev моделінің толық трансформер баптауын, batch=32 және сегіз GPU-мен FSDP2 параллелизмін белгілейді. Таро базасына тән қосымша параметрлер командалық жолдан беріледі.

3. Бапталған чекпоинттен генерациялау

Оқыту аяқталған соң, алынған чекпоинт Diffusers pipeline көмегімен жаңа кескіндерді немесе бейнелерді жасауда қолданылады. Бұл кезеңде толық масштабталған және нәтижелі генерация жүзеге асады.

4. Өнімділік

NeMo Automodel бір платформада масштабты баптауды автоматтандырады, параллелизмнің бірнеше түрін көтереді әрі үлкен әлеуметтік және өнеркәсіптік жобалар талаптарын қанағаттандырады. NVIDIA және Hugging Face бірлесіп жасаған интеграция Open Source форматында қолжетімді, қолданушылар мен зерттеушілер үшін ашық әрі ыңғайлы платформа ұсынады.

Практикалық маңызы

Бұл технологиялар кескін мен видеоны жасанды интеллект көмегімен өңдеудің ауқымын кеңейтеді. Әсіресе, түсіндіру, шығармашылық және мультимедиа саласында бейнелерді және суреттерді әртүрлі контексттерге икемді етіп баптауға мүмкіндік жасау арқылы инновациялық өнімдер мен қызметтерді дамытуды жылдамдатады. Модельдерді масштабтап баптаудың икемді және ресурсты үнемдеу тәсілі зерттеушілер мен әзірлеушілерге өз жобаларын жылдам іске асыруға көмектеседі.

Қорытынды

NVIDIA NeMo Automodel мен Hugging Face Diffusers экожүйесінің интеграциясы видеo және кескін модельдерін ауқымды түрде баптауда жаңа дәуір ашты. Бұл құрал бірнеше күрделі техникалық мәселелерді шешіп, қолжетімділікті арттырады, әрі жаңа модельдерді жедел қолдау мен тиімді оқыту мүмкіндіктерін ұсынады. Өз заманында технологияны тәжірибеге енгізу арқылы кәсіпкерлік пен ғылыми зерттеулердің дамуына оң ықпал етеді.

TAGS: жасанды интеллект, бейне өңдеу, кескін өңдеу, NeMo Automodel, Diffusers, масштабты баптау, NVIDIA, Hugging Face

Дереккөз: Hugging Face Blog

Басқа жаңалықтар

Back to top button