Мақалалар

Нунча́ку 4-разрядты диффузиялық есептеуді Diffusers кітапханасына енгізу

Кіріспе

Үлкен диффузиялық трансформерлер жоғары сапалы суреттер, видеолар, аудио үлгілер және мәтін генерациялауға мүмкіндік береді. Алайда, заманауи мәтіннен-суретке модельдерді BF16 дәлдікте жұмыс істету шамамен 20-30 Гбайт бейнежадты талап етеді. Бұл көпшілік тұтынушыларға арналған графикалық үдеткіштер үшін қолжетімсіз жағдай туғызады. Мұндай мәселені жадты азайту арқылы шешуге арналған тиімді тәсілдердің бірі – кванттау. Diffusers кітапханасында bitsandbytes, GGUF, torchao және Quanto секілді бірнеше кванттау технологиялары қолданылған. Олардың көпшілігі салмақтарды ғана төмен дәлдікте сақтайды әрі есептеу уақытында жоғары дәлдікке қайта түрлендіреді. Бұл әдіс жадты осалытайды, бірақ есептеуді жылдамдатпай, кейде кідірісті арттырады.

Негізгі түсіндірме

Нунча́ку (Nunchaku) атаулы кванттау әдісі SVDQuant негізінде жасалған. Басқа әдістерден өзгешелігі – бұл тәсіл трансформердің негізгі қабаттарын 4-разрядты салмақтар мен активтендірулер (W4A4) арқылы жұмыс істетеді. Сол арқылы жад үнемделіп қана қоймай, тазарту (денойзинг) циклі тездетіледі. SVDQuant әдісі салмақ матрицаларының ең күрделі бөлігінің төмен дәрежелі 16-разрядты бөлігін бөлек сақтайды да, қалған бөлігін 4-разрядқа санайды. Бұл комбинация үлкен ауытқулары бар активацияларды тиімді өңдеуге мүмкіндік береді. Нунча́ку бұл процесті CUDA ядросында модельге арнайы үйлестірілген есептеу ядроларымен жеделдетеді. Бұрын бұл үшін жеке кітапхана қажет болды, бірақ жаңа Diffusers нұсқалары Nunchaku тұқымдас чекпойнттарды ештеңе компиляцияламай-ақ оңай жүктеуге мүмкіндік береді.

Нунча́ку Lite интеграциясы

Түпнұсқа Нунча́ку қозғалтқышы жоғары жылдамдықты архитектуралық оңтайландырулар негізінде жұмыс істейді. Бұл оңтайландырулар әр модельдің жеке құрылымымен тығыз байланысты болғандықтан, жаңа модельдерге қолдану қиындық тудырады. Нунча́ку Lite Diffusers кітапханасына қолданыстағы стандартты модель құрылымдарын өзгерту арқылы енеді. Ол nn.Linear модульдерін динамикалық түрде арнайы SVDQ/AWQ қабаттарымен ауыстырады. CUDA ядролары hubs-тен kernels пакеті арқылы автоматты түрде жүктеледі.

Ядролар және қолдау көрсетілетін жабдық

Екі негізгі ядро түрі қолданылады:

  • svdq_w4a4: 4-разрядты салмақтар мен активациялар, SVDQuant әдісінің артықшылықтары бар. Бұл ядро трансформердің назар және MLP қабаттарында қолданылады. Оған INT4 және NVFP4 нұсқалары кіреді.
  • awq_w4a16: 4-разрядты салмақтар және 16-разрядты активациялар. Бұл ядро адаптивті параметрлендірулер үшін қолайлы, себебі жоғары дәлдікті талап етеді және RAM қолдану көлемін азайтады.

NVFP4 нұсқасы тек NVIDIA Blackwell архитектурасына (RTX 50 сериясы, RTX PRO 6000, B200) үйлесімді. Ал INT4 нұсқалары Turing, Ampere және Ada сериялы графикалық үдеткіштер үшін жарайды. Volta және Hopper архитектуралары 4-разрядты ядроларды қолдамайды.

Контекст және мысалдар

Nunchaku Lite моделі көмегімен 1024×1024 өлшемдегі бейнені RTX 5090 графикалық картасында шамамен 1.7 секундта жасауға болады, бұл BF16 дәлдіктегі моделмен салыстырғанда жадыны екі есе үнемдейді – шамамен 12 Гбайт қолдану.

Модельді орнату қарапайым командалардан тұрады, мысалы, оталды Diffusers және kernels пакеттерін орнатып, алдын ала квантталған чекпойнтты жүктеу арқылы іске қосылады. Қолданушыларға қосымша арнайы кітапханалар орнатудың немесе жергілікті компиляция жасаудың қажеті жоқ.

Модельді кванттау және өз параметрлерін өзгерту

Қолданушылар Nunchaku Lite протоколымен жаңа архитектураларды кванттап, оларды Diffusers қоймалары ретінде жариялай алады. Бұл модель құрылымының түпнұсқадан өзгере қоймауына және басқа Diffusers мүмкіндіктерімен толық үйлесімділікке кепілдік береді.

Практикалық маңызы

Диффузиялық трансформерлердің есебін 4-разрядты кванттаумен оңтайландыру пайдаланушыларға жоғары сапалы генерацияны жұмсалатын жадыны 2 есеге дейін қысқартып, есептеу жылдамдығын арттыруға мүмкіндік береді. Бұл әсіресе шектеулі ресурстары бар графикалық үдеткіштер үшін маңызды. Сонымен қатар, технологияны тегін және ашық Diffusers экожүйесіне енгізу жасанды интеллект жүйелерін кеңінен таратуға ықпал етеді.

Nunchaku Lite Diffusers құралдарымен үйлесімді болғандықтан, қолданушылар LoRA модификациялары, жоспарлаушылар, offload әдістерін ақаусыз пайдалана алады. Әрі GPU архитектурасына сәйкес ядроларды таңдау арқасында кең аппараттық қолдауды қамтамасыз етеді.

Қазақ тіліндегі технологиялық салада мұндай құралдар жоқтың қасы болғандықтан, Nunchaku Lite моделі еліміздегі жасанды интеллект зерттеушілеріне және әзірлеушілерге тәжірибе жинау мен өз жұмысын жаңғыртуға мол мүмкіндіктер ашады.

Қорытынды

Nunchaku Lite 4-разрядты кванттау технологиясы көп ресурсты диффузиялық трансформерлерді әркімге қолжетімді етудің сенімді жолы. Оның басты ерекшелігі – жадты үнемдеу мен есептеуді жылдамдату, әрі Diffusers экожүйесіне жергілікті интеграция жасау мүмкіндігі. Бұл бастама жасанды интеллект саласындағы практикалық шешімдер қатарын кеңейтеді, әрі қуатты модельдерді әлдеқайда қолжетімді етеді.

TAGS: Нунча́ку, кванттау, диффузиялық трансформер, Diffusers, жасанды интеллект, жадты үнемдеу, CUDA ядролары

Дереккөз: Hugging Face Blog

Басқа жаңалықтар

Back to top button