Мақалалар

Quantization-Aware Healing: 4 биттік сығылған модельдің толық дәлдіктегі түпнұсқадан асып түсуі

Кіріспе

Үлкен тілдік модельдерді жеңілдету және тиімді пайдалану мақсатында оларды ықшамдау әдістері кең тараған. Модельдің көлемін азайту есептеу ресурстарын үнемдеп, қолдану жылдамдығын арттырады. Алайда параметрлер санының қысқаруы мен модельді төмен дәлдікке (мысалы, 4 битке) кванттау оның функционалдық қабілеттеріне, әсіресе күрделілігі жоғары тапсырмаларда, кері әсерін тигізеді. Осыған байланысты модельді ықшамдаудан кейінгі сапасын қалпына келтіру, яғни “жөндеу” кезеңі талап етіледі. Quantization-Aware Healing (QAH) — осы мәселені шешуге бағытталған жаңа тәсіл, оның нәтижесінде сығылған 4 биттік модель өзінен бұрынғы толық дәлдікке ие нұсқасынан жоғары өнімділік көрсетеді.

Негізгі түсіндірме

Кәдімгі ықшамдау және кванттау әдістері үш кезеңнен тұрады: архитектураны ықшамдау, параметрлерді төменгі дәлдікке кванттау және соңында модельдің қабілетін қайта қалпына келтіру. Қалпына келтіру кезеңі көбінде Quantization-Aware Training (QAT) әдісімен іске асады, ол модельді төмен дәлдікке бейімдеу үшін қосымша оқыту жұмыстарын жүргізеді. Алайда QAT әдісі қаржылай және есептеу тұрғысынан қымбат, әрі жаттықтыру ұзаққа созылғанда тұрақсыздық мәселесін туындатады. Басқа балама — Quantization-Aware Distillation (QAD), мұнда толық дәлдіктегі мұғалім модельдің алдын ала жаттықтырылған нұсқасынан арнайы шығыс логиттерін пайдаланып, сығылған әрі квантталған “оқушы” моделін үйретеді. Бірақ архитектуралық ықшамдау өткен жағдайда толық дәлдік нұсқасы болмайды, сондықтан мұғалім негізінен әлсіреген қалпына келтірілген нұсқаға негізделеді. Бұл әдіс оқушының мүмкіндіктерін шектейді.

QAH әдісінің басты айырмашылығы — көмейдің орнына түпнұсқа толық дәлдіктегі үлкен мұғалім модельден тікелей дистилляция жүргізу. Мұғалім және оқушы архитектурасы әртүрлі; мұғалім үлбір параметрлер санымен толық дәлдік, ал оқушы — ықшамдалған және 4 биттік квантталған модель. Мұғалімнің шығатын таралымы архитектураға тәуелсіз болғандықтан, мұндай айырмашылық оқу процесіне кедергі келтірмейді. Сондай-ақ, QAH-да кванттау қателігін түзетуге емес, бастапқы ақпаратты толық қалпына келтіруге бағытталған қосымша бақылау ретінде қарастырылады, бұл бұрынғы қалпына келтіру кезеңінің шектеулерін өтеді.

Контекст және мысалдар

Мысал ретінде GPT-OSS 120B моделінің 60B параметрлік нұсқасына ықшамдау және MXFP4 форматында 4 биттік кванттау қолданылды. QAH әдісі арқылы алынған модель 9 түрлі тестілеу тапсырмасынан 7-сінде өзінің толық дәлдікке ие нұсқасынан айтарлықтай артық нәтиже көрсетті. Ең үлкен жетістіктер ұзақ контекстілік логикалық есептер мен математикалық тапсырмаларда байқалды. Модель өзі шыққан үлкен әрі толық дәлдік мұғалім модельмен салыстырғанда бірқатар тапсырмаларында бәсекеге қабілетті немесе одан жақсы нәтиже көрсетті. Бұл ықшамдалған модельдің өнімділігінің тек көлемімен және бит санымен ғана емес, білімді ұтымды қайта бөліп жүргізумен де анықталатынын дәлелдейді.

QAH әдісі QAT-пен де салыстырылды. 9B параметрлік GPT-OSS модельді MXFP4-ке кванттау кезінде QAH жылдам әрі тұрақты жетістіктерге жетсе, QAT әдісі ұқсас дәлдікке ұзақ уақыт және сенімсіздікпен жетіп, кейінірек өнімділігін айтарлықтай жоғалтады. Бұл айырмашылықтар нақты өндірістік қолдануда маңызды мәнге ие.

Практикалық маңызы

Қысқартылған әрі төмен дәлдікке ие модельдердің нақты міндеттерді шешу қабілетін жоғарылату QAH әдісі арқылы жүзеге асады. Бұл үлкен тілдік модельдерді есептеу ресурстары шектеулі ортада немесе жылдамдық пен үнемділікті талап ететін сервис қызметтерінде кеңінен пайдалануға мүмкіндік береді. QAH тәсілі арқасында ықшамдалған және 4 биттік квантталған модельдер тиімді әрі сенімді жұмыс істей алады, ал ресурстар үнемделеді және өнімділік жоғарлайды. Осындай тәсілдер жасанды интеллект жүйелерін практикалық тұрғыда кең ауқымда енгізуге жол ашады.

Қорытынды

Quantization-Aware Healing — ықшамдалған және төмен дәлдікке квантталған модельдер сапасын жоғарылатудың тиімді жолы. Ол мұғалім-модель ретінде толық дәлдік және толық параметрлік бастапқы нұсқаны пайдаланып, оқушыға ақпаратты жоғары деңгейде бере алады. Бұл әдіс кең тараған healing тәсілдеріндегі шектеулерді еңсеріп, 4 биттік үлгілердің толық дәлдік моделінен асып түсуіне мүмкіндік жасайды. Нәтижесінде, тек ұсақталған ғана емес, өнімділігі мен дәлдігі де жоғары модельдерді іске қосу қолжетімді болады.

TAGS: кванттау, тілдік модельдер, ықшамдау, жасанды интеллект, дистилляция, GPT, есептеу тиімділігі

Дереккөз: Hugging Face Blog

Басқа жаңалықтар

Back to top button