Құнды ақпаратты масштабта тиімді тарату әдісі

Үлкен тілдік модельдерді қысқарту және оларды кішірейтілген, тиімді нұсқаларға айналдыру бүгінгі машиналық оқыту саласында аса қажет тақырыптардың бірі. Жасанды интеллектің дамуымен бірге модельдердің параметрлері көбейіп, күрделілігі артты. Мұндай модельдерді қолдану және олардың мүмкіндіктерін сақтай отырып кішірейту қымбат әрі талапшыл процесс. Бұл мақалада сіздерге білімді тарату әдісінің (knowledge distillation) шығындарын азайтуға бағытталған жаңа тәсілдер мен олардың практикалық маңыздылығын түсіндіреміз.
Кіріспе
Үлкен тілдік модельдер – GPT, Qwen, GLM сияқты алгоритмдердің параметрлері миллиардтаған өлшемге жетеді. Бұл модельдерді зерттеу, оқыту және қолдану үшін көп көлемдегі есептеу ресурстары қажет. Мұндай кезде білімді тарату әдісі тиімді тәсіл болып табылады. Оның көмегімен үлкен және күрделі «ұстаз» моделі ең маңызды ақпаратты «студент» моделіне береді, ол аз ресурсты талап етеді әрі жылдамырақ жұмыс істейді. Десе де, дәстүрлі әдістер өте көп компьютерлік жады мен есептеу қуатын қажет етеді, сондықтан қолдану ауқымы шектеулі болды.
Негізгі түсіндірме
Білімді тарату дәстүрлі әдісі бойынша ұстаз бен студент модельдері бір мезгілде жұмыс істейді. Әрбір қадам сайын ұстаз толық болжамдық үлестірімді есептейді, ал студент оған сәйкес болуға тырысады. Мұнда кең сөздік пен ұзын мәтін қатары есептеу ресурсын шектейтін басты сәт болып табылады. Мысалы, GPT-OSS-120B моделінің сөздігі 201 мыңнан астам токеннен тұрады. Егер мәтін ұзындығы 32 768 болса және пакет көлемі 4 болса, қажетті жады бір ғана болжамдық вектор үшін 50 ГБ-қа жуық болады. Осы сияқты факторлар есептеу мен жадының шектен тыс көп жұмсалуына алып келеді.
Жаңа зерттеу екі негізгі жүйелік өзгерісті ұсынады. Біріншісі – ұстаздың болжамдарын бір рет есептеп, ең ықтимал 100 токеннің логиттерін ғана сақтау. Бұл ұстаз моделі оқыту кезінде жадыда жоқ болады дегенді білдіреді. Екіншісі – есте сақтау тиімділігін арттыратын жаңа Кульбек-Лейблерлік дивергенцияның (KL) шығын функциясы, ол үлкен көлемді толық торды құрастырмай, есептеуді бөліктерге бөледі. Осы тәсіл екі өзгеріс бірігіп есептеу жүктемесін едәуір төмендетеді және ұзақ мәтіндік контекстілермен тиімді жұмыс істеуге мүмкіндік береді.
Контекст және мысалдар
Тәжірибелік сынақтар үш нұсқада KL шығын функциясын салыстырды: дәстүрлі толық торы бар “Dense KL”, алдын ала ғимаратталған бөліктер бойынша есептейтін “Forward-chunked KL” және авторлар ұсынған “Fused chunked KL” әдісі. Соңғысы модельдің шығару қабатын есептеуді шығын функциясына біріктіріп, әрбір мәтін бөлігін жеке өңдейді және жадыда толық торды сақтамайды. Нәтижеде жад пайдалану көлемі линейлік өседі, ал дәстүрлі әдісте ол өте күрт артады.
Мысалы, 8 мың токендік контексті бар Llama 3.1 8B ұстаз моделі мен 3.2B студент модельмен онлайн білімді тарату әдісі 103 ГБ жадыны қажет етсе, fused chunked KL 58 ГБ-ты пайдаланады. Сонымен қатар, уақыт пен өнімділік көрсеткіштері де жақсарды. Ұзын контексттерде (32 768, 256 000 токен) fused chunked KL жады көлемін 15 есе төмендетіп, үлкен модельдерді тек бір GPU арқылы оқытуға мүмкіндік берді.
Практикалық маңызы
Білімді тарату процессінің жылдамдығы мен ресурстық шығындары азайған сайын, үлкен тіл модельдерді кең көлемде зерттеп, қолдану оңтайланады. Бұл тәсіл модульдік және жылдам тәжірибе жасауға, әртүрлі бағытта сынақ жүргізуге, әрі нақты жобаларда шағын әрі тиімді шешімдерді жүзеге асыруға жол ашады. Мысалы, GPT-OSS 20B моделін ұзақ контексті қолдайтын қысқарған нұсқасын оқыту үдерісі төрт GPU кластерінен тек бір GPU-ға ауысып, уақыт пен шығындарды айтарлықтай қысқартты.
Осының бәрі жасанды интеллект жобаларының қолжетімділігін кеңейтіп, тілдік модельдерді өзекті әрі үнемді пайдалану жолын дамытады.
Қорытынды
Үлкен тілдік модельдерден алынған білімді тиімді әрі үнемді тарату маңызды міндеттердің бірі. Ұсынылған офлайн кешігулер мен сығынды есептеу тәсілдері қайталанатын ұстаз моделін жүктеуді жою арқылы жад пен есептеу шығынын азайтады. Жаңа KL шығын функциясының фьюзделген сығынды нұсқасы үлкен контексттерде жұмыс істеуді жеңілдетіп, ресурстарды үнемдейді. Бұл әдістер үлкен тіл модельдерінің мүмкіндігін сақтай отырып, оларды практикада кеңінен қолдануға жол ашады.
TAGS: білімді тарату, тілдік модельдер, есептеу ресурстары, жасанды интеллект, KL шығын функциясы, масштабтау, тиімділік
Дереккөз: Hugging Face Blog



