Мақалалар

LFM2.5 Q4_0 контролдық нүктелері: сандықталуға бейімделген дистилляция әдісі

Жасанды интеллекттің дамуы үлкен үлес қосып отырған тілдік модельдердің тиімділігі мен жылдамдығын арттыру маңызды мәселеге айналған. Осы тұрғыда LFM2.5 Q4_0 санатындағы жаңартылған бақылау нүктелері Quantization-Aware Distillation (Сандықталуға бейімделген дистилляция) әдісі арқылы ұсынылды. Бұл технология өнеркәсіптегі қолданбаларда үлкен модельдерді жеңіл құрылғыларда қолдануды жеңілдетіп, есептеу қуатын ұтымды пайдалануға мүмкіндік береді.

Quantization-Aware Distillation әдісі және LFM2.5 Q4_0 контролдық нүктелері

Сандықталуға бейімделген дистилляция (QAD) – бұл жоғары дәлдікті мұғалім (teacher) моделінен сандықталған оқу моделі арасындағы білімді тиімді қайталау әдісі. Осы тәсіл арқылы LFM2.5 моделінің 230 миллионнан 2,6 миллиардқа дейінгі түрлі көлемдеріндегі төрт нұсқасы 4-биттік нұсқаға өзгертілді. Нәтижесінде, жад пен жылдамдық бойынша Q4_0 денгейінде жұмыс істесе де, бастапқы жоғары сапа деңгейінен айтарлықтай айырмашылық байқалмайды. QAD Q4_0 бақылау нүктелері кванттаудан кейін жоғалған BF16 деңгейіндегі дәлдіктің 97% қайта қалпына келтірілген.

Контекст және үлгілер: бағалау және салыстыру

Тестілеу бірқатар күрделі бағалау жиынтығында жүргізілді. Оған логикалық пайымдау, нұсқауларды орындау, құралдарды пайдалану және агенттік қабілеттерді бағалайтын бірнеше тесттер (GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF және BFCLv4) енгізілген. Сонымен бірге, LFM2.5-230M және 350M үшін GSM8K математика тесті, ал 1.2B мен 2.6B нұсқалар үшін AIME25 математика бағалау тапсырмасы қолданылды. Бес рет қайталанып алынған орташа нәтижелер QAD әдісінің барлық модельдерде Q4_0 бақылау нүктелерін айтарлықтай жақсартатынын көрсетті. Бұл модельдер сәйкесінше BF16 бастапқы деңгейінің 96-97% аралығында өнімділікті сақтады.

Жылдамдық және өлшем жағы

LFM2.5 төрт моделі әртүрлі аппараттық платформаларда, соның ішінде MacBook Pro мен NucBox EVO-X2 (GPU есептеу), Samsung Galaxy S26 Ultra және Raspberry Pi 5 (Arm CPU орындау) құрылғыларында жылдамдығы тексерілді. Жан-жақты өлшеулер көрсеткендей, 230М және 350M QAD Q4_0 моделдері Q5_K_M сапасымен салыстырғанда 4-33% жоғары жылдамдық көрсетті. 1.2B және 2.6B QAD Q4_0 модельдері де Q4_K_M форматына сәйкес келіп, 3-14% жылдамырақ жұмыс жасады. Бұл көрсеткіштер басқа постоқыту негізіндегі сандықталу нұсқаларына қарағанда да бәсекеге қабілетті екенін дәлелдеді.

QAD GGUF файлдарын пайдалану әдісі

QAD Q4_0 форматындағы GGUF файлдары llama.cpp немесе GGUF Q4_0 қолдайтын кез келген іске қосу ортасында пайдалануға лайықталған. Мысалы, LFM2.5-350M моделі іске қосқанда келесі команда қолданылады:

llama-cli -hf LiquidAI/LFM2.5-350M --hf-file LFM2.5-350M-QAD-Q4_0.gguf -p "What is C. elegans?"

Бұл әдіс модельдерді жылдам әрі тиімді іске қосуға, аппараттық ресурстарды үнемдеуге мүмкіндік береді.

Практикалық маңызы

LFM2.5 Q4_0 контролдық нүктелері есептеу қуаты шектеулі құрылғыларда жоғары сапалы тілдік модельдерді қолдану мүмкіндігін айтарлықтай кеңейтеді. Артық жад пен қуат көзін қажет етпейтін бұл технология мобильді құрылғылардан бастап шағын серверлерге дейін әртүрлі платформаларға оңтайлы келеді. Сандықталуға бейімделген дистилляция арқылы сапа мен жылдамдық арасындағы баланс сақталып, қолданушыларға нақты уақыттағы интерактивті тапсырмаларды шешуде қосымша жеңілдік ұсынады.

Қорытынды

LFM2.5 Q4_0 бақылау нүктелерінің сандықталуға бейімделген дистилляция әдісімен жаңартылуы есептеу ресурстарын тиімді пайдалану мен модельдердің өнімділігін арттыру мәселелерін шешудің өзекті үлгісі. Бұл шешім көптеген салаларда, әсіресе шекаралық есептеулер мен мобильді құралдарда жасанды интеллекттің қолжетімділігін жаңа деңгейге жеткізеді.

Дереккөз: Hugging Face Blog

Басқа жаңалықтар

Back to top button