Мақалалар

Олмо-core 3: ірі мамандықтардан тұратын үлкен модельдерді ашық және кеңейтілетін оқу инфрақұрылымы

Жасанды интеллект саласында үлкен тілдік модельдерді даярлау қиын әрі ресурсты көп талап ететін процесс. Мұндай модельдер деректерді өңдеу мен үйрену үшін аса көп есептеу қуатын қажет етеді, бұл олардың көптеген зерттеу орталықтары мен жеке зертханалар үшін қолжетімсіз болуына себепші. Бұл жағдайды шешу мақсатында мамандар арнайы мамандықтардан құралған, яғни әртүрлі тапсырмаларға маманданған бөлімшелері бар модельдерді – MoE (mixture-of-experts) – дамытты. Olmo-core 3 инфрақұрылымы дәл осы үлкен MoE модельдерін тиімді әрі кеңейтілетін түрде даярлауға арналған жүйенің жаңа буыны ретінде ұсынылды.

MoE модельдері мен Olmo-core 3 жүйесінің маңызы

Мамандықтардан тұратын үлгілердің негізгі артықшылығы – әрбір мәтіндік бөлікті өңдеу үшін модельдің барлық параметрлері қолданылмайды, тек қажетті мамандар ғана белсенді болады. Бұл есептеу шығындарын азайтып, үлкен параметрлер санын барынша тиімді пайдалануға мүмкіндік береді. Алайда, үлкен көлемдегі MoE модельдерін әзірлеу кезінде мамандардың жадтағы үйлестіруі, дұрыс мамандарға кіріс деректерін бағыттау сияқты мәселелер туындайды. Olmo-core 3 жүйесі осы қиындықтарды шешуге бағытталып, үлкен параметрлі MoE модельдерін тиімді басқаруға және оңтайлы үйретуге мүмкіндік береді.

Жүйенің архитектуралық жаңалығы

Алдыңғы Olmo нұсқаларының бірі – Olmo 3, барлық параметрлері белсенді тығыз модель архитектурасын пайдаланған, бұл әрбір жазбаға тең мөлшерде есептеу ресурсын жұмсауға алып келген. Ал Olmo-core 3 MoE архитектурасына бейімделіп, мамандар санын 8-ден 128-ге дейін арттыра отырып, әрбір жазбаға белсенді төрт маман ғана таңдауды қамтамасыз етеді. Бұл тәсіл бір жазбаға жұмсалатын параметр санын шамамен 3,2 миллиард параметр мөлшерінде ұстап, жалпы параметрлер санын 4,6 миллиардтан 47 миллиардқа дейін ұлғайтуға мүмкіндік береді. Әрбір топта өңделетін жадтың мөлшері мен есептеу қуаты тиімді үйлестірілген.

Модельдерді масштабтау және оңтайландыру әдістері

Olmo-core 3 жүйесінде үлкен MoE үлгілерін бірнеше әдіспен бөлу арқылы бөлек есептеу құрылғыларына тарату жүзеге асады. Біріншісі – мамандардың бөлімшендерін (эксперттерді) түрлі GPU-ларға тарату, осылайша әрбір құрылғы тек өзіне бекітілген мамандардың ақпаратын сақтайды. Екіншісі – модельдің қабаттарын топтарға бөліп жүргізу, бұл GPU жадында бір уақытта ұсталынаратын көлемді азайтады. Үшіншісі – оқу үдерісінде параметрлерді жаңартатын ақпаратты барлық құрылғыларға түгел емес, таратып сақтау арқылы жадты үнемдеу.

Деректерді бағыттау және есептеуді оңтайландыру

Деректерді дұрыс мамандарға жедел әрі тиімді жөнелту үшін Olmo-core 3 мынадай технологияларды пайдаланады: бағыттау операциялары GPU жадысында орындалып, CPU-ның күтімін азайтады; мамандардың кіріс буферлеріне деректерді тура орналастыру арқылы артық өңдеуді қысқартады; бірнеше кіші есептеулер топтап, GPU ресурстарын тиімді пайдалануды арттырады. Сонымен қатар, жүйе төмен дәлдіктегі MXFP8 форматымен жұмыс істей отырып, есептеу жылдамдығы мен жад көлемін азайтуға мүмкіндік береді. Бұл тәсіл есептеу нәтижесінің дәлдігін тым төмендетпей, жауап беру уақытын оңтайландырады.

Үлкен параметрлік модельдерге жету және нәтижелер

Нақты сынақтарда Olmo-core 3 жүйесі NVIDIA B300 GPU-ларында 1,2 триллион параметрлі MoE моделін іске қосып, әр GPU-ға шаққанда 85,8 триллион операция секундына (TFLOP/s) өлшенетін есептеудің жоғары жылдамдығын көрсетті. Бұл деңгей үлкен тілдік модельдерді ыңғайлы әрі жылдам үйретуге мүмкіндік береді. Басқа зерттеулер барысында 2,38 триллион параметрге дейінгі эксперименттер жүргізіліп, жүйенің ауқымдылығы мен үлгілігін көрсетті. Бұл сынақтар жүйенің тек техникалық мүмкіндіктерін анықтап, толық оқытудың тиімділігін саралауға септігін тигізді.

Модельді оқытудағы маңызды тәжірибелер

Olmo-core 3 инфрақұрылымы дамытылу барысында мамандар бірнеше маңызды байламдарға жетті. Мысалы, біртекті жүктемені сақтауға бағытталған көрсеткіштер кей жағдайда қисынды нәтиже бермей, кейбір мамандардың жүктемесі шынайы теңгерілмей қалатындығы байқалынды. Оқыту үдеуінің қарқынын кей мамандар үшін төмендету әсері зерттеліп, қолданылған модельдерге байланысты нәтиже бермегені анықталды. Сонымен қатар, есептеулердің нақты уақыты ұсынылған деректерге байланысты өзгеріп, бұл өнімділікті салыстыруда қосымша факторларды ескеруді талап етті. Коммуникация мен есептеуді GPU ағындарында қатар орындау кейде жылдамдықты арттырмай, керісінше бәсеңдеткенін көрсетті. Осы тәжірибелер жүйенің жұмысын терең түсінуге және одан әрі жақсартуға бағытталды.

Қорытынды

Olmo-core 3 жүйесі – үлкен көлемді мамандардан тұратын модельдерді оқытуға арналған технологиялық шешім, ол OpenAI Olmo жобасының келесі буынын қолдайды. Бұл жүйе ашық әрі икемді болып, зерттеушілер мен әзірлеушілерге өздерінің MoE модельдерін дамытуға, әртүрлі аппараттарға бейімдеуге және маршрутизация мен параллелділікті реттеуге мүмкіндік береді. Olmo-core 3 қызметінің нәтижесі ірі тілдік үлгілерді жазатын жылдамдық пен тиімділікті арттырып, жасанды интеллекттің дамуына тың серпін береді.

TAGS: жасанды интеллект, MoE, үлкен модельдер, Olmo-core 3, GPU, оқу жүйелері, масштабтау

Дереккөз: Hugging Face Blog

Басқа жаңалықтар

Back to top button