Мақалалар

Granite 4.2 LLM: Құрылымы мен оқыту әдістері

Жасанды интеллект саласындағы ірі жетістіктердің бірі – үлкен тілдік модельдердің (LLM) дамуы. Granite 4.2 – IBM компаниясының салыстырмалы жаңа және қуатты тілдік модельдер отбасының мүшесі. Бұл модельдер негізінен шешім қабылдау қабілетін арттыруға бағытталған, яғни қарапайым сұрақтарға ғана жауап беріп қана қоймай, күрделі ойлау және мән-жайларды талдау дағдыларын дамытады. Бұл мақалада Granite 4.2 модельдерінің құрылымы, оның оқыту кезеңдері мен технологиялық ерекшеліктері кеңінен қарастырылады.

Granite 4.2 моделі туралы жалпы түсінік

Granite 4.2 – үш түрлі көлемдегі (3 миллиард, 8 миллиард және 30 миллиард параметрлік) тілдік модельдер тобы. Бұл модельдер тек декодерлік тығыз трансформер архитектурасында құрылған. Әрқайсысының негізгі архитектуралық элементтері мен оқыту әдістемесі бірдей, айырмашылығы – модель көлемі мен оқыту мәліметтерінің біртіндеп күрделенуі. Бұл модельдер алдын ала нөлден бастап оқытылады, яғни жаңа мәліметтер негізінде үйрету тәсілі қолданылады.

Архитектураның негізгі элементтері

Granite 4.2 моделі жоғары өнімділікке арналған декодерлік трансформерден тұрады. Онда дәстүрлі назар механизмінің орнына топтық сұраулы назар (GQA) қолданылады, оның басты ерекшелігі – ресурстарды тиімді пайдаланып, үлкен көлемдегі мәтіндерді өңдеу мүмкіндігі. Позициялық ақпарат алу үшін ротациялық позициялық ендірім (RoPE) пайдаланылады, ол максималды ұзындықтағы мәтінге (131072 токен) орынды түрде мән бере алады. Әр қабатта SwiGLU активациясы арқылы өңделетін көпқабатты персептрондар (MLP) қолданылады, сонымен қатар тұрақты нормализация (RMSNorm) қамтамасыз етіледі. Модельдің кіріс пен шығыс үшін жеке ендірімдері бар, бұл әртүрлі тапсырмалар шеңберінде икемділікті арттырады.

Оқыту кезеңдері

Оқыту бес негізгі кезеңнен тұрады. Алғашқы екі кезеңде кең ауқымды мәліметтерге негізделген негізгі оқыту жүргізіледі, мұнда түрлі ақпарат көздерінен алынған 15 триллион токен өңделеді. Ұзақ мәтінмен жұмыс істейтін модель жасауға басымдық беріліп, контекст ұзындығы 512 мың токенге дейін жетеді.

Қадағаланатын ұсақ оқыту (SFT)

Негізгі оқытудан кейін модельді нақты тапсырмаларға бағыттау үшін қадағаланатын ұсақ оқыту қолданылады. Бұл кезеңде шамамен 7,2 миллион мысалдан тұратын мәліметтер жиынтығы пайдаланылады, оның 31,6 пайызы агенттік әрекеттерге байланысты деректер, ал қалған бөлігі нұсқау орындау мен шешім қабылдау қабілеттерін жетілдіреді. Агенттік деректерге бағдарламалау, құралдарды қолдау, терминалмен жұмыс істеу, математикалық есептер мен ақпарат іздеу кіреді. Бұл деректер модельдің нақты ортада әрекет етуге және тапсырмаларды әртүрлі жағдайларда орындауға дайындығын арттырады.

Сапа бақылау және деректерді өңдеу

Деректер сапасын қамтамасыз ету маңызды кезең болып табылады. Әртүрлі көздерден келген мәліметтер OpenAI Chat форматына келтіріледі, бұл модельдің қарым-қатынас құрылымын және құралдармен өзара әрекетін стандарттайды. Сапасы төмен, қате ақпарат қамтитын немесе жарамсыз құралдарды шақыратын мысалдар автоматты және қолмен тексеру арқылы тазартылады. Сонымен қатар, деректердің қайталануы SHA-256 хеші бойынша жойылады. Бұл модельдің тұрақты және айқын нәтиже көрсетуіне мүмкіндік береді.

Екінші кезеңдегі арнайы ұсақ оқыту

30 миллиард параметрлік модельге арналған екінші ұсақ оқыту фазасында агенттік бағдарламалық код жазу траекторияларының үлесі арттырылады. Бұл кезеңде негізгі SFT деректерінің бір бөлігі қайталанып, модельдің нақты бағдарламалау тапсырмаларындағы тиімділігін жақсартады.

Контекст және мысалдар

Granite 4.2 модельдерінің артықшылығы – олар әртүрлі көлемде болуы және бірдей оқыту әдістерін қолдануы. Кіші модельдер де нұсқауды орындауда жоғары нәтиже көрсетеді, алайда 8 миллиард және 30 миллиард параметрлік үлгілерге агенттік оқыту кезеңі қосымша енгізілген. Бұл оларға нақты орталарда құралдарды қолданып әрекет етуге қабілет береді: мысалы, код жазу, оны орындау, терминалмен жұмыс істеу және веб-іздеулер жүргізу. Мұндай мүмкіндіктер модельді тек мәтінмен шектелмей, кешенді тапсырмаларды шешетін «агентке» айналдырады.

Практикалық маңызы

Granite 4.2 тілдік модельдерінің құралдарды бірдей ортада қолдай алуы және біріктірілетін интерфейстер арқылы басқа жүйелермен оңай байланысуы – оларды түрлі өнеркәсіп саласына икемді ете түседі. Мысалы, бағдарламалау, техникалық қолдау, ақпарат іздеу және талдау жұмыстарында олар адаммен ынтымақтаса отырып, өнімділікті арттыра алады. Модельдің «ойлану» және «ойланбау» режимдерінің болуы күрделі және жеңіл тапсырмаларды тиімді орындауға мүмкіндік береді, ал аз күш жұмсайтын арнаулы режим жеңіл сұрақтарды тез шешуге бағытталған.

Қорытынды

Granite 4.2 – табиғи тілде ойлау, талдау және агенттік әрекет жасау қабілеттері бар қазіргі заманғы үлкен тілдік модельдер үлгісі. Оның арнайы архитектурасы, көпсатылы оқыту әдістері мен сапа бақылау жүйелері оған күрделі мәселелерді шешу мүмкіндігін береді. Түрлі көлемдегі үлгілерінің болуы әрі олардың арнайы агенттік оқыту кезеңімен толықтырылуы Granite 4.2 тілдік модельін әртүрлі қолдану салаларына ыңғайлы әрі тиімді етеді.

Дереккөз: Hugging Face Blog

Басқа жаңалықтар

Back to top button