AI модельдерінің интеллект сынақтарындағы қателіктері. Сіз үздік нәтиже көрсете аласыз ба?

Кіріспе
Жасанды интеллект (AI) саласындағы жетістіктерді бағалаудың бір тәсілі – әртүрлі жұмбақтар мен ойындар арқылы модельдердің қабілетін тексеру. Адамдар өз ақыл-ойын сынағанда кроссвордтар мен логикалық тапсырмаларды қолданатын сияқты, әзірлеушілер де AI-дің дамуын ойындар арқылы байқайды. Еңбек машиналық оқыту терминін алғаш рет 1959 жылы IBM компьютер ғалымы Артур Самуэл жариялаған мақалада қолданған, онда ол шашканы үйренетін алгоритмді сипаттаған. Бұдан бастап шахмат пен қытайдың го ойыны сияқты күрделі ойындар да AI-дің дамуын тексеру құралына айналды. Бұл мақалада AI модельдерінің интеллект сынақтарында кездесетін қиындықтары мен адам ақыл-ойымен салыстырғанда олардың шектеулері мен артықшылықтары сарапталады.
Негізгі түсіндірме
AI модельдері жұмбақтарда тез дамығанымен, олар әртүрлі типтегі сынақтарда әлі де қатты қате жіберетін тұстар бар. Модельдердің дұрыс шешу қабілеті байқалатын тапсырмалар арасында кеңістік пен кеңістік-бағытталған пайымдау, есте сақтау мен бейімделу, абстрактілі және визуалды түсінік, сондай-ақ интуиция бөліктері бар.
Жиһазды ауыстырып қарау (кеңістік пайымдау)
Адамдар үшін кеңістіктік пайымдау ерекше маңызды саналады. Мысалы, интеллект тесттеріндегі ең танымал тапсырмалардың бірі – ментальдық айналдыру, яғни нысандардың түрлі бұрыштардағы бейнелерін салыстыру. Қазіргі тілді модельдер визуалды ақпаратты өңдей алса да, үш өлшемді нысандарды ментальды түрде айналдыра алу қабілеті төмен. Бұл модельдердің архитектура мен механикалық инженерия саласындағы кеңістіктік ойлаушылардан біршама төмен тұратынын көрсетеді.
Есте сақтау және бейімделу
Үлкен тілдік модельдердің (ҮТМ) есте сақтау қабілеті өте жоғары. Оларды оқыту кезінде көлемді мәліметтер алынғандықтан, олар көптеген фактілерді дәл қайталап береді. Дегенмен, бұл кейде теріс әсер етуі мүмкін–егер жұмбақ оқу кезінде кездескен тапсырмаларға ұқсас болса, модель негізгі айырмашылықтарды өткізіп, бұрын жаттап алғанын қайталайды. Мысалы, 2024 жылы Google мен Иллинойс Университеті бірлесіп өткізген зерттеуде “Рыцарьлер мен өтірікшілер” деген классикалық жұмбақтың кішкене өзгерістеріне модельдер қиындық көрді. Бұл жұмбақта кейбір кейіпкерлер үнемі шын айтады, ал басқалары үнемі өтірікші болады. Адамдар жаттықтырылған модельдерге қарағанда бұл айырымды жеңіл табады.
Абстрактілі және визуалды пайымдау
AI модельдері тек үш өлшемді емес, екі өлшемді визуалды тапсырмаларда да қателіктер жібереді. Ең танымал тесттерден бірі – ARC-AGI, ол әртүрлі ұяшықтардан құралған торлардағы ережелерді анықтап шешуді талап етеді. Модельдер визуалды бейне ретінде емес, санды код түрінде алынған деректер арқылы жақсырақ жауап береді, бірақ олардың қол қойған шешімдері принициалды және әмбебап емес, қарапайым визуалды түсініктерге сүйенетін адам пайымына қарағанда күрделі әрі бірізді емес. Осыған қарамастан, модельдер ARC-AGI тапсырмалардың көпшілігін шешуші деңгейге жетті, алайда тағы да кейбірі қиындық туғызады.
Интуиция және адамның когнитивтік ерекшеліктері
Адамдар кейде интуитивті қателіктерге жиі ұрынады, бірақ AI модельдері сирек кездесетін мұндай “импульсивті” қателіктерді бере қоймайды. Психологтар әзірлеген арнайы тест топтамалары (мысалы, Lightning Round) адамдардың жылдам жауап бергенде қателесуі мүмкінін көрсетеді, ал модельдер мұндайда саналы әрі ұстамды мінез танытады.
Контекст және мысалдар
Жоғарыда аталған тапсырмалар әртүрлі зерттеулер нәтижесінде алынған. Мысалы, Columbia University-дің ғалымдары New York Times газетінде жарияланатын Connections түріндегі логикалық жұмбақтардың AI тарапынан өте нашар шешілетінін байқады, бірақ 2025 басында кейбір модельдер оны мүлтіксіз шешіп шықты. Apple зерттеуі LLM модельдердің Tower of Hanoi және өзеннен өту сияқты қарапайым логикалық тапсырмаларды жақсы орындағанын көрсетті, бірақ тапсырмалар күрделенген сайын олардың қателігі артқан.
Есте сақтау және бейімделу зерттеулері Google және Иллинойс университетінен алынған, онда алдыңғы қатарлы модельдердің кішігірім өзгертулерге тым сіңіп кеткеніне назар аударылған. Сондай-ақ, Stanford University мен Allen Institute for AI бірлесе отырып, логикалық торлардағы жұмбақтардың шешуіндегі шектеулерді анықтады. Бұл зерттеулер жалпы AI интеллектінің дамуының негізгі күрделілігін көрсетеді.
Практикалық маңызы
Жұмбақтар мен логикалық тапсырмалар AI-дің нақты когнитивтік мүмкіндіктерін диагностикалау құралы ретінде қызмет етеді. Олар модельдердің қай бағытта әлсіз екенін және қайсысы адам ойлауынан өзгеше жұмыстар атқаратындығын анықтауға мүмкіндік береді. Бұл технологияны жетілдіруде маңызды ақпарат береді, әсіресе кеңістіктік пайымдау, бейімделу және визуалды түсінікті жақсарту тұрғысынан. Білім және робот техникасы саласында AI-дің осы аспектілерін жетілдіру қажеттігі маңыздылығын арттырады.
Сондай-ақ, осы тесттер арқылы адамдар өз интеллект деңгейін салыстыра алады. Егер адам жұмбақтарды моделдерден жақсы шешсе, ол өздерінің мығым ойлау қабілетіне сенімді бола алады. Бұл AI дамуындағы бірқатар қиындықтарды көрсетеді және адамның ерекше логикасы мен интуициясының маңызын еске салады.
Қорытынды
AI модельдері логикалық тапсырмаларда және жұмбақтарда айтарлықтай ілгерілейді, бірақ кейбір күрделі немесе визуалды тапсырмаларда әлі де қиындықтарға ұшырайды. Адам ойлауының ерекшеліктері мен интуициясы оларды кейбір есептерде әлі де үздік етеді. Бұл айырмашылықтар AI жүйелерін жетілдіру шаралары үшін маңызды бағыттарды анықтайды. Сондықтан, жұмбақтарды қолдану арқылы модельдердің күшті және әлсіз тұстары айқындалады, әрі осы білім технологиялардың әрі қарай даму жолын айқындауда әсерлі құрал болып қала береді.
Дереккөз: MIT Technology Review



