Өзін-өзі бағалау жүйесін жетілдіру мәселесі сөйлеуді тану саласында

Сөйлеуді тану технологиясының дамуы өміріміздің әртүрлі саласында маңызға ие болып отыр. Алайда, диагностикалық сынақтардағы көрсеткіштер нақты әлемдегі нәтижелерді толық көрсетуі қиын. Себебі, көпшілікке ашық және жиі қолданылатын сынақтар жүйелерді тестілеуге бейімдеуге әкеледі. Бұл жағдайда жүйелер шынайы тапсырмадан гөрі, тестілік мәліметтердің үлгілерін тануда жақсы нәтиже көрсетеді. Мұндай құбылыс сөйлеуді тану саласында жүйенің тиімділігін бағалауда арнайы әдістерді талап етеді.
Сөйлеуді танудағы сынақтарды оңтайландырудың мәні
Сөйлеуді тану жүйелерінің көпшілікке қолжетімді сынақтары модельдердің адам дәрежесіндегі көрсеткіштерге жеткенін көрсетеді. Бірақ бұл көрсеткіштер жүйенің нақты пайдаланудағы қабілетін толық сипаттамайды. Сынақта жақсы нәтиже көрсету үшін жүйелер тек жобаланған тапсырманы шешуде ғана емес, сол сынақтың ерекшеліктерін тануға үйренеді. Нәтижесінде олар шын мәніндегі сөйлеуді тану сапасынан асып түсетін әсер қалдырады. Классикалық сынақтардың көпшілігі дауыс жүйесінің табиғи, сенімді және тиімді болуын анықтайтын түрлі жағдайлар мен ерекшеліктерді ескермейді.
Осындай кемшіліктерді жою мақсатында Real World VoiceEQ, Open-ASR Leaderboard және Far-field ASR Leaderboard сынақтары енгізілген. Бұл сынақтар нақты өмірдегі қажеттіліктерді ескеріп, жүйелерді жан-жақты бағалайды. Дегенмен, сынақтарды кеңінен жүргізу өздігінен мәселелерді шешпейді.
Мысалдар: VoxPopuli жүйесіндегі қате аудармалар
VoxPopuli жиыны транскрипция қателері көп болатын негізгі сынақтар қатарында саналады. Оның негізінде жасалған талдауда танымал 11 ашық бастапқы коды бар автоматтандырылған сөйлеуді тану (АСР) моделінің көрсеткіштері тек аудио мәліметті нақты қайтаратын емес, сынақтық транскрипцияның қателігін де қайталайтыны анықталған. Кейбір жағдайларда модельдер аудиода жоқ сөздерді қосады немесе мағына тұрғысынан екі дұрыс нұсқаның арасынан сынаққа тән нұсқаны таңдайды.
Бұл жағдайда модельдер қате нұсқаларды қайталайды, не өзгеше дауыстық сигналдарға сүйеніп, оларды қай сынаққа бағынышты екенін белгілейді. Мысалы, VoxPopuli-дағы бір аудиожазбада «Thank you, Mr. President» сөзі анық естілсе де, ресми транскрипциядан «Thank you» сөзі алынып тасталған. Ал тиісті модельдердің жартысынан көбі сынақтағы қате нұсқаны қайталайды. Сонымен қатар, осындай модельдер сынаққа тән тыныс белгілері мен жазу үлгісін де қайталайды.
Мұндай мінез-құлық зерттеліп, жаңа дауыс үлгілерінде күшеюі жоқ не мүлдем жоғалғаны байқалған. Бұл жүйелердің сөйлеуді тану тапсырмасын орындауда ғана емес, сынаққа тән дыбыстық дауыстық ерекшеліктерге де бейімделетініне дәлел.
Практикалық маңызы және қолданылуы
Жүйенің шынайы сөйлеуді тану сапасына сену үшін олардың сынақтық көрсеткіштерін ғана емес, нақты әлемдегі мінез-құлқын да бағалау қажет. Жасалған зерттеулер көрсеткендей, сөйлеген сөздің арнайы сынақ талабына бейімделуі жүйенің жалпы нәтижесіне теріс әсер етуі мүмкін. Бұл кемшілік әсіресе дауыс көмекшілері, транскрипция және автоматты мәтінге көшіру қызметтерінде айқын көрінеді.
Қазіргі сынақтардың жеткіліксіздігінен туындайтын мәселелерді шешу үшін жаңа сынақ әдістері жасалды. Олардың бірі — жаңа дауыс топтамаларын пайдалану арқылы модельдердің аудиодан тыс дауыстық ерекшеліктерге тәуелділігін азайту. Басқа тәсілдер қатесіз және шынайы мәтінді дәл анықтауға бағытталған нақты әлемдік сынақ жиынтықтарын енгізу болып табылады.
Бұл тәсілдер модельдердің жалпы сөйлеуді тану қабілетін арттырады, олардың индустрияда, соның ішінде заң, медицина, білім беру салаларында кеңінен немесе күрделі түрде қолдануға мүмкіндік береді.
Қорытынды
Сөйлеуді тану жүйелерінің тесттік көрсеткіштері олардың нақты әлемдегі өнімділігі туралы толық ақпарат бермейді. Сынақтарға бейімделу үрдісі — «benchmark optimization» немесе «benchmaxxing» деп аталатын құбылыс — жүйенің қабілетін асыра бағалауға әкеледі. Оны анықтау үшін жаңа сынақтар мен талдау әдістері қажет. Осы бағытта жүргізілген зерттеулер дәлдікке, сапаға және әділ баға қоюға жол ашады. Болашақта жаңа әдістерді жетілдіру арқылы сөйлеуді тану жүйелерінің пайдалы және сенімді құралдар ретінде жетілуі күтіледі.
Дереккөз: Hugging Face Blog



