Երբ ԱԻ-ն կը սկսի տեսնել, լսել, հասկնալ եւ պատասխանել. Griffin եւ HIM
October 6, 2026
Երկար ժամանակ արուեստական իմացականութեան հետ մեր յարաբերութիւնը շատ պարզ էր։ Մենք բան մը կը գրէինք, մեքենան կը պատասխանէր։ Յետոյ սկսանք խօսիլ անոր հետ։ Ան սկսաւ լսել մեր ձայնը, հասկնալ մեր հարցումները եւ ձայնով պատասխանել։ Բայց մարդկային հաղորդակցութիւնը միայն բառերու փոխանակում չէ։
Երբ երկու հոգի իրարու հետ կը խօսին, անոնք միաժամանակ կը լսեն, կը նային, կը սպասեն, կը ժպտին, գլուխը կը շարժեն, երբեմն կը միջամտեն, երբեմն ալ կը հասկնան, որ դիմացինը տակաւին չէ վերջացուցած իր խօսքը։ Նոյնիսկ լռութիւնը տեղեկութիւն կը փոխանցէ։
Քանի մը օր առաջ, ամերիկեան Tavus ընկերութիւնը ներկայացուց Griffin անունով նոր ԱԻ համակարգ մը, որ կը փորձէ մեքենային տալ ճիշդ այս կարողութիւնը։ Tavus զայն կ’անուանէ Human Interaction Model՝ մարդկային փոխազդեցութեան մոտել։ Ի տարբերութիւն սովորական զրուցավարներուն, Griffin-ը նախատեսուած է ոչ միայն հասկնալու մեր ըսածը, այլ նաեւ հետեւելու մեր դէմքին, նայուածքին, ձայնին, դադարներուն եւ շարժումներուն՝ մինչ ինք եւս կը խօսի եւ կը շարժի։
Այսինքն՝ փոփոխութիւնը առաջին հերթին գեղեցիկ թուային դէմք մը ստեղծելը չէ։ Շատ աւելի խորքային փոփոխութիւն մը տեղի կ’ունենայ. ԱԻ-ն կը փորձէ հասկնալ ոչ միայն այն, ինչ կ’ըսենք, այլ նաեւ այն, թէ ինչպէ՛ս կ’ըսենք զայն։

Մարդիկ ինչպէ՞ս կը խօսին իրականութեան մէջ
Պատկերացնենք շատ պարզ տեսարան մը։
Մէկը ձեզի կ’ըսէ.
— Կարծեմ վաղը պիտի…
եւ յանկարծ կը լռէ։
Սովորական ձայնային ԱԻ համակարգ մը կրնայ այդ լռութիւնը հասկնալ իբրեւ նախադասութեան աւարտ եւ անմիջապէս պատասխանել։ Բայց մարդը ուրիշ նշաններ ալ կը տեսնէ։ Եթէ խօսողը աչքերը վեր դարձնէ, գլուխը քիչ մը բարձրացնէ եւ փորձէ յիշել բառ մը, մենք սովորաբար կը հասկնանք, որ ան տակաւին կը մտածէ։ Ուստի չենք ընդհատեր։
Ճիշդ այս տարբերութիւնը կը քննէ NVIDIA-ի հետազօտողներուն ստեղծած VideoFDB չափանիշը։ Ան հիմնուած է իրական տեսազանգերէ վերցուած 237 երկխօսութեան հատուածներու վրայ եւ կը քննէ 11 տեսակի ոչ-բառային վարք՝ ներառեալ նայուածքը, դէմքի արտայայտութիւնը, մարմնի շարժումները եւ խօսելու կարգին կառավարումը։ Հետազօտողները նկատած են, որ ներկայ ԱԻ համակարգերէն շատերը կրնան «տեսնել» պատկերը, բայց իրական զրոյցի ընթացքին յաճախ չեն գիտեր այդ տեսածը գործածել։
Այստեղ կարեւոր տարբերութիւն մը կայ. տեսնելը դեռ հասկնալ չէ։ Համակարգիչ մը կրնայ գիտնալ, որ մարդը կը ժպտի։ Բայց բոլորովին ուրիշ կարողութիւն է հասկնալ, թէ այդ ժպիտը ի՛նչ կը նշանակէ տուեալ պահուն եւ արդեօք պէ՞տք է փոխէ իր պատասխանը։
Ի՞նչ տարբերութիւն ունի Griffin-ը
Griffin-ի հիմնական նորութիւնը այն է, որ լսելը, տեսնելը, որոշում կայացնելը, խօսիլը եւ շարժիլը իրարմէ անջատ հերթական փուլեր չեն։ Համակարգը կը շարունակէ ձեզ դիտել ու լսել նոյնիսկ այն ժամանակ, երբ ինք կը խօսի։
Tavus-ի նկարագրութեամբ՝ Griffin-Lite-ը ունի երկու հիմնական բաժին։ Առաջինը շարունակաբար կը մշակէ դիմացինին ձայնն ու պատկերը եւ կ’որոշէ՝ ե՞րբ պատասխանել, ի՞նչ ըսել եւ ինչպիսի՞ ոչ-բառային վարք ցուցաբերել։ Երկրորդը այդ որոշումները կը վերածէ ձայնի եւ շարժող պատկերի։ Այս գործընթացները զուգահեռաբար կը կատարուին, փոխանակ սպասելու, որ մէկը ամբողջութեամբ աւարտի, ապա միւսը սկսի։
Պարզեցնելով՝ կարելի է այսպէս ներկայացնել.
կը տեսնէ + կը լսէ → կը մեկնաբանէ → կը պատասխանէ + կը շարժի → շարունակ կը տեսնէ ու կը լսէ։
Եւ վերջին մասը թերեւս ամենակարեւորն է։ Մինչեւ հիմա ԱԻ-ի հետ զրոյցը մեծ մասամբ փինկ-փոնկի նման էր.
դուն կը խօսիս → ԱԻ-ն կը լսէ → դուն կը լռես → ԱԻ-ն կը պատասխանէ։
Մարդկային խօսակցութիւնը այդպէս չի գործեր։ Երկու կողմերն ալ գրեթէ միշտ միաժամանակ տեղեկութիւն կը ստանան եւ կը փոխանցեն։
Իսկ դէմքը ու ձայնը ուրկէ՞ կու գան
Griffin-ը նաեւ իրական ժամանակի մէջ կը ստեղծէ խօսող անձի շարժող պատկերը։
Tavus-ի համաձայն՝ Griffin-Lite-ի տեսանիւթի համակարգը 720p պատկեր կը ստեղծէ 25 պատկեր/երկվայրկեան արագութեամբ եւ տեսանիւթը կը մշակէ 320 millisecond-անոց հատուածներով։ Համակարգը կրնայ նաեւ շուրջ տասը երկվայրկեան ձայնային նմուշէ մը ընդօրինակել խօսողի ձայնը։ Ընկերութիւնը կը հաղորդէ, որ իր տեսանիւթի ստեղծման բաժինը H100 մշակիչներու վրայ փորձարկելու ժամանակ ձայնէն պատկեր միջին ուշացումը եղած է շուրջ 0,43 երկվայրկեան։
Այս թուային մանրամասնութիւնները կրնան երկրորդական թուիլ, բայց իրականութեան մէջ անոնք մարդկային զգացողութեան հիմքն են։ Երկու կամ երեք երկվայրկեան ուշացող ժպիտը բնական ժպիտ չի թուիր։ Ուշացած գլխու շարժումը կրնայ անմիջապէս մատնել, որ դիմացինը համակարգիչ է։ Մարդկային հաղորդակցութեան մէջ ժամանակը նոյնքան կարեւոր է, որքան բառը։
48 առ հարիւրը կարծած է, թէ իրական մարդու հետ կը խօսի
Tavus-ի կազմակերպած փորձին ընթացքին մարդիկ մէկ վայրկեան տեւող տեսազանգ (video call) ունեցած են Griffin-Lite-ի հետ՝ առանց գիտնալու, որ իրենց դիմացինը ԱԻ է։ Ընկերութեան համաձայն՝ մասնակիցներուն 48 առ հարիւրը կարծած է, որ իրական մարդու հետ խօսած էր։ Tavus-ի նախորդ համակարգին պարագային նոյն ցուցանիշը ընդամէնը 2,4 առ հարիւր եղած էր։ Tavus այս արդիւնքը կը ներկայացնէ որպէս իրական ժամանակի «տեսանիւթային Թիւրինկի քննութեան» առաջին յաջողութիւնը։
Այս փորձը Tavus-ի կողմէ կազմակերպուած էր, իսկ Griffin-Lite-ի խումբը փոքր էր՝ 54 մասնակից։ Հետեւաբար 48 առ հարիւրը հետաքրքրական ցուցանիշ է, բայց զայն տակաւին պէտք չէ ընդունիլ իբրեւ գիտականօրէն վերջնական ապացոյց, թէ մեքենան այլեւս կարելի չէ մարդէն տարբերել։ Անկախ, աւելի մեծ եւ տարբեր պայմաններու տակ կատարուած փորձեր անհրաժեշտ պիտի ըլլան այդ պնդումը հաստատելու համար։
Ինչո՞ւ ասիկա աւելի կարեւոր է, քան նոր զրուցավար մը
Այս արհեստագիտութեան կարեւորութիւնը ChatGPT-ի աւելի գեղեցիկ տարբերակ մը ստեղծելը չէ։
Պատկերացնենք ԱԻ ուսուցիչ մը։
Այսօր ան կրնայ հարցում տալ եւ ստուգել պատասխանը։ Վաղը կրնայ նաեւ նկատել, որ աշակերտը բառերով կ’ըսէ «հասկցայ», բայց դէմքը շփոթ կը մատնէ։ Կրնայ տեսնել, որ ան երկար կը լռէ, հայեացքը կը հեռացնէ կամ կը վարանի, եւ ըստ այդմ փոխել բացատրութեան ձեւը։
Կամ տարեց մարդու ընկերակցող ԱԻ համակարգ մը։ Ան միայն հարցումներու պատասխանող ձայն մը պիտի չըլլայ, այլ կրնայ հետեւիլ խօսակցութեան ընթացքին, սպասել, արձագանգել եւ բնական զրոյցի տպաւորութիւն ստեղծել։
Նոյնը կարելի է պատկերացնել բժշկական նախնական հարցազրոյցներու, յաճախորդներու սպասարկման, աշխատանքի հարցազրոյցներու, լեզուի ուսուցման, վաճառքի եւ բազմաթիւ այլ ոլորտներու մէջ։
Tavus արդէն իր ներկայ համակարգերը կը ներկայացնէ վաճառքի, առողջապահութեան, կրթութեան եւ աշխատակիցներու ընտրութեան նման գործածութիւններու համար։
Եթէ դէմք մը տեսնենք, տակաւին պիտի գիտնա՞նք, թէ ով է դիմացինը
Մինչեւ վերջերս թուային խաբէութեան մասին խօսելու ժամանակ հիմնական մտահոգութիւնը deepfake-ն էր՝ նախապէս պատրաստուած կեղծ տեսանիւթը։
Griffin-ի նման համակարգերը նոր հորիզոններ կը բանան։ Պայման չէ, որ պատկերը այլեւս նախապէս պատրաստուած ըլլայ։ Այն կրնայ ստեղծուիլ զրոյցի ընթացքին եւ արձագանգել մեզի իրական ժամանակի մէջ։ Դուք հարցում կու տաք՝ ան կը պատասխանէ։ Դուք կը ժպտիք՝ ան կը նկատէ։ Դուք բան մը ցոյց կու տաք՝ ան կը նայի։ Դուք կը լռէք՝ ան կրնայ սպասել։
Այստեղ deepfake-ը այլեւս միայն կեղծ տեսանիւթ չէ։ Ան կրնայ դառնալ կեղծ ներկայութիւն։ Tavus ինք կը գիտակցի այս վտանգին։ Ընկերութիւնը կ’ըսէ, որ Griffin-Lite-ը առայժմ լայնօրէն տրամադրելի չէ վաճառքի եւ զայն միայն սահմանափակ փորձարկողներու հասանելի դարձուցած է, մինչ կ’աշխատի անվտանգութեան եւ ԱԻ ըլլալը յայտնող միջոցներու վրայ։
Թիւրինկի հարցումը կամաց-կամաց կը փոխուի
1950-ին Ալան Թիւրինկի նշանաւոր հարցումը հիմնականօրէն հետեւեալն էր. եթէ մարդը գրութիւններու միջոցով խօսի մեքենայի մը հետ եւ չկարենայ վստահօրէն որոշել, թէ դիմացինը մարդ է թէ մեքենայ, կրնա՞նք ըսել, որ մեքենան մտածող վարք կը ցուցաբերէ։ Եօթանասունվեց տարի ետք հարցումը շատ աւելի շօշափելի իրականութիւն դարձած է։
Այլեւս միայն բառերը չեն։
Ձայնն է։
Դէմքն է։
Նայուածքն է։
Դադարն է։
Ժպիտն է։
Ճիշդ պահուն լռելն է։
Եւ երբեմն՝ ճիշդ պահուն գլուխը շարժելը։
Griffin-ը տակաւին մարդ չէ, եւ հրապարակուած տեղեկութիւնները չեն ապացուցեր, որ ան մարդկային փոխազդեցութիւնը ամբողջութեամբ հասկցած է։ Բայց ան կը մատնանշէ ԱԻ-ի զարգացման կարեւոր ուղղութիւն մը. մեքենաները կը փորձեն այլեւս ոչ միայն հասկնալ մեր լեզուն, այլ նաեւ սորվիլ մեր ներկայութեան լեզուն։
Եւ թերեւս շուտով «ԱԻ-ն ի՞նչ գիտէ» հարցումին կողքին պիտի ստիպուինք ուրիշ հարցում մըն ալ տալ.
Երբ մեքենան սկսի մեզի նայիլ, լսել մեր լռութիւնը եւ պատասխանել մեր ժպիտին՝ մենք ինչպէ՞ս պիտի գիտնանք, թէ մեր դիմացը իսկապէս ո՛վ — կամ ի՛նչ — կայ։
Բնագիրը այս կապով
Պատրաստութիւն՝ «Տարբերակ21»-ի