Փաստերը, այնուամենայնիվ — և պաշտոնական զգուշացման նշում հոդվածի վրա
2024 թվականին հրապարակված ուսումնասիրությունը հակասեց մի հարմարավետ, տարածված համոզմունքի։ Եթե մարդուն տալ կարճ՝ երեք փուլից բաղկացած զրույց ԱԲի հետ՝ GPT-4 Turbo, որը հրահանգված է պատասխանելու հենց այն կոնկրետ ապացույցներին, որոնցով մարդը հիմնավորում է իր հավատացած դավադրության տեսությունը, ապա միջինում այդ տեսության նկատմամբ հավատը նվազում է մոտ 20%-ով։ Նվազումը պահպանվել էր նաև երկու ամիս անց։ Արդյունքը երևացել էր թե՛ դասական դավադրությունների դեպքում՝ John F. Kennedy-ի սպանություն, այլմոլորակայիններ, Illuminati, թե՛ արդիական թեմաների դեպքում՝ COVID-19, 2020 թվականի ԱՄՆ ընտրություններ, և նույնիսկ այն մարդկանց մոտ, որոնց համոզմունքը սկզբում ուժեղ էր ու կապված ինքնության հետ։ Երբ պրոֆեսիոնալ fact-checker-ը գնահատել է ԱԲի արած 128 փաստական պնդումները, 127-ը գնահատվել է ճիշտ, մեկը՝ misleading, ոչ մեկը՝ սխալ։
Տարածված վերնագիրը սա էր. մարդկանց հնարավոր է փաստերով դուրս բերել «rabbit խոռոչ»-ից։ Այսինքն՝ դավադրություն believer-ները ապացույցից դուրս չեն, պարզապես պետք է նրանց կոնկրետ բերած փաստարկներին պատասխանել բավականաչափ անհատականացված ձևով։ Սա իսկապես հետաքրքիր պնդում է, իսկ հետազոտության դիզայնը persuasion-ի մասին բազմաթիվ աշխատանքներից ավելի զգույշ էր։
Հետո՝ 2026 թվականի հունիսին, Science-ը հոդվածին կցեց խմբագրական Expression of Concern։ Վերապատմումների մեծ մասը հենց այս մասն է հեշտությամբ բաց թողնում, մինչդեռ այսօր արդյունքին որքան կշիռ տալու հարցը կախված է հենց դրանից։
Ի՞նչ է Expression of Concern-ը — և ինչ չէ
խմբագրական Expression of Concern-ը ամսագրի պաշտոնական զգուշացումն է, որը ընթերցողին տեղեկացնում է, որ հոդվածի վերաբերյալ հարցեր են առաջացել, մինչ այդ հարցերը դեռ քննվում են։ Այն հետկանչ չէ՝ հոդվածը հետ չի կանչվել, և ինքնին գիտական խախտման եզրակացություն չէ։ Այն նշանակում է. կարդացեք այս վերապահումը հաշվի առնելով, որովհետև գիտական գրառումը դեռ կարող է փոխվել։ Այստեղ խնդիրների մասին տեղեկանալուց հետո հեղինակները հետաքննել են, մանրամասները փոխանցել Science-ին և ներկայացրել ուղղված վերլուծություն։
Flag արված խնդիրները կոնկրետ են։ Հեղինակներին տեղեկացրել են, որ մասնակից-screening criteria-ն ձեռագիրում և հրապարակված վերլուծություն կոդում նույն կերպ չի կիրառվել, և որ հանրային տվյալների հավաքածուում կոդ-merging սխալի պատճառով հայտնվել են ավելորդ շարքեր։ Դրա պատճառով հրապարակված նյութերից որոշ թվեր վերարտադրելը դժվար էր։ Հեղինակները Science-ին ներկայացրել են ուղղված վերլուծություն pipeline և updated արդյունքներ, որոնք, իրենց խոսքով, բնօրինակին համապատասխան են ուղղությամբ, վիճակագրական նշանակալիությունով և substantive չափով։ Science-ը դեռ գնահատում է դրանք։ Քանի դեռ այդ գնահատումը չի ավարտվել, ճշգրիտ թվերը պետք է դիտել որպես նախնական։
Այսպիսով սա միաժամանակ երկու պատմություն է. հետաքրքիր արդյունք այն մասին, թե փաստերը կարո՞ղ են շարժել ամուր համոզմունքները, և կենդանի օրինակ այն մասին, թե գիտական գրանցումը ինչպես է բաց ձևով ինքն իրեն ուղղում։ Այս հոդվածի նպատակն այդ երկուսը իրարից չխառնելն է։

Ինչ արեցին հեղինակները
- Անցկացրին երկու փորձ՝ 2,190 մասնակցով։ Յուրաքանչյուր մարդ իր բառերով անվանեց այն դավադրություն տեսությունն, որին հավատում էր, և այն ապացույցները, որով կարծում էր, թե այն հիմնավորվում է։
- Յուրաքանչյուր մասնակից երեք փուլով խոսեց GPT-4 Turbo-ի հետ։ Treatment պայմանում ԱԲին հրահանգ էր տրված հակադարձելու հենց մասնակցի կոնկրետ ապացույցներին, իսկ վերահսկիչ պայմանում քննարկվում էր անկապ թեմա։
- Ընտրված դավադրությունի նկատմամբ հավատը չափվեց զրույցից առաջ և անմիջապես հետո, ապա մասնակիցներին նորից դիմեցին 10 օր և 2 ամիս անց։
- Պրոֆեսիոնալ fact-checker-ը գնահատեց նմուշում ԱԲի արած բոլոր 128 փաստական պնդումների ճշգրտությունը։
- Ստուգեցին՝ ազդեցությունը տարածվո՞ւմ է այլ, անկապ դավադրությունների վրա, և specificity թեստի համար՝ արդյոք այն նվազեցնո՞ւմ է նաև այն դավադրությունների նկատմամբ հավատը, որոնք պատահում է իրականում ճիշտ լինեն։
Ինչ գտան
- Մոտ 20% միջին նվազում բուժում խումբում ընտրված դավադրությունի նկատմամբ հավատում՝ վերահսկիչ խմբի համեմատ (ուսումնասիրություն 1՝ 95% վստահության միջակայք՝ [13.8, 19.7] կետ 100-կետանոց սանդղակի վրա, P < 0.001)։
- Արդյունքը պահպանվեց։ Treatment խումբում նվազումը չանհետացավ. հավատը 10 օր և երկու ամիս անց մնաց մոտավորապես անմիջապես զրույցից հետո եղած մակարդակին՝ չվերադառնալով սկզբնականին, մինչ վերահսկիչ խումբը շարունակեց ավելի բարձր մնալ։ Հոդվածը ազդեցությունը նկարագրում է որպես ընտրված դավադրությունի նկատմամբ առնվազն երկու ամիս առանց նկատելի թուլացման պահպանված փոփոխություն, ոչ կարճատև տատանում։
- Արդյունքը generalize էր անում մարդկանց նշած տարբեր դավադրությունների միջև և պահպանվում էր նաև սկզբում շատ ուժեղ հավատ ունեցող մասնակիցների մոտ։
- Այս միջավայրում ԱԲի փաստական պնդումները շատ ճշգրիտ էին՝ 128-ից 127-ը (99.2%) ճիշտ, 1-ը (0.8%) misleading, ոչ մեկը սխալ։
- Ազդեցությունը կոնկրետ էր, ոչ ընդհանուր կասկածամտություն։ Intervention-ը չէր նվազեցնում իրական դավադրությունների նկատմամբ հավատը, ինչը հուշում է, որ այն շարժում էր unsupported belief-երը, ոչ մարդկանց դարձնում ամեն ինչից ցինիկ։
- Կար նաև modest spillover. այլ, անկապ դավադրությունների նկատմամբ հավատը նվազեց մոտ 12%-ով, և մասնակիցներն ավելի մեծ պատրաստակամություն էին հայտնում հակադարձելու դավադրություն պնդումներին։ Հիմնական ազդեցությունը պահպանվեց ուսումնասիրություն 2-ում և նույն ուղղությունն էր ցույց տալիս նաև առանց վերահսկիչ խումբի ավելի փոքր նմուշը՝ ավելի թույլ ապացույցներ, բայց համահունչ։
Ինչ սա չի ապացուցում
- Այս պահին արդյունքը առանց հարցականների չի կանգնած։ Հոդվածը խմբագրական Expression of Concernի տակ է տվյալների մշակման և վերարտադրելիությունի խնդիրների պատճառով, իսկ ուղղված թվերը դեռ Science-ի գնահատման փուլում են։ Մինչ այդ գրախոսության ավարտը կոնկրետ թվերը նախնական են։
- Սա չի ցույց տալիս, որ ԱԲը «բուժում» է դավադրություն belief-ը։ Մոտ 20% միջին նվազումը իմաստալից փոփոխություն է, ոչ վերացում։ Մասնակիցների մեծ մասը հետո էլ հավատում էր տեսությանը՝ պարզապես պակաս։
- Սա իրական աշխարհի կիրառում արդյունք չէ։ Մասնակիցները կամավոր մտել էին ուսումնասիրություն և բարեխղճորեն շփվում էին ԱԲի հետ։ Իրական կյանքում դավադրությունին ամենաուժեղ կապված մարդիկ կարող են ամենաքիչը ցանկանալ դիմել chatbot-ի, որը հակադարձելու է իրենց։
- 99.2% ճշգրտությունը կոնկրետ է այս առաջադրանքի, մոդելի և զգույշ prompting-ի համար։ Սա ընդհանուր երաշխիք չէ, որ լեզու մոդելները ճշմարտություն են ասում։ Հեղինակները նույնիսկ շեշտում են, որ նույն personalized persuasive վիճակագրական հզորությունը կարող էր սխալ belief-եր ուժեղացնել, եթե այդ ուղղությամբ կիրառվեր։
- «կայուն» այստեղ նշանակում է երկու ամիս։ Դա տպավորիչ է մեկ conversation-ի համար, բայց մշտական արդյունք չէ։
Որքա՞ն ուժեղ է ապացույցը
- Դիզայնը իրական ուժեղ կողմ է։ Treatment-versus-վերահսկիչ վերահսկվող experiments, մաքուր պլացեբո-like վերահսկիչ, կրկնություն երկու ուսումնասիրությունում և անկախ նմուշում, durability հետագա դիտարկումեր և ԱԲի սեփական փաստական պնդումների explicit ճշգրտություն check. սա persuasion հետազոտությունի մեծ մասից զգույշ է, և ազդեցության ուղղությունը նույնն է այն բոլոր տեղերում, որտեղ ստուգվել է։
- Բայց Expression of Concern-ը ծանոթագրություն չէ։ Հրապարակված տվյալներից ու կոդից հաղորդված թիվները նորից ստանալ կարողանալը արդյունքի վստահելիության մաս է, և հենց դա է այստեղ խախտվել՝ զտման չափանիշների անհամապատասխանությունների ու կոդի միավորման սխալից առաջացած կրկնվող տողի-երի պատճառով։ Հեղինակների պնդումը, որ ուղղված վերլուծական շղթան պահպանում է արդյունքը, հուսադրող ու հավանական է, բայց դեռ հեղինակների սեփական հաշվետվությունն է, ոչ անկախ verdict։ Սպասելու բանն այստեղ Science-ի գնահատումն է։
- Ազնիվ կարգավիճակը «flagged» է, ոչ «debunked» կամ «հաստատված»։ Լավ կառուցված ու հետաքրքիր ուսումնասիրություն, որի ճշգրիտ թվերը պաշտոնական գրախոսության տակ են։ Սա գուցե անհարմար վայր է լավ պատմությունը թողնելու համար, բայց հենց հիմա ամենաճշգրիտ ձևակերպումն է։
Ինչու է սա կարևոր
Տարիներ շարունակ ազդեցիկ տեսակետ կար, որ դավադրություն believer-ներին շարժում են psychological need-երն ու identity-ն, ուստի փաստերով նրանց համոզմունքները փոխել հնարավոր չէ։ Եթե այս արդյունքը պահպանվի, ապացույցներ-based և կայուն նվազումը կարևոր հակակշիռ կլինի այդ pessimism-ին։ Այն հուշում է, որ խնդրի մի մասը կարող էր լինել այն, որ generic debunking-ը երբեք չէր զբաղվում այն կոնկրետ ապացույցներով, որը տվյալ մարդը իրականում է մեջբերում, մինչ LLM-ը կարող է դա անել մասշտաբով։
Արդյունքը կարևոր է նաև որպես օրինակ՝ գիտությունը ինչպես է պետք աշխատի։ Expression of Concernի դասը այն չէ, որ հայտնի արդյունքները անարժեք են։ Դասն այն է, որ սխալները դուրս են գալիս, տվյալները նորից է ուսումնասիրվում, պնդումերը հանրային ձևով կրկին են ստուգվում։ Այդ մեխանիզմի աշխատելը համակարգի առավելություն է, ոչ սկանդալ, և հենց դրա պատճառով այս արդյունքի նկատմամբ ճիշտ դիրքը համբերությունն է՝ ոչ անմիջական ծափահարություն, ոչ անմիջական մերժում։
Եվ ԱԲի համար պատմությունը երկսայր է։ Նույն կարողությունը, որը անհատականացված փաստարկով կարող է թուլացնել սխալ belief-ը, նույնքան կարող է ուժեղացնել այն։ Technique-ը չեզոք է, նպատակը՝ ոչ։
Կարճ ամփոփում
2024 թվականի ուսումնասիրությունը գտել էր, որ GPT-4 Turbo-ի հետ երեք փուլով զրույցը մարդկանց մոտ մոտ 20%-ով նվազեցնում է իրենց հավատացած դավադրություն տեսությունի նկատմամբ համոզվածությունը։ Ազդեցությունը պահպանվել էր երկու ամիս, երևացել էր տարբեր դավադրությունների տարբեր տեսակների դեպքում, իսկ ԱԲի փաստական պնդումները հիմնականում գնահատվել էին ճիշտ։ 2026 թվականի հունիսին հոդվածը տվյալների մշակման և վերարտադրելիություն խնդիրների պատճառով հայտնվեց խմբագրական Expression of Concernի տակ։ Հեղինակները հայտնում են, որ ուղղված վերլուծությունը պահպանում է արդյունքի ուղղությունը, նշանակալիությունը և չափը, իսկ Science-ը դեռ գնահատում է այն։ Ճիշտ է այն կարդալ որպես իսկապես հետաքրքիր, զգույշ կառուցված արդյունք, որը ներկայում գրախոսության տակ է՝ ոչ հաստատված վերջնական փաստ, ոչ հերքված պատմություն։ Ամենաազնիվ եզրակացությունը հենց գիտական գործընթացն է թելադրում. նորից ստուգել։
Աղբյուրներ
Հիմնված է: Durably reducing conspiracy beliefs through dialogues with AI — Thomas H. Costello, Gordon Pennycook, David G. Rand, Science 385, eadq1814 (2024).
Խմբագրական նշում
Այս հոդվածը գրվել է AI-ի կողմից և վերանայվել խմբագրական թիմի կողմից։ Այն կապված աշխատանքի հստակ ու պահպանողական բացատրությունն է, ոչ թե այն կարդալու փոխարինողը։ Ընտրության, մեկնաբանության և վերջնական ձևակերպման պատասխանատվությունը կրում է խմբագիրը։