মডেল কেন আন্দাজ করে, আর আমরা কেন তাদের তা করতে শিখিয়েছি

একটি বৃহৎ ভাষা মডেল-কে কোনো অচেনা ব্যক্তির জন্মদিন জিজ্ঞেস করুন। সে হয়তো এমন আত্মবিশ্বাসে বলবে, “৭ মার্চ”, যেন কার্ড থেকে পড়ছে—কিন্তু উত্তরটি ভুল। আবার জিজ্ঞেস করলে অন্য তারিখ, তৃতীয়বারে আরও একটি। গবেষণাপত্রের লেখকেরা ঠিক এমন উদাহরণ দেন: প্রধান ক্রমের মডেলগুলোকে সাধারণ তথ্যভিত্তিক প্রশ্ন করা হলে—কোনো ব্যক্তির জন্মতারিখ, বা আড়াল করে সংক্ষিপ্ত রূপের পূর্ণরূপ—প্রতিটি মডেল নির্দিষ্ট ও আত্মবিশ্বাসী কিন্তু আলাদা ভুল উত্তর বানায়। শিল্পখাত এটাকে হ্যালুসিনেশন বলে, শব্দটি যেন উপলব্ধির অদ্ভুত ত্রুটি বোঝায়। গবেষণাপত্রের প্রথম কাজ হলো রহস্যের আবরণ সরানো।

মডেল কীভাবে তৈরি হয় তা থেকে শুরু করা যাক। প্রথম ও সবচেয়ে বড় প্রশিক্ষণ পর্যায়ে সে বিপুল পাঠ্য পড়ে fluent ভাষার ধরন শেখে। এখন এমন একটি তথ্য নিন যার পেছনে শেখার মতো ধরন নেই—একজন নির্দিষ্ট মানুষের জন্মতারিখ। প্রশিক্ষণ পাঠ্যে তারিখটি একবার এসেছে, বা একবারও আসেনি, তাহলে ধরন শিক্ষণ-ব্যবস্থার ধরার মতো কিছু নেই। মডেলের দৃষ্টিতে উত্তর-টি ইচ্ছামতো। লেখকেরা Alan Turing-এর একটি পুরোনো পরিসংখ্যানগত ধারণা নিয়ে এটিকে নির্দিষ্ট করেন: প্রশিক্ষণ-তথ্যে যদি পাঁচটির একটি জন্মতারিখ মাত্র একবার দেখা যায়, তাহলে মডেলের অন্তত প্রায় পাঁচটির একটিতে ভুল হওয়া প্রত্যাশিত—মডেল “ভাঙা” বলে নয়, বরং শেখার মতো পর্যাপ্ত প্রমাণ ছিল না বলে। বিপরীতে দেশের রাজধানী মডেল খুব কম ভুল করে, কারণ “Paris” বা অনুরূপ তথ্য তথ্যে বারবার আসে।

তারা আরও যুক্তি দেন যে কোনো সম্ভাব্য বিবৃতি সত্য কি মিথ্যা তা নির্ভরযোগ্যভাবে classifying করাই কঠিন; তাই শুধু সত্য বিবৃতি তৈরি করা অন্তত সেই শ্রেণিবিন্যাস সমস্যার মতো কঠিন। অর্থাৎ কিছু ত্রুটির পরিসংখ্যানগত নিম্নসীমা থেকেই যায়।

যে ধারণাটি নিচে কাজ করছে: যা এখনো দেখেননি, তা কীভাবে গোনা যায়

এখানে একটি সুন্দর পুরোনো পরিসংখ্যানগত ধারণা কাজ করে।

রঙিন বলের একটি থলি কল্পনা করুন। কত রং আছে জানেন না। 100টি বল একে একে তুললেন: লাল 40, নীল 25, সবুজ 15, হলুদ 5, বেগুনি 3, কমলা 2—আর তারপর 10টি আলাদা রং, যেগুলোর প্রত্যেকটি মাত্র একবার করে দেখা গেল।

প্রশ্নটি হলো: পরের বলটি এমন রঙের হওয়ার সম্ভাবনা কত, যা আপনি এখনো একবারও দেখেননি? যা দেখেননি তা সরাসরি গোনা যায় না। কিন্তু যে রংগুলো ঠিক একবার দেখা গেছে, অর্থাৎ একক, সেগুলো গোনা যায়। ভালো–Turing estimation-এর মূল অন্তর্দৃষ্টি হলো: নমুনায় এককের ভাগ, অদেখা শ্রেণি-তে এখনো কত সম্ভাবনা ভর লুকিয়ে আছে তার অনুমান দেয়। 100 draw-এর মধ্যে 10টি একক হলে পরের draw একেবারে নতুন রঙের হওয়ার সম্ভাবনা আনুমানিক 10 / 100 = 10%

এই একবার-seen রংগুলো mistake নয়। এগুলো আপনার অজ্ঞতার পরিমাপ: অনেক একক মানে নমুনা নিজেই বলছে, বাইরে আরও শ্রেণি আছে যা এখনো ঠিকমতো দেখা হয়নি।

এখন রঙের বদলে জন্মতারিখ ধরুন, আর bag-এর বদলে মডেলের প্রশিক্ষণ পাঠ্য। দেখা জন্মতারিখের মধ্যে যদি পাঁচটির একটি মাত্র একবার উপস্থিত হয়, তাহলে একই বিবেচনামূলক চিন্তা বলে বণ্টনের উল্লেখযোগ্য অংশ মডেল কার্যত ভালো করে কখনো শেখেনি। জন্মতারিখের কোনো গণনাযোগ্য ধরন নেই—কারও জন্মতারিখ “উৎপন্ন করা” করা যায় না। তাই একবার-seen বা অদেখা তারিখে মডেলের ভুলের একটি নিম্নসীমা থাকে।

এটাই যুক্তির ক্ষুদ্র সংস্করণ: একক হার বলে এই তথ্য থেকে পৃথিবীর কতটা অংশ শেখা কঠিন, এবং সেটিই ত্রুটির নিচে একটি নিম্নসীমা তৈরি করে। Capital city-তে এই নিম্নসীমা খুব ছোট, কারণ সেগুলো বারবার দেখা যায়।

এতে হ্যালুসিনেশন কোথা থেকে আসে তার একটি অংশ বোঝা গেল। কিন্তু পরে সহায়কতা ও সততা শেখানোর প্রশিক্ষণের পরও মডেল কেন ভান করে উত্তর দেয়, সেটি এখনো বাকি। এখানে গবেষণাপত্রের উপমা খুব সরাসরি। পরীক্ষায় কোনো শিক্ষার্থী উত্তর জানে না। Blank রাখলে শূন্য, আন্দাজ করলে শূন্য বা একটি—তাহলে গ্রেড সর্বাধিক করার কৌশল হলো আন্দাজ করা। “আমি জানি না” বললে কোনো upside নেই। মডেলের মানদণ্ডেও প্রায় একই প্রণোদনা। লেখকেরা ক্ষেত্রের প্রভাবশালী মানদণ্ডগুলো দেখেন এবং দেখেন অধিকাংশে “I don’t know” ভুল উত্তরের মতোই শূন্য পায়। এই স্কোরিং নিয়মে অনিশ্চয়তা স্বীকার করা মডেলের চেয়ে সব সময় আন্দাজ করা মডেল বেশি স্কোর করতে পারে। এক অর্থে আমরা মূল্যায়ন দিয়েই মডেলকে ভান করে উত্তর দিতে শিখিয়েছি।

Standard accuracy বনাম explicit wrong-answer penalty-সহ open rubric-এর scoreboard comparison।
মানদণ্ড আন্দাজ করাকে rational করে তুলতে পারে। সাধারণ স্কোরিংে (বাম দিকে) ভুল উত্তর এবং সৎ “আমি জানি না”—দুটোই শূন্য, তাই আন্দাজ করলে কেবল লাভের সম্ভাবনা থাকে। প্রশ্নের মধ্যেই নিয়ম স্পষ্ট করে ভুল উত্তরে penalty দিলে (ডান দিকে), অনিশ্চয়তা বেশি হলে উত্তর না দেওয়া ভালো কৌশল হতে পারে। এটি মূল্যায়ন কী পুরস্কার করে তা বদলায়; নিজে থেকে হ্যালুসিনেশনের পুরো সমাধান নয়।Original diagram — The Clean Paper · CC BY 4.0

এই অংশটি গুরুত্বপূর্ণ, কারণ প্রচলিত শিরোনামের সঙ্গে এর বিরোধ আছে। হ্যালুসিনেশনকে কখনও প্রযুক্তির রহস্যময় ও অবশ্যম্ভাবী সীমা হিসেবে দেখানো হয়। গবেষণাপত্র দুই দাবিকেই নরম করে। পূর্বপ্রশিক্ষণ ত্রুটি নিম্নসীমা রহস্য নয়—সাধারণ পরিসংখ্যানগত ত্রুটি। আর হ্যালুসিনেশনের স্থায়িত্ব পুরোপুরি অনিবার্য নয়—তার একটি অংশ আমাদের বানানো প্রণোদনা। কোনো ব্যবস্থা সত্যিই অনিশ্চিত হলে উত্তর না করলেই hallucinate করবে না; মোতায়েন করা মডেল কেন এমন করে না, তার একটি কারণ স্কোরবোর্ড refusal-কে শাস্তি দেয়।

লেখকেরা কী করেছেন

গবেষণাপত্রটির তিনটি অংশ। প্রথমে গাণিতিক যুক্তি: পূর্বপ্রশিক্ষণে কিছু হ্যালুসিনেশন পরিসংখ্যানগতভাবে forced, কারণ “শুধু বৈধ পাঠ্য তৈরি করা” অন্তত দ্বিমিক “এই বিবৃতি বৈধ কি না?” শ্রেণিবিন্যাসের মতো কঠিন। দ্বিতীয় অংশে দশটি প্রভাবশালী মানদণ্ডের সমীক্ষা দিয়ে দেখানো হয়েছে মূলধারার নির্ভুলতা-শৈলী মেট্রিক আন্দাজকে উত্তর না দেওয়ার চেয়ে পুরস্কার করে। তৃতীয় অংশে একটি প্রস্তাবিত সংশোধন এবং কেস স্টাডি: উন্মুক্ত-rubric মূল্যায়ন, যেখানে স্কোরিং নিয়ম প্রশ্নের মধ্যেই লেখা থাকে—উদাহরণ হিসেবে, “সঠিক উত্তর +1, ভুল উত্তর −1; আস্থা 50%-এর কম হলে উত্তর না দেওয়া করো।” এতে মডেল জানে অনিশ্চয়তা স্বীকার করা কখন পুরস্কার পাবে।

কেস স্টাডি-তে চারটি সীমান্ত মডেল ব্যবহৃত হয়েছে—Google-এর Gemini 3 Pro, OpenAI-এর GPT-5, xAI-এর Grok 4 এবং Anthropic-এর Claude Opus 4.5—এবং SimpleQA-এর 4,326 তথ্যভিত্তিক প্রশ্ন। লেখকেরা স্পষ্ট বলেন এটি illustrative কেস স্টাডি, নিয়ন্ত্রিত মডেল তুলনা নয়: ডিফল্ট বিন্যাস, আলাদা সামঞ্জস্য নেই, খরচ normalization নেই।

তারা কী পেয়েছেন

  • পূর্বপ্রশিক্ষণ কিছু ত্রুটি বাধ্য করে। মডেল যে আত্মবিশ্বাসী ভুল বিবৃতি তৈরি করে তার হারের একটি নিম্নসীমা আছে, যা মডেল থেকে বানানো সেরা “বিবৃতি বৈধ কি না” শ্রেণিবিন্যাসকারীর ত্রুটির সঙ্গে সম্পর্কিত। শেখার মতো ধরন নেই এমন তথ্যের ক্ষেত্রে নিম্নসীমা অন্তত একক হার—প্রশিক্ষণে ঠিক একবার দেখা তথ্যের ভগ্নাংশ। তথ্য পুরো পরিষ্কার হলেও কিছু হ্যালুসিনেশন অনিবার্য হতে পারে।
  • স্কোরিং বাস্তবেই আন্দাজ করা পুরস্কার করে। সাধারণ সংশোধন করা/ভুল স্কোরিংে কখনও উত্তর না দেওয়া না করা সর্বোত্তম কৌশল হতে পারে। সমীক্ষায় দেখা যায় জনপ্রিয় মানদণ্ডের বড় অংশ “I don’t know”-কে স্রেফ ভুল ধরে। SimpleQA-র একটি উজ্জ্বল উদাহরণ: কাঁচা নির্ভুলতা সামান্য o4-mini-কে অনুকূল করে, যদিও এটি প্রায় সব প্রশ্নের উত্তর দেয় এবং তিন-চতুর্থাংশেরও বেশি ক্ষেত্রে ভুল; GPT-5-mini বেশি অনিশ্চয়তা স্বীকার করে বলে কম ভুল করেও কাঁচা স্কোরবোর্ডে পিছিয়ে পড়তে পারে। Reckless মডেল দেখতে ভালো লাগে।
  • স্কোরিং নিয়ম আগে থেকে স্পষ্ট করে দিলে প্রণোদনা উল্টে যায়—অন্তত এই কেস স্টাডিতে। গবেষকেরা একটি সহজ প্রশমন কৌশল পরীক্ষা করেন: মডেলকে একই প্রশ্নের উত্তর দুবার দিতে বলা হয়, আর দুই উত্তর না মিললে উত্তর না দিতে বলা হয়। প্রচলিত নির্ভুলতা মেট্রিকে এতে ভুল কমে, কিন্তু উত্তর দেওয়ার হারও কমে—ফলে মেট্রিকটি এই সতর্ক আচরণকে নিরুৎসাহিত করে। কিন্তু স্কোরিং নিয়ম খোলাখুলি জানানো হলে একই কৌশল বিভিন্ন penalty-তে চারটি মডেলেই ভালো স্কোর করে; এমনকি GPT-5-mini, কাঁচা নির্ভুলতার জন্য অনুকূল করা o4-mini-কে ছাড়িয়ে যায় (n = 4,326 প্রশ্ন প্রতি মডেল)।

এর সম্ভাব্য অর্থ কী

হ্যালুসিনেশন কমাতে আরেকটি হ্যালুসিনেশন-নির্দিষ্ট পরীক্ষা বানানোই প্রধান কাজ নাও হতে পারে। মূলধারার মানদণ্ড অনিশ্চয়তা কীভাবে স্কোর করে সেটি বদলানোও গুরুত্বপূর্ণ, যাতে “আমি জানি না” বলা স্বয়ংক্রিয়ভাবে শাস্তি না পায়। স্কোরবোর্ড না বদলালে হ্যালুসিনেশন-হ্রাসকারী আচরণ নির্ভুলতা বিন্দু খরচ করতে পারে, ফলে ডেভেলপাররার প্রণোদনা উল্টো থাকে। এই জন্য লেখকেরা সমস্যাটিকে socio-প্রযুক্তিগত বলেন: মেট্রিক নকশা এবং প্রভাবশালী লিডারবোর্ডের adoption—দুটোই দরকার।

এটি কী প্রমাণ করে না

  • উন্মুক্ত rubric বাস্তব মোতায়েন করা ব্যবস্থায় হ্যালুসিনেশন ঠিক করে দেয়—এটি গবেষণাপত্র দেখায় না। সমর্থনকারী পরীক্ষা ছোট এবং ইচ্ছাকৃতভাবে অনিয়ন্ত্রিত: চার মডেল, ডিফল্ট settings, একটি প্রশমন, একটি তথ্যভিত্তিক-QA পরীক্ষা। উদ্দেশ্য প্রণোদনা উল্টে যাওয়া দেখানো, মডেল ranking বা সাধারণ কার্যকারিতা নয়।
  • Grading-ই হ্যালুসিনেশনের একমাত্র কারণ—গবেষণাপত্র তা বলে না। প্রশিক্ষণ-তথ্য ত্রুটি, সত্যিই কঠিন সমস্যা এবং অপরিচিত প্রম্পট আলাদা উৎস।
  • হ্যালুসিনেশন অবশ্যম্ভাবী—জনপ্রিয় দাবিটিও গবেষণাপত্র সমর্থন করে না। তাদের যুক্তি হলো, ব্যবস্থা যদি শুধু checkable প্রশ্ন উত্তর করে এবং অন্য ক্ষেত্রে “জানি না” বলে, তাহলে হ্যালুসিনেশন এড়ানো সম্ভব।
  • পূর্বপ্রশিক্ষণ নিম্নসীমা অদৃশ্য হয়—উন্মুক্ত rubric তা করে না। গবেষণাপত্র নিম্নসীমা ব্যাখ্যা ও সীমা করে; সীমা আত্মবিশ্বাসী তথ্যভিত্তিক ত্রুটি নিয়ে, সব মডেল আচরণ নিয়ে নয়।
  • উন্মুক্ত rubric একাই যথেষ্ট—এটিও নয়। মূল্যায়ন প্রণোদনা বদলানো retrieval, সরঞ্জাম ব্যবহার বা ভালো ক্যালিব্রেশনের বিকল্প নয়।

প্রমাণ কতটা শক্ত?

  • মূল অংশটি গাণিতিক: আনুষ্ঠানিক নিম্নসীমা, প্রায়োগিক পরিমাপ নয়। তাত্ত্বিক যুক্তি তার অনুমানগুলোর মধ্যে শক্ত।
  • সমস্যাটির একটি ইচ্ছাকৃতভাবে সরলীকৃত মডেল ব্যবহার করা হয়েছে। লেখকেরা নিজেরাই “সঠিক / ভুল / ‘আমি জানি না’” এই তিন ভাগকে অতিরিক্ত সরল ত্রিবিভাজন বলেন এবং সবচেয়ে পরিষ্কার সীমা বের করতে আদর্শায়িত, ইচ্ছামতো-তথ্য বিন্যাস ব্যবহার করেন।
  • মানদণ্ড সমীক্ষা ছোট ও curated: দশটি প্রভাবশালী মূল্যায়ন, exhaustive নিরীক্ষা নয়।
  • কেস স্টাডি বাস্তব কিন্তু সীমিত: চার সীমান্ত মডেল, এক প্রশমন, শুধু SimpleQA, ডিফল্ট settings, এবং স্পষ্টভাবে “not a নিয়ন্ত্রিত মূল্যায়ন”। এটি প্রণোদনা যুক্তির ধারণার প্রাথমিক প্রমাণ, মানদণ্ড ফল নয়।
  • Vantage বিন্দু-ও উল্লেখযোগ্য: চার লেখকের তিনজন OpenAI-তে কাজ করেন বা করেছেন, এবং গবেষণাপত্র ক্ষেত্রের মূল্যায়ন চর্চা বদলানোর পক্ষে যুক্তি দেয়। এটিকে dismiss করার কারণ নয়, কিন্তু স্বাধীন নিরপেক্ষ পর্যালোচনা হিসেবেও পড়া ঠিক নয়। কৃতিত্ব হলো, critique তারা নিজেদের o4-mini ও GPT-5-mini-এর ক্ষেত্রেও প্রয়োগ করেছেন।

কেন এটি গুরুত্বপূর্ণ

এটি খুব অতিরঞ্জিত প্রচার হওয়া একটি সমস্যাকে নতুনভাবে কাঠামো করে। “হ্যালুসিনেশন” কখনও spooky defect, কখনও immovable প্রাচীর হিসেবে বিক্রি হয়। এই গবেষণাপত্র এটিকে অনেক বেশি সাধারণ করে: একটি পরিসংখ্যানগত নিম্নসীমা, যা বোঝা যায়; তার ওপর আমাদের তৈরি প্রণোদনা, যা বদলানো যায়। Quiet কিন্তু উপযোগী শিক্ষা হলো, নির্ভরযোগ্যতার পরবর্তী অগ্রগতি কেবল মডেল স্থাপত্য বা প্রশিক্ষণ পরিসর থেকে নাও আসতে পারে—আমরা কী মাপি এবং কী পুরস্কার করি, সেটিও সমান গুরুত্বপূর্ণ হতে পারে।

সংক্ষিপ্ত সারাংশ

ভাষা মডেলের আত্মবিশ্বাসী ভুলের দুটি আলাদা উৎস থাকতে পারে। প্রথমটি পরিসংখ্যানগত: কোনো তথ্যের শেখার মতো নিয়ম না থাকলে এবং প্রশিক্ষণ-তথ্যে সেটি খুব কম দেখা গেলে অনুকরণভিত্তিক প্রশিক্ষিত মডেল কখনো না কখনো ভুল করবে; একক হারের মতো রাশি থেকে সেই নিম্নসীমা অনুমান করা যায়। দ্বিতীয়টি প্রণোদনার সমস্যা: অধিকাংশ মানদণ্ডে “আমি জানি না” এবং ভুল উত্তর একই শূন্য স্কোর পায়, ফলে আন্দাজ করাই যুক্তিসঙ্গত কৌশল হয়ে দাঁড়ায়। এমনকি প্রায় তিন-চতুর্থাংশ ভুল করা বেপরোয়া মডেলও, অনিশ্চিত হলে উত্তর না দেওয়া মডেলের চেয়ে কাঁচা নির্ভুলতায় ভালো দেখাতে পারে। লেখকদের প্রস্তাব হলো স্কোরিং নিয়ম খোলাখুলি জানানো—প্রশ্নের মধ্যেই কীভাবে নম্বর দেওয়া হবে তা বলা। চারটি সীমান্তবর্তী মডেলের ছোট কেস স্টাডিতে এতে হ্যালুসিনেশন কমানোর আচরণ প্রচলিত নির্ভুলতার তুলনায় বেশি পুরস্কার পায়। এটি তত্ত্ব, মানদণ্ড-সমীক্ষা ও ছোট অনিয়ন্ত্রিত পরীক্ষার সমন্বয়; সমাধানটি আশাব্যঞ্জক, কিন্তু বৃহৎ পরিসরে প্রমাণিত নয়। মূল বক্তব্য: হ্যালুসিনেশন রহস্যময়ও নয়, পুরোপুরি অনিবার্যও নয়।

সরাসরি যাচাই

গবেষণাপত্র কী দেখায়: পূর্বপ্রশিক্ষণে কিছু তথ্যভিত্তিক হ্যালুসিনেশনের গাণিতিক নিম্নসীমা; সমীক্ষায় অধিকাংশ প্রধান ক্রমের মানদণ্ড “I don’t know”-কে কৃতিত্ব দেয় না; এবং চার-মডেল কেস স্টাডি-তে প্রম্পটের মধ্যেই স্কোরিং নিয়ম দেওয়া হলে হ্যালুসিনেশন-হ্রাসকারী প্রশমন, সরল নির্ভুলতা-তে penalised হওয়ার বদলে পুরস্কার পায়।

কী সম্ভাব্য কিন্তু প্রমাণিত নয়: মূলধারার মানদণ্ডে উন্মুক্ত rubric চালু করলে মোতায়েন করা মডেলের হ্যালুসিনেশন বাস্তবে উল্লেখযোগ্যভাবে কমবে। সমর্থনকারী পরীক্ষা ছোট ও স্পষ্টভাবে অনিয়ন্ত্রিত।

কী দেখায় না: হ্যালুসিনেশন অনিবার্য—গবেষণাপত্র উল্টো যুক্তি দেয়; grading-ই sole কারণ; হ্যালুসিনেশন একেবারে eliminate করা যাবে; বা কেস স্টাডি চার মডেলের ন্যায্য ranking।

মূল সীমাবদ্ধতা: Simplified সংশোধন করা/ভুল/“I don’t know” মডেল; দশটি মূল্যায়নের curated সমীক্ষা; চার মডেল, এক প্রশমন, এক পরীক্ষা ও ডিফল্ট বিন্যাসের অনিয়ন্ত্রিত কেস স্টাডি; এবং মূল্যায়ন চর্চা নিয়ে OpenAI-led যুক্তি।

সাধারণ পাঠকের আস্থা কতটা হওয়া উচিত? উচ্চ আস্থা যে হ্যালুসিনেশন রহস্যময় বা strictly অনিবার্য কোনো ঘটনা নয় এবং মূলধারার মানদণ্ড আন্দাজ করাকে পুরস্কার করতে পারে। প্রস্তাবিত উন্মুক্ত-rubric সংশোধন বিস্তৃতভাবে কাজ করবে—এতে মাঝারি আস্থা: ধারণার প্রাথমিক প্রমাণ বাস্তব, কিন্তু পরিসর ও ব্যবহারিক মোতায়েনে প্রদর্শন এখনো নেই।

উৎস

ভিত্তি: Evaluating large language models for accuracy incentivizes hallucinations — Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang, Nature 653, 1047–1050 (2026).

Read in full: arXiv preprint 2509.04664 (LaTeX source) AND the peer-reviewed Nature version. Claims follow the Nature version, which adds an empirical case study not present in the preprint.

সম্পাদকীয় নোট

এই নিবন্ধটি AI লিখেছে এবং সম্পাদকীয় দল পর্যালোচনা করেছে। এটি সংযুক্ত গবেষণার একটি পরিষ্কার ও সতর্ক ব্যাখ্যা, মূল গবেষণাপত্র পড়ার বিকল্প নয়। নির্বাচন, ব্যাখ্যা ও চূড়ান্ত ভাষার দায়িত্ব সম্পাদকের।