নিরাপদ ও কাজে লাগা মানেই কার্যকর নয়
চিকিৎসাবিষয়ক AI নিয়ে বহু শিরোনাম ভুল ধরনের প্রমাণ থেকে তৈরি হয়। কোনো মডেল পরীক্ষার প্রশ্নে ভালো স্কোর করে, অথবা সাজানো ক্লিনিক্যাল সংক্ষিপ্ত ক্লিনিক্যাল বর্ণনায় চিকিৎসকদের ছাড়িয়ে যায়, আর সেখান থেকে খুব দ্রুত সিদ্ধান্ত আসে—যন্ত্র নাকি ক্লিনিকের জন্য প্রস্তুত।
এই পরীক্ষা আরও কঠিন প্রশ্ন করেছে। একটি জেনারেটিভ AI সিদ্ধান্ত-সহায়ক সরঞ্জামকে বাস্তব প্রাথমিক চিকিৎসাসেবা কেন্দ্রে, বাস্তব চিকিৎসক ও বাস্তব রোগীর সঙ্গে ব্যবহার করে দেখা হয়েছে: রোগীদের ফলাফল কি সত্যিই ভালো হয়েছে?
সংক্ষেপে উত্তর হলো—14 দিনের মধ্যে তা পরিমাপযোগ্যভাবে ভালো হয়নি। সরঞ্জামটির সঙ্গে কোনো নিরাপত্তা-সংকেত ধরা পড়েনি; চিকিৎসা নথিবদ্ধকরণ উন্নত হয়েছে; অ্যান্টিবায়োটিকের কিছু খরচ কমতেও পারে। কিন্তু পূর্বনির্ধারিত চিকিৎসা-ব্যর্থতা শেষবিন্দু উল্লেখযোগ্যভাবে কমেনি, এবং লেখকেরাও বলেন—উপকার থাকলেও সম্ভবত ছোট।
এটি গবেষণার ব্যর্থতা নয়; বরং ভালো পরীক্ষার কাজ। চিকিৎসাবিষয়ক AI-কে মানদণ্ড নয়, রোগীর ফলাফল দিয়ে মাপলে প্রমাণ দেখতে এমনই হয়।
গবেষকেরা কী করেছেন
Kenya-র Nairobi ও Kiambu কাউন্টিতে Penda Health-এর বেসরকারি নেটওয়ার্কের 16টি প্রাথমিক-চিকিৎসা কেন্দ্রে ব্যবহারিক গুচ্ছ-র্যান্ডমাইজড পরীক্ষা চালানো হয়। এসব ক্লিনিকে চিকিৎসার বড় অংশ দেন clinical officer—তিন বছরের ডিপ্লোমাপ্রাপ্ত মধ্যস্তরের চিকিৎসাকর্মী—যাদের কাছে সব সময় জ্যেষ্ঠ চিকিৎসকের পরামর্শ সহজে পাওয়া যায় না।
Randomization রোগীকে নয়, চিকিৎসককে করা হয়। মোট 103 ক্লিনিক্যাল officer: 52 জন হস্তক্ষেপ শাখায় এবং 51 জন নিয়ন্ত্রণ শাখায়। উভয় দল একই মেঘ-ভিত্তিক ইলেকট্রনিক চিকিৎসাবিষয়ক নথি ব্যবহার করেছে। হস্তক্ষেপ শাখা অতিরিক্তভাবে AI পরামর্শ নেওয়া 2.0 পেয়েছিল—OpenAI GPT-4o-ভিত্তিক জেনারেটিভ সিদ্ধান্ত-সহায়ক সরঞ্জাম, যা নথির ভেতরেই চিকিৎসকের লেখা তথ্য পড়ে রোগনির্ণয় বা চিকিৎসা পরিকল্পনায় সম্ভাব্য সমস্যা চিহ্নিত করতে পারত। চূড়ান্ত সিদ্ধান্ত চিকিৎসকেরই: ইঙ্গিত গ্রহণ, বদলানো বা উপেক্ষা—সবই তার হাতে।
কোন মডেল ছিল, আর নির্দিষ্ট বিবরণটি কেন গুরুত্বপূর্ণ
AI পরামর্শব্যবস্থা 2.0 OpenAI-এর GPT-4o-র মে 2025 সংস্করণ ব্যবহার করেছিল, এন্টারপ্রাইজ-স্তরের বাণিজ্যিক API-এর মাধ্যমে এবং কম এলোমেলোতা (temperature 0.1) রেখে। এটি EasyClinic-এর বিশেষভাবে তৈরি EMR-এর ভেতরে বসানো ছিল এবং Kenya-র জাতীয় চিকিৎসা নির্দেশিকার সঙ্গে সামঞ্জস্য রাখতে system prompt দিয়ে নির্দেশিত করা হয়েছিল; লেখকেরা পুরো নির্দেশনা-প্রম্পট প্রকাশ করেছেন।
ফলটি তাই “চিকিৎসাবিজ্ঞানে LLM” সম্পর্কে চিরস্থায়ী কোনো রায় নয়। এটি নির্দিষ্ট একটি মডেল-সংস্করণ, প্রম্পট, ইলেকট্রনিক নথি ও ক্লিনিক্যাল পরিবেশের ফল। লেখকেরা একে সময়-নির্দিষ্ট মানদণ্ড বলেছেন—নতুন মডেল, ভিন্ন প্রম্পট বা কম ডিজিটালাইজড ক্লিনিকে ফল বদলাতে পারে। OpenAI পরে ক্লাউড-কম্পিউট ক্রেডিট ও API-সংক্রান্ত প্রযুক্তিগত সহায়তা দিয়েছিল, তবে লেখকদের মতে মডেলটি সেই সহায়তার প্রস্তাবের আগেই বেছে নেওয়া হয়েছিল এবং OpenAI পরীক্ষা-নকশা, তথ্য সংগ্রহ, বিশ্লেষণ বা প্রকাশনার সিদ্ধান্তে ভূমিকা রাখেনি।
22 এপ্রিল থেকে 16 জুলাই 2025 পর্যন্ত 9,691 রোগী অন্তর্ভুক্ত হয়। প্রধান ফলাফল ইচ্ছাকৃতভাবে রোগী-centered ও কঠোর ছিল: সাক্ষাৎের 14 দিনের মধ্যে বিশেষজ্ঞ-adjudicated সমন্বিত চিকিৎসা ব্যর্থতা। গবেষণা শাখা না-জেনে চিকিৎসক প্যানেল বিচার করেছে অসুস্থতা অমীমাংসিত বা খারাপ হওয়ার মতো খারাপ ফলাফল হয়েছে কি না। পরীক্ষা আগে থেকেই Pan-African ক্লিনিক্যাল পরীক্ষাগুলো Registry-তে 202502499779176 নম্বরে registered ছিল।
এটাই নকশার মূল শক্তি। AI চিকিৎসক কী লিখেছে তা বদলেছে কি না দেখানো সহজ; রোগীর কী হয়েছে তা বদলেছে কি না দেখানো অনেক কঠিন এবং বেশি অর্থবহ।
তারা কী পেয়েছেন
প্রধান ফলাফল উন্নত হয়নি। AI শাখায় 4,693 জনের মধ্যে 102 জনের (2.2%) চিকিৎসা ব্যর্থতা হয়; নিয়ন্ত্রণ শাখায় 4,654 জনের মধ্যে 94 জনের (2.0%)। কাঁচা শতাংশ AI শাখায় সামান্য বেশি হলেও গুচ্ছ পার্থক্য বদলানো করার পর বিন্দু অনুমান উপকারের দিকে যায়: সমন্বয়কৃত odds অনুপাত 0.77 (95% CI 0.55–1.08, P = 0.13)। এটি পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ নয়। কাঁচা ও সমন্বয়কৃত দিকের পার্থক্য arithmetic ত্রুটি নয়; adjustment চিকিৎসক-গুচ্ছের পার্থক্য হিসাব করে। আস্থার ব্যবধান “না প্রভাব” অন্তর্ভুক্ত করে, তাই উপকার দাবি করা যায় না; পরম পার্থক্য-ও খুব ছোট।
Odds অনুপাত, আস্থার ব্যবধান ও P মান একসঙ্গে পড়ার সাধারণ ব্যাখ্যার জন্য ক্লিনিক্যাল ফলাফল নির্দেশিকা দেখা যেতে পারে।
নিরাপত্তা-সংকেত পাওয়া যায়নি—কিন্তু সীমার মধ্যে। সরঞ্জামের সঙ্গে সম্পর্কিত বলে বিচার করা কোনো গুরুতর বিরূপ ঘটনা ছিল না, এবং স্বাধীন পর্যালোচনা-ও নিরাপত্তা-সংকেত পায়নি। তবে বিরল গুরুতর ক্ষতি ধরার মতো পরিসংখ্যানগত ক্ষমতা পরীক্ষায় ছিল না; পূর্বনির্ধারিত noninferiority বা আনুষ্ঠানিক নিরাপত্তা কাঠামো-ও ছিল না। তাই uncommon ক্ষতির ক্ষেত্রে সরঞ্জাম “নিরাপদ প্রমাণিত”—এ কথা বলা যায় না।
নথিবদ্ধকরণ ভালো হয়েছে। Blinded বিশেষজ্ঞ দ্বারা পর্যালোচনা করা 2,000 সাক্ষাৎে AI পরামর্শ নেওয়া ব্যবহারকারী চিকিৎসকদের নথিবদ্ধকরণ সব rated ক্ষেত্রেই উন্নত ছিল—রেকর্ড করা রোগনির্ণয়, চিকিৎসা পরিকল্পনা এবং সামগ্রিক পূর্ণতা।
ওষুধ দেওয়া প্রায় বদলায়নি। সংশোধন করা অ্যান্টিবায়োটিক ব্যবহার-সহ ওষুধ দেওয়ায় তাৎপর্যপূর্ণ পার্থক্য ছিল না (সমন্বয়কৃত odds অনুপাত 0.86, 95% CI 0.48–1.55)। অ্যান্টিবায়োটিক ওষুধ দেওয়া হার সরঞ্জাম বদলায়নি।
রোগী সন্তুষ্টি বদলায়নি। সমীক্ষা শেষ করা 826 রোগীর সন্তুষ্টি দুই শাখায় প্রায় অভিন্ন; consultation সময়ও কাছাকাছি ছিল।
খরচ সামান্য নিচের দিকে ইঙ্গিত করেছে। সমন্বয়কৃত বিশ্লেষণে AI শাখার অ্যান্টিবায়োটিক-সম্পর্কিত খরচ কম ছিল—সম্ভবত প্রেসক্রিপশন কমানোর বদলে কম দামের বিকল্প বেছে নেওয়ার কারণে। প্রতিরোগী অ্যান্টিবায়োটিক সাশ্রয় সরঞ্জাম চালানোর প্রতিরোগী খরচের চেয়েও বেশি মনে হয়েছে। কিন্তু লেখকেরা এটিকে ইঙ্গিতবহ বলেছেন; সম্পূর্ণ মোট-খরচ-of-ownership অর্থনৈতিক মূল্যায়ন পরীক্ষার পরিধিতে ছিল না।
সব মিলিয়ে লেখকদের সংক্ষিপ্ত ব্যাখ্যাই পরিষ্কার: এই সীমার মধ্যে LLM assistance-এর নিরাপত্তা-সংকেত ছিল না, কিন্তু 14 দিনের চিকিৎসা ব্যর্থতা কমেনি; উপকার থাকলে সম্ভবত মাঝারি।
“তাৎপর্যপূর্ণ পার্থক্য নেই” মানে “কাজ করে না” নয়
শূন্য প্রধান ফলাফল দুই দিকেই অতিরিক্ত পড়া যায়। দুটি কারণ সহজ রায় আটকায়।
প্রথমত, পরীক্ষা যে প্রভাব শনাক্ত করার জন্য নকশা হয়েছিল, পর্যবেক্ষিত প্রভাব তার চেয়ে ছোট। প্রাথমিক চিকিৎসাসেবা-তে গুরুতর খারাপ ফলাফল বিরল—এখানে প্রায় 2%। শব্দদূষণ থেকে ছোট বাস্তব উপকার আলাদা করতে খুব বড় নমুনা লাগে। লেখকদের পরবর্তী বিশ্লেষণ ক্ষমতা হিসাব অনুযায়ী পর্যবেক্ষিত মাত্রার প্রভাব ধরতে 100,000-এরও বেশি রোগীর নির্দেশ দেওয়ার পরীক্ষা দরকার হতে পারে। এই নমুনায় অ-তাৎপর্যপূর্ণ ফল ছোট উপকার অসম্ভব প্রমাণ করে না; শুধু বলে এই গবেষণা সেটি সমাধান করতে পারেনি।
দ্বিতীয়ত, দুই শাখার পার্থক্য কিছুটা ঝাপসা হয়ে গিয়েছিল। বিন্যাসগত ত্রুটির কারণে কিছু সময় নিয়ন্ত্রণ-শাখার চিকিৎসকেরাও AI পরামর্শে প্রবেশাধিকার পেয়েছিলেন। একই নেটওয়ার্কের চিকিৎসকেরা আবার পরস্পরের সঙ্গে কথা বলেন এবং কাজের অভ্যাস ভাগ করে নিতে পারেন। দুটো কারণেই intervention ও control গোষ্ঠী বাস্তবে আরও কাছাকাছি হয়ে যেতে পারে; সত্যিকারের কোনো পার্থক্য থাকলে এতে মাপা প্রভাব শূন্যের দিকে টেনে নামবে। উপরন্তু, Penda নেটওয়ার্কে আগেই তুলনামূলক উচ্চ মানের সেবা ছিল, তাই উন্নতির সুযোগও সীমিত ছিল।
এগুলো “বড় অগ্রগতি” শিরোনাম উদ্ধার করে না। সঠিক পাঠ আরও ক্যালিব্রেটেড: সবচেয়ে কঠিন রোগী শেষবিন্দুতে সরঞ্জাম দুই সপ্তাহে দেখানো সম্ভব উপকার দেখায়নি; কিন্তু নথি-keeping উন্নত করেছে এবং নিরাপত্তা-সংকেত দেয়নি।
এই গবেষণা কী প্রমাণ করে না
- AI রোগীর ফলাফল উন্নত করেছে—এটি দেখায় না। 14-দিন প্রধান পূর্বনির্ধারিত ফলসূচকে তাৎপর্যপূর্ণ উপকার ছিল না।
- AI অকার্যকর—এটিও দেখায় না। সমন্বয়কৃত বিন্দু অনুমান উপকারের দিকে, নথিবদ্ধকরণ উন্নত, ওষুধ খরচ কমার সংকেত আছে; ছোট উপকার নিশ্চিত করার জন্য নমুনা অপর্যাপ্ত হতে পারে।
- বিরল ক্ষতির ক্ষেত্রে সরঞ্জাম নিরাপদ প্রমাণিত—এ কথা বলা যায় না। বিরল গুরুতর ঘটনা ধরার মতো নকশা/ক্ষমতা ছিল না।
- “AI চিকিৎসককে হারায়” বা চিকিৎসক প্রতিস্থাপন করে—এটি নয়। এটি সিদ্ধান্ত-সহায়তা; চূড়ান্ত কর্তৃত্ব চিকিৎসকের।
- Kenya-র একটি শহুরে বেসরকারি স্বাস্থ্যসেবা নেটওয়ার্কে পাওয়া ফল গ্রামীণ, peri-urban বা উচ্চ-আয়ের দেশের পরিবেশে স্বয়ংক্রিয়ভাবে প্রযোজ্য ধরে নেওয়া যায় না।
- খরচ সাশ্রয় প্রতিষ্ঠিত হয়নি; সংকেত আছে, সম্পূর্ণ অর্থনৈতিক মূল্যায়ন নেই।
প্রমাণ কতটা শক্ত?
কেন্দ্রীয় দাবি—সংক্ষিপ্ত-পরিভাষা রোগী ক্ষতি কমেছে বলে প্রমাণ নেই—এর জন্য নকশা শক্তিশালী, উপসংহার যথাযথভাবে সংযত। ভবিষ্যতমুখী, আগে থেকে নিবন্ধিত, গুচ্ছর্যান্ডমাইজড পরীক্ষা এবং blinded রোগী-স্তর সমন্বিত ফলাফল বাস্তব ক্লিনিক্যাল AI-এর জন্য মানদণ্ড/সংক্ষিপ্ত ক্লিনিক্যাল বর্ণনা গবেষণার তুলনায় অনেক বেশি informative।
গৌণ সিদ্ধান্ত—নথিবদ্ধকরণ উন্নতি, ওষুধ দেওয়া অপরিবর্তিত, সন্তুষ্টি একই, অ্যান্টিবায়োটিক খরচ কিছুটা কম—ভালো প্রমাণ, কিন্তু গৌণ হিসেবেই পড়তে হবে। একই দূষণ ও একক-নেটওয়ার্ক সীমাবদ্ধতা এগুলোতেও আছে।
নিরাপত্তা প্রমাণ আশ্বস্তকর কিন্তু সীমাবদ্ধ: কোনো সংকেত পাওয়া যায়নি, তবে বিরল ক্ষতি ধরার গবেষণা নয়।
সবচেয়ে সঠিক অবস্থান “কাজ করে” বা “ব্যর্থ”—দুটোর কোনোটিই নয়। বাস্তব জগতের র্যান্ডমাইজড পরীক্ষায় সরঞ্জাম নিরাপত্তা-সংকেত দেয়নি এবং সেবা প্রক্রিয়া উন্নত করেছে, কিন্তু দুই সপ্তাহে রোগী উপকার দেখানো করেনি; এমন ছোট উপকার ধরতে অনেক বড় পরীক্ষা লাগতে পারে।
কেন এটি গুরুত্বপূর্ণ
চিকিৎসাবিষয়ক AI নিয়ে বিতর্কে এই ধরনের প্রমাণ খুব কম। পরীক্ষা স্কোর, মানদণ্ড এবং tidy সংক্ষিপ্ত ক্লিনিক্যাল বর্ণনায় চিকিৎসক-মিলযুক্ত গবেষণাপত্র হাজার হাজার আছে; বাস্তব রোগী ভালো হলো কি না মাপা বড় ব্যবহারিক র্যান্ডমাইজড পরীক্ষা খুব অল্প। এই গবেষণা তাদের একটি। তার অনাড়ম্বর শিক্ষা: পরীক্ষা পাস করা আর রোগীকে সাহায্য করা এক জিনিস নয়।
একটি সরঞ্জাম চিকিৎসকের কাজে বাস্তবভাবে উপযোগী হতে পারে—ভালো note, দ্বিতীয় জোড়া of চোখ, কম ওষুধ খরচ—তবু 14 দিনে কঠিন রোগীর ফলাফল নড়াতে না-ও পারে। দুই সত্য একসঙ্গে থাকতে পারে। পরিণত স্বাস্থ্য ব্যবস্থাকে সুবিধাজনক একটি বয়ান বেছে নেওয়ার বদলে দুটোই ধরে রাখতে হবে।
এটি বোঝা of প্রমাণ-ও সঠিক জায়গায় ফেরায়। ক্লিনিক্যাল AI সেবা উন্নত করে—এ দাবি করলে প্রাসঙ্গিক প্রমাণ লিডারবোর্ড নয়; রোগী-প্রাসঙ্গিক ফলাফল সহ পরীক্ষা। আর মাঝারি উপকার সত্যিই থাকলে তা দেখতে সম্ভবত আরও বড় পরীক্ষা দরকার।
সংক্ষিপ্ত সারাংশ
Kenya-র 16 প্রধান-সেবা কেন্দ্রে গুচ্ছর্যান্ডমাইজড ব্যবহারিক পরীক্ষায় ক্লিনিক্যাল officer-দের ইলেকট্রনিক নথির সঙ্গে জেনারেটিভ AI সিদ্ধান্ত-সহায়ক AI পরামর্শ নেওয়া যোগ করা হয়। মোট 9,691 রোগীর মধ্যে বিশেষজ্ঞ-adjudicated 14-দিন চিকিৎসা-ব্যর্থতা সমন্বিত ছিল AI শাখায় 2.2% এবং নিয়ন্ত্রণে 2.0%; সমন্বয়কৃত OR 0.77, 95% CI 0.55–1.08, P=0.13—তাৎপর্যপূর্ণ পার্থক্য নয়। সরঞ্জামের সঙ্গে নিরাপত্তা-সংকেত পাওয়া যায়নি; নথিবদ্ধকরণ সব rated ক্ষেত্রে উন্নত হয়েছে; ওষুধ দেওয়া বা সন্তুষ্টি বদলায়নি; অ্যান্টিবায়োটিক খরচ কিছুটা কমার সংকেত ছিল। লেখকদের উপসংহার: এই সীমার মধ্যে সরঞ্জাম আশ্বস্তকর, কিন্তু চিকিৎসা ব্যর্থতা কমানোর প্রমাণ নেই; পর্যবেক্ষিত প্রভাবের মতো উপকার ধরতে 100,000-এর নির্দেশ দেওয়ার রোগী লাগতে পারে। এটি ক্লিনিক্যাল AI রোগীর ফলাফল উন্নত করে প্রমাণ করে না, আবার অকার্যকর-ও প্রমাণ করে না।
সরাসরি যাচাই
পেপার যা দেখায়: বাস্তব র্যান্ডমাইজড প্রধান-সেবা পরীক্ষায় LLM-ভিত্তিক সিদ্ধান্ত-সহায়তার নিরাপত্তা-সংকেত ধরা পড়েনি, চিকিৎসা নথিবদ্ধকরণ উন্নত হয়েছে, ওষুধ দেওয়া উল্লেখযোগ্যভাবে বদলায়নি এবং কঠোর 14-দিন চিকিৎসা-ব্যর্থতা শেষবিন্দু উল্লেখযোগ্যভাবে কমেনি।
যা সম্ভব, কিন্তু প্রমাণিত নয়: পর্যবেক্ষিত ছোট প্রভাব সত্যিকারের মাঝারি উপকার হতে পারে; সম্পূর্ণ খরচ গণনায় টাকা বাঁচতে পারে; ভালো নথিবদ্ধকরণ ভবিষ্যতে ভালো সেবায় রূপ নিতে পারে।
যা দেখায় না: ক্লিনিক্যাল AI রোগীর ফলাফল উন্নত করে; বিরল ঘটনায় নিরাপত্তা প্রতিষ্ঠিত; AI চিকিৎসক প্রতিস্থাপন করা/outperform করে; ফল সব বিন্যাসে সাধারণীকরণ করে; খরচ সাশ্রয় নিশ্চিত।
প্রধান সীমাবদ্ধতা: পর্যবেক্ষিত প্রভাবের তুলনায় পরীক্ষা ছোট; নিয়ন্ত্রণ-শাখা দূষণ ও যৌথ-নেটওয়ার্ক আচরণ পার্থক্যকে শূন্যর দিকে পক্ষপাত করতে পারে; এক ব্যক্তিগত urban নেটওয়ার্ক; পূর্বনির্ধারিত noninferiority/নিরাপত্তা কাঠামো নেই; অনুসরণকালীন 14 দিন।
সাধারণ পাঠকের আস্থা কতটা হওয়া উচিত? নথিবদ্ধকরণ improvement এবং এই পরীক্ষায় নিরাপত্তা-সংকেত না-পাওয়া—উচ্চ। 14-দিন রোগীর ফলাফল demonstrably improve না-হওয়া—উচ্চ। সরঞ্জাম রোগী-উপকার হস্তক্ষেপ হিসেবে “কাজ করে” বা “ব্যর্থ”—এই দুই রায়ের জন্য কম; প্রশ্নটি এখনও খোলা।
উৎস
ভিত্তি: Generative AI-enabled clinical decision support system in primary care: a pragmatic, cluster-randomized trial — Ambrose Agweyu, Paul Mwaniki, Vaishnavi Menon, Robert Korom, Lynda Isaaka, Conrad Wanyama, Xiaoxuan Liu & Bilal A. Mateen (and colleagues), Nature Medicine (2026).
সম্পাদকীয় নোট
এই নিবন্ধটি AI লিখেছে এবং সম্পাদকীয় দল পর্যালোচনা করেছে। এটি সংযুক্ত গবেষণার একটি পরিষ্কার ও সতর্ক ব্যাখ্যা, মূল গবেষণাপত্র পড়ার বিকল্প নয়। নির্বাচন, ব্যাখ্যা ও চূড়ান্ত ভাষার দায়িত্ব সম্পাদকের।