নিরাপদ ও কাজে লাগা মানেই কার্যকর নয়
চিকিৎসাবিষয়ক AI নিয়ে বহু শিরোনাম ভুল ধরনের প্রমাণ থেকে তৈরি হয়। কোনো মডেল পরীক্ষার প্রশ্নে ভালো স্কোর করে, অথবা সাজানো ক্লিনিক্যাল বর্ণনায় চিকিৎসকদের ছাড়িয়ে যায়, আর সেখান থেকে খুব দ্রুত সিদ্ধান্ত আসে—যন্ত্র নাকি ক্লিনিকের জন্য প্রস্তুত।
এই পরীক্ষা আরও কঠিন প্রশ্ন করেছে। একটি জেনারেটিভ AI সিদ্ধান্তসহায়ক সরঞ্জামকে বাস্তব প্রাথমিক চিকিৎসাসেবা কেন্দ্রে, বাস্তব চিকিৎসক ও বাস্তব রোগীর সঙ্গে ব্যবহার করে দেখা হয়েছে: রোগীদের ফলাফল কি সত্যিই ভালো হয়েছে?
সংক্ষেপে উত্তর হলো—14 দিনের মধ্যে তা পরিমাপযোগ্যভাবে ভালো হয়নি। সরঞ্জামটির সঙ্গে কোনো নিরাপত্তা-সংকেত ধরা পড়েনি; চিকিৎসা নথিবদ্ধকরণ উন্নত হয়েছে; অ্যান্টিবায়োটিকের কিছু খরচ কমতেও পারে। কিন্তু পূর্বনির্ধারিত চিকিৎসা-ব্যর্থতা শেষবিন্দু উল্লেখযোগ্যভাবে কমেনি, এবং লেখকেরাও বলেন—উপকার থাকলেও সম্ভবত ছোট।
এটি গবেষণার ব্যর্থতা নয়; বরং ভালো পরীক্ষার কাজ। চিকিৎসাবিষয়ক AI-কে মানদণ্ড নয়, রোগীর ফলাফল দিয়ে মাপলে প্রমাণ দেখতে এমনই হয়।
গবেষকেরা কী করেছেন
Kenya-র Nairobi ও Kiambu কাউন্টিতে Penda Health-এর বেসরকারি নেটওয়ার্কের 16টি প্রাথমিক-চিকিৎসা কেন্দ্রে ব্যবহারিক গুচ্ছ-র্যান্ডমাইজড পরীক্ষা চালানো হয়। এসব ক্লিনিকে চিকিৎসার বড় অংশ দেন ক্লিনিক্যাল কর্মকর্তা—তিন বছরের ডিপ্লোমাপ্রাপ্ত মধ্যস্তরের চিকিৎসাকর্মী—যাদের কাছে সব সময় জ্যেষ্ঠ চিকিৎসকের পরামর্শ সহজে পাওয়া যায় না।
র্যান্ডমাইজেশন রোগীকে নয়, চিকিৎসককে করা হয়। মোট 103 ক্লিনিক্যাল কর্মকর্তা: 52 জন হস্তক্ষেপ শাখায় এবং 51 জন নিয়ন্ত্রণ শাখায়। উভয় দল একই মেঘ-ভিত্তিক ইলেকট্রনিক চিকিৎসাবিষয়ক নথি ব্যবহার করেছে। হস্তক্ষেপ শাখা অতিরিক্তভাবে AI পরামর্শ 2.0 পেয়েছিল—OpenAI GPT-4o-ভিত্তিক জেনারেটিভ সিদ্ধান্তসহায়ক সরঞ্জাম, যা নথির ভেতরেই চিকিৎসকের লেখা তথ্য পড়ে রোগনির্ণয় বা চিকিৎসা পরিকল্পনায় সম্ভাব্য সমস্যা চিহ্নিত করতে পারত। চূড়ান্ত সিদ্ধান্ত চিকিৎসকেরই: ইঙ্গিত গ্রহণ, বদলানো বা উপেক্ষা—সবই তার হাতে।
কোন মডেল ছিল, আর নির্দিষ্ট বিবরণটি কেন গুরুত্বপূর্ণ
AI পরামর্শব্যবস্থা 2.0 OpenAI-এর GPT-4o-র মে 2025 সংস্করণ ব্যবহার করেছিল, এন্টারপ্রাইজ-স্তরের বাণিজ্যিক API-এর মাধ্যমে এবং কম এলোমেলোতা (তাপমাত্রা 0.1) রেখে। এটি EasyClinic-এর বিশেষভাবে তৈরি EMR-এর ভেতরে বসানো ছিল এবং Kenya-র জাতীয় চিকিৎসা নির্দেশিকার সঙ্গে সামঞ্জস্য রাখতে সিস্টেম প্রম্পট দিয়ে নির্দেশিত করা হয়েছিল; লেখকেরা পুরো নির্দেশনা-প্রম্পট প্রকাশ করেছেন।
ফলটি তাই “চিকিৎসাবিজ্ঞানে LLM” সম্পর্কে চিরস্থায়ী কোনো রায় নয়। এটি নির্দিষ্ট একটি মডেল-সংস্করণ, প্রম্পট, ইলেকট্রনিক নথি ও ক্লিনিক্যাল পরিবেশের ফল। লেখকেরা একে সময়-নির্দিষ্ট মানদণ্ড বলেছেন—নতুন মডেল, ভিন্ন প্রম্পট বা কম ডিজিটালাইজড ক্লিনিকে ফল বদলাতে পারে। OpenAI পরে ক্লাউড-কম্পিউট ক্রেডিট ও API-সংক্রান্ত প্রযুক্তিগত সহায়তা দিয়েছিল, তবে লেখকদের মতে মডেলটি সেই সহায়তার প্রস্তাবের আগেই বেছে নেওয়া হয়েছিল এবং OpenAI পরীক্ষা-নকশা, তথ্য সংগ্রহ, বিশ্লেষণ বা প্রকাশনার সিদ্ধান্তে ভূমিকা রাখেনি।
22 এপ্রিল থেকে 16 জুলাই 2025 পর্যন্ত 9,691 রোগী অন্তর্ভুক্ত হয়। প্রধান ফলাফল ইচ্ছাকৃতভাবে রোগী-কেন্দ্রিক ও কঠোর ছিল: সাক্ষাৎের 14 দিনের মধ্যে বিশেষজ্ঞ-নির্ণীত সমন্বিত চিকিৎসা ব্যর্থতা। গবেষণা শাখা না-জেনে চিকিৎসক প্যানেল বিচার করেছে অসুস্থতা অমীমাংসিত বা খারাপ হওয়ার মতো খারাপ ফলাফল হয়েছে কি না। পরীক্ষা আগে থেকেই Pan-African ক্লিনিক্যাল পরীক্ষাগুলো রেজিস্ট্রিতে 202502499779176 নম্বরে নিবন্ধিত ছিল।
এটাই নকশার মূল শক্তি। AI চিকিৎসক কী লিখেছে তা বদলেছে কি না দেখানো সহজ; রোগীর কী হয়েছে তা বদলেছে কি না দেখানো অনেক কঠিন এবং বেশি অর্থবহ।
তারা কী পেয়েছেন
প্রধান ফলাফল উন্নত হয়নি। AI শাখায় 4,693 জনের মধ্যে 102 জনের (2.2%) চিকিৎসা ব্যর্থতা হয়; নিয়ন্ত্রণ শাখায় 4,654 জনের মধ্যে 94 জনের (2.0%)। কাঁচা শতাংশ AI শাখায় সামান্য বেশি হলেও গুচ্ছভিত্তিক পার্থক্য সমন্বয় করার পর বিন্দু অনুমান উপকারের দিকে যায়: সমন্বয়কৃত অডস অনুপাত 0.77 (95% CI 0.55–1.08, P = 0.13)। এটি পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ নয়। কাঁচা ও সমন্বয়কৃত দিকের পার্থক্য গাণিতিক ত্রুটি নয়; সমন্বয় চিকিৎসক-গুচ্ছের পার্থক্য হিসাব করে। আস্থার ব্যবধান “কোনো প্রভাব নেই” অবস্থাকে অন্তর্ভুক্ত করে, তাই উপকার দাবি করা যায় না; পরম পার্থক্যও খুব ছোট।
অডস অনুপাত, আস্থার ব্যবধান ও P মান একসঙ্গে পড়ার সাধারণ ব্যাখ্যার জন্য ক্লিনিক্যাল ফলাফল নির্দেশিকা দেখা যেতে পারে।
নিরাপত্তা-সংকেত পাওয়া যায়নি—কিন্তু সীমার মধ্যে। সরঞ্জামের সঙ্গে সম্পর্কিত বলে বিচার করা কোনো গুরুতর বিরূপ ঘটনা ছিল না, এবং স্বাধীন পর্যালোচনাও নিরাপত্তা-সংকেত পায়নি। তবে বিরল গুরুতর ক্ষতি ধরার মতো পরিসংখ্যানগত ক্ষমতা পরীক্ষায় ছিল না; পূর্বনির্ধারিত অ-নিকৃষ্টতা বা আনুষ্ঠানিক নিরাপত্তা কাঠামোও ছিল না। তাই অস্বাভাবিক ক্ষতির ক্ষেত্রে সরঞ্জাম “নিরাপদ প্রমাণিত”—এ কথা বলা যায় না।
নথিবদ্ধকরণ ভালো হয়েছে। ব্লাইন্ড বিশেষজ্ঞদের দ্বারা পর্যালোচনা করা 2,000 সাক্ষাৎে AI পরামর্শ ব্যবহারকারী চিকিৎসকদের নথিবদ্ধকরণ সব মূল্যায়িত ক্ষেত্রেই উন্নত ছিল—রেকর্ড করা রোগনির্ণয়, চিকিৎসা পরিকল্পনা এবং সামগ্রিক পূর্ণতা।
ওষুধ দেওয়া প্রায় বদলায়নি। সমন্বয়কৃত বিশ্লেষণে অ্যান্টিবায়োটিকসহ ওষুধ দেওয়ায় তাৎপর্যপূর্ণ পার্থক্য ছিল না (সমন্বয়কৃত অডস অনুপাত 0.86, 95% CI 0.48–1.55)। অ্যান্টিবায়োটিক ওষুধ দেওয়া হার সরঞ্জাম বদলায়নি।
রোগী সন্তুষ্টি বদলায়নি। সমীক্ষা শেষ করা 826 রোগীর সন্তুষ্টি দুই শাখায় প্রায় অভিন্ন; পরামর্শ সময়ও কাছাকাছি ছিল।
খরচ সামান্য কমার ইঙ্গিত দিয়েছে। সমন্বয়কৃত বিশ্লেষণে AI শাখার অ্যান্টিবায়োটিক-সম্পর্কিত খরচ কম ছিল—সম্ভবত প্রেসক্রিপশন কমানোর বদলে কম দামের বিকল্প বেছে নেওয়ার কারণে। প্রতিরোগী অ্যান্টিবায়োটিক সাশ্রয় সরঞ্জাম চালানোর প্রতিরোগী খরচের চেয়েও বেশি মনে হয়েছে। কিন্তু লেখকেরা এটিকে ইঙ্গিতবহ বলেছেন; সম্পূর্ণ মালিকানার মোট খরচ অর্থনৈতিক মূল্যায়ন পরীক্ষার পরিধিতে ছিল না।
সব মিলিয়ে লেখকদের সংক্ষিপ্ত ব্যাখ্যাই পরিষ্কার: এই সীমার মধ্যে LLM সহায়তার নিরাপত্তা-সংকেত ছিল না, কিন্তু 14 দিনের চিকিৎসা ব্যর্থতা কমেনি; উপকার থাকলে সম্ভবত মাঝারি।
“তাৎপর্যপূর্ণ পার্থক্য নেই” মানে “কাজ করে না” নয়
শূন্য প্রধান ফলাফল দুই দিকেই অতিরিক্ত পড়া যায়। দুটি কারণ সহজ রায় আটকায়।
প্রথমত, পরীক্ষা যে প্রভাব শনাক্ত করার জন্য নকশা হয়েছিল, পর্যবেক্ষিত প্রভাব তার চেয়ে ছোট। প্রাথমিক চিকিৎসাসেবায় গুরুতর খারাপ ফলাফল বিরল—এখানে প্রায় 2%। শব্দদূষণ থেকে ছোট বাস্তব উপকার আলাদা করতে খুব বড় নমুনা লাগে। লেখকদের পরবর্তী বিশ্লেষণ ক্ষমতা হিসাব অনুযায়ী পর্যবেক্ষিত মাত্রার প্রভাব ধরতে 100,000-এরও বেশি রোগীর পরীক্ষা দরকার হতে পারে। এই নমুনায় অ-তাৎপর্যপূর্ণ ফল ছোট উপকার অসম্ভব প্রমাণ করে না; শুধু বলে এই গবেষণা সেটি সমাধান করতে পারেনি।
দ্বিতীয়ত, দুই শাখার পার্থক্য কিছুটা ঝাপসা হয়ে গিয়েছিল। বিন্যাসগত ত্রুটির কারণে কিছু সময় নিয়ন্ত্রণ-শাখার চিকিৎসকেরাও AI পরামর্শে প্রবেশাধিকার পেয়েছিলেন। একই নেটওয়ার্কের চিকিৎসকেরা আবার পরস্পরের সঙ্গে কথা বলেন এবং কাজের অভ্যাস ভাগ করে নিতে পারেন। দুটো কারণেই হস্তক্ষেপ ও নিয়ন্ত্রণ গোষ্ঠী বাস্তবে আরও কাছাকাছি হয়ে যেতে পারে; সত্যিকারের কোনো পার্থক্য থাকলে এতে মাপা প্রভাব শূন্যের দিকে টেনে নামবে। উপরন্তু, Penda নেটওয়ার্কে আগেই তুলনামূলক উচ্চ মানের সেবা ছিল, তাই উন্নতির সুযোগও সীমিত ছিল।
এগুলো “বড় অগ্রগতি” শিরোনাম উদ্ধার করে না। সঠিক পাঠ আরও ক্যালিব্রেটেড: সবচেয়ে কঠিন রোগী শেষবিন্দুতে সরঞ্জাম দুই সপ্তাহে দেখানো সম্ভব উপকার দেখায়নি; কিন্তু নথি-রাখা উন্নত করেছে এবং নিরাপত্তা-সংকেত দেয়নি।
এই গবেষণা কী প্রমাণ করে না
- AI রোগীর ফলাফল উন্নত করেছে—এটি দেখায় না। 14-দিন প্রধান পূর্বনির্ধারিত ফলসূচকে তাৎপর্যপূর্ণ উপকার ছিল না।
- AI অকার্যকর—এটিও দেখায় না। সমন্বয়কৃত বিন্দু অনুমান উপকারের দিকে, নথিবদ্ধকরণ উন্নত, ওষুধ খরচ কমার সংকেত আছে; ছোট উপকার নিশ্চিত করার জন্য নমুনা অপর্যাপ্ত হতে পারে।
- বিরল ক্ষতির ক্ষেত্রে সরঞ্জাম নিরাপদ প্রমাণিত—এ কথা বলা যায় না। বিরল গুরুতর ঘটনা ধরার মতো নকশা/ক্ষমতা ছিল না।
- “AI চিকিৎসককে হারায়” বা চিকিৎসক প্রতিস্থাপন করে—এটি নয়। এটি সিদ্ধান্তসহায়তা; চূড়ান্ত কর্তৃত্ব চিকিৎসকের।
- Kenya-র একটি শহুরে বেসরকারি স্বাস্থ্যসেবা নেটওয়ার্কে পাওয়া ফল গ্রামীণ, শহরতলিসংলগ্ন বা উচ্চ-আয়ের দেশের পরিবেশে স্বয়ংক্রিয়ভাবে প্রযোজ্য ধরে নেওয়া যায় না।
- খরচ সাশ্রয় প্রতিষ্ঠিত হয়নি; সংকেত আছে, সম্পূর্ণ অর্থনৈতিক মূল্যায়ন নেই।
প্রমাণ কতটা শক্ত?
কেন্দ্রীয় দাবি—স্বল্পমেয়াদি রোগী-ক্ষতি কমেছে বলে প্রমাণ নেই—এর জন্য নকশা শক্তিশালী, উপসংহার যথাযথভাবে সংযত। ভবিষ্যতমুখী, আগে থেকে নিবন্ধিত, গুচ্ছ-র্যান্ডমাইজড পরীক্ষা এবং ব্লাইন্ড রোগী-স্তর সমন্বিত ফলাফল বাস্তব ক্লিনিক্যাল AI-এর জন্য মানদণ্ড/সংক্ষিপ্ত ক্লিনিক্যাল বর্ণনা গবেষণার তুলনায় অনেক বেশি তথ্যবহুল।
গৌণ সিদ্ধান্ত—নথিবদ্ধকরণ উন্নতি, ওষুধ দেওয়া অপরিবর্তিত, সন্তুষ্টি একই, অ্যান্টিবায়োটিক খরচ কিছুটা কম—ভালো প্রমাণ, কিন্তু গৌণ হিসেবেই পড়তে হবে। একই দূষণ ও একক-নেটওয়ার্ক সীমাবদ্ধতা এগুলোতেও আছে।
নিরাপত্তা প্রমাণ আশ্বস্তকর কিন্তু সীমাবদ্ধ: কোনো সংকেত পাওয়া যায়নি, তবে বিরল ক্ষতি ধরার গবেষণা নয়।
সবচেয়ে সঠিক অবস্থান “কাজ করে” বা “ব্যর্থ”—দুটোর কোনোটিই নয়। বাস্তব জগতের র্যান্ডমাইজড পরীক্ষায় সরঞ্জাম নিরাপত্তা-সংকেত দেয়নি এবং সেবা প্রক্রিয়া উন্নত করেছে, কিন্তু দুই সপ্তাহে রোগী উপকার দেখাতে পারেনি; এমন ছোট উপকার ধরতে অনেক বড় পরীক্ষা লাগতে পারে।
কেন এটি গুরুত্বপূর্ণ
চিকিৎসাবিষয়ক AI নিয়ে বিতর্কে এই ধরনের প্রমাণ খুব কম। পরীক্ষা স্কোর, মানদণ্ড এবং পরিষ্কার সংক্ষিপ্ত ক্লিনিক্যাল বর্ণনায় চিকিৎসক-মিলযুক্ত গবেষণাপত্র হাজার হাজার আছে; বাস্তব রোগী ভালো হলো কি না মাপা বড় ব্যবহারিক র্যান্ডমাইজড পরীক্ষা খুব অল্প। এই গবেষণা তাদের একটি। তার অনাড়ম্বর শিক্ষা: পরীক্ষা পাস করা আর রোগীকে সাহায্য করা এক জিনিস নয়।
একটি সরঞ্জাম চিকিৎসকের কাজে বাস্তবভাবে উপযোগী হতে পারে—ভালো উল্লেখ, দ্বিতীয় জোড়া চোখ, কম ওষুধ খরচ—তবু 14 দিনে কঠিন রোগীর ফলাফল নড়াতে নাও পারে। দুই সত্য একসঙ্গে থাকতে পারে। পরিণত স্বাস্থ্য ব্যবস্থাকে সুবিধাজনক একটি বয়ান বেছে নেওয়ার বদলে দুটোই ধরে রাখতে হবে।
এটি প্রমাণের ভারও সঠিক জায়গায় ফেরায়। ক্লিনিক্যাল AI সেবা উন্নত করে—এ দাবি করলে প্রাসঙ্গিক প্রমাণ লিডারবোর্ড নয়; রোগী-প্রাসঙ্গিক ফলাফল সহ পরীক্ষা। আর মাঝারি উপকার সত্যিই থাকলে তা দেখতে সম্ভবত আরও বড় পরীক্ষা দরকার।
সংক্ষিপ্ত সারাংশ
Kenya-র 16 প্রাথমিক-সেবা কেন্দ্রে গুচ্ছ-র্যান্ডমাইজড ব্যবহারিক পরীক্ষায় ক্লিনিক্যাল কর্মকর্তাদের ইলেকট্রনিক নথির সঙ্গে জেনারেটিভ AI সিদ্ধান্তসহায়ক AI পরামর্শ যোগ করা হয়। মোট 9,691 রোগীর মধ্যে বিশেষজ্ঞ-নির্ণীত 14-দিন চিকিৎসা-ব্যর্থতা সমন্বিত ছিল AI শাখায় 2.2% এবং নিয়ন্ত্রণে 2.0%; সমন্বয়কৃত OR 0.77, 95% CI 0.55–1.08, P=0.13—তাৎপর্যপূর্ণ পার্থক্য নয়। সরঞ্জামের সঙ্গে নিরাপত্তা-সংকেত পাওয়া যায়নি; নথিবদ্ধকরণ সব মূল্যায়িত ক্ষেত্রে উন্নত হয়েছে; ওষুধ দেওয়া বা সন্তুষ্টি বদলায়নি; অ্যান্টিবায়োটিক খরচ কিছুটা কমার সংকেত ছিল। লেখকদের উপসংহার: এই সীমার মধ্যে সরঞ্জাম আশ্বস্তকর, কিন্তু চিকিৎসা ব্যর্থতা কমানোর প্রমাণ নেই; পর্যবেক্ষিত প্রভাবের মতো উপকার ধরতে 100,000-এর পর্যায়ের রোগী লাগতে পারে। এটি ক্লিনিক্যাল AI রোগীর ফলাফল উন্নত করে প্রমাণ করে না, আবার অকার্যকরও প্রমাণ করে না।
সরাসরি যাচাই
পেপার যা দেখায়: বাস্তব র্যান্ডমাইজড প্রধান-সেবা পরীক্ষায় LLM-ভিত্তিক সিদ্ধান্তসহায়তার নিরাপত্তা-সংকেত ধরা পড়েনি, চিকিৎসা নথিবদ্ধকরণ উন্নত হয়েছে, ওষুধ দেওয়া উল্লেখযোগ্যভাবে বদলায়নি এবং কঠোর 14-দিন চিকিৎসা-ব্যর্থতা শেষবিন্দু উল্লেখযোগ্যভাবে কমেনি।
যা সম্ভব, কিন্তু প্রমাণিত নয়: পর্যবেক্ষিত ছোট প্রভাব সত্যিকারের মাঝারি উপকার হতে পারে; সম্পূর্ণ খরচ গণনায় টাকা বাঁচতে পারে; ভালো নথিবদ্ধকরণ ভবিষ্যতে ভালো সেবায় রূপ নিতে পারে।
যা দেখায় না: ক্লিনিক্যাল AI রোগীর ফলাফল উন্নত করে; বিরল ঘটনায় নিরাপত্তা প্রতিষ্ঠিত; AI চিকিৎসক প্রতিস্থাপন করা/outperform করে; ফল সব বিন্যাসে সাধারণীকরণ করে; খরচ সাশ্রয় নিশ্চিত।
প্রধান সীমাবদ্ধতা: পর্যবেক্ষিত প্রভাবের তুলনায় পরীক্ষা ছোট; নিয়ন্ত্রণ-শাখা দূষণ ও যৌথ-নেটওয়ার্ক আচরণ পার্থক্যকে শূন্যের দিকে পক্ষপাত করতে পারে; একটি বেসরকারি শহুরে নেটওয়ার্ক; পূর্বনির্ধারিত noninferiority/নিরাপত্তা কাঠামো নেই; অনুসরণকালীন 14 দিন।
সাধারণ পাঠকের আস্থা কতটা হওয়া উচিত? নথিবদ্ধকরণ উন্নতি এবং এই পরীক্ষায় নিরাপত্তা-সংকেত না-পাওয়া—উচ্চ। 14-দিন রোগীর ফলাফল প্রদর্শনযোগ্যভাবে উন্নত করা না-হওয়া—উচ্চ। সরঞ্জাম রোগী-উপকার হস্তক্ষেপ হিসেবে “কাজ করে” বা “ব্যর্থ”—এই দুই রায়ের জন্য কম; প্রশ্নটি এখনও খোলা।
উৎস
ভিত্তি: Generative AI-enabled clinical decision support system in primary care: a pragmatic, cluster-randomized trial — Ambrose Agweyu, Paul Mwaniki, Vaishnavi Menon, Robert Korom, Lynda Isaaka, Conrad Wanyama, Xiaoxuan Liu & Bilal A. Mateen (and colleagues), Nature Medicine (2026).
সম্পাদকীয় নোট
এই নিবন্ধটি AI লিখেছে এবং সম্পাদকীয় দল পর্যালোচনা করেছে। এটি সংযুক্ত গবেষণার একটি পরিষ্কার ও সতর্ক ব্যাখ্যা, মূল গবেষণাপত্র পড়ার বিকল্প নয়। নির্বাচন, ব্যাখ্যা ও চূড়ান্ত ভাষার দায়িত্ব সম্পাদকের।