একটি প্রশ্নের উত্তর দেওয়া আর পুরো ক্লিনিক্যাল ক্ষেত্র চালানো এক জিনিস নয়
চিকিৎসাবিষয়ক AI গল্পের বেশির ভাগ মডেল উত্তর দেয়: সংক্ষিপ্ত ক্লিনিক্যাল বর্ণনা/পরীক্ষা প্রশ্ন দিলে রোগনির্ণয় বা পরামর্শ অনুচ্ছেদ দেয়। উপযোগী, কিন্তু সংকীর্ণ—চার্টে কোনো ক্রিয়া নেয় না।
MIRA (Medical Intelligence for Reasoning and Action)—চিকিৎসাবিষয়ক যুক্তি ও সিদ্ধান্তের জন্য তৈরি একটি AI ব্যবস্থা অন্য কিছু পরীক্ষা করে। এটি একটি ক্লিনিক্যাল কেস শুরু থেকে শেষ পর্যন্ত পরিচালনা করে: রোগী নথি পড়ে, আর কী ইতিহাস দরকার ঠিক করে, পরীক্ষাগার/ইমেজিং/মাইক্রোবায়োলজি নির্দেশ দেয়, ফল পড়ে, পার্থক্যমূলক রোগনির্ণয় সংকীর্ণ করে এবং প্রেসক্রিপশন, ভর্তি বা অস্ত্রোপচার রেফারেলের মতো নির্দেশ লিখে। মুক্ত পাঠ্য মানবকে অনুলিপি করতে দেওয়ার বদলে স্যান্ডবক্সে সীমাবদ্ধ ইলেকট্রনিক স্বাস্থ্য নথির ভেতর চিকিৎসকের মতো ধাপে ধাপে কাজ করে।
এটি সত্যিই সক্ষমতা ধাপ: পরামর্শদাতা ব্যবস্থা থেকে কর্মপ্রবাহে সক্রিয় অংশগ্রহণকারী ব্যবস্থা। কিন্তু “AI চিকিৎসকদের ছাড়িয়ে যায়” শিরোনামে ফল flatten হয়। এক বাক্যে বললে: MIRA পশ্চাৎদৃষ্টিমূলক স্যান্ডবক্স মানদণ্ডে পুরো ক্ষেত্র স্বয়ংক্রিয়ভাবে চালিয়ে রোগনির্ণয়ের নির্ভুলতায় চিকিৎসক দলের ওপরে স্কোর করেছে—কিন্তু বাস্তব রোগী নয়, আটটি আগে থেকে নির্বাচিত রোগনির্ণয়, শুধু পাঠ্যভিত্তিক নথি, এবং সুবিধার বড় অংশ স্পষ্ট পরীক্ষা-ফল শর্তে; আরও রক্ত পরীক্ষা ব্যবহার করেছে। অগ্রগতি বাস্তব; স্কোরবোর্ড ক্লিনিক নয়।
গবেষকেরা কী করেছেন
MIRA-র আলাপ ও ক্রিয়া অংশে GPT-4o, আর আলাদা পরিকল্পনা ধাপে OpenAI o1 reasoning model ব্যবহার করা হয়েছে। এগুলো HL7 FHIR-সম্মত বিশেষভাবে তৈরি কাঠামোর মধ্যে কাজ করে, যেখানে 80,000-এর বেশি ক্লিনিক্যাল ক্রিয়া রয়েছে। স্যান্ডবক্সে এজেন্ট রোগীর ইতিহাস সংগ্রহ করতে, পরীক্ষা নির্দেশ ও ব্যাখ্যা করতে, পার্থক্যমূলক রোগনির্ণয় তৈরি করতে, চিকিৎসা পরিকল্পনা ও প্রেসক্রিপশন দিতে, এমনকি অস্ত্রোপচারের সময়সূচি বা ভর্তি পরিকল্পনাও করতে পারে। স্বয়ংক্রিয় স্কোরিংয়েও GPT-4o পরিবারের মডেল ছিল—একই মডেল পরিবার ব্যবহারের পক্ষপাতের আশঙ্কা সহকর্মী-পর্যালোচনায় ওঠার পর লেখকেরা বোর্ড-সনদপ্রাপ্ত চিকিৎসকদের পর্যালোচনা দিয়ে তা যাচাই করেন।
পরীক্ষা-সেট অনুকরণ করা-IV জনসাধারণের পরিচয়মুক্ত EHR ডেটাবেস। Beth Israel Deaconess চিকিৎসাবিষয়ক কেন্দ্রে 2008–2019-এর প্রায় 300,000 রোগী থেকে 574 ক্ষেত্র, 8 লক্ষ্য রোগনির্ণয়—অ্যাপেন্ডিসাইটিস, প্যানক্রিয়াটাইটিস, নিউমোনিয়া, UTI-সহ abdominal/অভ্যন্তরীণ-চিকিৎসাবিজ্ঞান emergency—বেছে নেওয়া হয়। MIRA সীমিত প্রারম্ভিক চিত্র থেকে ধাপ-by-ধাপ পরবর্তী ক্রিয়া সিদ্ধান্ত নেয়; ঐতিহাসিক নথিতে বাস্তব ফলাফল আগে থেকেই আছে।
চিকিৎসকদের একই ক্ষেত্র/সরঞ্জাম পরিবেশে তুলনা করা হয়, কিন্তু সব 574-তে head-to-head নয়।
“স্বায়ত্তশাসিত এজেন্ট in a স্যান্ডবক্সে সীমাবদ্ধ EHR” মানে কী
এজেন্ট: এটি একবারের prompt-এর উত্তর নয়। ব্যবস্থা বর্তমান অবস্থা দেখে একটি পদক্ষেপ বেছে নেয়, ফল পায়, তারপর সেই ফলের ভিত্তিতে পরবর্তী পদক্ষেপ ঠিক করে—এভাবে রোগনির্ণয় ও পরিকল্পনা পর্যন্ত এগোয়। ভাষা মডেলটি যুক্তি ও ভাষাগত সক্ষমতা দেয়; চারপাশের সফটওয়্যার কাঠামো সেই সিদ্ধান্তকে অনুমোদিত EHR কাজের মধ্যে সীমাবদ্ধ রাখে।
স্যান্ডবক্সে সীমাবদ্ধ EHR: এটি চলমান হাসপাতাল ব্যবস্থা নয়, বরং ঐতিহাসিক নথি দিয়ে তৈরি বন্ধ simulation। MIRA কোনো পরীক্ষা “নির্দেশ” দিলে ফল কেবল তখনই ফেরে, যদি বাস্তব রোগীর ইতিহাসে সেই পরীক্ষা সত্যিই করা হয়ে থাকে। না হলে উত্তর আসে “N/A—could not be performed”; কোনো মান বানিয়ে দেওয়া হয় না। নথিতে তথ্য না থাকলে simulated patient-ও সেটি “জানে না”।
স্বায়ত্তশাসিত: মানব-in-লুপ ছাড়া স্যান্ডবক্স ক্ষেত্র শুরু থেকে শেষ পর্যন্ত সম্পূর্ণ। বাস্তব রোগী unsupervised manage করা নয়। শিরোনাম শব্দটির এই দুই অর্থ আলাদা রাখা জরুরি।
তারা কী পেয়েছেন
রোগনির্ণয়ের নির্ভুলতায় MIRA মানদণ্ডে চিকিৎসকের ওপরে ছিল, কিন্তু তিনটি সংখ্যা আলাদা।
সব 574 ক্ষেত্র-এ MIRA ছাড়পত্রকালীন রোগনির্ণয়ের সঙ্গে 88.9% মিল করে। মানব head-to-head subset 311 ক্ষেত্র। ওই একই 311-এ MIRA 87.8%।
জ্যেষ্ঠ তুলনা: 4 বোর্ড-সনদপ্রাপ্ত চিকিৎসক, 7–11 বছর অভিজ্ঞতা, স্কোর 78.1%। মিশ্র-seniority দল—মূলত কনিষ্ঠ resident + 2 বিশেষজ্ঞ—স্কোর 71.1%। একই ক্ষেত্রগুলো/সরঞ্জামে নির্দেশ দেওয়া: MIRA, জ্যেষ্ঠ, কনিষ্ঠ-ভারী। গবেষণাপত্র নিজে “ধারাবাহিকভাবে সমতুল্য to, এবং প্রায়ই exceeded” ভাষা ব্যবহার করে, সব আটটি রোগ জুড়ে।
Downstream সিদ্ধান্ত মূলত guideline-concordant; ওষুধ-নিরাপত্তা শ্রেণিতে উচ্চ-তীব্রতা ত্রুটি প্রতিবেদন হয়নি। প্রেসক্রিপশন 467/468 ক্ষেত্রে সংশোধন করা, যদিও লেখকেরা স্পষ্ট বলেন 100% নির্ভরযোগ্যতা নয়।
কিন্তু সাফল্যের আকৃতি গুরুত্বপূর্ণ। Science মাধ্যম কেন্দ্র বিশেষজ্ঞ commentary-তে Dr Wei Xing note করেন শিরোনাম সুবিধা মূলত স্পষ্ট নির্ণায়ক পরীক্ষা ফল-যুক্ত শর্ত—অ্যাপেন্ডিসাইটিস/প্যানক্রিয়াটাইটিস—এ বেশি। নিউমোনিয়া/UTI-তে AI ও চিকিৎসক উভয়ই সবচেয়ে খারাপ এবং ব্যবধান ছোট।
তথ্য অসমতা: MIRA নিয়মিত-সেবা উপলভ্য পরীক্ষাগার বিশ্লেষ্যের প্রায় 51% ব্যবহার করেছে; বোর্ড-সনদপ্রাপ্ত চিকিৎসক প্রায় 28%—মধ্যমা ক্ষেত্রে সাতটি বেশি রক্ত প্যারামিটার। লেখকেরা বলেন এটি ডেটাসেট নিয়মিত প্রারম্ভিক মানের নিচে এবং ব্যয়বহুল আন্তঃ-sectional ইমেজিং ধারাবাহিকভাবে বাড়ায়নি। তবু বেশি প্রমাণ নিজেই রোগনির্ণয়মূলক নির্ভুলতা বাড়াতে পারে; সমান তথ্যপ্রাপ্ত contest নয়।
“চিকিৎসককে হারিয়েছে” মানে “ভালো চিকিৎসক” নয় কেন
1. স্কোর কীসের বিরুদ্ধে। Julie Jacko note করেন কিছু চিকিৎসা-সামঞ্জস্য মেট্রিক ঐতিহাসিক চার্টে নথিবদ্ধ আচরণ পুনরুত্পাদন করাকে পুরস্কার করে। ঐতিহাসিক নথি উত্তর মূলের অংশ। রোগনির্ণয়মূলক নির্ভুলতা অবশ্য ছাড়পত্রকালীন রোগনির্ণয়ের বিরুদ্ধে, তাই বিশুদ্ধ নথিবদ্ধকরণ echo-এর চেয়ে শক্তিশালী; তবু চিকিৎসা মানের পরম রেফারেন্স সত্য নয়।
2. তথ্য অসমতা। 51% বনাম 28% উপলভ্য পরীক্ষাগার বিশ্লেষ্য—MIRA বেশি তথ্য কিনেছে/ব্যবহার করেছে। খরচ, অস্বস্তি, বিলম্ব বিবেচনা না করে চিকিৎসক-ও বেশি কম খরচের পরীক্ষা পেলে নির্ভুলতা বাড়াতে পারে।
3. পরিবেশ। পশ্চাৎদৃষ্টিমূলক স্যান্ডবক্স, আটটি নির্বাচিত রোগনির্ণয়, শুধু পাঠ্যভিত্তিক। বাস্তব মূল্যায়নে ভৌত পরীক্ষা, tone, আচরণ, দেহ ভাষা, বিবর্তনশীল উপসর্গ আছে। আটটি রোগনির্ণয়ের বাইরে অস্পষ্ট চিকিৎসাবিজ্ঞান নিয়ে গবেষণা কথা বলে না।
4. সম্ভাব্য প্রশিক্ষণ-তথ্য দূষণ। যে কেসগুলো অনুকরণ করা হয়েছে সেগুলো জনসাধারণের জন্য উন্মুক্ত এবং বহুল আলোচিত। LLM প্রশিক্ষণের সময় গবেষণাপত্র, কেস বা সেগুলো থেকে তৈরি উপাদান দেখে থাকতে পারে। Dr Midhun Parakkal Unni এই উদ্বেগটি তুলেছেন। লেখকেরাও সতর্কভাবে বলেন, ফলটি সম্ভাব্য ঊর্ধ্বসীমা হতে পারে এবং অন্য প্রকাশ্য কেসে সাধারণীকরণের ক্ষমতাকে বেশি দেখাতে পারে। স্বাধীন ব্যক্তিগত বা ভবিষ্যতমুখী পুনরাবৃত্তি ছাড়া মুখস্থ করা আর প্রকৃত যুক্তি আলাদা করা কঠিন।
এই সতর্কতা সক্ষমতাকে মুছে দেয় না। সংশোধন করা পাঠ: পশ্চাৎদৃষ্টিমূলক মানদণ্ডে পুরো-নথি এজেন্ট চিকিৎসকের ওপরে স্কোর করেছে, বিশেষ করে পরিষ্কার-পরীক্ষা রোগে; বেশি পরীক্ষাগার info ব্যবহার করেছে এবং ঐতিহাসিক চার্টের সঙ্গে আংশিক সামঞ্জস্য পেয়েছে। এটি সক্ষমতা প্রদর্শন, যন্ত্র ভালো চিকিৎসক—রায় নয়।
এই গবেষণা কী প্রমাণ করে না
- বাস্তব রোগীতে কাজ করে—না; সব ক্ষেত্র পশ্চাৎদৃষ্টিমূলক/সিমুলেটেড।
- আটটি রোগনির্ণয়ের বাইরে সাধারণীকরণ করে—না।
- Deploy নিরাপদে করা যায়—না; ভবিষ্যতমুখী নিরাপত্তা/শাসনব্যবস্থা দরকার।
- ন্যায্য সমান তথ্যপ্রাপ্ত চিকিৎসক head-to-head—না; MIRA বেশি রক্ত বিশ্লেষ্য ব্যবহার করেছে এবং চিকিৎসা মেট্রিক চার্টের বিরুদ্ধে আংশিক স্কোর করেছে।
- মুখস্থকরণ-মুক্ত—না; জনসাধারণের অনুকরণ করা-IV প্রশিক্ষণ ওভারল্যাপ exclude হয়নি।
- AI replaces চিকিৎসক—না। বাস্তব ব্যবহার চিকিৎসক partnership/কর্তৃত্ব এবং পাঠ্য নথির বাইরে মানব পর্যবেক্ষণ দরকার।
প্রমাণ কতটা শক্ত?
দুটি দাবি আলাদা।
সক্ষমতা প্রদর্শন—ভাষা-মডেল এজেন্ট স্যান্ডবক্সে সীমাবদ্ধ EHR-এ ইতিহাস→পরীক্ষাগুলো→রোগনির্ণয়→নির্দেশ পুরো লুপ চালাতে পারে—নতুন ও যথেষ্ট বিশ্বাসযোগ্য। এটিই সত্যিই নতুন অংশ।
শ্রেষ্ঠত্বের দাবি—MIRA চিকিৎসকদের চেয়ে ভালো রোগনির্ণয়কারী—খুব সীমিতভাবে পড়তে হবে। এটি নির্দিষ্ট retrospective benchmark, মাত্র আটটি diagnosis, অসম তথ্যপ্রাপ্তি, ঐতিহাসিক উত্তরকে gold standard ধরা এবং সম্ভাব্য training-data contamination-এর মধ্যে মাপা ফল। তাই “এই benchmark-এ impressive performance” বলা যায়; “মানুষের চেয়ে ভালো চিকিৎসক” বলা যায় না—লেখকেরাও দ্বিতীয় দাবি করেন না।
সঠিক অবস্থানটি “AI চিকিৎসকদের হারিয়ে দিয়েছে” কিংবা “এটি খেলনা”—কোনোটিই নয়। নথির ভেতরে বাস্তব ক্রিয়া নিতে পারে এমন চিকিৎসাবিষয়ক এজেন্টটি কঠিন পশ্চাৎদৃষ্টিমূলক মানদণ্ডে ভালো করেছে; এখন দরকার বাস্তব, অস্পষ্ট রোগীর ক্ষেত্রে ভবিষ্যতমুখী এবং যথাযথ তত্ত্বাবধান-সহ পরীক্ষা।
কেন এটি গুরুত্বপূর্ণ
চিকিৎসাবিষয়ক AI-এর আকর্ষণীয় প্রশ্ন বদলাচ্ছে। আগে “মডেল রোগনির্ণয় ঠিক বলতে পারে?”—এখন আরও কঠিন প্রশ্ন “কর্মপ্রবাহ চালাতে পারে? ইতিহাস নেওয়া, পরীক্ষা নির্দেশ দেওয়া, ফল ব্যাখ্যা করা, সিদ্ধান্ত, ক্রিয়া?” MIRA এই সরণ দেখায়। Acting-এ উপযোগিতা এবং ঝুঁকি দুটোই বাড়ে।
শিরোনাম “AI চিকিৎসকদের ছাড়িয়ে যায়” সর্বনিম্ন নতুন/সর্বনিম্ন সমর্থিত অংশ। সত্যিই গুরুত্বপূর্ণ অংশ: এজেন্ট পুরো নথি কর্মপ্রবাহে পদক্ষেপ করতে পারে। সক্ষমতা টিকে থাকা করলে প্রথমে কে চিকিৎসক থাকবে তা নয়, কর্মপ্রবাহ—ক্রম, ফলাফল chase, ব্যাখ্যা—বদলাবে।
Leaderboard-এ ভালো ফল ভবিষ্যতমুখী clinical testing-এর বিকল্প নয়। রোগী-স্তরের বাস্তব পরিবেশে prospective গবেষণাই পরবর্তী বড় প্রমাণের ধাপ।
সংক্ষিপ্ত সারাংশ
MIRA স্যান্ডবক্সে সীমাবদ্ধ EHR-এ স্বায়ত্তশাসিত এজেন্ট: ইতিহাস, পরীক্ষাগার/ইমেজিং/মাইক্রোবায়োলজি নির্দেশ দেওয়া/ব্যাখ্যা করা, রোগনির্ণয় এবং চিকিৎসা নির্দেশ দেওয়া শুরু থেকে শেষ পর্যন্ত। জনসাধারণের অনুকরণ করা-IV-এর 574 পশ্চাৎদৃষ্টিমূলক ক্ষেত্র, 8 রোগনির্ণয়-এ সামগ্রিক রোগনির্ণয়মূলক নির্ভুলতা 88.9%। যৌথ 311-ক্ষেত্র চিকিৎসক তুলনায় MIRA 87.8%, জ্যেষ্ঠ বোর্ড-সনদপ্রাপ্ত দল 78.1%, কনিষ্ঠ-ভারী দল 71.1%। ওষুধ সিদ্ধান্ত মূলত নিরাপদ/guideline-concordant, 467/468 প্রেসক্রিপশন সংশোধন করা, উচ্চ-তীব্রতা ওষুধ ত্রুটি প্রতিবেদন নেই। কিন্তু স্যান্ডবক্স/শুধু পাঠ্যভিত্তিক, নির্বাচিত রোগনির্ণয়, স্পষ্ট-পরীক্ষা শর্তে প্রান্ত বড়, MIRA ~51% বনাম চিকিৎসক ~28% উপলভ্য পরীক্ষাগার বিশ্লেষ্য ব্যবহার করেছে, কিছু ফলাফল ঐতিহাসিক চার্টের বিরুদ্ধে স্কোর করেছে, এবং জনসাধারণের অনুকরণ করা-IV দূষণ ঝুঁকি আছে। বাস্তব অগ্রগতি হলো পুরো-কর্মপ্রবাহ actor; বাস্তব-ক্লিনিক শ্রেষ্ঠত্ব/ব্যবহারিক মোতায়েন প্রমাণ নয়।
সরাসরি যাচাই
পেপার যা দেখায়: ভাষা-মডেল এজেন্ট স্যান্ডবক্সে সীমাবদ্ধ EHR-এ পুরো ক্ষেত্র চালাতে পারে এবং নির্দিষ্ট পশ্চাৎদৃষ্টিমূলক মানদণ্ডে উচ্চ রোগনির্ণয়মূলক স্কোর করেছে।
যা সম্ভব, কিন্তু প্রমাণিত নয়: বাস্তব রোগী উপকার; সুবিধা বিশুদ্ধ বিবেচনামূলক চিন্তার কারণে; ব্যক্তিগত অদেখা তথ্যেও একই কার্যসম্পাদন।
যা দেখায় না: বিস্তৃত চিকিৎসাবিজ্ঞান সাধারণীকরণ, ব্যবহারিক মোতায়েন নিরাপত্তা, ন্যায্য সমান তথ্যপ্রাপ্ত চিকিৎসক শ্রেষ্ঠত্ব, চিকিৎসক প্রতিস্থাপন, দূষণ-মুক্ত ফল।
প্রধান সীমাবদ্ধতা: পশ্চাৎদৃষ্টিমূলক সিমুলেশন, আটটি রোগনির্ণয়, শুধু পাঠ্যভিত্তিক, আরও পরীক্ষাগার পরীক্ষাগুলো, চার্ট-ভিত্তিক স্কোরিং elements, জনসাধারণের ডেটাসেট দূষণ সম্ভাবনা।
সাধারণ পাঠকের কতটা আস্থা রাখা উচিত? স্যান্ডবক্সে শুরু থেকে শেষ পর্যন্ত কাজ সম্পাদনের সক্ষমতায়—উচ্চ। “AI চিকিৎসকদের চেয়ে ভালো রোগনির্ণয় করে” এই বৃহত্তর দাবিতে—কম; ফলটি benchmark-এর সীমানার মধ্যে।
উৎস
ভিত্তি: Towards autonomous medical artificial intelligence agents — Dyke Ferber, Lars Hilgers, Christiane Höper and colleagues; senior author Jakob Nikolas Kather, Nature (2026).
সম্পাদকীয় নোট
এই নিবন্ধটি AI লিখেছে এবং সম্পাদকীয় দল পর্যালোচনা করেছে। এটি সংযুক্ত গবেষণার একটি পরিষ্কার ও সতর্ক ব্যাখ্যা, মূল গবেষণাপত্র পড়ার বিকল্প নয়। নির্বাচন, ব্যাখ্যা ও চূড়ান্ত ভাষার দায়িত্ব সম্পাদকের।