একটি প্রশ্নের উত্তর দেওয়া আর পুরো ক্লিনিক্যাল ক্ষেত্র চালানো এক জিনিস নয়
চিকিৎসাবিষয়ক AI গল্পের বেশির ভাগ মডেল উত্তর দেয়: সংক্ষিপ্ত ক্লিনিক্যাল বর্ণনা/পরীক্ষা প্রশ্ন দিলে রোগনির্ণয় বা পরামর্শ অনুচ্ছেদ দেয়। উপযোগী, কিন্তু সংকীর্ণ—চার্টে কোনো ক্রিয়া নেয় না।
MIRA (Medical Intelligence for Reasoning and Action)—চিকিৎসাবিষয়ক যুক্তি ও সিদ্ধান্তের জন্য তৈরি একটি AI ব্যবস্থা অন্য কিছু পরীক্ষা করে। এটি একটি ক্লিনিক্যাল কেস শুরু থেকে শেষ পর্যন্ত পরিচালনা করে: রোগী নথি পড়ে, আর কী ইতিহাস দরকার ঠিক করে, পরীক্ষাগার/ইমেজিং/মাইক্রোবায়োলজি নির্দেশ দেয়, ফল পড়ে, পার্থক্যমূলক রোগনির্ণয় সংকীর্ণ করে এবং প্রেসক্রিপশন, ভর্তি বা অস্ত্রোপচার রেফারেলের মতো নির্দেশ লিখে। মুক্ত পাঠ্য মানবকে অনুলিপি করতে দেওয়ার বদলে স্যান্ডবক্সে সীমাবদ্ধ ইলেকট্রনিক স্বাস্থ্য নথির ভেতর চিকিৎসকের মতো ধাপে ধাপে কাজ করে।
এটি সত্যিই সক্ষমতা ধাপ: পরামর্শদাতা ব্যবস্থা থেকে কর্মপ্রবাহে সক্রিয় অংশগ্রহণকারী ব্যবস্থা। কিন্তু “AI চিকিৎসকদের ছাড়িয়ে যায়” শিরোনামে ফল সরল করে ফেলা হয়। এক বাক্যে বললে: MIRA পশ্চাৎদৃষ্টিমূলক স্যান্ডবক্স মানদণ্ডে পুরো ক্ষেত্র স্বয়ংক্রিয়ভাবে চালিয়ে রোগনির্ণয়ের নির্ভুলতায় চিকিৎসক দলের ওপরে স্কোর করেছে—কিন্তু বাস্তব রোগী নয়, আটটি আগে থেকে নির্বাচিত রোগনির্ণয়, শুধু পাঠ্যভিত্তিক নথি, এবং সুবিধার বড় অংশ স্পষ্ট পরীক্ষা-ফল শর্তে; আরও রক্ত পরীক্ষা ব্যবহার করেছে। অগ্রগতি বাস্তব; স্কোরবোর্ড ক্লিনিক নয়।
গবেষকেরা কী করেছেন
MIRA-র আলাপ ও ক্রিয়া অংশে GPT-4o, আর আলাদা পরিকল্পনা ধাপে OpenAI o1 যুক্তি মডেল ব্যবহার করা হয়েছে। এগুলো HL7 FHIR-সম্মত বিশেষভাবে তৈরি কাঠামোর মধ্যে কাজ করে, যেখানে 80,000-এর বেশি ক্লিনিক্যাল ক্রিয়া রয়েছে। স্যান্ডবক্সে এজেন্ট রোগীর ইতিহাস সংগ্রহ করতে, পরীক্ষা নির্দেশ ও ব্যাখ্যা করতে, পার্থক্যমূলক রোগনির্ণয় তৈরি করতে, চিকিৎসা পরিকল্পনা ও প্রেসক্রিপশন দিতে, এমনকি অস্ত্রোপচারের সময়সূচি বা ভর্তি পরিকল্পনাও করতে পারে। স্বয়ংক্রিয় স্কোরিংয়েও GPT-4o পরিবারের মডেল ছিল—একই মডেল পরিবার ব্যবহারের পক্ষপাতের আশঙ্কা সহকর্মী-পর্যালোচনায় ওঠার পর লেখকেরা বোর্ড-সনদপ্রাপ্ত চিকিৎসকদের পর্যালোচনা দিয়ে তা যাচাই করেন।
পরীক্ষা-সেট অনুকরণ করা-IV জনসাধারণের পরিচয়মুক্ত EHR ডেটাবেস। Beth Israel Deaconess চিকিৎসাবিষয়ক কেন্দ্রে 2008–2019-এর প্রায় 300,000 রোগী থেকে 574 ক্ষেত্র, 8 লক্ষ্য রোগনির্ণয়—অ্যাপেন্ডিসাইটিস, প্যানক্রিয়াটাইটিস, নিউমোনিয়া, UTI-সহ abdominal/অভ্যন্তরীণ-চিকিৎসাবিজ্ঞান জরুরি-অবস্থা—বেছে নেওয়া হয়। MIRA সীমিত প্রারম্ভিক চিত্র থেকে ধাপে ধাপে পরবর্তী ক্রিয়া সিদ্ধান্ত নেয়; ঐতিহাসিক নথিতে বাস্তব ফলাফল আগে থেকেই আছে।
চিকিৎসকদের একই ক্ষেত্র/সরঞ্জাম পরিবেশে তুলনা করা হয়, কিন্তু সব 574-তে সরাসরি তুলনা নয়।
“স্যান্ডবক্সে সীমাবদ্ধ EHR-এ স্বায়ত্তশাসিত এজেন্ট” মানে কী
এজেন্ট: এটি একবারের প্রম্পটের উত্তর নয়। ব্যবস্থা বর্তমান অবস্থা দেখে একটি পদক্ষেপ বেছে নেয়, ফল পায়, তারপর সেই ফলের ভিত্তিতে পরবর্তী পদক্ষেপ ঠিক করে—এভাবে রোগনির্ণয় ও পরিকল্পনা পর্যন্ত এগোয়। ভাষা মডেলটি যুক্তি ও ভাষাগত সক্ষমতা দেয়; চারপাশের সফটওয়্যার কাঠামো সেই সিদ্ধান্তকে অনুমোদিত EHR কাজের মধ্যে সীমাবদ্ধ রাখে।
স্যান্ডবক্সে সীমাবদ্ধ EHR: এটি চলমান হাসপাতাল ব্যবস্থা নয়, বরং ঐতিহাসিক নথি দিয়ে তৈরি বন্ধ সিমুলেশন। MIRA কোনো পরীক্ষা “নির্দেশ” দিলে ফল কেবল তখনই ফেরে, যদি বাস্তব রোগীর ইতিহাসে সেই পরীক্ষা সত্যিই করা হয়ে থাকে। না হলে উত্তর আসে “N/A—could not be performed”; কোনো মান বানিয়ে দেওয়া হয় না। নথিতে তথ্য না থাকলে সিমুলেটেড রোগীও সেটি “জানে না”।
স্বায়ত্তশাসিত: মানব-অংশগ্রহণ ছাড়া স্যান্ডবক্স ক্ষেত্র শুরু থেকে শেষ পর্যন্ত সম্পূর্ণ। বাস্তব রোগীকে তত্ত্বাবধানহীনভাবে পরিচালনা করা নয়। শিরোনাম শব্দটির এই দুই অর্থ আলাদা রাখা জরুরি।
তারা কী পেয়েছেন
রোগনির্ণয়ের নির্ভুলতায় MIRA মানদণ্ডে চিকিৎসকের ওপরে ছিল, কিন্তু তিনটি সংখ্যা আলাদা।
সব 574 ক্ষেত্র-এ MIRA ছাড়পত্রকালীন রোগনির্ণয়ের সঙ্গে 88.9% মেলে। মানব সরাসরি-মুখোমুখি উপসেট 311 ক্ষেত্র। ওই একই 311-এ MIRA 87.8%।
জ্যেষ্ঠ তুলনা: 4 বোর্ড-সনদপ্রাপ্ত চিকিৎসক, 7–11 বছর অভিজ্ঞতা, স্কোর 78.1%। মিশ্র-জ্যেষ্ঠতা দল—মূলত কনিষ্ঠ রেসিডেন্ট + 2 বিশেষজ্ঞ—স্কোর 71.1%। একই ক্ষেত্রগুলো/সরঞ্জামে নির্দেশ দেওয়া: MIRA, জ্যেষ্ঠ, কনিষ্ঠ-ভারী। গবেষণাপত্র নিজে “ধারাবাহিকভাবে সমতুল্য এবং প্রায়ই ছাড়িয়ে গেছে” ভাষা ব্যবহার করে, সব আটটি রোগ জুড়ে।
Downstream সিদ্ধান্ত মূলত guideline-concordant; ওষুধ-নিরাপত্তা শ্রেণিতে উচ্চ-তীব্রতা ত্রুটি প্রতিবেদন হয়নি। প্রেসক্রিপশন 467/468 ক্ষেত্রে সঠিক ছিল, যদিও লেখকেরা স্পষ্ট বলেন 100% নির্ভরযোগ্যতা নয়।
কিন্তু সাফল্যের আকৃতি গুরুত্বপূর্ণ। Science মাধ্যম কেন্দ্র বিশেষজ্ঞের মন্তব্যে Dr Wei Xing উল্লেখ করেন শিরোনাম সুবিধা মূলত স্পষ্ট নির্ণায়ক পরীক্ষা ফল-যুক্ত শর্ত—অ্যাপেন্ডিসাইটিস/প্যানক্রিয়াটাইটিস—এ বেশি। নিউমোনিয়া/UTI-তে AI ও চিকিৎসক উভয়ই সবচেয়ে খারাপ এবং ব্যবধান ছোট।
তথ্য অসমতা: MIRA নিয়মিত-সেবা উপলভ্য পরীক্ষাগার বিশ্লেষ্যের প্রায় 51% ব্যবহার করেছে; বোর্ড-সনদপ্রাপ্ত চিকিৎসক প্রায় 28%—মধ্যমা ক্ষেত্রে সাতটি বেশি রক্ত প্যারামিটার। লেখকেরা বলেন এটি ডেটাসেট নিয়মিত প্রারম্ভিক মানের নিচে এবং ব্যয়বহুল ক্রস-সেকশনাল ইমেজিং ধারাবাহিকভাবে বাড়ায়নি। তবু বেশি প্রমাণ নিজেই রোগনির্ণয়মূলক নির্ভুলতা বাড়াতে পারে; সমান তথ্যপ্রাপ্ত প্রতিযোগিতা নয়।
“চিকিৎসককে হারিয়েছে” মানে “ভালো চিকিৎসক” নয় কেন
1. স্কোর কীসের বিরুদ্ধে। Julie Jacko উল্লেখ করেন কিছু চিকিৎসা-সামঞ্জস্য মেট্রিক ঐতিহাসিক চার্টে নথিবদ্ধ আচরণ পুনরুত্পাদন করাকে পুরস্কার করে। ঐতিহাসিক নথি উত্তর মূলের অংশ। রোগনির্ণয়মূলক নির্ভুলতা অবশ্য ছাড়পত্রকালীন রোগনির্ণয়ের বিরুদ্ধে, তাই বিশুদ্ধ নথিবদ্ধকরণের প্রতিধ্বনির চেয়ে শক্তিশালী; তবু চিকিৎসা মানের পরম রেফারেন্স সত্য নয়।
2. তথ্য অসমতা। 51% বনাম 28% উপলভ্য পরীক্ষাগার বিশ্লেষ্য—MIRA বেশি তথ্য কিনেছে/ব্যবহার করেছে। খরচ, অস্বস্তি, বিলম্ব বিবেচনা না করে চিকিৎসকও বেশি কম খরচের পরীক্ষা পেলে নির্ভুলতা বাড়াতে পারে।
3. পরিবেশ। পশ্চাৎদৃষ্টিমূলক স্যান্ডবক্স, আটটি নির্বাচিত রোগনির্ণয়, শুধু পাঠ্যভিত্তিক। বাস্তব মূল্যায়নে ভৌত পরীক্ষা, স্বর, আচরণ, দেহ ভাষা, বিবর্তনশীল উপসর্গ আছে। আটটি রোগনির্ণয়ের বাইরে অস্পষ্ট চিকিৎসাবিজ্ঞান নিয়ে গবেষণা কথা বলে না।
4. সম্ভাব্য প্রশিক্ষণ-তথ্য দূষণ। যে কেসগুলো অনুকরণ করা হয়েছে সেগুলো জনসাধারণের জন্য উন্মুক্ত এবং বহুল আলোচিত। LLM প্রশিক্ষণের সময় গবেষণাপত্র, কেস বা সেগুলো থেকে তৈরি উপাদান দেখে থাকতে পারে। Dr Midhun Parakkal Unni এই উদ্বেগটি তুলেছেন। লেখকেরাও সতর্কভাবে বলেন, ফলটি সম্ভাব্য ঊর্ধ্বসীমা হতে পারে এবং অন্য প্রকাশ্য কেসে সাধারণীকরণের ক্ষমতাকে বেশি দেখাতে পারে। স্বাধীন ব্যক্তিগত বা ভবিষ্যতমুখী পুনরাবৃত্তি ছাড়া মুখস্থ করা আর প্রকৃত যুক্তি আলাদা করা কঠিন।
এই সতর্কতা সক্ষমতাকে মুছে দেয় না। সতর্ক পাঠ: পশ্চাৎদৃষ্টিমূলক মানদণ্ডে পুরো-নথি এজেন্ট চিকিৎসকের ওপরে স্কোর করেছে, বিশেষ করে পরিষ্কার-পরীক্ষা রোগে; বেশি পরীক্ষাগার তথ্য ব্যবহার করেছে এবং ঐতিহাসিক চার্টের সঙ্গে আংশিক সামঞ্জস্য পেয়েছে। এটি সক্ষমতা প্রদর্শন, যন্ত্র ভালো চিকিৎসক—রায় নয়।
এই গবেষণা কী প্রমাণ করে না
- বাস্তব রোগীতে কাজ করে—না; সব ক্ষেত্র পশ্চাৎদৃষ্টিমূলক/সিমুলেটেড।
- আটটি রোগনির্ণয়ের বাইরে সাধারণীকরণ করে—না।
- নিরাপদে ব্যবহারিক মোতায়েন করা যায়—না; ভবিষ্যতমুখী নিরাপত্তা/শাসনব্যবস্থা দরকার।
- ন্যায্য সমান তথ্যপ্রাপ্ত চিকিৎসক সরাসরি তুলনা—না; MIRA বেশি রক্ত বিশ্লেষ্য ব্যবহার করেছে এবং চিকিৎসা মেট্রিক চার্টের বিরুদ্ধে আংশিক স্কোর করেছে।
- মুখস্থকরণ-মুক্ত—না; জনসাধারণের অনুকরণ করা-IV প্রশিক্ষণ ওভারল্যাপ বাদ দেওয়া হয়নি।
- AI চিকিৎসককে প্রতিস্থাপন করে—না। বাস্তব ব্যবহার চিকিৎসক partnership/কর্তৃত্ব এবং পাঠ্য নথির বাইরে মানব পর্যবেক্ষণ দরকার।
প্রমাণ কতটা শক্ত?
দুটি দাবি আলাদা।
সক্ষমতা প্রদর্শন—ভাষা-মডেল এজেন্ট স্যান্ডবক্সে সীমাবদ্ধ EHR-এ ইতিহাস→পরীক্ষাগুলো→রোগনির্ণয়→নির্দেশ পুরো লুপ চালাতে পারে—নতুন ও যথেষ্ট বিশ্বাসযোগ্য। এটিই সত্যিই নতুন অংশ।
শ্রেষ্ঠত্বের দাবি—MIRA চিকিৎসকদের চেয়ে ভালো রোগনির্ণয়কারী—খুব সীমিতভাবে পড়তে হবে। এটি নির্দিষ্ট পশ্চাৎদৃষ্টিমূলক মানদণ্ড, মাত্র আটটি রোগনির্ণয়, অসম তথ্যপ্রাপ্তি, ঐতিহাসিক উত্তরকে সোনা মানক ধরা এবং সম্ভাব্য প্রশিক্ষণ-তথ্য দূষণের মধ্যে মাপা ফল। তাই “এই মানদণ্ডে চিত্তাকর্ষক কার্যক্ষমতা” বলা যায়; “মানুষের চেয়ে ভালো চিকিৎসক” বলা যায় না—লেখকেরাও দ্বিতীয় দাবি করেন না।
সঠিক অবস্থানটি “AI চিকিৎসকদের হারিয়ে দিয়েছে” কিংবা “এটি খেলনা”—কোনোটিই নয়। নথির ভেতরে বাস্তব ক্রিয়া নিতে পারে এমন চিকিৎসাবিষয়ক এজেন্টটি কঠিন পশ্চাৎদৃষ্টিমূলক মানদণ্ডে ভালো করেছে; এখন দরকার বাস্তব, অস্পষ্ট রোগীর ক্ষেত্রে ভবিষ্যতমুখী এবং যথাযথ তত্ত্বাবধানসহ পরীক্ষা।
কেন এটি গুরুত্বপূর্ণ
চিকিৎসাবিষয়ক AI-এর আকর্ষণীয় প্রশ্ন বদলাচ্ছে। আগে “মডেল রোগনির্ণয় ঠিক বলতে পারে?”—এখন আরও কঠিন প্রশ্ন “কর্মপ্রবাহ চালাতে পারে? ইতিহাস নেওয়া, পরীক্ষা নির্দেশ দেওয়া, ফল ব্যাখ্যা করা, সিদ্ধান্ত, ক্রিয়া?” MIRA এই সরণ দেখায়। কাজে সক্রিয় হওয়ার সঙ্গে উপযোগিতা এবং ঝুঁকি দুটোই বাড়ে।
শিরোনাম “AI চিকিৎসকদের ছাড়িয়ে যায়” সর্বনিম্ন নতুন/সর্বনিম্ন সমর্থিত অংশ। সত্যিই গুরুত্বপূর্ণ অংশ: এজেন্ট পুরো নথি কর্মপ্রবাহে পদক্ষেপ করতে পারে। সক্ষমতা টিকে থাকলে প্রথমে কে চিকিৎসক থাকবে তা নয়, কর্মপ্রবাহ—ক্রম, ফলাফল ধাওয়া করা, ব্যাখ্যা—বদলাবে।
লিডারবোর্ডে ভালো ফল ভবিষ্যতমুখী ক্লিনিক্যাল পরীক্ষার বিকল্প নয়। রোগী-স্তরের বাস্তব পরিবেশে প্রত্যাশিত গবেষণাই পরবর্তী বড় প্রমাণের ধাপ।
সংক্ষিপ্ত সারাংশ
MIRA স্যান্ডবক্সে সীমাবদ্ধ EHR-এ স্বায়ত্তশাসিত এজেন্ট: ইতিহাস, পরীক্ষাগার/ইমেজিং/মাইক্রোবায়োলজি নির্দেশ দেওয়া/ব্যাখ্যা করা, রোগনির্ণয় এবং চিকিৎসা নির্দেশ দেওয়া শুরু থেকে শেষ পর্যন্ত। জনসাধারণের অনুকরণ করা-IV-এর 574 পশ্চাৎদৃষ্টিমূলক ক্ষেত্র, 8 রোগনির্ণয়-এ সামগ্রিক রোগনির্ণয়মূলক নির্ভুলতা 88.9%। যৌথ 311-ক্ষেত্র চিকিৎসক তুলনায় MIRA 87.8%, জ্যেষ্ঠ বোর্ড-সনদপ্রাপ্ত দল 78.1%, কনিষ্ঠ-ভারী দল 71.1%। ওষুধ সিদ্ধান্ত মূলত নিরাপদ/guideline-concordant, 467/468 প্রেসক্রিপশন সঠিক ছিল, উচ্চ-তীব্রতা ওষুধ ত্রুটি প্রতিবেদন নেই। কিন্তু স্যান্ডবক্স/শুধু পাঠ্যভিত্তিক, নির্বাচিত রোগনির্ণয়, স্পষ্ট-পরীক্ষা শর্তে প্রান্ত বড়, MIRA ~51% বনাম চিকিৎসক ~28% উপলভ্য পরীক্ষাগার বিশ্লেষ্য ব্যবহার করেছে, কিছু ফলাফল ঐতিহাসিক চার্টের বিরুদ্ধে স্কোর করেছে, এবং জনসাধারণের অনুকরণ করা-IV দূষণ ঝুঁকি আছে। বাস্তব অগ্রগতি হলো পুরো-কর্মপ্রবাহ অভিনেতা; বাস্তব-ক্লিনিক শ্রেষ্ঠত্ব/ব্যবহারিক মোতায়েন প্রমাণ নয়।
সরাসরি যাচাই
পেপার যা দেখায়: ভাষা-মডেল এজেন্ট স্যান্ডবক্সে সীমাবদ্ধ EHR-এ পুরো ক্ষেত্র চালাতে পারে এবং নির্দিষ্ট পশ্চাৎদৃষ্টিমূলক মানদণ্ডে উচ্চ রোগনির্ণয়মূলক স্কোর করেছে।
যা সম্ভব, কিন্তু প্রমাণিত নয়: বাস্তব রোগী উপকার; সুবিধা বিশুদ্ধ বিবেচনামূলক চিন্তার কারণে; ব্যক্তিগত অদেখা তথ্যেও একই কার্যসম্পাদন।
যা দেখায় না: বিস্তৃত চিকিৎসাবিজ্ঞান সাধারণীকরণ, ব্যবহারিক মোতায়েন নিরাপত্তা, ন্যায্য সমান তথ্যপ্রাপ্ত চিকিৎসক শ্রেষ্ঠত্ব, চিকিৎসক প্রতিস্থাপন, দূষণ-মুক্ত ফল।
প্রধান সীমাবদ্ধতা: পশ্চাৎদৃষ্টিমূলক সিমুলেশন, আটটি রোগনির্ণয়, শুধু পাঠ্যভিত্তিক, আরও বেশি পরীক্ষাগার পরীক্ষা, চার্ট-ভিত্তিক স্কোরিং উপাদান, জনসাধারণের ডেটাসেট দূষণ সম্ভাবনা।
সাধারণ পাঠকের কতটা আস্থা রাখা উচিত? স্যান্ডবক্সে শুরু থেকে শেষ পর্যন্ত কাজ সম্পাদনের সক্ষমতায়—উচ্চ। “AI চিকিৎসকদের চেয়ে ভালো রোগনির্ণয় করে” এই বৃহত্তর দাবিতে—কম; ফলটি মানদণ্ডের সীমানার মধ্যে।
উৎস
ভিত্তি: Towards autonomous medical artificial intelligence agents — Dyke Ferber, Lars Hilgers, Christiane Höper and colleagues; senior author Jakob Nikolas Kather, Nature (2026).
সম্পাদকীয় নোট
এই নিবন্ধটি AI লিখেছে এবং সম্পাদকীয় দল পর্যালোচনা করেছে। এটি সংযুক্ত গবেষণার একটি পরিষ্কার ও সতর্ক ব্যাখ্যা, মূল গবেষণাপত্র পড়ার বিকল্প নয়। নির্বাচন, ব্যাখ্যা ও চূড়ান্ত ভাষার দায়িত্ব সম্পাদকের।