অভিজ্ঞ ডেভেলপাররা AI ব্যবহার করে নিজেকে দ্রুত মনে করেছিলেন—কিন্তু মাপা সময়ে তারা ধীর ছিলেন; আসল ফল এটিই, AI কোডিংের চূড়ান্ত রায় নয়
একজন অভিজ্ঞ programmer-কে জিজ্ঞেস করলে AI coding assistant তাকে দ্রুত করে কি না, প্রায়ই একটি সংখ্যা শোনা যায়: 20%, 30% সময় বাঁচে। অর্থনীতিবিদ বা machine-learning গবেষকদের অনুমান আরও বড় হতে পারে। 2025 সালের শুরুতে METR-এর একটি দল এই প্রশ্নে ধীর ও ব্যয়বহুল কাজটি করল: সরাসরি মেপে দেখল। 16 জন অভিজ্ঞ open-source developer-কে তাদের খুব পরিচিত বড় codebase থেকে 246টি বাস্তব কাজ দেওয়া হয় এবং প্রতিটি কাজ আলাদা করে randomize করে ঠিক করা হয় কখন AI tool ব্যবহার করা যাবে, কখন যাবে না। তারপর কাজ শেষ করতে কত সময় লাগে তা মাপা হয়।
ডেভেলপাররা আগেই অনুমান করেছিলেন AI কাজ সময় প্রায় 24% কমাবে। ঘটল উল্টো: AI-সহ কাজ শেষ করতে 19% বেশি সময় লাগল। আরও আকর্ষণীয় অংশ হলো—কাজ শেষ করার পরও একই ডেভেলপাররা বিশ্বাস করছিলেন AI তাদের প্রায় 20% দ্রুত করেছে। তারা মাপা সময়ে ধীর, অনুভবে দ্রুত। এই দুই সংখ্যার দূরত্বই গবেষণাটির সবচেয়ে গুরুত্বপূর্ণ ফল।
এটি বাস্তব এবং যত্নসহকারে মাপা ফল। কিন্তু এটি 16 জন ডেভেলপার, নিজেদের অতি পরিচিত কোডভাণ্ডার, এবং প্রাথমিক-2025 সরঞ্জামের সময়ের একটি চিত্র। তাই এটি “AI ডেভেলপারদের ধীর করে” এমন সর্বজনীন sentence নয়। একই গবেষণা দলের পরের তথ্য ইতিমধ্যেই অন্য দিকে ইঙ্গিত করেছে।
এই পরীক্ষা কী মেপেছে, আর randomisation কী সুবিধা দেয়
র্যান্ডমাইজড নিয়ন্ত্রিত পরীক্ষা (RCT) চিকিৎসাবিজ্ঞানে hopeful সম্পর্ক আর কারণগত প্রভাব আলাদা করতে ব্যবহৃত হয়। এখানে 246 কাজ এলোমেলোভাবে AI-অনুমোদিত বা AI-disallowed শর্তে গেছে। ফলে গড়ে দুই pile-এর পদ্ধতিগত পার্থক্য হওয়ার কথা শুধু AI প্রবেশাধিকার। এই নকশা-ই “AI সময়ের পরিবর্তন সৃষ্ট করেছে” বলা সম্ভব করে—শুধু “যারা AI নেয় তারা অন্যরকম” এমন confounding নয়।
AI কোডিং লাভের সাধারণ প্রমাণ—স্ব-প্রতিবেদন ও মানদণ্ড—এটি করতে পারে না। মানদণ্ড বাস্তব কোডভাণ্ডার কাজ নয়; স্ব-প্রতিবেদন, এই গবেষণায়ই দেখা যাচ্ছে, confidently ভুল হতে পারে। অংশগ্রহণকারীরা novice ছিলেন না: পরিণত উন্মুক্ত-উৎস প্রকল্পের প্রতিষ্ঠিত contributor, প্রকল্প-নির্দিষ্ট অভিজ্ঞতা গড়ে প্রায় পাঁচ বছর, এবং AI সরঞ্জাম ব্যবহারের কিছু পূর্বধারণা অভিজ্ঞতা ছিল।
গবেষকেরা কী করেছেন
- METR-এর Joel Becker, Nate Rush, Beth Barnes ও David Rein একটি র্যান্ডমাইজড নিয়ন্ত্রিত পরীক্ষা চালান। 16 experienced উন্মুক্ত-উৎস ডেভেলপার নিজেদের নিয়মিত অবদান রাখা বড় কোডভাণ্ডার-তে কাজ করেন; নির্দিষ্ট প্রকল্পে গড় অভিজ্ঞতা প্রায় পাঁচ বছর।
- প্রকল্প সমস্যা tracker থেকে নেওয়া 246 বাস্তব কাজ—ত্রুটি সংশোধন, বৈশিষ্ট্য ও refactor—ব্যবহার করা হয়। প্রতিটি কাজ এলোমেলোভাবে “AI অনুমোদিত” বা “AI disallowed” করা হয়।
- AI-অনুমোদিত শর্ত ছিল Cursor Pro + Claude 3.5/3.7 Sonnet, অর্থাৎ প্রাথমিক-2025 tooling। প্রধান ফলাফল ছিল বাস্তব সম্পূর্ণতা সময়। পাশাপাশি ডেভেলপারদের pre-কাজ পূর্বাভাস, পরবর্তী-কাজ অনুমান এবং অর্থনীতিবিদ/ML বিশেষজ্ঞ পূর্বাভাস সংগ্রহ করা হয়।
তাঁরা কী পেয়েছেন
- AI ব্যবহার করলে কাজ 19% বেশি সময় নিয়েছে। 95% আস্থার ব্যবধান প্রায় +2% থেকে +39%; অর্থাৎ সুনির্দিষ্ট প্রভাবের মাত্রা অনিশ্চিত হলেও দিক এই নমুনায় যথেষ্ট কঠিন।
- সবাই উল্টোটা পূর্বাভাস করেছিল। ডেভেলপার ~24% গতি বৃদ্ধি, ML বিশেষজ্ঞ ~38%, অর্থনীতিবিদ ~39% আশা করেছিলেন। বাস্তব স্টপওয়াচ কিছু গতি বৃদ্ধি নয়, slowdown দেখায়।
- উপলব্ধি ব্যবধান: কাজ শেষে ডেভেলপাররা এখনও মনে করেছিলেন AI তাদের ~20% দ্রুত করেছে। Felt প্রভাব ও পরিমাপিত প্রভাবের ব্যবধান প্রায় 40 শতাংশ বিন্দু।
- লেখকেরা সম্ভব ব্যাখ্যাগুলোকে অনুমান হিসেবে সাজান, রায় হিসেবে নয়: পরিচিত কোডভাণ্ডারে বিশেষজ্ঞের own প্রেক্ষাপট সুবিধা; পরিণত প্রকল্পের implicit মান মানক; কোডভাণ্ডারর প্রেক্ষাপট মডেলের বাইরে থাকা; prompting-এর সময়; AI আউটপুট পর্যালোচনা/সংশোধন খরচ।
এটি কী দেখায় না
- AI অধিকাংশ ডেভেলপারকে ধীর করে—এটি দেখায় না। লেখকেরা নিজেরাই বলেন, 16 বিশেষজ্ঞ পরিচিত কোডভাণ্ডার গড় ডেভেলপার/কাজের প্রতিনিধি নয়।
- Newcomer, greenfield প্রকল্প, অপরিচিত ভাষা, ছোটতর কোডভাণ্ডার বা অন্য ক্ষেত্রে AI অকার্যকর/ধীর—এমন উপসংহার নয়।
- সরঞ্জাম মান স্থির—না। এটি প্রাথমিক-2025 Cursor এবং Claude 3.5/3.7 Sonnet। সরঞ্জাম বা usage ধরন improve করলে একই বিন্যাসেও ফল বদলাতে পারে।
- এটি প্রিপ্রিন্ট (জুলাই 2025), তখন সহকর্মী পর্যালোচনা সম্পন্ন ছিল না; লেখকেরা পরীক্ষামূলক কৃত্রিম প্রভাব পুরোপুরি নিয়ম বাইরে করতে পারেননি, যদিও ফল বিভিন্ন দৃঢ়তা যাচাইে টিকে ছিল।
- “ডেভেলপাররা হয়তো অন্যভাবে লাভবান হয়েছে—শিখেছে, happier ছিল, ভালো কোড লিখেছে”—এই আশ্বস্তকর গল্প গবেষণা প্রমাণ করে না। পরিমাপিত ব্যক্তিনির্ভর দাবি ছিল felt গতি বৃদ্ধি, আর সেটিই তথ্যের সঙ্গে disagree করেছে।
প্রমাণ কতটা শক্তিশালী?
নকশা অস্বাভাবিকভাবে শক্তিশালী। Randomization, বাস্তব সমস্যা, পরিচিত কোডভাণ্ডার এবং বাস্তব সময়বিন্যাস স্ব-প্রতিবেদন/মানদণ্ড-ভারী গবেষণা-সাহিত্যের তুলনায় বড় upgrade। 19% slowdown লেখকদের দৃঢ়তা বিশ্লেষণেও থাকে।
সবচেয়ে transferable সিদ্ধান্ত উপলব্ধি ব্যবধান। বিশেষজ্ঞ নিজস্ব উৎপাদনশীলতা পরিবর্তন সম্পর্কে ~40 শতাংশ বিন্দু optimisticভাবে ভুল ছিল। AI উৎপাদনশীলতার স্ব-প্রতিবেদন শুনলে এই ফল সতর্ক করে: মানুষ নিজের speed পরিবর্তন খুব বিশ্বাসযোগ্যভাবে অনুমান নাও করতে পারে।
এটি একটি সময়বিন্দুর ছবি, দীর্ঘমেয়াদি প্রবণতা নয়। METR-এর ফেব্রুয়ারি 2026 follow-up-এ একই ধরনের developer কিন্তু নতুনতর tool ব্যবহার করে কিছুটা গতি বৃদ্ধির সংকেত দিয়েছেন—ফিরে আসা developer-দের ক্ষেত্রে আনুমানিক −18%, নতুনদের ক্ষেত্রে −4%। লেখকেরা একে দুর্বল প্রমাণ বলেন, কারণ অংশগ্রহণকারী নির্বাচনের ধরন বদলেছে: developer-রা AI ছাড়া কাজ করতে ক্রমে অনিচ্ছুক হয়েছে, পারিশ্রমিকের হার কমেছে এবং বেছে নেওয়া কাজের ধরনেও পক্ষপাত থাকতে পারে। তাই সতর্ক পাঠ হলো: প্রভাব বদলাচ্ছে হতে পারে, কিন্তু সেই পরিবর্তনটিও অনিশ্চিত।
কেন এটি গুরুত্বপূর্ণ
AI coding নিয়ে আলোচনা প্রায়ই demo, ব্যক্তিগত অনুভূতি ও anecdote-এ আটকে যায়। এই গবেষণার মূল্য হলো বিরক্তিকর কিন্তু শক্ত পদ্ধতি: randomize করা, বাস্তব কাজের সময় মাপা, তারপর অংশগ্রহণকারীদের নিজেদের অভিজ্ঞতাও জিজ্ঞেস করা। ফলটি দুই পক্ষের সহজ গল্পই ভেঙে দেয়। “AI সব বিশেষজ্ঞকে বহুগুণ দ্রুত করে” এখানে ভুল; আবার “AI coding প্রমাণিতভাবেই ধীর” বলাও অতিরঞ্জিত, কারণ পরবর্তী তথ্য ইতিমধ্যে অন্য দিকের সংকেত দিচ্ছে।
সবচেয়ে স্থায়ী শিক্ষা খুব মানব: মানুষ পরিমাপিতভাবে ধীর ছিল, কিন্তু নিজেকে দ্রুত মনে করেছে। “দ্রুত মনে হচ্ছে” প্রমাণ নয় যে সত্যিই দ্রুত। পরিমাপ করুন।
সংক্ষিপ্ত সারাংশ
METR-এর র্যান্ডমাইজড পরীক্ষায় 16 experienced উন্মুক্ত-উৎস ডেভেলপার নিজেদের পরিচিত কোডভাণ্ডারে 246 বাস্তব কাজ করেন। এলোমেলো অর্ধেকে প্রাথমিক-2025 AI সরঞ্জাম (Cursor Pro + Claude 3.5/3.7 Sonnet) অনুমোদিত ছিল। ডেভেলপাররা ~24% গতি বৃদ্ধি আশা করলেও AI শর্তে কাজ সম্পূর্ণতা সময় 19% বেড়েছে; কাজ শেষে তারা তবুও ~20% গতি বৃদ্ধি হয়েছে বলে মনে করেছেন। উপলব্ধি ব্যবধান গবেষণাটির সবচেয়ে শক্তিশালী শিক্ষা। কিন্তু নমুনা ছোট, বিন্যাস সংকীর্ণ, সরঞ্জাম সময়ের একটি চিত্র কালনির্ধারিত, এবং লেখকদের 2026 অনুসরণকালীন newer সরঞ্জামে গতি বৃদ্ধির দিকে দুর্বল সংকেত দেয়। এটি সতর্ক কারণগত পরিমাপ—AI কোডিংের চূড়ান্ত রায় নয়।
উৎস
ভিত্তি: Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity — Joel Becker, Nate Rush, Beth Barnes, David Rein (METR), arXiv:2507.09089 [cs.AI] (preprint).
- প্রিপ্রিন্ট — J. Becker, N. Rush, B. Barnes, D. Rein (METR), Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity, arXiv:2507.09089 [cs.AI] (2025)
- উৎস — METR, 'Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity' (study write-up, July 2025)
- উৎস — METR, developer-uplift follow-up (February 2026)
সম্পাদকীয় নোট
এই নিবন্ধটি AI লিখেছে এবং সম্পাদকীয় দল পর্যালোচনা করেছে। এটি সংযুক্ত গবেষণার একটি পরিষ্কার ও সতর্ক ব্যাখ্যা, মূল গবেষণাপত্র পড়ার বিকল্প নয়। নির্বাচন, ব্যাখ্যা ও চূড়ান্ত ভাষার দায়িত্ব সম্পাদকের।