চোখ বন্ধ করে ছবি আঁকা
আজকের কোনো AI মডেলকে ছবি আঁকতে বললে ভেতরে মোটামুটি দুই রকমের কাজ হতে পারে। পরিচিত ইমেজ জেনারেটর—যেগুলো একটি বাক্য থেকে ছবির মতো দৃশ্য তৈরি করে—সরাসরি পিক্সেল আঁকে, আর কাজ চলাকালেই ক্যানভাসের ফল দেখতে পারে। কিন্তু আরেক ধরনের, তুলনামূলক নীরব পদ্ধতিতে মডেল আসলে ছবি আঁকে না। সে নির্দেশনা লেখে: এখানে একটি বৃত্ত আঁকো, ওখানে একটি রেখা দাও, এই আকৃতিটি নীল করো। এই নির্দেশনাগুলোই কোড—ওয়েবে অধিকাংশ আইকন ও লোগোর পেছনে থাকা Scalable ভেক্টর গ্রাফিক্স বা SVG। এর সুবিধা হলো, ফলাফল কোনো স্থির পিক্সেল-গ্রিড নয়; বরং এমন আকৃতির সমষ্টি, যেগুলো বারবার বড়-ছোট, নতুন রঙে রাঙানো বা সম্পাদনা করা যায়, তবু ঝাপসা হয় না।
সমস্যা ছিল, অল্প দিন আগেও এই ড্রয়িং-কোড লিখতে গিয়ে মডেল কার্যত অন্ধ ছিল। সে পুরো নির্দেশনার ক্রম একবারে লিখে দিত—বৃত্ত, রেখা, fill—কিন্তু মাঝপথে উপস্থাপন করে দেখে নিত না আসলে কী তৈরি হচ্ছে। চোখ বন্ধ করে মুখ আঁকার কথা ভাবুন: চোখ কোথায় হওয়া উচিত তা মোটামুটি জানা থাকলেও দ্বিতীয় চোখটি গালে পড়ে গেছে, বা চুলের জন্য আঁকা আকৃতি নাক ঢেকে ফেলেছে—এটি ধরার কোনো উপায় থাকবে না। এই মডেলগুলোর অবস্থাও কাছাকাছি ছিল। তাই কোড ব্যাকরণগতভাবে বৈধ হলেও ছবিটি দৃশ্যত বিশৃঙ্খল হতে পারত।
Guotao Liang-এর নেতৃত্বাধীন একটি দল এখন আপাতদৃষ্টিতে খুব সরল কাজটি করেছে: তারা মডেলকে “চোখ খুলতে” দিয়েছে। তাদের উপস্থাপন-in-the-লুপ পদ্ধতিতে প্রতিটি ধাপের পর অসম্পূর্ণ ছবিটি উপস্থাপন করা হয় এবং পরের স্ট্রোক তৈরি করার আগে সেই ছবিটি মডেলকে আবার দেখানো হয়। আসল আকর্ষণীয় বিষয়টি এই নয় যে প্রতিক্রিয়া কাজে লাগে; বরং প্রতিক্রিয়াকে কার্যকর করতে তাদের মডেলকে কীভাবে নতুন করে শেখাতে হয়েছে।
একটি আঁকার মান কীভাবে মাপা হয়?
কোনো গবেষণাপত্র যদি বলে তার মডেল অন্যটিকে “হারিয়েছে”, তখন প্রশ্ন করা উচিত: কোন কাজে, কোন মাপকাঠিতে? “একটি laptop আঁকো” ধরনের অনুরোধের একটি মাত্র সঠিক ছবি নেই। তাই উৎপন্ন ছবি বিচার করতে গবেষকেরা কয়েকটি স্বয়ংক্রিয় স্কোর ব্যবহার করেন; প্রতিটিই মানুষের চোখের বিচারকে আনুমানিকভাবে ধরার চেষ্টা করে, নিখুঁতভাবে নয়।
এই গবেষণাপত্রে কয়েকটি পরিচিত মেট্রিক আছে। FID উৎপন্ন ছবির পুরো batch-এর পরিসংখ্যানগত বৈশিষ্ট্য বাস্তব ছবির batch-এর সঙ্গে তুলনা করে; কম স্কোর ভালো, কিন্তু এটি একটি নির্দিষ্ট ছবির মান বলে না। CLIP স্কোর আলাদা একটি AI-কে জিজ্ঞেস করে ছবি প্রম্পটের ভাষার সঙ্গে কতটা মেলে—উপকারী, কিন্তু সেই মূল্যায়ন করা যতটা ভালো, মেট্রিক-ও ততটাই। DINO, SSIM এবং LPIPS পুনর্গঠিত ছবিকে লক্ষ্যের সঙ্গে তুলনা করে; তুলনাটি কখনও কাঁচা pixel, কখনও learned বৈশিষ্ট্যের স্তরে হয়।
এগুলোর কোনোটিই “সত্য” নয়। এগুলো প্রতিনিধি সূচক মেট্রিক, আর পার্থক্য প্রায়ই ছোট হয়। একটি মডেল 127.6 আর অন্যটি 128.8 পেলে তা দিকের হিসাবে বাস্তব পার্থক্য হতে পারে, কিন্তু এটি ভূমিধস নয়—একটি ছোট নড়াচড়া, তাও এমন মেট্রিকে যার সঙ্গে মানুষের চোখের মূল্যায়নের সম্পর্ক অসম্পূর্ণ। “২০ গুণ বেশি তথ্যে প্রশিক্ষিত মডেলকে হারিয়েছে” ধরনের শিরোনাম পড়ার সময় এই সীমাটি মনে রাখা দরকার।
লেখকেরা কী করেছেন
তাদের লক্ষ্য ছিল এই “অন্ধভাবে আঁকা” সমস্যাটি বদলানো। আগের মডেলগুলো SVG লেখা যেন নিছক পাঠ্য প্রজন্ম: এখন পর্যন্ত লেখা কোড দেখে পরের কোড খণ্ড অনুমান করো, কিন্তু তা উপস্থাপন কোরো না। ফলে আধুনিক multimodal মডেলের ভেতরে থাকা শক্তিশালী দৃষ্টি এনকোডার প্রায় নিষ্ক্রিয় থাকে। উপস্থাপন-in-the-লুপ কাজটিকে ধাপে ধাপে দৃশ্যমান প্রক্রিয়ায় বদলে দেয়। প্রতিটি অঙ্কন-কোড খণ্ডের পরে আংশিক SVG উপস্থাপন হয়, সেই ছবি আবার মডেলে যায়, এবং পরের খণ্ড বেছে নেওয়া হয় ইতিমধ্যে আঁকা ক্যানভাস-টি দেখে।
প্রথম ফলটি সতর্ক করার মতো, এবং লেখকেরা সেটি স্পষ্টভাবে দেখান: শুধু existing প্রস্তুত-ব্যবহারযোগ্য মডেলের সঙ্গে এই লুপ জুড়ে দিলেই কাজ হয় না। বিশেষ প্রশিক্ষণ ছাড়া শক্তিশালী সাধারণ মডেলকে intermediate উপস্থাপন দেখালে মান বাড়েনি—বরং সব ক্ষেত্রে কমেছে। আগে কখনও এইভাবে নিজের দৃশ্যমান আউটপুট ব্যবহার করতে শেখেনি এমন মডেল, হঠাৎ ছবি দেখলেই সেই প্রতিক্রিয়া সঠিকভাবে কাজে লাগাতে পারে না।
তাই মূল কাজটি প্রশিক্ষণে। গবেষকেরা প্রশিক্ষণ-তথ্য পুনর্গঠন করেন, যাতে প্রতিটি অঙ্কন অনেক ছোট, visually অর্থবহ ধাপে ভাঙা থাকে। জটিল আকৃতি-ও ছোট অংশে ভাগ করা হয়, যাতে প্রতিটি ধাপে ক্যানভাসে নতুন কিছু দেখা যায়। এরপর Qwen3-VL-ভিত্তিক প্রায় আট-বিলিয়ন-প্যারামিটার উন্মুক্ত মডেলকে এই ধাপ-by-ধাপ ক্রমে সূক্ষ্ম-সামঞ্জস্য করা হয়। তারা এই পদ্ধতিকে দৃশ্যমান স্ব-প্রতিক্রিয়া বলে।
অঙ্কনের সময় তারা আরেকটি প্রক্রিয়া যোগ করেন, উপস্থাপনেবং-Verify। নতুন স্ট্রোক গ্রহণ করার আগে সেটি উপস্থাপন করে দেখা হয় স্ট্রোক-টি সত্যিই ছবি বদলেছে কি না, নাকি আগের কাজটাই পুনরাবৃত্তি করছে। কোনো পরিবর্তন না আনলে স্ট্রোক বাদ দেওয়া হয়; আরও স্ট্রোক কাজে না দিলে মডেলকে থামতেও বলা হয়। উল্লেখযোগ্য হলো, পুরো প্রশিক্ষণ ডেটাসেট তুলনামূলক ছোট—প্রায় 850,000 উদাহরণ। এটি এক rival-এর ডেটাসেটের অর্ধেকেরও কম, আর আরেক rival-এর মাত্র একটি ছোট অংশ।
তারা কী পেয়েছেন
- এইভাবে প্রশিক্ষণ দেওয়া মডেল তার ব্লাইন্ড সমতুল্যের তুলনায় ভালো আঁকে। পার্থক্য ব্যর্থতা ক্ষেত্রে বিশেষ স্পষ্ট: ব্লাইন্ড মডেল কখনও চোখ গালে বসায়, আবার অনুরোধ করা দণ্ড চার্ট বাদ দিয়ে সাধারণ monitor আঁকে; দৃশ্যমান-প্রতিক্রিয়া মডেল এমন ভুল বেশি ধরতে পারে।
- মানক মানদণ্ড MMSVGBench-এ পদ্ধতিটি শক্তিশালী rival-দের সমতুল্য, এবং কয়েকটি মেট্রিকে সামান্য এগিয়ে। এর মধ্যে OmniSVG আছে, যেটি দ্বিগুণের বেশি তথ্যে প্রশিক্ষিত, এবং InternSVG আছে, যেটি প্রায় 20× বেশি তথ্য ব্যবহার করেছে।
- পার্থক্য ছোট। আইকন সেটে, উদাহরণ হিসেবে, প্রধান ছবি-মান স্কোর 127.6, সেরা rival-এর 128.8-এর তুলনায়; প্রম্পট-মিলযুক্ত স্কোর 0.293 বনাম 0.291। দিকের হিসাবে এগুলো সামঞ্জস্যপূর্ণ, কিন্তু ব্যবধান সরু।
- দুটো যোগ করা উপাদানই অবদান রাখে। বিশেষ প্রশিক্ষণ বন্ধ করলে, বা অঙ্কন-সময় যাচাই সরালে, স্কোর মাপযোগ্যভাবে কমে। যাচাই বিশেষ করে মডেলকে একই জিনিস বারবার আঁকার লুপে আটকে পড়া থেকে রক্ষা করে।
- লেখকেরা সবচেয়ে জোর দেন দক্ষতা-তে: leader-দের তুলনায় অনেক কম প্রশিক্ষণ-তথ্য ব্যবহার করে কাছাকাছি বা সামান্য ভালো মানদণ্ড কার্যসম্পাদন পাওয়া।
এটি কী প্রমাণ করে না
- এটি দেখায় না যে মডেলকে “দেখতে দেওয়া” নিজেই মুক্ত সাফল্য। গবেষণাপত্রের নিজস্ব ফল উল্টো: retraining ছাড়া দৃশ্যমান প্রতিক্রিয়া কার্যসম্পাদন খারাপ করে। লাভ আসে মডেলকে প্রতিক্রিয়া ব্যবহার করতে শেখানোর পর।
- এটি বড় বা নির্ণায়ক lead দেখায় না। অধিকাংশ স্কোরে rival-দের সঙ্গে ব্যবধান খুব কম। “20× তথ্যে প্রশিক্ষিত মডেলকে হারিয়েছে” বাক্যটি সত্য, কিন্তু এক মানদণ্ডের প্রতিনিধি সূচক মেট্রিকে ছোট ব্যবধানে।
- এটি সাধারণ artistic ability প্রমাণ করে না। এটি 8B গবেষণা মডেল, প্রধানত আইকন ও সরল চিত্রণ তৈরি করছে ছোট স্থির রেজোলিউশনে—224×224 pixels—সাধারণ-উদ্দেশ্য নকশাকৃত নয়।
- GPT-5-এর মতো বড় সাধারণ মডেলের সঙ্গে তুলনা apples-to-apples নয়। সে সংকীর্ণ SVG-কোড কাজের জন্য তৈরি বা tuned নয়; এখানে তাকে হারানো দুই মডেলের সাধারণ সক্ষমতা সম্পর্কে খুব কমই বলে।
- এই লুপ বিনা খরচে আসে না। প্রতিটি ধাপে ক্যানভাস উপস্থাপন ও আবার পড়তে হয় বলে প্রজন্ম, একবারে কোড লিখে দেওয়ার চেয়ে ধীর হয়। লেখকেরা এই খরচ স্বীকার করেন।
প্রমাণ কতটা শক্ত
- নিয়ন্ত্রিত তুলনার অংশটি শক্ত। Ablation স্পষ্ট: প্রশিক্ষণ সরালে বা যাচাই সরালে স্কোর কমে। তাই দুই উপাদানই লেখকের দাবি অনুযায়ী কাজে লাগছে—এটি শুধু গল্প নয়।
- অপ্রত্যাশিত ঋণাত্মক ফলটি সৎভাবে দেখানো হয়েছে। Naive দৃশ্যমান প্রতিক্রিয়া ক্ষতি করে—এটি গবেষণাপত্রের সবচেয়ে আকর্ষণীয় ফলগুলোর একটি, কারণ “বেশি ইনপুট মানেই ভালো” ধারণাটিকে এটি সংশোধন করে।
- লিডারবোর্ড দাবি তুলনামূলক পাতলা। বেশি-তথ্য rival-এর ওপর জয় ছোট, এবং একটি মাত্র মানদণ্ডে; মানদণ্ডটির সঙ্গে competitor দলেরও সম্পর্ক আছে। এক পরীক্ষা-সেটে প্রতিনিধি সূচক মেট্রিকের ছোট ব্যবধান ইঙ্গিত দেয়, চূড়ান্ত সিদ্ধান্ত নয়।
- বড় পরিসর বা বাস্তব নকশা কর্মপ্রবাহে পরীক্ষা হয়নি। এখানে নিম্নরেজোলিউশন আইকন ও সরল চিত্রণ। জটিল, উচ্চরেজোলিউশনের বা বাস্তব জগতের গ্রাফিক্সে একই সুবিধা থাকবে কি না ভবিষ্যৎ কাজ। লেখকেরাও এ সীমা বলেন।
কেন এটি গুরুত্বপূর্ণ
গবেষণাপত্রের কেন্দ্রীয় ধারণা প্রায় অস্বস্তিকরভাবে সহজ, কিন্তু অঙ্কনের বাইরেও প্রযোজ্য। কোনো কর্মসূচি কোড লিখে web page, চার্ট, চিত্র বা 3D দৃশ্য বানালে তার সামনে দুই পথ: পুরো কোড অন্ধভাবে লিখে শেষে আশা করা যে সব ঠিক হয়েছে; অথবা কাজ চলার সময় উপস্থাপন দেখে পরের ধাপ ঠিক করা। মানুষের জন্য দ্বিতীয়টি স্বাভাবিক—আমরা বারবার নিজের কাজের দিকে তাকাই। এই ধরনের মডেলের জন্য লুপ বন্ধ করার ধারণাটি আশ্চর্যজনকভাবে নতুন।
তবে গবেষণাপত্রের সবচেয়ে গুরুত্বপূর্ণ সতর্কচিহ্নটি হলো: দেখতে পারা আর কীভাবে দেখা তথ্য ব্যবহার করতে হয় তা শেখা এক জিনিস নয়। দৃশ্যমান চ্যানেল থাকলেই মডেল প্রতিক্রিয়াটি বুঝে কাজে লাগাতে পারবে না; সেটি আলাদা করে শেখাতে হয়। প্রশিক্ষণের পরে লুপটি কাজে দেয়, কিন্তু লাভ পরিমিত ও সীমিত—একজন আরও স্থির অঙ্কনকারী, একেবারে নতুন ধরনের শিল্পী নয়। বর্ণনা থেকে সম্পাদনাযোগ্য গ্রাফিক বানানোর সরঞ্জামের জন্য ব্যবহারিক শিক্ষাটি বড়: এখানে লাভ এসেছে শুধু বেশি তথ্য ঢেলে নয়, বরং কম তথ্যকে আরও কার্যকরভাবে কাজে লাগিয়ে। লিডারবোর্ডে আরেকটি বিন্দুর চেয়ে এই শিক্ষা বেশি মূল্যবান।
সংক্ষিপ্ত সারাংশ
ভেক্টর গ্রাফিক্স তৈরির ভাষা মডেল—ওয়েবের আইকন ও লোগোর পেছনের সম্পাদনাযোগ্য, যেকোনো মাপে বাড়ানো যায় এমন কোড—দীর্ঘদিন মূলত “অন্ধভাবে” কাজ করেছে: অঙ্কনের নির্দেশ লিখেছে, কিন্তু মাঝপথে ফলটি রেন্ডার করে দেখেনি। Guotao Liang-এর দল render-in-the-loop পদ্ধতি প্রস্তাব করেছে: প্রতিটি ধাপের পর অসম্পূর্ণ অঙ্কন রেন্ডার করে মডেলকে আবার দেখানো হয়, যাতে পরের স্ট্রোক ক্যানভাস দেখে বেছে নেওয়া যায়। গুরুত্বপূর্ণ ফলটি হলো, বিদ্যমান মডেলে শুধু এই প্রতিক্রিয়া যোগ করলে কার্যসম্পাদন খারাপ হয়; উন্নতি আসে তখনই, যখন মডেলকে সেই প্রতিক্রিয়া ব্যবহার করার জন্য পুনঃপ্রশিক্ষণ দেওয়া হয়। অঙ্কনের সময় যাচাই পুনরাবৃত্ত বা অকার্যকর স্ট্রোক বাদ দিতেও সাহায্য করে। পুনঃপ্রশিক্ষিত 8B মডেল মানক মানদণ্ডে অনেক বেশি তথ্য দিয়ে প্রশিক্ষিত প্রতিদ্বন্দ্বী মডেলের সমান বা সামান্য এগিয়ে যায়, তবে ব্যবধান ছোট, মেট্রিক কেবল প্রতিনিধি সূচক, আর কাজটি নিম্ন-রেজোলিউশনের আইকন ও সরল চিত্রে সীমিত। লেখকদের মূল কথা দক্ষতা: নিজের কাজ ভালোভাবে দেখতে শেখানো কখনো কখনো নিছক তথ্যের পরিমাণ বাড়ানোর বিকল্প হতে পারে।
সরাসরি যাচাই
গবেষণাপত্র কী দেখায়: ভেক্টর-গ্রাফিক্স মডেলকে ধাপ-by-ধাপ নিজের অসম্পূর্ণ অঙ্কন উপস্থাপন করে দেখতে শেখালে ব্লাইন্ড প্রজন্মের তুলনায় ফল ভালো হয়; এক মানক মানদণ্ডে কম প্রশিক্ষণ-তথ্য ব্যবহার করেও বড়-তথ্য rival-দের সমতুল্য বা সামান্য ভালো কার্যসম্পাদন পাওয়া যায়।
কী সম্ভাব্য কিন্তু প্রমাণিত নয়: “নিজের কাজ দেখে নেওয়া” বিস্তৃতভাবে বেশি তথ্য পরিসর করার চেয়ে ভালো পদ্ধতি; জটিল/উচ্চরেজোলিউশনের বাস্তব জগতের গ্রাফিক্সে একই লাভ থাকবে; মানদণ্ডের ছোট ব্যবধান মানুষের চোখেও স্পষ্ট হবে।
কী দেখায় না: কেবল দৃশ্যমান প্রতিক্রিয়া যোগ করলেই উন্নতি হয়—পুনঃপ্রশিক্ষণ ছাড়া বরং ক্ষতি হয়েছে; প্রতিদ্বন্দ্বী মডেলের ওপর বড় ও নির্ণায়ক ব্যবধান; সাধারণ উদ্দেশ্যের শিল্পসৃষ্টির ক্ষমতা; অথবা GPT-5-এর মতো সাধারণ মডেলের সঙ্গে ন্যায্য সরাসরি তুলনা।
মূল সীমাবদ্ধতা: একটি মানদণ্ড; প্রতিনিধি সূচক মেট্রিকে ছোট ব্যবধান; 8B গবেষণা মডেল; 224×224 আইকন/সরল চিত্রণ; এবং প্রতিটি ধাপে উপস্থাপন করার কারণে ধীর প্রজন্ম।
সাধারণ পাঠকের আস্থা কতটা হওয়া উচিত? উচ্চ আস্থা যে কোড দিয়ে আঁকা মডেলের জন্য উপস্থাপন করে নিজের কাজ দেখা সত্যিই উপকারী হতে পারে, কিন্তু সেই লুপ-টি প্রশিক্ষণ দিতে হয়। এই মডেল rival-দের decisively হারিয়েছে—এ দাবিতে নিম্ন-to-মাঝারি আস্থা। সবচেয়ে শক্ত শিক্ষা: অঙ্কন কোডের ক্ষেত্রে ব্লাইন্ড একবারের প্রজন্মের চেয়ে শেখানো দৃশ্যমান প্রতিক্রিয়া ভালো কাজ করতে পারে।
উৎস
ভিত্তি: Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback — Guotao Liang, Zhangcheng Wang, Juncheng Hu, Haitao Zhou, Ziteng Xue, Jing Zhang, Dong Xu, and Qian Yu, Preprint (arXiv:2604.20730).
সম্পাদকীয় নোট
এই নিবন্ধটি AI লিখেছে এবং সম্পাদকীয় দল পর্যালোচনা করেছে। এটি সংযুক্ত গবেষণার একটি পরিষ্কার ও সতর্ক ব্যাখ্যা, মূল গবেষণাপত্র পড়ার বিকল্প নয়। নির্বাচন, ব্যাখ্যা ও চূড়ান্ত ভাষার দায়িত্ব সম্পাদকের।