চোখ বন্ধ করে ছবি আঁকা
আজকের কোনো AI মডেলকে ছবি আঁকতে বললে ভেতরে মোটামুটি দুই রকমের কাজ হতে পারে। পরিচিত ইমেজ জেনারেটর—যেগুলো একটি বাক্য থেকে ছবির মতো দৃশ্য তৈরি করে—সরাসরি পিক্সেল আঁকে, আর কাজ চলাকালেই ক্যানভাসের ফল দেখতে পারে। কিন্তু আরেক ধরনের, তুলনামূলক নীরব পদ্ধতিতে মডেল আসলে ছবি আঁকে না। সে নির্দেশনা লেখে: এখানে একটি বৃত্ত আঁকো, ওখানে একটি রেখা দাও, এই আকৃতিটি নীল করো। এই নির্দেশনাগুলোই কোড—ওয়েবে অধিকাংশ আইকন ও লোগোর পেছনে থাকা স্কেলেবল ভেক্টর গ্রাফিক্স বা SVG। এর সুবিধা হলো, ফলাফল কোনো স্থির পিক্সেল-গ্রিড নয়; বরং এমন আকৃতির সমষ্টি, যেগুলো বারবার বড়-ছোট, নতুন রঙে রাঙানো বা সম্পাদনা করা যায়, তবু ঝাপসা হয় না।
সমস্যা ছিল, অল্প দিন আগেও এই ড্রয়িং-কোড লিখতে গিয়ে মডেল কার্যত অন্ধ ছিল। সে পুরো নির্দেশনার ক্রম একবারে লিখে দিত—বৃত্ত, রেখা, পূরণ করা—কিন্তু মাঝপথে রেন্ডার করে দেখে নিত না আসলে কী তৈরি হচ্ছে। চোখ বন্ধ করে মুখ আঁকার কথা ভাবুন: চোখ কোথায় হওয়া উচিত তা মোটামুটি জানা থাকলেও দ্বিতীয় চোখটি গালে পড়ে গেছে, বা চুলের জন্য আঁকা আকৃতি নাক ঢেকে ফেলেছে—এটি ধরার কোনো উপায় থাকবে না। এই মডেলগুলোর অবস্থাও কাছাকাছি ছিল। তাই কোড ব্যাকরণগতভাবে বৈধ হলেও ছবিটি দৃশ্যত বিশৃঙ্খল হতে পারত।
Guotao Liang-এর নেতৃত্বাধীন একটি দল এখন আপাতদৃষ্টিতে খুব সরল কাজটি করেছে: তারা মডেলকে “চোখ খুলতে” দিয়েছে। তাদের রেন্ডার-ইন-দ্য-লুপ পদ্ধতিতে প্রতিটি ধাপের পর অসম্পূর্ণ ছবিটি রেন্ডার করা হয় এবং পরের স্ট্রোক তৈরি করার আগে সেই ছবিটি মডেলকে আবার দেখানো হয়। আসল আকর্ষণীয় বিষয়টি এই নয় যে প্রতিক্রিয়া কাজে লাগে; বরং প্রতিক্রিয়াকে কার্যকর করতে তাদের মডেলকে কীভাবে নতুন করে শেখাতে হয়েছে।
একটি আঁকার মান কীভাবে মাপা হয়?
কোনো গবেষণাপত্র যদি বলে তার মডেল অন্যটিকে “হারিয়েছে”, তখন প্রশ্ন করা উচিত: কোন কাজে, কোন মাপকাঠিতে? “একটি ল্যাপটপ আঁকো” ধরনের অনুরোধের একটি মাত্র সঠিক ছবি নেই। তাই উৎপন্ন ছবি বিচার করতে গবেষকেরা কয়েকটি স্বয়ংক্রিয় স্কোর ব্যবহার করেন; প্রতিটিই মানুষের চোখের বিচারকে আনুমানিকভাবে ধরার চেষ্টা করে, নিখুঁতভাবে নয়।
এই গবেষণাপত্রে কয়েকটি পরিচিত মেট্রিক আছে। FID উৎপন্ন ছবির পুরো ব্যাচের পরিসংখ্যানগত বৈশিষ্ট্য বাস্তব ছবির ব্যাচের সঙ্গে তুলনা করে; কম স্কোর ভালো, কিন্তু এটি একটি নির্দিষ্ট ছবির মান বলে না। CLIP স্কোর আলাদা একটি AI-কে জিজ্ঞেস করে ছবি প্রম্পটের ভাষার সঙ্গে কতটা মেলে—উপকারী, কিন্তু মূল্যায়নটি যতটা নির্ভরযোগ্য, মেট্রিকও ততটাই। DINO, SSIM এবং LPIPS পুনর্গঠিত ছবিকে লক্ষ্যের সঙ্গে তুলনা করে; তুলনাটি কখনও কাঁচা পিক্সেল, কখনও শেখা বৈশিষ্ট্যের স্তরে হয়।
এগুলোর কোনোটিই “সত্য” নয়। এগুলো প্রতিনিধি সূচক মেট্রিক, আর পার্থক্য প্রায়ই ছোট হয়। একটি মডেল 127.6 আর অন্যটি 128.8 পেলে তা দিকের হিসাবে বাস্তব পার্থক্য হতে পারে, কিন্তু এটি ভূমিধস নয়—একটি ছোট নড়াচড়া, তাও এমন মেট্রিকে যার সঙ্গে মানুষের চোখের মূল্যায়নের সম্পর্ক অসম্পূর্ণ। “২০ গুণ বেশি তথ্যে প্রশিক্ষিত মডেলকে হারিয়েছে” ধরনের শিরোনাম পড়ার সময় এই সীমাটি মনে রাখা দরকার।
লেখকেরা কী করেছেন
তাদের লক্ষ্য ছিল এই “অন্ধভাবে আঁকা” সমস্যাটি বদলানো। আগের মডেলগুলো SVG লেখা যেন নিছক পাঠ্য প্রজন্ম: এখন পর্যন্ত লেখা কোড দেখে পরের কোড খণ্ড অনুমান করো, কিন্তু তা রেন্ডার কোরো না। ফলে আধুনিক বহুমাধ্যমিক মডেলের ভেতরে থাকা শক্তিশালী দৃষ্টি এনকোডার প্রায় নিষ্ক্রিয় থাকে। রেন্ডার-ইন-দ্য-লুপ কাজটিকে ধাপে ধাপে দৃশ্যমান প্রক্রিয়ায় বদলে দেয়। প্রতিটি অঙ্কন-কোড খণ্ডের পরে আংশিক SVG রেন্ডার হয়, সেই ছবি আবার মডেলে যায়, এবং পরের খণ্ড বেছে নেওয়া হয় ইতিমধ্যে আঁকা ক্যানভাসটি দেখে।
প্রথম ফলটি সতর্ক করার মতো, এবং লেখকেরা সেটি স্পষ্টভাবে দেখান: শুধু বিদ্যমান প্রস্তুত-ব্যবহারযোগ্য মডেলের সঙ্গে এই লুপ জুড়ে দিলেই কাজ হয় না। বিশেষ প্রশিক্ষণ ছাড়া শক্তিশালী সাধারণ মডেলকে মধ্যবর্তী উপস্থাপন দেখালে মান বাড়েনি—বরং সব ক্ষেত্রে কমেছে। আগে কখনও এইভাবে নিজের দৃশ্যমান আউটপুট ব্যবহার করতে শেখেনি এমন মডেল, হঠাৎ ছবি দেখলেই সেই প্রতিক্রিয়া সঠিকভাবে কাজে লাগাতে পারে না।
তাই মূল কাজটি প্রশিক্ষণে। গবেষকেরা প্রশিক্ষণ-তথ্য পুনর্গঠন করেন, যাতে প্রতিটি অঙ্কন অনেক ছোট, দৃশ্যত অর্থবহ ধাপে ভাঙা থাকে। জটিল আকৃতিও ছোট অংশে ভাগ করা হয়, যাতে প্রতিটি ধাপে ক্যানভাসে নতুন কিছু দেখা যায়। এরপর Qwen3-VL-ভিত্তিক প্রায় আট-বিলিয়ন-প্যারামিটার উন্মুক্ত মডেলকে এই ধাপে ধাপে ক্রমে সূক্ষ্ম-সামঞ্জস্য করা হয়। তারা এই পদ্ধতিকে দৃশ্যমান স্ব-প্রতিক্রিয়া বলে।
অঙ্কনের সময় তারা আরেকটি প্রক্রিয়া যোগ করেন, রেন্ডার-ও-যাচাই। নতুন স্ট্রোক গ্রহণ করার আগে সেটি রেন্ডার করে দেখা হয় স্ট্রোকটি সত্যিই ছবি বদলেছে কি না, নাকি আগের কাজটাই পুনরাবৃত্তি করছে। কোনো পরিবর্তন না আনলে স্ট্রোক বাদ দেওয়া হয়; আরও স্ট্রোক কাজে না দিলে মডেলকে থামতেও বলা হয়। উল্লেখযোগ্য হলো, পুরো প্রশিক্ষণ ডেটাসেট তুলনামূলক ছোট—প্রায় 850,000 উদাহরণ। এটি এক প্রতিদ্বন্দ্বীর ডেটাসেটের অর্ধেকেরও কম, আর অন্য প্রতিদ্বন্দ্বীর মাত্র একটি ছোট অংশ।
তারা কী পেয়েছেন
- এইভাবে প্রশিক্ষণ দেওয়া মডেল তার ব্লাইন্ড সমতুল্যের তুলনায় ভালো আঁকে। পার্থক্য ব্যর্থতা ক্ষেত্রে বিশেষ স্পষ্ট: ব্লাইন্ড মডেল কখনও চোখ গালে বসায়, আবার অনুরোধ করা দণ্ড চার্ট বাদ দিয়ে সাধারণ মনিটর আঁকে; দৃশ্যমান-প্রতিক্রিয়া মডেল এমন ভুল বেশি ধরতে পারে।
- মানক মানদণ্ড MMSVGBench-এ পদ্ধতিটি শক্তিশালী প্রতিদ্বন্দ্বীদের সমতুল্য, এবং কয়েকটি মেট্রিকে সামান্য এগিয়ে। এর মধ্যে OmniSVG আছে, যেটি দ্বিগুণের বেশি তথ্যে প্রশিক্ষিত, এবং InternSVG আছে, যেটি প্রায় 20× বেশি তথ্য ব্যবহার করেছে।
- পার্থক্য ছোট। আইকন সেটে, উদাহরণ হিসেবে, প্রধান ছবি-মান স্কোর 127.6, সেরা প্রতিদ্বন্দ্বীর 128.8-এর তুলনায়; প্রম্পট-মিলযুক্ত স্কোর 0.293 বনাম 0.291। দিকের হিসাবে এগুলো সামঞ্জস্যপূর্ণ, কিন্তু ব্যবধান সরু।
- দুটো যোগ করা উপাদানই অবদান রাখে। বিশেষ প্রশিক্ষণ বন্ধ করলে, বা অঙ্কন-সময় যাচাই সরালে, স্কোর মাপযোগ্যভাবে কমে। যাচাই বিশেষ করে মডেলকে একই জিনিস বারবার আঁকার লুপে আটকে পড়া থেকে রক্ষা করে।
- লেখকেরা সবচেয়ে জোর দেন দক্ষতা-তে: শীর্ষ মডেলগুলোর তুলনায় অনেক কম প্রশিক্ষণ-তথ্য ব্যবহার করে কাছাকাছি বা সামান্য ভালো মানদণ্ড কার্যসম্পাদন পাওয়া।
এটি কী প্রমাণ করে না
- এটি দেখায় না যে মডেলকে “দেখতে দেওয়া” নিজেই মুক্ত সাফল্য। গবেষণাপত্রের নিজস্ব ফল উল্টো: পুনঃপ্রশিক্ষণ ছাড়া দৃশ্যমান প্রতিক্রিয়া কার্যসম্পাদন খারাপ করে। লাভ আসে মডেলকে প্রতিক্রিয়া ব্যবহার করতে শেখানোর পর।
- এটি বড় বা নির্ণায়ক ব্যবধান দেখায় না। অধিকাংশ স্কোরে প্রতিদ্বন্দ্বীদের সঙ্গে ব্যবধান খুব কম। “20× তথ্যে প্রশিক্ষিত মডেলকে হারিয়েছে” বাক্যটি সত্য, কিন্তু এক মানদণ্ডের প্রতিনিধি সূচক মেট্রিকে ছোট ব্যবধানে।
- এটি সাধারণ শৈল্পিক ক্ষমতা প্রমাণ করে না। এটি 8B গবেষণা মডেল, প্রধানত আইকন ও সরল চিত্রণ তৈরি করছে ছোট স্থির রেজোলিউশনে—224×224 পিক্সেল—সাধারণ-উদ্দেশ্য নকশাকৃত নয়।
- GPT-5-এর মতো বড় সাধারণ মডেলের সঙ্গে তুলনা সরাসরি সমতুল্য নয়। সে সংকীর্ণ SVG-কোড কাজের জন্য তৈরি বা টিউনকৃত নয়; এখানে তাকে হারানো দুই মডেলের সাধারণ সক্ষমতা সম্পর্কে খুব কমই বলে।
- এই লুপ বিনা খরচে আসে না। প্রতিটি ধাপে ক্যানভাস উপস্থাপন ও আবার পড়তে হয় বলে প্রজন্ম, একবারে কোড লিখে দেওয়ার চেয়ে ধীর হয়। লেখকেরা এই খরচ স্বীকার করেন।
প্রমাণ কতটা শক্ত
- নিয়ন্ত্রিত তুলনার অংশটি শক্ত। Ablation স্পষ্ট: প্রশিক্ষণ সরালে বা যাচাই সরালে স্কোর কমে। তাই দুই উপাদানই লেখকের দাবি অনুযায়ী কাজে লাগছে—এটি শুধু গল্প নয়।
- অপ্রত্যাশিত ঋণাত্মক ফলটি সৎভাবে দেখানো হয়েছে। সরাসরি যোগ করা দৃশ্যমান প্রতিক্রিয়া ক্ষতি করে—এটি গবেষণাপত্রের সবচেয়ে আকর্ষণীয় ফলগুলোর একটি, কারণ “বেশি ইনপুট মানেই ভালো” ধারণাটিকে এটি সংশোধন করে।
- লিডারবোর্ড দাবি তুলনামূলক পাতলা। বেশি-তথ্য ব্যবহারকারী প্রতিদ্বন্দ্বীর ওপর জয় ছোট, এবং একটি মাত্র মানদণ্ডে; মানদণ্ডটির সঙ্গে প্রতিদ্বন্দ্বী দলেরও সম্পর্ক আছে। এক পরীক্ষা-সেটে প্রতিনিধি সূচক মেট্রিকের ছোট ব্যবধান ইঙ্গিত দেয়, চূড়ান্ত সিদ্ধান্ত নয়।
- বড় পরিসর বা বাস্তব নকশা কর্মপ্রবাহে পরীক্ষা হয়নি। এখানে নিম্নরেজোলিউশন আইকন ও সরল চিত্রণ। জটিল, উচ্চরেজোলিউশনের বা বাস্তব জগতের গ্রাফিক্সে একই সুবিধা থাকবে কি না ভবিষ্যৎ কাজ। লেখকেরাও এ সীমা বলেন।
কেন এটি গুরুত্বপূর্ণ
গবেষণাপত্রের কেন্দ্রীয় ধারণা প্রায় অস্বস্তিকরভাবে সহজ, কিন্তু অঙ্কনের বাইরেও প্রযোজ্য। কোনো কর্মসূচি কোড লিখে ওয়েব পৃষ্ঠা, চার্ট, চিত্র বা 3D দৃশ্য বানালে তার সামনে দুই পথ: পুরো কোড অন্ধভাবে লিখে শেষে আশা করা যে সব ঠিক হয়েছে; অথবা কাজ চলার সময় উপস্থাপন দেখে পরের ধাপ ঠিক করা। মানুষের জন্য দ্বিতীয়টি স্বাভাবিক—আমরা বারবার নিজের কাজের দিকে তাকাই। এই ধরনের মডেলের জন্য লুপ বন্ধ করার ধারণাটি আশ্চর্যজনকভাবে নতুন।
তবে গবেষণাপত্রের সবচেয়ে গুরুত্বপূর্ণ সতর্কচিহ্নটি হলো: দেখতে পারা আর কীভাবে দেখা তথ্য ব্যবহার করতে হয় তা শেখা এক জিনিস নয়। দৃশ্যমান চ্যানেল থাকলেই মডেল প্রতিক্রিয়াটি বুঝে কাজে লাগাতে পারবে না; সেটি আলাদা করে শেখাতে হয়। প্রশিক্ষণের পরে লুপটি কাজে দেয়, কিন্তু লাভ পরিমিত ও সীমিত—একজন আরও স্থির অঙ্কনকারী, একেবারে নতুন ধরনের শিল্পী নয়। বর্ণনা থেকে সম্পাদনাযোগ্য গ্রাফিক বানানোর সরঞ্জামের জন্য ব্যবহারিক শিক্ষাটি বড়: এখানে লাভ এসেছে শুধু বেশি তথ্য ঢেলে নয়, বরং কম তথ্যকে আরও কার্যকরভাবে কাজে লাগিয়ে। লিডারবোর্ডে আরেকটি বিন্দুর চেয়ে এই শিক্ষা বেশি মূল্যবান।
সংক্ষিপ্ত সারাংশ
ভেক্টর গ্রাফিক্স তৈরির ভাষা মডেল—ওয়েবের আইকন ও লোগোর পেছনের সম্পাদনাযোগ্য, যেকোনো মাপে বাড়ানো যায় এমন কোড—দীর্ঘদিন মূলত “অন্ধভাবে” কাজ করেছে: অঙ্কনের নির্দেশ লিখেছে, কিন্তু মাঝপথে ফলটি রেন্ডার করে দেখেনি। Guotao Liang-এর দল render-in-the-loop পদ্ধতি প্রস্তাব করেছে: প্রতিটি ধাপের পর অসম্পূর্ণ অঙ্কন রেন্ডার করে মডেলকে আবার দেখানো হয়, যাতে পরের স্ট্রোক ক্যানভাস দেখে বেছে নেওয়া যায়। গুরুত্বপূর্ণ ফলটি হলো, বিদ্যমান মডেলে শুধু এই প্রতিক্রিয়া যোগ করলে কার্যসম্পাদন খারাপ হয়; উন্নতি আসে তখনই, যখন মডেলকে সেই প্রতিক্রিয়া ব্যবহার করার জন্য পুনঃপ্রশিক্ষণ দেওয়া হয়। অঙ্কনের সময় যাচাই পুনরাবৃত্ত বা অকার্যকর স্ট্রোক বাদ দিতেও সাহায্য করে। পুনঃপ্রশিক্ষিত 8B মডেল মানক মানদণ্ডে অনেক বেশি তথ্য দিয়ে প্রশিক্ষিত প্রতিদ্বন্দ্বী মডেলের সমান বা সামান্য এগিয়ে যায়, তবে ব্যবধান ছোট, মেট্রিক কেবল প্রতিনিধি সূচক, আর কাজটি নিম্নরেজোলিউশনের আইকন ও সরল চিত্রে সীমিত। লেখকদের মূল কথা দক্ষতা: নিজের কাজ ভালোভাবে দেখতে শেখানো কখনো কখনো নিছক তথ্যের পরিমাণ বাড়ানোর বিকল্প হতে পারে।
সরাসরি যাচাই
গবেষণাপত্র কী দেখায়: ভেক্টর-গ্রাফিক্স মডেলকে ধাপে ধাপে নিজের অসম্পূর্ণ অঙ্কন উপস্থাপন করে দেখতে শেখালে ব্লাইন্ড প্রজন্মের তুলনায় ফল ভালো হয়; এক মানক মানদণ্ডে কম প্রশিক্ষণ-তথ্য ব্যবহার করেও বড়-তথ্য প্রতিদ্বন্দ্বী-দের সমতুল্য বা সামান্য ভালো কার্যসম্পাদন পাওয়া যায়।
কী সম্ভাব্য কিন্তু প্রমাণিত নয়: “নিজের কাজ দেখে নেওয়া” বিস্তৃতভাবে বেশি তথ্য পরিসর করার চেয়ে ভালো পদ্ধতি; জটিল/উচ্চরেজোলিউশনের বাস্তব জগতের গ্রাফিক্সে একই লাভ থাকবে; মানদণ্ডের ছোট ব্যবধান মানুষের চোখেও স্পষ্ট হবে।
কী দেখায় না: কেবল দৃশ্যমান প্রতিক্রিয়া যোগ করলেই উন্নতি হয়—পুনঃপ্রশিক্ষণ ছাড়া বরং ক্ষতি হয়েছে; প্রতিদ্বন্দ্বী মডেলের ওপর বড় ও নির্ণায়ক ব্যবধান; সাধারণ উদ্দেশ্যের শিল্পসৃষ্টির ক্ষমতা; অথবা GPT-5-এর মতো সাধারণ মডেলের সঙ্গে ন্যায্য সরাসরি তুলনা।
মূল সীমাবদ্ধতা: একটি মানদণ্ড; প্রতিনিধি সূচক মেট্রিকে ছোট ব্যবধান; 8B গবেষণা মডেল; 224×224 আইকন/সরল চিত্রণ; এবং প্রতিটি ধাপে উপস্থাপন করার কারণে ধীর প্রজন্ম।
সাধারণ পাঠকের আস্থা কতটা হওয়া উচিত? উচ্চ আস্থা যে কোড দিয়ে আঁকা মডেলের জন্য উপস্থাপন করে নিজের কাজ দেখা সত্যিই উপকারী হতে পারে, কিন্তু সেই লুপটি প্রশিক্ষণ দিতে হয়। এই মডেল প্রতিদ্বন্দ্বী-দের নির্ণায়কভাবে হারিয়েছে—এ দাবিতে নিম্ন থেকে মাঝারি আস্থা। সবচেয়ে শক্ত শিক্ষা: অঙ্কন কোডের ক্ষেত্রে ব্লাইন্ড একবারের প্রজন্মের চেয়ে শেখানো দৃশ্যমান প্রতিক্রিয়া ভালো কাজ করতে পারে।
উৎস
ভিত্তি: Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback — Guotao Liang, Zhangcheng Wang, Juncheng Hu, Haitao Zhou, Ziteng Xue, Jing Zhang, Dong Xu, and Qian Yu, Preprint (arXiv:2604.20730).
সম্পাদকীয় নোট
এই নিবন্ধটি AI লিখেছে এবং সম্পাদকীয় দল পর্যালোচনা করেছে। এটি সংযুক্ত গবেষণার একটি পরিষ্কার ও সতর্ক ব্যাখ্যা, মূল গবেষণাপত্র পড়ার বিকল্প নয়। নির্বাচন, ব্যাখ্যা ও চূড়ান্ত ভাষার দায়িত্ব সম্পাদকের।