OpenAI যখন Codex for (almost) everything প্রকাশ করল, তখন প্রযুক্তি বিশ্ব নজর দিল। বছরের পর বছর ধরে AI কোড লিখছে এবং ইমেল ড্রাফট তৈরি করছে, কিন্তু দাবি অনুযায়ী Codex এখন macOS পরিচালনা করতে পারে — “নিজের কার্সার দিয়ে দেখে, ক্লিক করে এবং টাইপ করে” — এটি একটি মৌলিকভাবে ভিন্ন ক্ষমতা।
ক্লাউড-ভিত্তিক ভাষা মডেল আর স্থানীয় অপারেটিং সিস্টেমের মধ্যকার ব্যবধান পূরণ করা কঠিন কাজে পরিচিত। কয়েক দশক ধরে অটোমেশন নির্ভর করত নড়বড়ে Application Programming Interfaces (APIs) কিংবা DOM-স্ক্রেপিং স্ক্রিপ্টের উপর, যেগুলো UI এলিমেন্ট বদলাতেই ভেঙে পড়ে।
মূল প্রকৌশলগত অন্তর্দৃষ্টি: Codex কোড-স্তরের ইন্টিগ্রেশন বাদ দিয়ে পিক্সেল-স্তরের এক্সিকিউশন গ্রহণ করেছে। মাল্টিমোডাল ভিশনকে লো-লেভেল কার্নেল ইভেন্ট ইনজেকশনের সাথে মিলিয়ে OpenAI Graphical User Interface (GUI)-কে একটি universal API-তে পরিণত করেছে।
নিচে এই সম্ভাবনা তৈরি করা প্রযুক্তিগত আর্কিটেকচার দেওয়া হলো।
Mac-Native এজেন্টের আর্কিটেকচার
মানুষের হস্তক্ষেপ ছাড়াই কোনো অ্যাপ্লিকেশন পরীক্ষা করতে বা ফ্রন্টএন্ড ডিজাইনে পুনরাবৃত্তি করতে একটি AI-এর একটি নিরবচ্ছিন্ন Perceive-Reason-Act লুপ দরকার। নিচে Codex সম্ভবত macOS-এ প্রতিটি ধাপ কীভাবে বাস্তবায়ন করে তা দেওয়া হলো।
1. পারসেপশন: সিমান্টিক ভিশন এবং গ্রাউন্ডিং ইঞ্জিন
প্রথাগত অটোমেশন টুল যেমন AppleScript UI অ্যাক্সেসিবিলিটি ট্রি পড়ে। এই পদ্ধতি দ্রুত, কিন্তু কাস্টম Electron অ্যাপ, ওয়েব ক্যানভাস বা গেমের ক্ষেত্রে ব্যর্থ হয় যেখানে UI এলিমেন্টে সঠিক অ্যাক্সেসিবিলিটি ট্যাগ থাকে না।
OpenAI জানিয়েছে যে Codex অ্যাপগুলো ব্যবহার করে সেগুলোকে “দেখে”, যার অর্থ এটি নির্ভর করে Computer Vision-এর উপর। Mac-এ চলমান হোস্ট অ্যাপ্লিকেশনটি ডেস্কটপের হাই-ফ্রিকোয়েন্সি ফ্রেম গ্র্যাব নেয়। এরপর একটি মাল্টিমোডাল মডেল সিমান্টিক সেগমেন্টেশন ব্যবহার করে এই ফ্রেমগুলো পার্স করে — এটি HTML ট্যাগ খোঁজে না, বরং বোতাম, সার্চ বার ও মেনুর মতো ইন্টারফেস এলিমেন্টের আকৃতি ও প্রসঙ্গ ভিজ্যুয়ালি চিনে নেয়।

এখানে মূল প্রকৌশলগত চ্যালেঞ্জ হলো গ্রাউন্ডিং। AI একবার লক্ষ্য চিহ্নিত করলে, সিমান্টিক অবজেক্টটিকে স্ক্রিনের নির্দিষ্ট পিক্সেল কোঅর্ডিনেটে ম্যাপ করতে একটি হিসাব চালায়। এটি “ক্লোজ বোতামে ক্লিক করো”-কে সঠিক (x, y) অবস্থানে রূপান্তর করে, নির্দিষ্ট ডিসপ্লে রেজোলিউশন ও স্কেলিং ফ্যাক্টর অনুযায়ী সমন্বয় করে।
| ধাপ | কী ঘটে | প্রযুক্তি |
|---|---|---|
| ফ্রেম ক্যাপচার | ডেস্কটপের হাই-ফ্রিকোয়েন্সি স্ক্রিনশট | হোস্ট অ্যাপ্লিকেশন |
| সিমান্টিক পার্সিং | কোড নয়, ভিজ্যুয়াল চেহারা দিয়ে UI এলিমেন্ট চেনা | মাল্টিমোডাল ভিশন মডেল |
| গ্রাউন্ডিং | সিমান্টিক লক্ষ্যকে পিক্সেল কোঅর্ডিনেটে ম্যাপ করা | কোঅর্ডিনেট রিগ্রেশন মডেল |
| অ্যাকশন ডিসপ্যাচ | সিনথেসাইজড ইনপুট ইভেন্ট OS-এ ইনজেক্ট করা | সিস্টেম ফ্রেমওয়ার্ক হুক |
2. অ্যাকশন: OS-স্তরের ইভেন্ট ইনজেকশন
কোথায় ক্লিক করতে হবে জানা ততটুকুই কাজের, যতটুকু সফটওয়্যার আসলে সেই অ্যাকশন ট্রিগার করতে পারে। Codex শারীরিক হার্ডওয়্যার সম্পূর্ণভাবে এড়িয়ে যায়।
macOS-এর সাথে নেটিভ স্তরে যোগাযোগ করতে Codex সম্ভবত Apple-এর গভীরতম সিস্টেম ফ্রেমওয়ার্কগুলো ব্যবহার করে: Quartz Event Services এবং Accessibility API।
Codex যখন ক্লিক করার সিদ্ধান্ত নেয়, তখন এটি একটি ভার্চুয়াল CGEvent সিনথেসাইজ করে — একটি mouseDown-এর পর একটি mouseUp — এবং সেটি সরাসরি macOS সিস্টেম ইভেন্ট কিউতে ইনজেক্ট করে। অপারেটিং সিস্টেমের দৃষ্টিকোণ থেকে এই সিনথেটিক ইভেন্ট একটি শারীরিক ট্র্যাকপ্যাড প্রেস থেকে অবিচ্ছিন্ন। এটিই কারণ Codex যেকোনো অ্যাপ্লিকেশন পরিচালনা করতে পারে: মানুষ যদি সেটিতে ক্লিক করতে পারে, Codex-ও পারে।
3. আইসোলেশন: “গোস্ট কার্সার” মেকানিক্স
সম্ভবত সবচেয়ে প্রযুক্তিগতভাবে উচ্চাকাঙ্ক্ষী দাবিটি হলো Codex “ব্যাকগ্রাউন্ডে চলে আপনার কম্পিউটার দখল না করে”। যারা ম্যাক্রো রেকর্ডার ব্যবহার করেছেন তারা জানেন যে প্রথাগত অটোমেশন মাউস কার্সার সম্পূর্ণভাবে নিজের দখলে নিয়ে নেয়।
একই সাথে এক্সিকিউশন অর্জন করতে সিস্টেমকে অবশ্যই AI-এর ইনপুটগুলো ব্যবহারকারীর শারীরিক ইনপুট থেকে আলাদা রাখতে হবে। দুটি সম্ভাব্য বাস্তবায়ন পদ্ধতি রয়েছে:
| পদ্ধতি | কীভাবে কাজ করে | ট্রেড-অফ |
|---|---|---|
| টার্গেটেড উইন্ডো রাউটিং | macOS নির্দিষ্ট Process Identifiers (PIDs)-এ ইভেন্ট পাঠানোর অনুমতি দেয়। Codex সিনথেসাইজড ক্লিকগুলো সরাসরি টার্গেট অ্যাপ্লিকেশনের ইভেন্ট লুপে পাঠায়, গ্লোবাল হার্ডওয়্যার কার্সারকে এড়িয়ে। | কম ওভারহেড; সুনির্দিষ্ট উইন্ডো টার্গেটিং প্রয়োজন। |
| ভার্চুয়াল ফ্রেমবাফার | সিস্টেম একটি হেডলেস ভার্চুয়াল ডেস্কটপ লেয়ার চালু করে। Codex এই অদৃশ্য ওয়ার্কস্পেসে “দেখে” এবং কাজ করে, অন্যদিকে ব্যবহারকারী অব্যাহত থাকে প্রাথমিক ওয়ার্কস্পেসে নিরবচ্ছিন্নভাবে। | বেশি মেমরি ব্যবহার; শক্তিশালী আইসোলেশন গ্যারান্টি। |
ভার্চুয়াল ফ্রেমবাফার পদ্ধতিটি সেই মেকানিক্সের সাথে সামঞ্জস্যপূর্ণ যা Anthropic তাদের নিজস্ব Computer Use ক্ষমতা প্রকাশ করার সময় পরিলক্ষিত হয়েছিল, যা ইঙ্গিত দেয় যে এটি ডেস্কটপ AI এজেন্টের জন্য একটি শিল্প-মান প্যাটার্ন হিসেবে আবির্ভূত হচ্ছে।
দৃষ্টিভঙ্গি: একটি Post-API বিশ্ব
বিস্তারের প্রভাব প্রযুক্তিগত বাস্তবায়নের চেয়েও অনেক বেশি দূর পর্যন্ত বিস্তৃত। OS স্তরে ভিশন-টু-অ্যাকশন পাইপলাইন সমাধান করে OpenAI প্রথাগত API-গুলোকে ঐচ্ছিক করে তুলেছে। আমরা Large Action Model (LAM)-এর যুগে প্রবেশ করছি।
ব্যবহারিক প্রভাবগুলো বিবেচনা করুন:
- লিগেসি সফটওয়্যার ইন্টিগ্রেশন: ২০০৮ সালের এন্টারপ্রাইজ টুল, যার কোনো API নেই? Codex-এর কোনোটার দরকার নেই। এটি অ্যাপ্লিকেশনটি খোলে, ইন্টারফেস নেভিগেট করে, ডেটা কপি করে এবং সেটি একটি আধুনিক ড্যাশবোর্ডে পেস্ট করে।
- প্ল্যাটফর্ম বিধিনিষেধ: প্ল্যাটফর্মগুলো আক্রমণাত্মক API রেট লিমিটিংয়ের মাধ্যমে ডেভেলপার অ্যাক্সেস সীমিত করে? Codex ওয়েব ব্রাউজার খোলে এবং সরাসরি ইন্টারফেস চালায়, ঠিক যেমন একজন মানুষ্য ব্যবহারকারী করত।
- ক্রস-অ্যাপ্লিকেশন ওয়ার্কফ্লো: আগে যে কাজগুলোর জন্য বিচ্ছিন্ন অ্যাপ্লিকেশনগুলোর মধ্যে কাস্টম মিডলওয়্যার দরকার হতো, সেগুলো এখন একটি সাধারণ ন্যাচারাল-ল্যাঙ্গুয়েজ নির্দেশনার মাধ্যমে পরিচালনা করা যায়।
সফটওয়্যার শিল্প কয়েক দশক ধরে অ্যাপ্লিকেশনগুলোর মধ্যে সেতু তৈরি করেছে। macOS GUI-তে Codex-এর দক্ষতার সাথে, অ্যাপ্লিকেশনগুলোর আর নিজেদের মধ্যে কথা বলার দরকার নেই। AI আমাদের হয়ে সেগুলো ব্যবহার করে।
সাধারণ জিজ্ঞাসা
Codex macOS-এ স্ক্রিন কীভাবে “দেখে”?
Codex এমন একটি হোস্ট অ্যাপ্লিকেশন ব্যবহার করে যা ডেস্কটপের হাই-ফ্রিকোয়েন্সি স্ক্রিনশট নেয়। এরপর একটি মাল্টিমোডাল ভিশন মডেল এই ফ্রেমগুলোতে সিমান্টিক সেগমেন্টেশন সম্পন্ন করে, অন্তর্নিহিত কোড বা অ্যাক্সেসিবিলিটি ট্যাগের পরিবর্তে ভিজ্যুয়াল চেহারার ভিত্তিতে বোতাম, মেনু ও টেক্সট ফিল্ডের মতো UI এলিমেন্ট চিহ্নিত করে।
ক্লিক এবং কীস্ট্রোক সিমুলেট করতে Codex কোন macOS ফ্রেমওয়ার্ক ব্যবহার করে?
Codex সম্ভবত Apple-এর Quartz Event Services এবং Accessibility API-এর সাথে ইন্টারফেস করে। এটি ভার্চুয়াল CGEvents (যেমন mouseDown ও mouseUp) সিনথেসাইজ করে এবং macOS সিস্টেম ইভেন্ট কিউতে ইনজেক্ট করে, যা এই ইনপুটগুলোকে শারীরিক হার্ডওয়্যার ইভেন্ট থেকে অবিচ্ছিন্ন করে তোলে।
কার্সার দখল না করে Codex কীভাবে ব্যাকগ্রাউন্ডে কাজ করতে পারে?
সিস্টেমটি সম্ভবত হয় টার্গেটেড উইন্ডো রাউটিং ব্যবহার করে — ইভেন্ট সরাসরি নির্দিষ্ট Process Identifiers (PIDs)-এ পাঠানো — অথবা ভার্চুয়াল ফ্রেমবাফার, যা একটি অদৃশ্য ডেস্কটপ ওয়ার্কস্পেস তৈরি করে যেখানে AI স্বাধীনভাবে কাজ করে এবং ব্যবহারকারীর শারীরিক কার্সার অপ্রভাবিত থাকে।
Large Action Model (LAM) কী এবং এটি LLM থেকে কীভাবে আলাদা?
Large Action Model একটি Large Language Model-এর ক্ষমতা টেক্সট জেনারেশন থেকে বাস্তব-বিশ্বের টাস্ক এক্সিকিউশন পর্যন্ত প্রসারিত করে। যেখানে একটি LLM রেসপন্স জেনারেট করে, সেখানে একটি LAM ভিশনের মাধ্যমে নিজের পরিবেশ পারসিভ করে, কোন অ্যাকশন নিতে হবে তা নিয়ে রিজনিং করে এবং সিস্টেম-স্তরের ইনপুট ইনজেকশনের মাধ্যমে সেই অ্যাকশনগুলো এক্সিকিউট করে। Codex LAM ধারণার একটি ব্যবহারিক বাস্তবায়ন উপস্থাপন করে।



