OpenAI, Codex’i (neredeyse) her şey için duyurduğunda teknoloji dünyası dikkatini verdi. Yapay zekâ yıllardır kod yazıyor ve e-posta taslakları hazırlıyor; ancak Codex’in artık macOS’u — “kendi imlecini kullanarak görerek, tıklayarak ve yazarak” — kullanabileceği iddiası, temelden farklı bir yeteneği temsil ediyor.
Bulut tabanlı bir dil modeli ile yerel bir işletim sistemi arasındaki boşluğu kapatmak son derece zordur. On yıllardır otomasyon, bir UI öğesi değiştiği an bozulan kırılgan Uygulama Programlama Arayüzlerine (API’ler) veya DOM kazıma betiklerine dayanıyordu.
Temel mühendislik içgörüsü şu: Codex, kod düzeyinde entegrasyonu bıraktı ve piksel düzeyinde yürütmeye yöneldi. Çok modlu görüyü düşük düzey çekirdek olay enjeksiyonuyla birleştirerek OpenAI, Grafiksel Kullanıcı Arayüzünü (GUI) evrensel bir API’ye dönüştürdü.
Bunu mümkün kılan teknik mimari aşağıdadır.
Mac’e Özgü Bir Ajanın Mimarisi
Bir yapay zekânın bir uygulamayı test edebilmesi veya insan müdahalesi olmadan bir ön yüz tasarımı üzerinde yineleme yapabilmesi için kesintisiz bir Algıla-Akıl Yürüt-Eyle döngüsüne ihtiyacı vardır. Codex’in bunu macOS üzerinde muhtemelen her aşamada şu şekilde uyguladığı görülüyor.
1\. Algılama: Anlamsal Görü ve Temellendirme Motoru
AppleScript gibi geleneksel otomasyon araçları, UI erişilebilirlik ağacını okur. Bu yaklaşım hızlıdır; ancak UI öğelerinin düzgün erişilebilirlik etiketlerinden yoksun olduğu özel Electron uygulamalarında, web tuvallerinde veya oyunlarda başarısız olur.
OpenAI, Codex’in uygulamaları “görerek” kullandığını belirtiyor; bu da Bilgisayarlı Görüye dayandığı anlamına gelirler. Mac üzerinde çalışan ana uygulama, masaüstünün yüksek frekanslı kare görüntülerini alır. Ardından çok modlu bir model, bu kareleri anlamsal bölütleme kullanarak ayrıştırır; HTML etiketleri aramaz, bunun yerine düğmeler, arama çubukları ve menüler gibi arayüz öğelerinin şeklini ve bağlamını görsel olarak tanır.

Buradaki temel mühendislik zorluğu Temellendirmedir. Yapay zekâ bir hedef belirlediğinde, anlamsal nesneyi ekrandaki kesin piksel koordinatlarına eşlemek için bir hesaplama yürütür. “Kapat düğmesine tıkla” ifadesini, belirli ekran çözünürlüğüne ve ölçeklendirme faktörüne göre ayarlayan kesin (x, y) konumlarına dönüştürür.
| Aşama | Ne Olduğu | Teknoloji |
|---|---|---|
| Kare Yakalama | Masaüstünün yüksek frekanslı ekran görüntüleri | Ana uygulama |
| Anlamsal Ayrıştırma | UI öğelerini koda değil görsel görünüme göre tanımlama | Çok modlu görü modeli |
| Temellendirme | Anlamsal hedefleri piksel koordinatlarına eşleme | Koordinat regresyon modeli |
| Eylem Dağıtımı | Sentezlenmiş giriş olaylarını işletim sistemine enjekte etme | Sistem çerçevesi kancaları |
2\. Eylem: İşletim Sistemi Düzeyinde Olay Enjeksiyonu
Nereye tıklanacağını bilmek, ancak yazılım bu eylemi fiilen tetikleyebildiğinde işe yarar. Codex, fiziksel donanımdan tamamen bağımsız hareket eder.
macOS ile yerel düzeyde etkileşim kurmak için Codex, neredeyse kesinlikle Apple’ın en derin sistem çerçevelerine — Quartz Event Services ve Erişilebilirlik API’sine — başvuruyor.
Codex tıklamaya karar verdiğinde, sanal bir CGEvent — bir mouseDown ve ardından bir mouseUp — sentezler ve bunu doğrudan macOS sistem olay kuyruğuna enjekte eder. İşletim sisteminin bakış açısından bu sentetik olay, fiziksel bir izleme dörtgeni dokunuşundan ayırt edilemez. Codex’in herhangi bir uygulamayı kullanabilmesinin nedeni budur: bir insan tıklayabiliyorsa, Codex de tıklayabilir.
3\. Yalıtım: “Hayalet İmleç” Mekaniği
Belki de teknik açıdan en iddialı iddia, Codex’in “bilgisayarınızı ele geçirmeden arka planda” çalışmasıdır. Bir makro kaydedici kullanmış herkes, geleneksel otomasyonun fare imlecini tamamen ele geçirdiğini bilir.
Eşzamanlı yürütmeyi başarmak için sistem, yapay zekânın girişlerini kullanıcının fiziksel girişlerinden yalıtmak zorundadır. Olası iki uygulama yaklaşımı vardır:
| Yaklaşım | Nasıl Çalıştığı | Ödünleşim |
|---|---|---|
| Hedeflenmiş Pencere Yönlendirme | macOS, olayları belirli Süreç Tanımlayıcılarına (PID’ler) göndermeye izin verir. Codex, sentezlenen tıklamaları doğrudan hedef uygulamanın olay döngüsüne yönlendirir ve genel donanım imlecini atlar. | Daha düşük ek yük; kesin pencere hedeflemesi gerektirir. |
| Sanal Kare Arabellekleri | Sistem başsız bir sanal masaüstü katmanı başlatır. Codex, bu görünmez çalışma alanını “görür” ve içinde çalışırken kullanıcı, birincil çalışma alanında aksamadan çalışmaya devam eder. | Daha yüksek bellek kullanımı; daha güçlü yalıtım garantileri. |
Sanal kare arabelleği yaklaşımı, Anthropic kendi Computer Use yeteneğini duyurduğunda gözlemlenen mekaniklerle örtüşüyor; bu da desenin masaüstü yapay zekâ ajanları için giderek endüstri standardı bir kalıb olarak ortaya çıktığını gösteriyor.
Görünüm: API Sonrası Bir Dünya
Aşağı doğru etkisi, teknik uygulamanın ötesine uzanıyor. Görü-den-eyleme ardışık düzenini işletim sistemi düzeyinde çözerek OpenAI, geleneksel API’leri isteğe bağlı hale getirdi. Büyük Eylem Modeli (LAM) çağına giriyoruz.
Pratik sonuçları göz önünde bulundurun:
- Eski Yazılım Entegrasyonu: API’si olmayan, 2008’den kalma kurumsal araçlar? Codex’in bir API’ye ihtiyacı yok. Uygulamayı açar, arayüzde gezinir, veriyi kopyalar ve modern bir panoya yapıştırır.
- Platform Kısıtlamaları: Geliştirici erişimini agresif API hız sınırlarıyla kısıtlayan platformlar? Codex web tarayıcısını açar ve bir insan kullanıcı gibi arayüzü doğrudan kullanır.
- Uygulamalar Arası İş Akışları: Önceden bağlantısız uygulamalar arasında özel ara yazılım gerektiren görevler artık tek bir doğal dil talimatı üzerinden orkestre edilebilir.
Yazılım endüstrisi, uygulamalar arasında köprüler kurmakla on yıllarını geçirdi. Codex macOS GUI’sinde ustalaştıkça, uygulamaların artık birbirleriyle konuşmasına gerek kalmadı. Yapay zekâ onları bizim adımıza kullanıyor.
SSS
Codex macOS’ta ekranı nasıl “görüyor”?
Codex, masaüstünün yüksek frekanslı ekran görüntülerini yakalayan bir ana uygulama kullanır. Ardından çok modlu bir görü modeli, bu karelerde anlamsal bölütleme yapar; düğmeler, menüler ve metin alanları gibi UI öğelerini altta yatan koda veya erişilebilirlik etiketlerine göre değil, görsel görünümlerine göre tanır.
Codex tıklama ve tuş vuruşlarını taklit etmek için hangi macOS çerçevelerini kullanıyor?
Codex muhtemelen Apple’ın Quartz Event Services ve Erişilebilirlik API’si ile arayüz oluşturuyor. Sanal CGEvent’ler (mouseDown ve mouseUp gibi) sentezler ve bunları macOS sistem olay kuyruğuna enjekte eder; bu girişleri fiziksel donanım olaylarından ayırtılamaz hale getirir.
Codex imleci ele geçirmeden arka planda nasıl çalışabiliyor?
Sistem muhtemelen ya hedeflenmiş pencere yönlendirmeyi — olayları doğrudan belirli Süreç Tanımlayıcılarına (PID’ler) göndermeyi — ya da kullanıcının fiziksel imlecinin etkilenmemesini sağlarken yapay zekânın bağımsız çalıştığı görünmez bir masaüstü çalışma alanı oluşturan sanal kare arabelleklerini kullanıyor.
Büyük Eylem Modeli (LAM) nedir ve bir LLM’den nasıl farklıdır?
Büyük Eylem Modeli, bir Büyük Dil Modelinin yeteneklerini metin üretiminden gerçek dünyada görev yürütmeye genişletir. Bir LLM yanıtlar üretirken; LAM, ortamını görü yoluyla algılar, hangi eylemleri alacağı konusunda akıl yürütür ve bu eylemleri sistem düzeyinde giriş enjeksiyonu yoluyla yürütür. Codex, LAM kavramının pratik bir uygulamasını temsil eder.
Bir yanıt yazın