Aktif olarak kullandığımız büyük dil modellerine ne yapmasını istediğimizi metin olarak veriyor ve karşılığında bir çıktı alıyoruz. Oysa burada çok daha ilginç bir durum var. Malum, artık gündemimiz robotların günlük hayatımıza daha fazla katılması ve yapay zekanın gerçek hayattaki sorunların üstesinden nasıl geleceği.

Burada tabii ki model eğitimi çok kıymetli ve bu konuda hala yoğun çalışmalar devam ediyor. Buna çok basit bir örnek olarak Tesla araçları verebiliriz. Her gün yollarda dolaşan bu araçlar, yapay zeka ile fiziksel koşulları bir araya getiriyor. Ancak araçların hareketi belirli eksenlerle sınırlı olduğu için başarı oranı daha yüksek olabiliyor. Normal hayatta ise x, y ve z eksenlerinin yanı sıra itme, çekme, kavrama, kaldırma ve döndürme gibi kuvvetleri de hesaba kattığınızda işler çok daha karmaşık hale geliyor.

Peki paylaştığım videoda ne görüyoruz? Geleneksel eğitim yöntemleri yerine robota birkaç saniyelik bir örnek gösteriliyor ve robotun aynı işi yapması sağlanıyor. Model, bu kısa gösterimi 30 saniyelik bağlam penceresi içerisinde değerlendirerek herhangi bir ek eğitim sürecine ihtiyaç duymadan görevi yerine getirmeye çalışıyor.

Bu, yapay zekanın bilgisayarımızda ne yaptığımızı izleyerek aynı işlemleri tekrarlamasının çok ötesinde bir şey. Çünkü bilgisayarda yaptığımız her fare hareketinin hangi koordinata karşılık geldiği, nereye tıkladığımız ve bir tuşa ne kadar süre bastığımız net olarak ölçülebiliyor. Burada ise fiziksel dünyanın değişkenleri devreye giriyor. Nesnenin konumu, ağırlığı, yüzeyi, uygulanması gereken kuvvet ve robotun hareket sırasında karşılaşabileceği beklenmeyen durumlar işi çok daha zor hale getiriyor.

Özetle gerçekten harika bir iş çıkarmışlar. Tabii ki bu teknolojiler henüz emekleme aşamasında ve yüzde 100 başarıdan söz edemiyoruz. Ancak açıklanan başarı oranları ve özellikle robotun yalnızca kısa bir gösterim üzerinden yeni bir görevi öğrenebilmesi, gelecekte bizi nelerin beklediğini göstermesi açısından oldukça etkileyici.

Robotik yapay zeka alanında son derece dikkat çekici bir gelişme yaşandı. Generalist, fiziksel dünyadaki yeni görevleri yalnızca tek bir gösterim üzerinden öğrenebilen GEN-1.5 isimli yeni modelini duyurdu.

Açıkçası yayınlanan videoları izlediğinizde etkilenmemek çok zor. Robota yapılması istenen görev birkaç saniye boyunca gösteriliyor ve robot herhangi bir ek eğitim sürecine ihtiyaç duymadan aynı görevi yerine getirmeye başlıyor. Üstelik GEN-1.5 yalnızca gördüğü hareketleri tekrar etmiyor; nesnelerin konumu veya kullanılan araç değiştiğinde davranışını yeni duruma göre uyarlayabiliyor.

Generalist bu yöntemi “physical prompting”, yani fiziksel yönlendirme olarak tanımlıyor. Büyük dil modellerine ne yapmasını istediğimizi bir metin ile anlatırken GEN-1.5’e görev, sensör ve hareket verilerinden oluşan kısa bir fiziksel gösterim ile aktarılıyor. Model, 30 saniyelik bağlam penceresine eklenen 3 ila 12 saniyelik tek bir gösterimi kullanarak görevi gerçekleştirebiliyor. Bunun için model üzerinde yeniden eğitim veya parametre güncellemesi yapılması gerekmiyor.

Şirket tarafından gerçekleştirilen 10 farklı görevden oluşan testlerde, tek gösterim ile öğrenme yönteminin ortalama başarı oranı yüzde 59 olarak ölçülmüş. Modele yaklaşık beş dakikalık veri sağlandığında ve 10 eğitim adımı uygulandığında ise başarı oranı yüzde 83 seviyesine yükseliyor.

Bu oranlar henüz kusursuz çalışan genel amaçlı robotlardan söz edemeyeceğimizi gösteriyor. Test edilen görevlerin de ağırlıklı olarak kısa süreli ve nispeten basit nesne manipülasyonlarından oluştuğunu unutmamak gerekiyor. Ancak robotların yeni bir görev için saatlerce veya günlerce yeniden eğitilmesi gerektiği düşünüldüğünde, birkaç saniyelik gösterim ile bu seviyeye ulaşılması oldukça önemli bir gelişme.

GEN-1.5’in dikkat çeken bir başka özelliği de daha önce doğrudan gösterilmeyen yöntemleri kullanabilmesi. Örneğin model, bir küpü fırça ile kabın içerisine itme görevini öğrendikten sonra aynı işlem için muz veya faraş gibi farklı nesneleri kullanabiliyor. Engel ile karşılaştığında engeli kaldırması, yaptığı hatayı düzeltebilmesi ve aynı görevi farklı elleriyle gerçekleştirebilmesi de modelin yalnızca hareketleri ezberlemediğini gösteriyor.

Model, simülasyon ortamında gerçekleştirilen bir gösterimi gerçek dünyadaki robota aktarabiliyor. Daha da ilginç olanı, bazı görevlerde bir insanın kendi elleriyle yaptığı hareketi robot kameralarından izleyerek aynı görevi robot kollarıyla tekrar edebilmesi.

Tüm bu yeteneklerin, fiziksel etkileşim verileri üzerinde gerçekleştirilen büyük ölçekli ön eğitim sırasında kendiliğinden ortaya çıktığı belirtiliyor. Generalist ekibi, modeli özellikle tek gösterimden öğrenmesi için tasarlamadıklarını ve bu davranışın herhangi bir özel meta öğrenme yöntemi kullanılmadan geliştiğini ifade ediyor.

Peki Generalist ekibi fiziksel dünyanın AGI karşılığını, başka bir ifadeyle Physical General Intelligence seviyesini çözmüş olabilir mi? Bugün için bunu söylemek oldukça iddialı olur. Başarı oranları, görevlerin kapsamı ve gerçek dünya koşullarındaki sınırlamalar önümüzde hâlâ uzun bir yol olduğunu gösteriyor. Buna karşılık GEN-1.5’in ortaya koyduğu yaklaşım, genel amaçlı robotlara giden yolda şimdiye kadar gördüğümüz en etkileyici adımlardan biri olabilir.

Bugüne kadar robotlara yeni görevler öğretmek ciddi miktarda veri, zaman ve mühendislik çalışması gerektiriyordu. Eğer robotlar gelecekte insanları birkaç saniye izleyerek yeni beceriler kazanabilecek hale gelirse üretimden lojistiğe, sağlıktan ev içi kullanıma kadar robotik sistemlerin kullanım biçimi tamamen değişebilir.

Generalist ekibini bu önemli çalışmadan dolayı tebrik etmek gerekiyor. Yayınlanan görüntüler gerçekten etkileyici; ancak asıl heyecan verici olan, bu yöntemin daha büyük modeller ve daha fazla fiziksel dünya verisiyle nereye ulaşabileceği.

Teknik ayrıntılar ve deney sonuçları Generalist ekibinin GEN-1.5 duyurusunda yer alıyor.

Published On: 20 Ağustos 2026 / Categories: Yapay Zeka / 5,5 min read /

Bilgiyi Paylaşın!