动察 Beating AI hızlı haber: UCSD yardımcı doçenti Huang Biwei tarafından kurulan nedensel dünya modeli şirketi Aether AI, RSIAgent'i açık kaynak olarak yayınladı.
Bu, model eğitmeyen özyinelemeli bir kendini geliştirme çerçevesidir. Alt katman model parametreleri baştan sona sabit kalır; Agent kendisi pratik yapmaya değer görevleri bulur, gerçekten uygular, sonuçları kontrol eder ve başarılı yöntemlerle başarısızlık derslerini uzun vadeli Memory'ye yazar. Bir sonraki turda bu deneyimlerden yararlanmaya devam ederek yetenek eksikliklerini kademeli olarak kapatır.
Sistem üç Agent'ın işbirliğinden oluşur. Curriculum Agent sırada neyin çalışılacağına karar verir, Actor Agent yazılımı gerçekten kullanır, Verifier Agent sonuçları bağımsız olarak kontrol eder. Keşif iki adıma ayrılır: önce farklı görevler geniş çapta denenir, ardından başarısızlıklar, gizli kısıtlamalar ve sınır durumları üzerinde derinlemesine çalışılır. Son olarak Memory dondurulur ve doğrudan resmi görevleri yürütmek için kullanılır.
OSWorld 2.0'da bu RSI eklendikten sonra ortalama kısmi puan %71,97'den %78,98'e yükseldi; Agents' Last Exam %83,75'ten %84,82'ye çıktı. Ancak bu, tüm test setinin katı bir A/B karşılaştırması değildir. OSWorld'de görevlerin yalnızca yarısı RSI sonrası yeni sonuçları kullandı, geri kalan görevler önceki puanları kullanmaya devam etti.
Prime Agent gibi Harness kendini geliştirme yaklaşımlarıyla aynı büyük yöne aittir: model ağırlıkları değişmez, modelin dışındaki şeyler sürekli güncellenir. RSIAgent'in özelliği, iyileştirme odağını Memory'ye koyması ve otonom soru üretme ile bağımsız doğrulama yoluyla bu harici deneyim kütüphanesinin sürekli birikmesini sağlamasıdır.
