Echoverse: Derin, evrilen ortamlar bilgisayar kullanan ajanlar için

Echoverse: Derin, evrilen ortamlar bilgisayar kullanan ajanlar için
Bilgisayar kullanan yapay zeka ajanları, e-posta ve müşteri desteği gibi çok adımlı iş akışlarında zorluk yaşıyor. Echoverse, ajanları yalnızca daha fazla eğitim görevi sunmak yerine gerçekçi ortamlarda eğiterek, görevler, testler ve ortamlar geliştikçe onların gelişmesine yardımcı oluyor. "Echoverse: Bilgisayar kullanan ajanlar için derin, evrilen ortamlar" başlıklı yazı ilk olarak Microsoft Research'te yayınlandı.

Saflık sayısı yerine sadakat ölçeği, ajanların gerçekten eksik olduğu yeteneklere odaklanmak ve eğittikleri modellerle evrimleşmek.

Bir modelin bir dünya ürettiği, dünyanın bir derecelendirilmiş çalıştırma ürettiği ve geri bildirimin hem dünyayı hem de modeli güncellediği yinelemeli bir eğitim döngüsünün diyagramı.

Bir bakışta

Bilgisayar kullanım ajanları için on iki eğitim dünyası oluşturduk: on derin alan dünyası ve iki yetenek dünyası, her biri birçok biçimde sunulan tek bir kontrolü işleyerek (tarih seçiciler ve iç içe filtreler). Derinlik, bunların üzerinde eğitim yapmayı değerli kılan şeydir: bu dünyalar bir uygulamanın gerçek davranışını yeniden üretir, gerçekçi verilerle tohumlanır ve ekranlar ve kullanıcılar arasında durumu tutarlı tutar. On iki dünyada eğitim alan 9B modeli, temel puanını neredeyse iki katına çıkarır (36.5%’ten 67.1%’e), GPT-5.4’e on dört puan yaklaşır. Deney bize birkaç ders öğretti:

  • Yüksek simülasyon sadakati bir zorunluluktur; yüzeysel dünyalar ajana zarar verir. Aynı sitelerin yüzeysel ve derin yapıları üzerinde eğitim alan model, yüzeysel olanlarda geriledi ancak derin olanlarda gelişti.
  • Ajanlar genellikle tarih seçiciler ve iç içe filtreler gibi zorlu UI öğeleriyle mücadele eder. Bu kontrolleri çeşitli biçimlerde işlemek, modele eğitimde hiç görmediği alanlarda bunları kullanmayı öğretti.
  • Modeli, dünyayı ve doğrulayıcıyı birlikte evrimleştirmek hepsini geliştirir. Dünya daha doğru hale geldikçe ve görevleri daha zorlaştıkça, model de onunla birlikte yükselir.
  • Dünyalara karşı pekiştirme öğrenimi ajanın taklitten öteye geçmesini sağlar. Temellendirilmiş doğrulayıcıyı ödül olarak kullanarak, RL, tutulan performansı artırır ve ajanın hedefe daha az adımda ulaşmayı öğrenmesini sağlar.
  • Dört dünyayı kodları, verileri ve temellendirilmiş derecelendiricileri ile birlikte yayınlıyoruz, yüksek sadakatli bilgisayar kullanım dünyaları üzerine araştırmaları desteklemek için.
    Github: microsoft/Echoverse: Derin, Evrimsel Ortamlar Bilgisayar Kullanım Ajanları için (yeni sekmede açılır)
    Hugging Face: