deney · olgun
Robotta ilk deneme
Üç deneme: ekran açısı, yaklaş–çekil döngüsü, operatör kadrajda. Replay testi düzenin kaydığını gösterdi.
Bu LeRobot sürümünde lerobot-record politika almıyor; robotta çalıştırma
lerobot-rollout ile. Üç deneme, üç farklı sonuç, hepsi aynı hikâyeyi
anlatıyor.
Deneme 1. Rerun'daki aksiyon grafiği periyodikti: her 100 karede, yani her ACT chunk'ında, bilek biraz kalkıyor, chunk sınırında geri iniyor. Politika "dinlenme pozunda kal" diyordu. Eğitim karelerine bakınca fark ortaya çıktı: kayıt gecesi laptop ekranı daha öne eğikti, ızgara ortada, alt şeritte laptop gövdesi; denemede ekran daha dikti, arka duvar ve lamba görünüyordu.
Deneme 2. Ekran eğitimdeki açıya getirildi. Kol dinlenmeden çıktı, yüzüğün
üstüne uzandı, sonra asılı kaldı: yaklaştı, geri çekildi, yine yaklaştı.
Gripper hiç açılmadı; eğitim verisinde gripper kol yüzüğe vardıktan sonra
açılıyor, kol oraya hiç varmadı. Temporal ensembling
(--policy.temporal_ensemble_coeff=0.01 --policy.n_action_steps=1)
checkpoint üstüne yüklenebiliyor, M5'te adım başına 40 ms; denendi, davranış
değişmedi.
Deneme 3. Kayıt sırasında ön kameranın sol yüzde kırkında kolum ve gövdem vardı. Kol yine dinlenme pozuna yapıştı.
Replay testi: pipeline mi, düzen mi?
lerobot-replay ile bölüm 0'ın kayıtlı aksiyonları follower'a birebir
oynatıldı, 34 saniye, bölüm süresiyle aynı. Kol doğru hareketi yaptı ama
yüzüğü birkaç santim ıskaladı. Yani robot, kalibrasyon (dosya 13 Eylül,
kayıttan önce, değişmemiş), veri ve politika doğru; kayıttan bu yana yüzük ya
da kol tabanı birkaç santim kaymış ve 10 bölümle eğitilmiş politika bunu
tolere edemiyor.
Üç denemenin ortak paydası: politika eğitimde görmediği bir görüntüye düşünce en güvenli şeye, başlangıç pozuna yapışıyor. Kamera açısı, kadrajdaki insan, kaymış yüzük: hepsi aynı hata sınıfı.