resource · evergreen
SmolVLA mı, ACT mi; kaç bölüm?
SmolVLA daha az veri istemez: taban 50 bölüm, 25 yetmedi, 30 başarısız. Kazandırdığı şey başarı ve dil.
Soru: SmolVLA ile eğitirsek daha az veriyle olur mu? Kaynaklı cevap: hayır. SmolVLA'nın kazandırdığı şey az veri değil; aynı veriyle daha yüksek başarı, ışığa ve arka plana dayanıklılık ve dil komutu.
| Kaynak | Bulgu |
|---|---|
| LeRobot SmolVLA dokümanı | ~50 bölüm, 5 konum × 10; 25 bölüm "yetmedi" |
| lerobot issue #1239 | 30 bölümle SmolVLA başarısız, aynı veriyle ACT çalıştı |
| ggando.com, 2026-03 | 50 bölüm / 30 cm alan başarısız; 75 bölüm / 10 cm başarılı; SmolVLA %60–80, ACT %80 |
| SmolVLA makalesi, SO-101 | SmolVLA %90 eğitim konumlarında, %50 yeni konumda; ACT %70 / %40 |
| SO-101 VLA benchmark, 2026-06, 100 gösterim | π0.5 %56, ACT %34, SmolVLA %32,5 |
| SEVO, 2026-05 | ışık, arka plan ve dikkat dağıtıcıyı kayıtta çeşitlendirmek genellemenin en önemli faktörü |
bizim ring-center-v210 bölüm
LeRobot docs tabanı50 bölüm
ggando, başarılı koşu75 bölüm
Konum çeşitliliği pahalı: konum başına 10 gösterim, alan büyüdükçe daha fazla. Küçük alan + çok tekrar, büyük alan + az tekrardan iyi.
Kararımız: SmolVLA, ama 50 bölüm tabanıyla. Sebep az veri değil; XOX'un 18 görevini tek politikada cümleyle ayırt etmesi ve Hashtag reçetesinin bu olması.
Kaynaklar: LeRobot SmolVLA · issue #1239 · ggando · SmolVLA makalesi · benchmark