VLA・模仿學習開發寫不出來的動作,就從人的示範中學。
對象物的形狀或位置每次都變的作業,很難把動作寫成程式。我們致力於從人的示範學習動作的模仿學習,以及將視覺・語言理解接到動作生成的VLA實作。
諮詢VLA・模仿學習有些作業寫不成程式
若是在固定位置抓取固定物體,直接寫出動作更可靠也更快。搬出學習的意義,只在於寫不出來的作業。
對象物形狀因個體而異、擺放方式每次不同、像袋子或布一樣會變形。這類作業無法把條件分支寫盡,透過展示人的示範來獲得動作的方法才現實。
另一方面,學習並非萬能。所需資料量隨作業難度與要求的成功率而變,有些部分不真正採集就看不清。我們先做試驗性採集,判斷清楚後再進入正式採集。
可承接的範圍
對象作業的切分
我們區分應由學習解決的部分與直接寫出來更快的部分。並非全部都需要學習。
示範資料的採集設計
記錄什麼、從哪個視角、記錄多少。我們設計對象作業、機體與品質基準。
透過遠端操作的實演
將操作者的身體動作轉寫至機器人,在實機作業的同時採集資料。營運與採集可並行推進。
模仿學習的實作
用採集到的資料訓練動作,並評估成功率。以ROS 2 / LeRobot為基礎實作。
VLA的實作
將視覺與語言的理解接到動作生成。該構成依據語言指令與眼前狀況決定下一個動作。
實機評估
我們不在基準測試上,而是在對象現場測量成功率與節拍。透過改變條件確定成立範圍。
資料是一切的地基
學習的成敗,在模型之前先由資料決定。視角不足、沒有失敗案例、作業條件搖擺不定——用這樣的資料訓練,在現場是動不了的。
我們在設計對象作業・機體・採集量・品質基準之後,從實機取得資料。也備有在遠端操作讓機體實際作業的同時,同步記錄視覺・行動・對話・非語言的構成。
也可以只承接資料採集,或僅就採集環境的搭建提供諮詢。
常見問題
我需要多少訓練資料?
隨作業難度、環境變動幅度與要求的成功率而變。我們先做試驗性採集,判斷所需數量與品質基準後再進入正式採集,不會一開始就承諾總量。
我們沒有資料,也能開始嗎?
可以。我們也負責採集設計。採用遠端操作讓實機作業的同時進行記錄的構成,營運與資料採集可並行推進。
可以在哪些機器人上實作?
只要是可透過ROS 2或機體SDK控制的機型都可以商談。支援二次開發的型號更易處理。請告知對象機型。
VLA與模仿學習有什麼區別?
模仿學習是從人的示範中獲得動作的方法的統稱。VLA指的是將視覺與語言理解接到動作生成的模型構成,不同之處在於能處理語言指令。我們依對象作業分別採用。
關於VLA・模仿學習的諮詢
請告知對象作業、機體,以及目前持有資料的狀況。我們會從「哪些該用學習解決」的切分開始與您同行。
諮詢VLA・模仿學習