伴隨著全球人工智能技術飛速進步,具身智能產業迅猛發展,賦予機器人類人化的泛化能力是具身智能機器人技術的核心目標之一,實現這一目標的關鍵在于如何使各類機器人本體在面對多樣化的環境和任務時,能夠展現出卓越的性能。
正如ChatGPT需要海量文本數據來訓練一樣,想要培養出一個能力全面的機器人,也需要大量優質的訓練數據,數據集是具身智能技術發展的重要基石。與視覺或語言數據的獲取相比,收集機器人訓練數據遠比收集文本或圖像數據困難得多,需要在專門的環境中記錄機器人的每個關節動作和末端執行器的信息,這個過程不僅需要昂貴的硬件設備,還需投入大量人力來確保數據質量,因而業內目前最具通用性的機器人操作策略主要依賴于在有限多樣性條件下收集的數據,大規模多構型具身智能數據集和Benchmark是極為稀缺的資源。

一、RoboMIND數據集特征分析:
1)多樣化構型:RoboMIND的數據來源包括31,005條Franka Emika Panda單臂機器人軌跡、9,686條“天工”AC米蘭機器人軌跡、8,030條AgileX Cobot Magic V2.0雙臂機器人軌跡以及6,911條UR-5e單臂機器人軌跡。研究團隊使用自研的“天工”AC米蘭機器人,收集了17.4%的數據,其中包含了大量的雙臂操作任務,需要較高的雙臂協調能力。
2)多樣化軌跡長度:研究團隊計算了每種機器人模型在任務執行過程中的平均任務時長(即每條軌跡中的時間步數)。如圖所示,Franka和UR的任務通常具有較短的軌跡(少于200個時間步),適合用于訓練基礎技能。相比之下,“天工”和AgileX的任務軌跡較長(超過500個時間步),更適合用于長時間跨度的任務訓練以及技能組合。
下圖展示了四種機器人平臺在任務中所涉及的技能數量分布的直方圖。從圖中可以看出,AgileX的任務通常涉及兩到三種組合技能,這使得任務的時長較長。而“天工”的任務則長度不一,其中一些任務涉及多達五種技能。為了進一步說明這一點,研究團隊選取了一項包含三種技能的AgileX任務,并在圖中展示了其雙臂操作的軌跡:首先,兩只手臂依次執行抓取技能,隨后左臂將胡蘿卜放置,右臂將其移交給黑色盤子,整個過程需要高水平的協調操作能力。
3)任務多樣性強:研究團隊根據自然語言描述,根據物品大小、使用場景、操作技能等因素,將整個數據集中的任務分為了五大類,分別是:基礎技能、精準操作、場景理解、柜體操作、協作任務。任務的具體分布如下所示:
可以看出,除了基礎的操作任務,RoboMIND數據集還包含了大量的復雜任務,為通用機器人策略的訓練提供了豐富的數據保障。
4)物品類別豐富:RoboMIND數據集包含了61種不同的物品類別,具體如下所示。可以看出,在廚房場景中,數據集不僅包含了常見的食物,如草莓、雞蛋、香蕉和梨子等,也包括了復雜的可調節物體,如烤箱和面包機。在家庭場景中,數據集既包括了剛性物體,如網球,也包括了可變形物體,如玩具。辦公和工業場景則包含了需要精確控制的小物體,如電池和齒輪。多樣化的物體種類不僅增加了數據集的復雜性,也有助于訓練能夠在各種環境下執行操作的通用操控策略。
5)語言描述精確:以AI(Gemini)和人工審核相結合的方式,研究團隊為10000條成功軌跡提供詳細的語言注釋,包括關鍵物體、重要操作和操作細節等。
二、RoboMIND數據收集策略:
1)遙操作真機數據采集
與通常通過腳本化收集、或者依靠VR設備的機械運動數據不同,RoboMIND的數據通過自研的遙操作系統進行收集,更自然、連貫和平滑,能夠更好地模擬人類的行為和認知過程。對于Franka、UR-5e機器人和模擬機器人,研究團隊按照Gello方法的設置,創建了相應的同類遙操作設備和控制系統。對于AgileX機器人,研究團隊采用了內建的雙臂遙操作系統。而對于AC米蘭機器人“天工”,研究團隊結合使用了Xsens動作捕捉服和Gello風格的遙操作設備。所有數據收集工作都在指定的內部區域進行,且操作人員的輪換最小化,保持統一的收集節奏,遵循內部標準,從而提高數據集的質量。
2)智能數據平臺管理
隨著收集數據量的增長,數據的高效記錄、傳輸、管理和分析成為了一個重大挑戰。為了支持具身智能系統的設計和開發,研究團隊開發了一個智能數據平臺,該平臺采用云原生架構和分布式計算,可進行大規模數據處理,提供以下四大功能模塊:
3)數據質檢
由于所有數據都來源于操作員實時控制系統,可能會因為操作員的身體限制(如疲勞、習慣、注意力分散或外部干擾)而導致錯誤。為了減輕這些問題,研究團隊通過輪換系統和提供舒適環境的方式,幫助操作員保持專注。此外,研究團隊還對收集到的所有數據進行質量檢查,以確保其可靠性。研究團隊還定義了質量保證標準,避免不必要的接觸和重復抓取等問題。質量保證過程分為以下三個步驟:
這一系列嚴格的數據收集和質量管理流程,確保了數據的高質量和可靠性,有助于為訓練更加精準和可靠的機器人模型奠定堅實的基礎。
三、RoboMIND數據集實驗驗證:
研究團隊使用RoboMIND數據集,測試了4種目前主流的機器人學習模型,分別為ACT、BAKU、RDT-1B和OpenVLA。以下是RoboMIND數據集包含的部分任務樣例:
在單任務實驗中,研究團隊根據任務類型、物品類型等,均勻選取了45個代表性任務進行訓練和測試,實驗結果如下:
如上圖所示,研究團隊發現ACT算法在AgileX機器人上對15個任務的平均成功率為55.3%,其他構型上Franka(30.7%)、UR-5e(38.0%)和“天工”(34.0%)。實驗結果表明,ACT算法在大多數任務中至少能夠完成一次成功的任務,這不僅證明了該方法的有效性,還驗證了RoboMIND提供的視覺感知和機器人關節信息的準確性。
此外,ACT算法在一些更為復雜的“天工”任務上也取得了不錯的結果,例如在TK-CloseDrawerLowerCabinet任務上取得了60%的成功率。這些結果表明ACT在復雜的靈巧手操作任務中表現穩健,突顯了RoboMIND數據的高質量。因此,研究團隊認為,RoboMIND中包含的單臂、雙臂和靈巧手的數據集,能夠作為高質量的訓練集,提升單任務模仿學習的表現,從而推動整個視覺-語言-動作(VLA)模仿學習領域的發展。
在多任務實驗中,研究團隊使用多類不同任務和技能組合成的多任務數據集,分別測試了RDT-1B和OpenVLA的效果,結果如下:
•RDT-1B模型:
在多項任務中表現優異,例如在將蘋果放入藍色盤子中高達80%成功率。

可以看出,RDT-1B和OpenVLA均展現出了一定的多任務操作能力,經過在多種模仿學習模型上的測試驗證,通過RoboMIND數據集進行模型訓練,可有效改進機器人的操作策略,實現更高的操作成功率,且展現出強大的泛化能力。
結語:
RoboMIND為機器人操作模型的訓練提供了一個高質量、廣泛多樣的數據基礎,旨在提升機器人在復雜環境中的操作能力和適應性。通過大規模、多樣化的數據集,機器人模型能夠更好地適應各種任務和環境變化,從而推動通用機器人技術的發展。
京公網安備11011202100775號