在全球人工智能高速邁進的浪潮下,具身智能技術和產業迅猛發展,但在數據與模型、感知與認知能力、交互與適應性等諸多關鍵領域仍存在諸多亟待突破的難題。作為國家級創新平臺,國家地方共建具身智能機器人創新中心始終聚焦底層前沿技術突破,致力于拓展具身智能技術邊界。2025年開年,國創中心在國際機器人與自動化頂會(ICRA)與多智能體系統頂會(AAMAS)等全球頂會上連續發布五篇重磅論文,為具身智能技術的多重要分支領域帶來了新的方法論與技術范式。
國際機器人與自動化會議(ICRA)是機器人與自動化領域的權威盛會,由IEEE主辦,匯聚全球頂尖學者,涵蓋前沿技術與創新應用,國創中心在多任務操作、模型擴展、數據利用、多層零樣本導航等領域的研究成果獲ICRA收錄;多智能體系統國際會議(AAMAS)聚焦多智能體的基礎理論與應用實踐,國創中心本次在視覺運動領域的研究成果獲AAMAS收錄。這些研究成果不僅攻克了相應領域的關鍵難題,還為機器人技術在復雜場景中的實際應用提供了全新的思路和方法。
離散策略:解耦動作空間,提升機器人多任務操作能力
論文標題:Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
arXiv地址:https://arxiv.org/abs/2409.18707
在具身智能機器人的多任務操作中,動作模式的多樣化是一個長期存在的挑戰。單一任務可能對應多種操作方式,導致動作分布復雜且存在多種模式,而多任務設置進一步加劇了這一問題。傳統方法難以區分不同任務的動作模式,導致在多任務場景下性能下降。例如,在桌面操作任務中,機器人需要掌握抓、放、推、拉、旋轉等多種動作技能,現有技術難以準確區分和適應不同任務,導致操作失敗率較高。
為了解決這一問題,國創中心技術團隊提出了一種名為Discrete Policy的創新方法,通過向量量化變分自編碼器(VQ-VAE)將動作序列映射到離散的隱動作空間,并利用條件擴散模型生成任務特定的隱動作模式嵌入向量,從而解耦多任務動作空間。該方法通過離散化隱動作空間,有效區分不同任務的動作模式。具體來說,VQ-VAE將連續的動作空間離散化為有限的隱動作空間,使得每個任務的動作模式可以被清晰地分離和識別。條件擴散模型則進一步生成任務特定的隱動作模式嵌入向量,確保機器人在執行不同任務時能夠選擇最合適的動作模式。

Discrete Policy顯著提升了多任務操作的準確性和適應性。在實驗中,Discrete Policy在12個任務中的平均成功率比Diffusion Policy高出32.5%,在5個任務測試中的平均成功率達到84%,比OpenVLA高出15%。此外,在6個雙機械臂操作任務中,其成功率也達到65.8%,顯著優于其他方法。
在應用方面,Discrete Policy不僅適用于桌面操作,還可廣泛應用于工業、家居等多種場景。例如在工業裝配線上,機器人需要執行多種復雜的操作任務,Discrete Policy可以有效提升其操作精度和效率。
未來,國創中心計劃進一步優化該方法,提升其在動態環境中的適應能力,并探索其在更復雜場景下的應用。通過不斷改進和擴展Discrete Policy,國創中心旨在為多任務機器人操作提供更加高效和可靠的技術支持,推動具身智能技術的進一步發展。
自我監督學習:從失敗數據中提取價值提升操作成功率
論文標題:Learning from Imperfect Demonstrations with Self-Supervision for Robotic Manipulation
arXiv地址:https://arxiv.org/abs/2401.08957
在機器人操作任務中,數據收集成本高、時間長且昂貴,現有模仿學習方法通常只使用成功數據,丟棄失敗數據,導致數據利用率低下,然而失敗數據中往往包含有價值的信息,可以幫助機器人更好地理解任務和環境,從而提高操作成功率。如何從這些失敗數據中提取有效信息,并將其轉化為可用的訓練數據,一直是模仿學習領域的一大難題。
為了更好地從失敗數據中提取有價值的信息,國創中心技術團隊提出了一種自監督數據過濾框架(SSDF)。該框架通過結合專家數據和失敗數據來計算失敗軌跡段的質量分數,并篩選出高質量的失敗數據片段用于訓練。具體來說,SSDF通過三種自監督任務(掩碼狀態轉換預測、狀態轉換重構和動作自回歸)提取代表性特征,并根據這些特征計算失敗數據與專家數據之間的相似度,最終篩選出高質量的失敗數據片段用于行為克隆。掩碼狀態轉換預測任務通過預測被掩碼的狀態轉換來學習狀態之間的依賴關系;狀態轉換重構任務通過重構狀態轉換來提取狀態變化的特征;動作自回歸任務則通過預測未來動作來學習動作序列的模式。這些任務共同作用,使得SSDF能夠從失敗數據中提取出與專家數據相似的高質量片段。

經ManiSkill2基準測評和真實機器人操作任務測試,SSDF顯著提升了任務成功率。例如,在懸掛繩子這一任務中,經SSDF框架過濾,機器人執行任務的成功率從14.4%提高到了28.4%。這一技術不僅提高了失敗數據的利用效率,還降低了對高質量專家數據的依賴,節省了數據收集和標注成本。
在應用方面,通過更加有效的數據過濾和利用,SSDF框架可以大幅提高各種機器人系統在高不確定性環境中的表現。例如在工業自動化中,機器人需要執行多種復雜的裝配任務,SSDF可以幫助機器人從失敗的操作中學習,提高裝配精度。SSDF框架的應用可以有效增強工業自動化、服務機器人以及人工智能系統實際部署效率,節約經濟成本和時間。
后續,國創中心技術團隊計劃進一步提升自監督數據過濾框架(SSDF)的能力,特別是在不同任務場景以及不同機械臂之間的設置。此外,團隊還希望改進特征提取和相似度計算方法,提升處理高維數據的穩定性和準確性。通過不斷優化和擴展SSDF框架,國創中心致力于為機器人操作任務提供更加高效和可靠的學習方法,推動具身智能技術的進一步發展。
除了離散策略和自我監督學習,國創中心技術團隊在擴散策略擴展、控制感知增強和多層零樣本導航策略等領域也同步創造了高價值成果,這些成果不僅在技術上實現了突破,更為具身智能技術的多場景實地應用提供了強大助力。
論文標題:Scaling Diffusion Policy in Transformer to 1 Billion Parameters for Robotic Manipulation
arXiv地址:https://arxiv.org/abs/2409.14411
為了解決增加擴散模型層數或參數量導致訓練梯度不穩定的問題,國創中心技術團隊提出了ScaleDP方法,首次驗證了基于擴散的模仿學習的模型擴展能力,成功解決了擴散策略在Transformer架構下的擴展難題。ScaleDP有效解決了擴散策略在Transformer架構中的梯度問題,使模型能夠擴展到10億參數,顯著提升了訓練穩定性和性能。
ScaleDP不僅驗證了模型擴展帶來的性能提升,還為具身智能的實際應用提供了更強的模型支持。同時,國創中心還計劃進一步探索ScaleDP在多機器人協作和動態環境實時操作等復雜任務中的應用。
論文標題:Efficient Training of Generalizable Visuomotor Policies via Control-Aware Augmentation
針對現有端到端視覺模型只能在有限環境中訓練且視覺泛化能力較差這一問題,國創中心技術團隊提出了EAGLE框架,通過自監督學習感知掩碼,精準定位操作中的關鍵區域(如機械爪接觸面),并利用大規模互聯網數據僅對非關鍵區域進行數據增強,同時通過非對稱知識蒸餾方法,讓視覺策略可從基于底層環境狀態的專家策略中學習,實現面向新場景的零樣本視覺策略遷移。
EAGLE框架有效避免了傳統數據增強技術對關鍵信息的破壞,并大幅降低了數據采集和標注的成本。未來,國創中心技術團隊計劃將此技術應用于大規模預訓練算法中,提升預訓練模型在不同背景和干擾物下的泛化能力。同時,國創中心正在與家用機器人廠商合作,開發零樣本自適應操作系統,使機械臂在新場景中無需大量數據采集即可高效部署。這一技術的廣泛應用將顯著降低機器人部署成本,推動家庭服務機器人的普及化發展。
論文標題:Multi-Floor Zero-Shot Object Navigation Policy
arXiv地址:https://arxiv.org/abs/2409.10906
為了應對多樓層環境中的智能體導航難題,國創中心技術團隊提出了多層導航策略(MFNP),通過構建語義地圖,融合RGB-D圖像和位姿數據,為導航提供基礎信息,結合大語言模型(LLM)、視覺語言模型(VLM)策略以及多層導航策略(MFNP),通過指定樓梯區域為路標點、對樓梯入口進行處理以及設置時間重置機制,有效提升了智能體在多樓層環境中的導航效率和成功率。
MFNP在HM3D和MP3D數據集上的表現超越了現有方法,顯著提升了零樣本對象導航的性能。這一成果不僅在數據集上得到驗證,也在真實場景中展現出實際應用價值,推動了基于視覺的導航技術在復雜現實場景中的發展。后續,國創中心技術團隊計劃進一步擴展MFNP,細化多層導航數據集和應用到端到端訓練方法,提高具身智能在復雜多層環境中的適應性和自主性。這一技術的深入發展和應用,有望在搜索救援、物品查找等多樣化任務中提升智能機器人的效率和成功率,具有重要的實用價值和廣泛的應用前景。
從離散策略的動作解耦到基于擴散策略的模型擴展,從自我監督學習到控制感知增強的策略訓練,再到多層零樣本導航策略,國創中心技術團隊的創新成果在具身智能機器人領域實現了關鍵性技術突破,為底層技術探索和應用拓展提供了重要的理論支持與實踐范例,有力推動了具身智能技術在多任務操作、模型擴展、數據利用和視覺運動策略等核心問題上的實質性進展。
具身智能的發展離不開全產業鏈的不懈努力和創新探索,后續,國創中心將繼續深耕具身智能領域,加強與全球頂尖高校和科研院所的合作,不斷探索未知,攻克更多技術難題。這些成果將為全球人工智能和機器人技術的發展提供新的思路和方向,推動具身智能從實驗室走向實際應用,為人類社會帶來更高效、更智能的服務與支持。
京公網安備11011202100775號