Speech2Grasp:將文本條件抓取檢測高效遷移到語音的人形機器人方法
本研究提出Speech2Grasp框架,基於輕量級MLP投影器將ALBEF等文本條件模型適配到語音輸入,在保持語義判別和魯棒性的同時,實現數據高效的遷移。實際人形機器人實驗證明,Speech2Grasp在推理延遲和性能上優於級聯ASR流水線,為擴展既有文本條件系統到語音模態提供了實用範式。
隨着人形機器人技術的快速發展,多模態理解能力已成為實現自然人機交互的關鍵。儘管當前視覺-語言模型取得了顯著進展,但它們通常依賴文本輸入,而非更自然的語音指令。針對這一侷限,一項新研究提出了Speech2Grasp框架,旨在以數據高效的方式將成熟的文本條件模型遷移到語音輸入,使人形機器人能夠直接通過語音指令完成抓取操作。
該研究團隊以ALBEF模型為案例,進行了深入的診斷分析。他們發現,通過引入一個輕量級的MLP(多層感知機)投影器,可以有效地將ALBEF從文本模態適配到語音模態,同時保持其原有的語義判別能力和魯棒性。這一關鍵發現為後續框架設計奠定了堅實基礎。
基於上述結果,研究人員正式提出Speech2Grasp——一種數據高效的跨模態遷移框架。其核心思想是利用簡單的神經網絡模塊將語音特徵映射到文本模型的嵌入空間,從而複用既有的文本條件抓取檢測能力。在真實人形機器人平台上進行的實驗表明,Speech2Grasp不僅優於傳統的級聯自動語音識別(ASR)流水線,還顯著降低了推理延遲,使機器人能夠更快速地響應語音指令。實驗結果顯示,該系統在多種抓取場景下均表現出色,充分驗證了其有效性和實用性。
Speech2Grasp的成功證實了一個重要觀點:對於許多已經成熟的文本條件系統,我們無需從頭訓練語音模型,而是可以通過輕量級適配實現高效遷移。這種範式有望在人形機器人領域得到廣泛應用,加速從實驗室研究到實際部署的進程。未來的工作可以探索將類似方法擴展到其他模態和任務,例如將文本條件模型遷移到觸覺或視覺指令,從而進一步推動人機交互的自然化。該研究已於2026年7月29日提交至arXiv預印本平台,論文編號為2607.26567,作者包括Hung Nguyen等九位研究人員。