AI News HubLIVE
站內改寫2 分鐘閱讀

從流式意圖中產生動作行為

研究者將動作湧現形式化為端到端自動駕駛的目標能力,並提出流式意圖機制,通過語義鏈式推理和時間一致性生成多樣化、可控的動作。其模型SI在Waymo基準測試中取得有競爭力的性能,並首次展示了意圖忠實可控性。

來源arXiv Robotics作者: Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Xie Yan, Benjin Zhu

在一篇新近提交至arXiv的論文中,來自多位作者的研究團隊正式定義了端到端自動駕駛中的“動作湧現”概念。所謂動作湧現,是指系統能夠通過場景條件推理,生成物理上可行、語義上恰當且符合安全規範的駕駛動作,而不是依賴對已學習場景-動作映射的簡單檢索或插值。這一能力被視為自動駕駛系統邁向真正智能的關鍵一步,因為它要求模型在面對任意長尾交通場景時,能夠基於對環境的深層理解自主推導出合適的動作,而非機械地匹配記憶中的模式。

論文指出,現有的主流範式均無法實現真正的動作湧現。自迴歸軌跡解碼器雖然能夠生成連續軌跡,但往往會將本質上多模態的未來可能性坍縮為單一的平均輸出,丟失多樣性。而擴散模型和流匹配生成器雖然能夠表達多模態性,但其生成過程無法由推理出的駕駛意圖進行引導或控制。換言之,這些方法雖然能產生多種結果,但缺乏一種機制來根據場景理解有意圖地選擇或調整行為。

為了克服這一侷限,研究者提出了“流式意圖”(Streaming Intent)機制。該機制的核心思想是讓駕駛意圖以兩種方式“流式”傳遞:首先,在語義層面,通過一個連續的思維鏈,從場景理解中因果推導出意圖,使得意圖的生成具有可解釋的推理過程;其次,在時間層面,意圖在連續的視頻片段間進行時間流式傳輸,確保意圖承諾在完整的駕駛視界內保持一致性,不會因片段切換而出現矛盾。

具體實現上,研究者構建了一個名為SI(Streaming Intent)的視覺-語言-動作(VLA)模型。SI首先自迴歸地解碼一個四步思維鏈,並輸出一個意圖令牌。該意圖令牌隨後用於驅動一個流匹配動作頭上的無分類器引導(CFG)過程。得益於流匹配的高效性,僅需兩個去噪步驟即可生成最終的軌跡。這種設計不僅保證了生成的高效性,更關鍵的是實現了意圖對動作的顯式控制。

在Waymo端到端自動駕駛基準測試中,SI模型取得了有競爭力的表現:在驗證集上RFS得分為7.96,測試集上為7.74。然而,更引人注目的是該模型首次在完全端到端的VLA框架中展示了“意圖忠實可控性”。這意味着對於同一個固定場景,當在推理時改變輸入的意圖類別時,模型能夠生成定性上完全不同但質量始終高的規劃方案。這一能力完全來源於數據驅動學習,無需任何預構建的軌跡庫或手工設計的後處理選擇器。這一突破為自動駕駛中的可控行為生成開闢了全新的路徑,有望推動更安全、更靈活的人機共駕系統的發展。