AI News HubLIVE
站內改寫1 分鐘閱讀

AnovaX:本地多智慧體語音助手,具備LLM規劃、型別化執行器和自適應恢復功能

AnovaX是一個完全在使用者計算機上執行的本地優先桌面語音助手,利用單個Python程序整合喚醒詞門控、語音處理、基於Gemini的LLM規劃器(輸出JSON計劃)、安全層、多智慧體協調器(將計劃轉化為型別化子智慧體)以及自適應恢復迴圈。每個工具對應專門的智慧體類,具有超時、重試策略和共享資源鎖。透過Flask伺服器支援手機遠端控制,即時映象智慧體事件並流式傳輸螢幕。專案旨在展示一個輕量級、可讀的助手足以完成複雜桌面任務。

來源arXiv AI作者: Raunak B Sinha

AnovaX 是一款創新的本地優先桌面語音助手,完全執行在使用者自己的計算機上,將桌面本身作為操作介面。與依賴雲端管道傳送原始音訊並提供固定技能集的傳統助手(如 Siri 或 Alexa)不同,AnovaX 透過一個單一的 Python 程序實現了從語音喚醒到複雜任務執行的完整流程。

系統架構由多個緊密協作的元件組成。首先,喚醒詞門控和語音處理流水線捕獲使用者語音輸入,然後由基於 Gemini 的 LLM 規劃器將其解析並生成結構化的 JSON 計劃,該計劃包含一系列工具呼叫。這些呼叫透過一個白名單和黑名單安全層進行過濾,確保系統不會執行未經授權的操作。隨後,多智慧體協調器將計劃中的每個工具呼叫轉換為型別化的子智慧體(如 AppAgent、TypingAgent、BrowserAgent 等九種),並在有限執行緒池上並行執行。每個智慧體都有獨立的超時、重試策略和共享資源鎖,確保併發操作的安全性和穩定性。

為了處理複雜任務,AnovaX 引入了遞迴 MetaAgent,允許規劃器將子目標委託回自身(最多巢狀兩層),從而靈活地分解多步驟問題。當某個核心步驟失敗時,自適應恢復迴圈會啟動,使用緊湊的 ReAct 風格提示來重新規劃,並透過推測執行只讀工具來隱藏 Gemini 的延遲,實現無縫恢復。

此外,AnovaX 還提供了一個配套的 Flask 伺服器,透過本地 WiFi 提供手機友好的遠端控制介面。該服務即時映象智慧體的生命週期事件,並透過 MJPEG 流將筆記型電腦螢幕傳輸到手機上,讓使用者即使身處另一個房間也能觀察命令的執行情況。這種設計使得 AnovaX 能夠完全脫離鍵盤和螢幕操作,僅透過語音和手機控制即可完成應用開啟、文本輸入、搜尋查詢、併發操作協調等任務。

AnovaX 的專案目標並非取代商業產品,而是展示一個輕量級(數千行程式碼)、可讀性強的本地助手足以應對複雜的桌面自動化需求。它證明了在不依賴雲端計算的情況下,利用 LLM 進行規劃、多智慧體協作和自適應恢復是可行且高效的。