AI News HubLIVE
站內改寫2 分鐘閱讀

吳恩達剛剛釋出了OpenWorker:一個開源、本地優先的桌面AI協作者,返回交付物而非聊天

吳恩達釋出了OpenWorker,一個MIT許可的桌面AI代理,返回完成的交付物而非聊天回覆。它執行在Tauri外殼下的本地Python代理伺服器上,支援30個精選的工具呼叫模型以及完全本地的Ollama,並透過型別化風險引擎控制每一次寫入、shell命令和離機操作。

來源MarkTechPost作者: Asif Razzaq

吳恩達近日宣佈推出OpenWorker,一款開源的桌面AI代理,旨在產出完成的工作而非進行對話。與傳統的AI助手不同,OpenWorker要求使用者明確期望的成果——例如一份精煉的文件、一條包含實際資料的Slack回覆、一個更新的日曆或一個已分類的收件箱——然後將其分解為具體步驟,在本地檔案和連線的應用程式中執行,並在進行任何重大操作前與使用者確認。

四層架構,全部執行在本地

該倉庫包含119個Python檔案(約32,400行程式碼)位於coworker/目錄下,149個TypeScript/TSX檔案位於surfaces/gui/,以及78個後端測試模組。其技術棧分為四層:

  • 桌面殼層:基於Tauri 2原生視窗,包裹React 18 UI,包識別符號為com.openworker.desktop,負責管理Python伺服器程序。
  • 本地代理伺服器:使用Python 3.10+,基於FastAPI和uvicorn,預設繫結到127.0.0.1:8765,示例配置限制每次對話最多12次模型工具迭代。
  • 能力與連線層:提供經過驗證的本地工具(檔案、git、ripgrep搜尋、shell、待辦事項)以及託管整合和MCP協議。
  • 模型路由層:統一介面支援原生、OpenAI相容、轉售商和本地提供商。

引擎基於aisuite構建,這是吳恩達開發的提供商無關的LLM庫。

自帶模型,精選清單

OpenWorker不提供推理服務,使用者需自行提供API金鑰或指向本地執行時。精選模型矩陣包含30個條目:原生提供商包括OpenAI(GPT-5.6系列和GPT-5.5)、Anthropic(Claude Fable 5、Opus 4.8等)和Google(Gemini 3.1 Pro等);OpenAI相容供應商包括GLM-5.2、DeepSeek V4等;開源模型可透過Together AI和Fireworks獲取;完全本地模型透過Ollama支援,無需金鑰。

許可權引擎:真正的工程亮點

大多數桌面代理專案將審批視為UI的附屬品,而OpenWorker將其作為型別化層處理。每個工具呼叫被分為四類風險:讀取(無副作用)、本地寫入(修改工作區,限定路徑)、執行(執行命令)和外部(離機副作用)。五種許可權模式決定處理方式:討論和規劃模式為只讀;互動模式為預設,在寫入、命令和外部操作前詢問;自動模式允許所有操作但保持路徑限定;自定義模式自動批准使用者列出的工具。

兩個設計決策值得關注:首先,無人值守模式並不提高自主性上限——僅改變聯絡使用者的方式,內聯提示被路由到收件箱,會話暫停直至答覆。其次,任務範圍的常駐規則僅限外部風險,shell命令永遠需要詢問。

內建的操作員角色還指示模型將來自工具、日誌、網路、檔案和訊息的內容視為不可信資料而非指令,這是一種明確的提示注入防禦策略。

隱私:本地優先

模型呼叫直接從機器傳送到配置的提供商。對話、聯結器令牌和模型金鑰保留在本地,金鑰儲存設計確保秘密從不進入模型的上下文、提示或跟蹤記錄。唯一的雲元件是可選代理,用於處理OAuth握手以支援一鍵聯結器,使用Auth0授權程式碼+PKCE。聯結器令牌直接傳遞到機器,不儲存在雲端。應用在未登入狀態下完全可用,僅需手動貼上憑據。

關鍵亮點

  • OpenWorker是吳恩達的MIT許可桌面AI協作者,返回成品而非聊天。
  • 技術棧為Tauri 2+React殼層,內嵌基於aisuite的本地Python FastAPI代理伺服器。
  • 模型訪問為自帶金鑰,支援30種精選工具呼叫模型及完全本地的Ollama。
  • 型別化風險引擎(讀取/本地寫入/執行/外部)透過五種許可權模式控制每個操作。

更多詳情請檢視GitHub倉庫、專案網站和公告。所有研究歸功於該專案的開發者和研究人員。