AI News HubLIVE
站内改写2 分钟阅读

吴恩达刚刚发布了OpenWorker:一个开源、本地优先的桌面AI协作者,返回交付物而非聊天

吴恩达发布了OpenWorker,一个MIT许可的桌面AI代理,返回完成的交付物而非聊天回复。它运行在Tauri外壳下的本地Python代理服务器上,支持30个精选的工具调用模型以及完全本地的Ollama,并通过类型化风险引擎控制每一次写入、shell命令和离机操作。

来源MarkTechPost作者: Asif Razzaq

吴恩达近日宣布推出OpenWorker,一款开源的桌面AI代理,旨在产出完成的工作而非进行对话。与传统的AI助手不同,OpenWorker要求用户明确期望的成果——例如一份精炼的文档、一条包含实际数据的Slack回复、一个更新的日历或一个已分类的收件箱——然后将其分解为具体步骤,在本地文件和连接的应用程序中执行,并在进行任何重大操作前与用户确认。

四层架构,全部运行在本地

该仓库包含119个Python文件(约32,400行代码)位于coworker/目录下,149个TypeScript/TSX文件位于surfaces/gui/,以及78个后端测试模块。其技术栈分为四层:

  • 桌面壳层:基于Tauri 2原生窗口,包裹React 18 UI,包标识符为com.openworker.desktop,负责管理Python服务器进程。
  • 本地代理服务器:使用Python 3.10+,基于FastAPI和uvicorn,默认绑定到127.0.0.1:8765,示例配置限制每次对话最多12次模型工具迭代。
  • 能力与连接层:提供经过验证的本地工具(文件、git、ripgrep搜索、shell、待办事项)以及托管集成和MCP协议。
  • 模型路由层:统一接口支持原生、OpenAI兼容、转售商和本地提供商。

引擎基于aisuite构建,这是吴恩达开发的提供商无关的LLM库。

自带模型,精选清单

OpenWorker不提供推理服务,用户需自行提供API密钥或指向本地运行时。精选模型矩阵包含30个条目:原生提供商包括OpenAI(GPT-5.6系列和GPT-5.5)、Anthropic(Claude Fable 5、Opus 4.8等)和Google(Gemini 3.1 Pro等);OpenAI兼容供应商包括GLM-5.2、DeepSeek V4等;开源模型可通过Together AI和Fireworks获取;完全本地模型通过Ollama支持,无需密钥。

权限引擎:真正的工程亮点

大多数桌面代理项目将审批视为UI的附属品,而OpenWorker将其作为类型化层处理。每个工具调用被分为四类风险:读取(无副作用)、本地写入(修改工作区,限定路径)、执行(运行命令)和外部(离机副作用)。五种权限模式决定处理方式:讨论和规划模式为只读;交互模式为默认,在写入、命令和外部操作前询问;自动模式允许所有操作但保持路径限定;自定义模式自动批准用户列出的工具。

两个设计决策值得关注:首先,无人值守模式并不提高自主性上限——仅改变联系用户的方式,内联提示被路由到收件箱,会话暂停直至答复。其次,任务范围的常驻规则仅限外部风险,shell命令永远需要询问。

内置的操作员角色还指示模型将来自工具、日志、网络、文件和消息的内容视为不可信数据而非指令,这是一种明确的提示注入防御策略。

隐私:本地优先

模型调用直接从机器发送到配置的提供商。对话、连接器令牌和模型密钥保留在本地,密钥存储设计确保秘密从不进入模型的上下文、提示或跟踪记录。唯一的云组件是可选代理,用于处理OAuth握手以支持一键连接器,使用Auth0授权代码+PKCE。连接器令牌直接传递到机器,不存储在云端。应用在未登录状态下完全可用,仅需手动粘贴凭据。

关键亮点

  • OpenWorker是吴恩达的MIT许可桌面AI协作者,返回成品而非聊天。
  • 技术栈为Tauri 2+React壳层,内嵌基于aisuite的本地Python FastAPI代理服务器。
  • 模型访问为自带密钥,支持30种精选工具调用模型及完全本地的Ollama。
  • 类型化风险引擎(读取/本地写入/执行/外部)通过五种权限模式控制每个操作。

更多详情请查看GitHub仓库、项目网站和公告。所有研究归功于该项目的开发者和研究人员。