微軟研究院AI Frontiers團隊今日發佈了MagenticLite,這是一款實驗性的智能體應用,專為小型模型設計。作為Magentic-UI的下一代產品,MagenticLite能夠在同一工作流中跨瀏覽器和本地文件系統運行。該應用由兩個專用模型驅動:MagenticBrain負責推理、委派和終端操作,而Fara1.5則是一系列用於瀏覽器任務的電腦使用模型。這三個組件協同設計,作為一個統一系統運行,從而打造出一個高效、數據保留在用户設備上且支持廣泛智能體任務的代理。
這一項目基於一個核心研究假設:智能體的能力更多取決於工具編排和行動,而非單純的知識。這一洞察使得使用小型模型成為可能,同時能以更低的成本支持廣泛的智能體任務。MagenticLite體現了微軟對智能體AI端到端的處理方式——從訓練數據和模型設計到編排、交互設計以及整個體驗中的人類監督。
此次發佈包含三個主要組件:MagenticLite應用、MagenticBrain編排模型和Fara1.5電腦使用模型。MagenticLite是Magentic-UI的下一代版本,其代理引擎為小型模型重建,並根據社區反饋更新了用户界面。MagenticBrain集規劃、編碼和委派於一身,能將模糊請求轉化為具體計劃,為每一步選擇合適的工具或子代理,並在任務中斷時進行恢復。Fara1.5是電腦使用模型系列的新一代產品,提供三種尺寸,其中旗艦版90億參數模型適用於大多數用例。Fara1.5在小型電腦使用模型中取得了新的最先進成果,在Web導航任務上的性能幾乎達到前代Fara-7B的兩倍,尤其在表單填寫、憑據網站和長時間任務方面表現更佳。
研究團隊從現實世界用例中識別需求,如填寫表單、進行瀏覽器研究和本地文件管理,並圍繞這些需求構建了評估數據集。標準基準測試雖然重要,但並非衡量現實世界實用性的直接標準。基於場景的評估補充了這些基準測試,成為模型和引擎迭代改進的關鍵信號。在用户體驗方面,MagenticLite保留了Magentic-UI的關鍵元素,包括代理推理和行動的可見性、用户直接控制的能力以及關鍵節點的明確批准。根據最新用户研究,MagenticLite還通過更新的瀏覽器和聊天視圖降低了學習難度,方便用户理解代理行動並在需要時進行干預。
Fara1.5在Online-Mind2Web基準測試中,在同類模型中取得了最先進成果,並大幅超越了前代模型。除了基準測試的改進,Fara1.5在用户體驗上也有提升,用户應能觀察到在填寫表單、處理憑據網站登錄和預訂等日常任務中的更優表現。這些改進得益於FaraGen數據生成管線的進化。除了在真實網站上的訓練,模型還在高度逼真的合成環境中進行了訓練,以模擬登錄和不可逆操作等場景。Fara1.5擁有針對長時間任務調優的原生動作空間,內置工具可在數百步的上下文中存儲關鍵信息,並在需要時徵求用户許可或偏好,從而在跨越數分鐘實際任務中保持連貫性。同時,關鍵點的檢測得到了重新校準,既確保安全觸發,又不阻礙有用任務。
MagenticBrain是一個140億參數的編排模型,從Qwen 3 14B微調而來,並在MagenticLite引擎內與推理時相同的工具模式和運行環境中進行了端到端訓練。這使得它在如何學習編排和如何運行之間沒有差距。MagenticBrain的設計結合了多步工具調用軌跡、編碼和終端軌跡,以及電腦使用代理委派。它能夠識別瀏覽器或UI任務,向Fara1.5發出結構化交接,等待結果後繼續任務,從而在單個140億參數模型內完成推理、編碼、工具調用和委派。
引擎將編排模型和瀏覽器使用模型整合到單一工作流中,關鍵設計包括:逐步規劃保持靈活性;主動上下文管理保持小型模型的有效上下文窗口聚焦;通過子代理委派讓編排模型作為主代理,將瀏覽器任務委派給Fara1.5。引擎保留了Magentic-UI 1.0中的人機協同保證,瀏覽器和代碼操作的關鍵節點仍需用户明確批准,整個系統運行在Quicksand沙盒中,隔離瀏覽器會話和代碼執行與宿主機。
MagenticLite能夠執行廣泛的任務,如填寫費用表格、查找和預訂餐廳、查找食譜食材價格以及組織本地文件。MagenticLite、MagenticBrain和Fara1.5作為研究發佈,旨在支持持續的探索和開發,社區可訪問GitHub和Microsoft Foundry獲取。