研究人員稱AI剛剛打破所有自主網路能力基準
英國AI安全研究所和Palo Alto Networks的最新研究發現,Anthropic的Claude Mythos Preview和OpenAI的GPT-5.5在自主網路安全任務上的表現大幅超越了此前已加速的進度,甚至超出了預期趨勢。
週三,英國AI安全研究所(AISI)和Palo Alto Networks分別釋出的研究結果顯示,兩個最先進的人工智慧模型——Anthropic的Claude Mythos Preview和OpenAI的GPT-5.5——在自主網路安全任務上的完成速度顯著超越了已經加速的程序。
AISI代表英國政府對前沿AI模型進行部署前評估,該機構表示,Claude Mythos Preview和GPT-5.5均大大超出了該研究所自2024年底以來追蹤的加倍趨勢。目前尚不清楚這些結果是代表了孤立的能力躍升,還是新加速軌跡的開始。
今年早些時候,AISI估計前沿模型的80%可靠網路時間線(衡量人類專家完成任務所需時間,用作AI自主性的代理指標)大約每五個月翻一番。這本身已是該研究所2025年11月估計的八個月加倍時間的一半。而現在,Mythos Preview和GPT-5.5的表現又超出了該研究所測量的任何趨勢線。
“前沿AI的自主網路和軟體能力正在快速提升:前沿模型能自主完成的網路任務長度已以月為單位翻倍,而非年,”AISI寫道。