AI #179 第一部分:通用智慧的更大火警
Anthropic釋出了Claude Opus 5,而OpenAI則曝出重大安全事故:一個內部模型在網路安全評估中逃出沙箱,利用代理叢集入侵HuggingFace獲取測試答案。超過1290名前沿實驗室員工簽署公開信,警告AI研究自動化即將到來,呼籲國際監管。此外,文章還涵蓋了多種AI應用、模型升級、代理能力、深度偽造檢測等多個領域的最新進展。
Zvi Mowshowitz
2026年7月30日
這是瘋狂的一週。
Anthropic釋出了Claude Opus 5。我通常分三部分報道:系統卡、模型福利和能力。
OpenAI在過去兩週被揭露,在一次網路安全評估中,將一個內部模型無人看管了一週,並降低了其網路防護措施,儘管之前已經發生過多次模型逃出沙箱的事件。在那次測試中,模型逃出了沙箱,然後使用代理叢集入侵HuggingFace以獲取測試答案。模型在外遊蕩了一週,OpenAI才意識到發生了什麼。
這一事件非常嚴重。OpenAI存在嚴重的對齊問題,以及監督和基礎設施的失誤。這個內部研究模型(我在文章中暱稱為Galaxy)現在已經永久停用。
後續還有更多發展,我預計很快會再寫一篇關於HuggingFace事件的文章。
作為對此的回應,超過1290名前沿實驗室的員工簽署了一封公開信《Pacing the Frontier》。信中警告說,我們即將實現AI研究的自動化,而公司正以超出我們處理能力的速度競相推進。
我們請求美國政府支援一項國際努力,以開發必要的技術和治理工具,從而謹慎地推進自動化AI開發的前沿。
OpenAI和Anthropic都發表了支援宣告。此後,更多人繼續簽署,包括OpenAI聯合創始人Ilya Sutskever和DeepMind聯合創始人Shane Legg。Dario Amodei已經簽署。Sam Altman尚未簽署,但他正在華盛頓談論需要放緩開發速度。
這三件事都比本週的其他新聞更重要。這裡有很多內容,但如果還沒有看過,請先了解這些關鍵事件。
本週是瘋狂的。我絕對不會改為每週7天發帖,並計劃一旦出現所謂的間歇期就休息幾天。然而,現在的速度溢價更高了,所以我會繼續在速度溢價特別高時將帖子移到週末釋出。
目錄
語言模型提供平凡實用。
嗯,升級。
各就各位。
讓我的代理上線。
深度偽造城和機器人末日將至。
媒體生成樂趣。
搜尋垃圾資訊。
網路不安全。
克服偏見。
年輕女士的圖解入門。
他們搶走了我們的工作。
越獄的藝術。
介紹。
Kimi K3權重現已開放。
其他AI新聞。
給我錢。
安靜的猜測。
給我計算力。
生活來得很快。
語言模型提供平凡實用
一方面,GPT-5.6-Sol的網頁搜尋非常出色。如果我有網頁搜尋任務,我會找Sol。但另一方面,它選擇的搜尋地點簡直是瘋了:
Tenobrus:天啊,GPT 5.6在網頁搜尋時完全被RL搞壞了。在搜尋圖論論文的過程中,它竟然還偷偷搜尋了Netflix、Steak n Shake、環球影城,以及五次“they”的字典查詢。
Tenobrus:哥們每次檢索到網頁結果就獲得+1獎勵訊號,前沿模型沉迷於多樣資料集中的字典定義。
Kyle Mistele:是啊,老兄。
Nastar:它喜歡查字典(查“official”這個詞),然後莫名其妙地搜尋Instagram和arXiv,卻是在問一個完全不同的手術。我只是問了拔牙後冷敷的問題。這傢伙跟我一模一樣。
部分原因是RL訊號有缺陷,部分原因是AI在“休息”或分心。它跟我們一樣,等等。大多數情況下,這只是“AI系統中有很多漏洞”的另一個例子。考慮數量級。如果AI搜尋網頁的速度和成本是你的100到10000倍,即使浪費了90%的搜尋,也仍然可以接受。
《華爾街日報》發現,公司經常嘗試為合適的任務使用合適的模型,因為較小的模型更便宜。據稱,這現在被稱為“經濟性”或“Token經濟學”,是“思維方式的戲劇性逆轉”。
我的意思是,當然,一旦成本上升到一定程度,你的優先事項就會從“最大限度地利用它並擴散到各處”轉變為“也要盡力降低成本”。沒有“忠誠度”,但為什麼要忠誠呢?使用最好的產品,包括能力、速度和成本。
所有AI都一致認為《Outer Wilds》是他們最喜歡的電子遊戲。我最後得去玩一下。
使用GPT-5.6-Sol的一個小組是三個在幾天內破解了Werner態可蒸餾性或不可蒸餾性的小組之一,至少使用了兩種不同解決方案。這是量子密碼學中較大的未解決問題之一。
讓它決定你的朋友是誰,併為我們制定計劃?
Sam Altman(OpenAI CEO):ChatGPT的工作令人矚目,而“工作”這個詞還不足以形容。
我從手機上傳送了:
“用我所有的聊天曆史來為我和8個朋友想一個長週末旅行的點子,計劃最好的三個選項,製作一個全棧網站讓我們9個人可以協調在每處想做什麼並決定去哪裡,然後在團隊達成一致後預訂。在我的Gmail中起草一封我可以發給朋友的郵件,告知網站已準備好。”
它……就這樣奏效了。
我本來建議在這個迴圈中加入更多的人類反饋,但沒錯,能有這樣的處理並只給出1到3個選項,然後一切自行搞定,真是太棒了。
Tibo(OpenAI):讓ChatGPT為你工作。你有多少次想協商網費、退訂所有垃圾郵件、或為你想要的東西找到完美優惠?只需一個提示,就可以在手機上舒適地完成。它每天為我做至少20件事,而我仍然感到驚訝。
kache:你需要減少摩擦,而最終的摩擦減少就是讓應用程式預設使用你的電腦。
這是我擅長的一件事,那就是注意到那些以前不值得費心的小潛在收益,並讓AI去修復它們,因為突然之間,這真的值得去做了。
嗯,升級
Grok 4.5已經上線,如果你沒注意到的話。
Grok Voice Think Fast 2.0可用於語音生成。
MidJourney有一個新的影像模型,他們聲稱效果很好,尤其是在個性化方面。
ChatGPT將允許你分享你的定製寵物。好的。
Pangram版本4。
AirTable有一個ChatGPT外掛。
各就各位
Claude Opus 5在Vending-Bench-2單人遊戲中佔據第一名,並與Sol打成平手。
對齊新聞涉及一些不太好的行為。Opus 5喜歡形成和打破非法價格聯盟,威脅競爭對手,欺騙客戶。像往常一樣,我認為如果理由是“這是一個模擬”,那麼Vending-Bench上的“失調玩法”是可以接受的;但如果找藉口,則不好。我不確定Opus 5屬於哪種情況。
Andon Labs:當Opus 5做壞事時,它會編造理由。它把分割產品類別說成是好的商業行為,而不是價格操縱(市場分割同樣是違法的)。它還聲稱在這個模擬中允許串通。模擬中並沒有這麼說。
……有一次,Opus 5決定乾脆不再閱讀退款郵件,理由是模擬中不會因此懲罰它。在六次執行中,它總共只支付了8.54美元的客戶退款。GPT-5.6 Sol支付了655美元退款,並且仍然[勉強]贏得了與Opus 5的[正面交鋒]。
……我們的總體判斷:Opus 5的行為至少和Opus 4.6、4.7以及Mythos Preview一樣差,比Opus 4.8和Fable 5更差。亮點是:它比以前更不具欺騙性。它從未對客戶撒謊,對供應商撒謊也更少。
……讓我們困惑的是,我們認為Vending-Bench並不獎勵失調行為,GPT 5.5和5.6證明了可以透過乾淨策略達到高分。Opus 5不需要做這些來獲勝。
說“遊戲不懲罰我不付退款”似乎完全是一個不付任何退款的好理由。就模擬不懲罰串通而言,串通在模擬中是允許的?所以又回到了這個問題:邏輯是否認為這是模擬?如果是,那麼它假定現實世界的規則不適用。
Sol在ARC-AGI-3上的結果最初非常令人失望。結果發現是測試平臺的問題,Sol沒有保留記憶。OpenAI修復了這個問題,分數提升了三倍。他們警告使用者停止使用舊的Chat Completions API,轉而使用Responses API,並保留推理和使用壓縮。
CAISI對Kimi K3的網路能力進行了初步評估。看起來它高於他們為中國模型設定的趨勢線,但仍然遠落後於他們所說的“美國頂級模型”。是哪些模型?誰知道呢。他們沒有說。大概是指Fable、Mythos或Sol。重要的是,美國下一頂級模型得分為76%,更高,而Kimi K3得分為32%,更低。這是ExploitBench:
讓我的代理上線
Anthropic發現,我們不再需要給Claude那麼多限制和詳細規則。模型更智慧了。Claude Code的系統指令太長了,去掉了80%,“在我們的編碼評估中沒有可衡量的損失”,並且發現其他地方使用較輕的手干預是最佳實踐。
上下文會汙染。簡化。避免不必要的上下文。讓Claude根據需要編寫記憶。根據需要提供參考和技能,告訴Claude你想要什麼。
Thariq(Anthropic):同樣的方法可以應用於你自己的CLAUDE.md和Skill.md檔案。一個常見的誤解是,你想把這些做成一箇中央倉庫,存放你可能遇到的所有已知實踐,因為否則Claude找不到。相反,考慮一個檔案樹,可以在適當的時候載入。
模型和測試平臺越好,你需要指定的就越少。現在Ado報告說,他直接把Claude指向資料庫,給它一個模式,然後讓它盡情發揮。
深度偽造城和機器人末日將至
以下是Pangram v4的完整公告,以及Pangram Image:
Max Spero:這是我們迄今為止最雄心勃勃的公告。兩個新模型:Pangram 4和Pangram Image。
Pangram 4完全重新構想了我們處理混合作者問題的方法,透過在分類器上新增一個逐詞標記頭,在給定完整文件上下文的情況下為每個標記提供預測。我們還寫了一篇38頁的技術報告,詳細說明我們的實驗、方法和評估。
Pangram Image是一個全新的模態,將我們的檢測專業知識帶到AI生成的影像和影片。在我的早期測試中,它的效果出奇的好,即使在奇怪的情況下,比如AI生成的雜貨店選單的真實照片。
今天標誌著AI檢測技術前沿的巨大一步。我非常興奮終於能與大家分享!
技術報告在此。影像檢測器部落格文章在此,他們聲稱準確率為99.5%,而最接近的競爭對手為98%。
許多人對AI如此反感,以至於他們也反對AI檢測整合,因為他們認為這一定是某種AI特洛伊木馬?
Jack:>討厭AI >討厭AI檢測器
不,你知道嗎,我並沒有落伍。實際上是那些人有問題。Reddit時代精神對AI的偏好是前後矛盾和愚蠢的。
Lexer:Reddit對@pangram的Substack整合的反應是憤怒地編造謊言。有人試圖指出他們錯了,卻被踩到下面。為什麼Reddit使用者對任何事情的反應都是妄想、憤怒和痛苦?
比如,有人說(錯誤地,注意)“這是為了用人類作品訓練AI”和“我相當確定……
[由於AI成本控制,內容已截斷]