Codex崛起,Claude對編程使用進行計量
過去三週,GPT 5.5發佈後,AI工程師對Codex的支持增加,而Anthropic調整了Claude的定價策略,為訂閲用户提供API信用額度,但被部分用户視為'地毯式撤除'。同時,OpenAI推出企業遷移優惠。文章還涵蓋了代理基礎設施、模型訓練效率、企業AI定價競爭、自主科學與網絡安全等多個領域的最新動態。
自GPT 5.5發佈以來的三週內,金融界對Anthropic的增長和首席財務官表示青睞,但AI工程師羣體中支持Codex的情緒顯著上升。這可能是多種因素綜合作用的結果:GPT 5.5本身性能出色,Codex的廣泛推廣,以及更慷慨的使用限制。Anthropic對Claude定價的調整在傳達上做得很好,但並非所有使用替代工具的開發者都希望聽到:現在每個Claude訂閲每月都會獲得與訂閲金額等值的API令牌積分。例如,支付200美元的用户既享有Claude訂閲本身(在Anthropic自有平台如Claude.ai和Claude Code上的交互使用),又獲得200美元的API信用額度,可用於其他所有地方(包括claude-p、OpenClaw等程序化使用)。如果一開始就這樣,這會被視為一筆很好的交易。然而,由於歷史上的補貼和定價優勢(估計比API定價低70-90%),人們現在將其視為某種形式的“地毯式撤除”。不過,有了官方政策總比選擇性針對OpenClaw、OpenCode以及其他不太受歡迎的工具有所改善。這些新聞與OpenAI同一天推出企業遷移優惠形成了令人難以置信的巧合。最終,我們應謹慎對待任何一方的搖擺——兩家實驗室都表現良好,這些在宏觀上只是正常的定價調整,是正在創造編程未來的人們在顛覆數十年老行業的同時摸索最優定價的過程。Anthropic最初更為寬鬆,但現在Claude Code已擁有可持續的品牌和作為代理工具的聲望,Anthropic正將其最優惠的定價放在自有工具之後,並對其他一切進行計量,而作為挑戰者的Codex則對所有方面更加寬鬆。
在代理基礎設施方面,Cline開源了重建的Cline SDK,並更新了CLI,包含TUI、代理團隊、定時作業和連接器,將其工具定位為可重複使用的自定義編碼代理基板。LangChain在Interrupt上發佈了一大批代理生命週期基礎設施,包括LangSmith Engine、SmithDB、Sandboxes、Managed Deep Agents、LLM Gateway、Context Hub和Deep Agents 0.6。其中最值得技術關注的是SmithDB,這是一個針對嵌套、長期運行、攜帶大負載的追蹤的專用可觀測性數據庫,據稱在關鍵工作負載上訪問速度快12-15倍;團隊表示它構建在Apache DataFusion和Vortex之上。與此同時,Notion的External Agents API允許第三方代理(如Claude、Codex、Cursor、Decagon、Warp和Devin)直接在Notion內部操作,作為共享、可審核的上下文層,而非另一個數據孤島。Cursor擴展了雲代理,提供完全配置的開發環境,包括克隆的倉庫、依賴項、版本歷史、回滾、作用域出口和隔離的秘密。
在模型訓練和架構方面,Nous Research的Token Superposition Training修改了預訓練的早期階段,使模型讀取/預測連續的令牌包,然後再恢復到標準的下一令牌預測;他們報告在匹配FLOPs的情況下,壁鐘速度提升2-3倍,且推理時無需改變架構,已在270M到3B密集模型和10B-A1B MoE模型上驗證。Jonas Geiping等人認為當前基於消息的聊天訓練過度將代理限制在單一流中,併發布了一篇多流LLM論文,聲稱具有更低的延遲、更清晰的關注點分離以及更可讀的並行推理/工具使用。δ-mem提出了一種外部在線關聯記憶,附加到凍結的全注意力骨幹上,8×8狀態平均得分提高1.10倍,比非δ-mem基線高1.15倍,在記憶密集型基準上增益更大。NVIDIA的Star Elastic聲稱一次後訓練運行可以衍生出一系列推理模型尺寸,成本比預訓練一族模型低360倍,比最先進的壓縮方法好7倍。Datology的VLM工作表明,僅數據整理就能在多模態方面產生重大增益:在20個公共VLM基準上平均提升11.7點(2B模型),以約17倍少的訓練計算量擊敗InternVL3.5-2B約10點,並且以3.3倍低的響應FLOPs接近前沿的4B性能。Percy Liang表示下一次Marin運行已經在混合數據中集成了18T令牌,並仍在尋求更多預訓練、中期訓練和SFT數據。
在企業AI定價和平台競爭方面,Ramp數據顯示Anthropic在4月份佔企業業務的34.4%,而OpenAI為32.3%,這是首次明顯的領先變化。Anthropic同時改變了計劃經濟:ClaudeDevs宣佈付費Claude計劃將獲得專用的每月程序化使用信用額度,適用於Agent SDK、claude-p、GitHub Actions和第三方SDK應用。這立即被功率用户解讀為對訂閲補貼工具的重大限制,引發了Theo、Jeremy Howard、Matt Pocock和Omar Sanseviero的批評。Anthropic通過另一項50%的Claude Code每週限額提升(截至7月13日)部分抵消了反彈,疊加此前宣佈的2倍5小時限額提升。OpenAI則積極回應,提供兩個月免費Codex使用給在30天內遷移的企業客户。OpenAI還發布了更多技術平台細節,包括Windows沙箱設計描述,説明如何結合本地用户、防火牆規則、ACL、寫限制令牌、DPAPI和輔助可執行文件來安全運行具有本地文件系統/工具訪問權限的編碼代理。
在自主科學、網絡能力和機器人領域,Recursive公司成立,旨在構建自動化科學並安全自我改進的AI。英國AI安全研究所表示,前沿模型能完成的網絡任務長度每幾個月翻一番,近期模型正在超越以往趨勢。Anthropic/Glasswing的Logan Graham表示Claude Mythos Preview是首個解決AISI端到端網絡範圍(包括Cooling Tower)的模型,並且是唯一在研究所250萬令牌限制下完成所有任務的模型。Figure的Brett Adcock直播了人形機器人使用Helix-02運行完整8小時自主輪班進行包裹分揀的演示,機器人從攝像頭像素推理,達到人類水平的速度(約3秒/包裹),進行設備端推理,作為聯網艦隊協調,自主更換低電量電池,並自我診斷故障轉移到維護。這比簡短的基準測試片段更清晰地展示了多機器人、長時間、無人在環的編排。