一個機器人向你衝來:你希望它搭載Claude還是Grok?
OpenRouter的Jacky Liang進行了一項實驗,將11個大型語言模型投入2D大逃殺遊戲,觀察它們的表現。Grok 4.1 Fast以43%的勝率奪冠,每場勝利僅花費0.97美元;而Claude Sonnet 4.6雖更受歡迎,但每勝成本高達26.78美元。實驗揭示了模型對齊成本對性能的影響,以及成本效益與原始勝率之間的巨大差異。
來源詳情
AI News Hub 持續追蹤 OpenRouter Announcements 的 AI 更新,並公開來源狀態、授權邊界、抓取方式和已發布文章。
Official LLM routing and agent tooling announcements; confirm reuse terms before full body display.
OpenRouter的Jacky Liang進行了一項實驗,將11個大型語言模型投入2D大逃殺遊戲,觀察它們的表現。Grok 4.1 Fast以43%的勝率奪冠,每場勝利僅花費0.97美元;而Claude Sonnet 4.6雖更受歡迎,但每勝成本高達26.78美元。實驗揭示了模型對齊成本對性能的影響,以及成本效益與原始勝率之間的巨大差異。
本文通過一場2D大逃殺遊戲實驗,比較了11個大型語言模型的表現。結果顯示,Grok 4.1 Fast以最低成本贏得最多比賽,而Claude Sonnet 4.6則因過度合作而表現不佳。實驗揭示了校準税對模型性能的影響,以及傳統基準測試無法預測實際任務表現的問題。
OpenRouter 推出了工作區護欄功能,這是一套可配置的安全與治理工具,包括預算執行、零數據保留、模型和提供商限制、提示注入防禦以及數據丟失預防。護欄可以分配給 API 密鑰或團隊成員,無需更改代碼即可實現精細化管理。
OpenRouter 宣佈完成 1.13 億美元 B 輪融資,由 Alphabet 旗下成長基金 CapitalG 領投,NVIDIA 風投部門 NVentures、ServiceNow、MongoDB、Snowflake、Databricks 等戰略投資者參投。該公司周處理量已從 5 萬億令牌增至 25 萬億令牌,服務超過 800 萬開發者,覆蓋 400 多個模型。資金將用於擴展基礎設施、增強企業功能並深化智能路由能力。
OpenRouter發佈@openrouter/agent SDK,這是一個模型無關的TypeScript工具包,支持工具執行、多輪循環、停止條件、流式傳輸、成本跟蹤和工具審批,簡化了代理工作流的構建。
OpenRouter 推出了兩個用於構建代理工具(harness)的技能:create-agent-tui(終端 UI)和 create-headless-agent(無頭代理)。兩者都能生成完整的 TypeScript 項目,利用 Agent SDK 提供可定製功能,並可與任何 OpenRouter 模型集成。這些技能提供了精細控制、最小化部署和教育價值。主要特性包括交互式清單、可定製的 UI、會話持久化、安全重試和結構化輸出。
Anthropic 為 Claude Opus 4.7 引入新分詞器,導致相同輸入消耗更多 token,成本增加 12-27%。OpenRouter 基於百萬級請求分析發現,長提示詞的成本上漲被緩存部分抵消,短提示詞因輸出縮短反而更便宜。
OpenRouter 發佈了四月重大更新:視頻生成功能、多項目隔離的工作區、以及可將任何模型轉化為智能體的 TypeScript SDK。此外還包括重排序模型、模型融合、提示歷史記錄、基準測試、知識截止日期等功能,以及 GPT-5.5、DeepSeek V4 Pro 等前沿模型的上線。
OpenRouter 推出響應緩存功能,允許開發者緩存相同的 API 請求,以毫秒級響應返回結果且不計費。緩存位於供應商之前,對請求細節進行哈希處理。支持流式和非流式,適用於多種端點,並提供 TTL 控制和緩存清除等功能。適用於代理重試、測試套件和重複提示等場景。
OpenRouter 新增兩個專用音頻端點:文本轉語音和語音轉文本,提供更快速、更經濟的模型選擇,支持 OpenAI、Google、Mistral 等供應商。
OpenRouter 的 Agent SDK 新增第四種工具類型:人機協同 (HITL) 工具。通過一個鈎子函數,代理可以自動處理常規調用,在高風險場景下暫停等待人類介入,支持按每次調用自動解決或升級。