Anthropic的Claude Fable 5在FrontierMath最難級別上達到88%的準確率,較2026年初Opus 4.5低於10%的成績有巨大飛躍。OpenAI的GPT-5.5在同一級別上約為75%。AI數學能力的提升速度正在加快。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
Model Due Diligence 是一個 Python 命令列工具,用於對本地 AI 模型檔案和克隆的模型倉庫進行靜態供應鏈盡職調查,幫助使用者在匯入模型前識別明顯的風險指標。它檢查檔案清單、雜湊值、高風險序列化格式、可疑文本和程式碼模式、Git 來源等,並生成人類可讀的 Markdown 報告和自動化 JSON/SARIF 報告。工具不載入模型權重或執行程式碼,風險評分從 0 到 100 分。
Meta內部備忘錄顯示,僅內部使用的AI成本就將達到數十億美元。從2027年起,將透過預算、分配和名為“AI Gateway”的中央儀表板來管理代幣消耗。CTO Andrew Bosworth直言:“並非所有行動都是進步,代幣使用量本身不能衡量任何影響。”
美國政府利用出口管制工具,未經公開標準或申訴程式,強制Anthropic召回其前沿模型Fable 5和Mythos 5。作者在模型被關閉前與其進行了對話,揭露了政府不透明的決策過程,以及此舉對AI透明度和經濟穩定的潛在影響。
本文提出了名為“歐洲2031”的情景,描述了歐洲在AI政策上的失誤如何導致其在2031年前經濟和政治上被邊緣化。文章從2025年講起,勾勒了一系列事件,強調大規模投資、聯盟建設、勞動力改革和積極願景的必要性。
Visa與OpenAI合作,為AI代理交易提供安全支付處理。專家警告,儘管有安全措施,但代理支付存在新風險,如未經授權的交易和責任模糊。
Anthropic在收到美國商務部指令後,緊急關閉了剛釋出的Mythos 5和Fable 5模型,這些模型被納入出口管制。政府擔憂存在突破安全防護的越獄攻擊,但Anthropic稱證據僅顯示微不足道的漏洞。
Meta新成立的Applied AI部門引發員工強烈不滿,工作被形容為“靈魂折磨”。超過1600名員工請願反對監控措施,扎克伯格承認錯誤並承諾穩定,但士氣已降至歷史低點。
月之暗面AI釋出了擁有1萬億引數的開源模型Kimi K2.7 Code,專為程式設計設計。雖在編碼基準測試中仍落後於GPT-5.5和Claude Opus 4.8,但價格僅為它們的幾分之一。關鍵問題不在於它是否是最好的模型,而是相同預算下,額外的執行次數能否彌補質量差距。
Validates AI 是一個用於驗證人工智慧相關內容的網站。
畢馬威一份關於代理型AI的報告被發現包含大量AI生成的虛假引用和誤導性案例,其中45條引用僅5條真實。GPTZero指出這種現象為“氛圍引用”,並警告其可能造成錯誤資訊的全球傳播。
Whissle Gateway是一個輕量級的Docker容器,僅需一個命令即可在本地執行多模態語音AI,包括ASR、TTS、語音通話、說話人識別、後設資料分析及AI輔導等功能。模型自動下載,無需雲依賴,支援多種硬體配置。
Anthropic 根據美國政府的出口管制指令,停用了其兩款最強大的模型 Claude Fable 5 和 Mythos 5。該指令於2026年6月12日生效,禁止任何外國國民訪問。由於無法即時區分外國使用者,Anthropic 選擇對所有使用者關閉這兩個模型。其他所有 Anthropic 模型,包括 Opus 4.8,仍然可用。Anthropic 表示該指令可能是基於誤解,並正努力恢復訪問。
theta_py 是 Theta 命令列工具的 Python 繫結,使開發者能夠以程式設計方式建立和管理 AI 代理專案,包括新增規則、工具和技能,同步專案狀態,以及將專案部署到 Claude Code 等平臺。專案提供了高階的 ThetaProject 類和低階函式,幷包含錯誤處理和版本鎖定功能。
美國政府以“越獄風險”為由,命令Anthropic停止Claude Fable 5和Mythos 5的全球服務。Anthropic在遵守的同時公開反駁,稱漏洞很小且同樣存在於GPT-5.5等競品模型中,並警告此舉可能開創先例,阻礙前沿部署。
Drinkner是一款工具,讓您選擇自己的酒類原料,然後生成您可以實際調變的雞尾酒配方,匹配102種IBA經典雞尾酒。當您缺少某種原料時,AI會提供替代方案。
新研究估計前沿AI模型在沒有思維鏈的情況下能進行多長時間的推理,發現每373天翻一番,到2030年可能達到約25分鐘的隱藏推理,引發對監控有效性的擔憂。
Anthropic釋出了一個被認為過於危險的模型,作者用它一次性建立了夢想中的遊戲《牧羊犬》。模型耗時45分鐘、花費超過20歐元,生成了一個2319行、零依賴的HTML遊戲。
Kimi K2.7 Code 是最新發布的程式設計模型,具備長時域編碼、256K超長上下文和強大推理能力,支援多模態工具呼叫。本文詳細介紹其特性、使用示例及最佳實踐。
Moonshot AI 開源了 Kimi K2.7-Code,這是一個專注於編碼的智慧體模型,基於 Kimi K2.6 構建,擁有 256K 上下文視窗,推理 token 使用量降低約 30%。在六個基準測試中均優於 K2.6,其中 Kimi Code Bench v2 提升 21.8%。模型可透過 Kimi API 和 Kimi Code 使用。
Anthropic在釋出僅3天后,因美國政府指令撤回Claude Fable 5和Mythos 5模型,引發“模型主權”爭論。同時,開源社群釋出Kimi K2.7-Code和MiniMax M3模型,基準測試和代理基礎設施也有重要更新。
荷蘭自由黨(PVV)未經許可使用法院素描師佩特拉·烏爾班的畫作,並用AI將其修改得更加兇惡,現已向該藝術家支付賠償。該畫作描繪了兩名因謀殺姐妹被判刑的敘利亞兄弟。
作者提議用“aigents”代替“AI agents”,以避免歧義並簡化術語。
中國國家安全部警告使用西方AI模型存在安全風險,同時美國企業因成本優勢紛紛採用中國開源模型。雙方在AI領域相互牽制,使用者繞道訪問對方模型的現象加劇了技術博弈。
本教程介紹了使用city2graph構建端到端空間圖學習流水線的方法,用於城市功能推斷。它從OpenStreetMap收集興趣點(POI)和街道網路資料,設計了合成資料回退機制以確保可靠性。接著,工程化空間特徵,構建多種近鄰圖家族(如KNN、Delaunay、Gabriel等),並比較它們在表示同一城市環境時的差異。然後,同時構建異質圖和同質圖,轉換為PyTorch Geometric格式,並訓練GraphSAGE模型根據空間結構預測POI類別。整個工作流整合了地理空間資料處理、圖構建和GNN訓練,提供了一個實用的實現範例。
Babel是一個匿名語音通話平臺,隨機配對陌生人,雙方可選擇各自說和聽的語言,透過即時AI翻譯實現雙向同步翻譯。該應用85%的功能由一次性的MVP使用前沿模型和API完成,即時WebRTC經過除錯實現。
文章認為,開源AI對於維護公眾對智慧基礎設施的控制至關重要。它警告AI不要成為少數公司控制的訂閱服務,並強調AI必須可用、可理解、可複製、可本地部署、經濟可行且由社群治理。
美國聯邦政府釋出出口管制指令,以國家安全為由要求Anthropic立即停用Fable 5和Mythos 5模型。Anthropic雖有異議,但為合規已全面關閉模型,並表示該指令缺乏具體細節,僅基於一個聲稱的越獄演示。
這是一篇使用者生成的內容,未經驗證。標題為“Hasta Pronto — 一封AI告別信和互動紀念”,由Claude建立。
AccInt展示了一種AI編碼代理的工作模型,該模型透過逐步推理和持續學習,在招聘流程中實現了高效、高質量的執行。代理從搜尋候選人到傳送定製訊息的每一步都經過驗證,拒絕批次操作,並堅持只向指名候選人傳送。九周後,代理能在6分鐘內完成招聘任務,大部分工作為已驗證的重複操作。系統從每次執行中學習,例如發現資深工程師更重視事後分析而非福利,以及特定時間段傳送訊息的回覆率是其他時間的兩倍。