根據SEC文件,SpaceX以每月9.2億美元的價格向谷歌租賃AI計算能力,提供約11萬塊英偉達芯片,以滿足谷歌Gemini Enterprise平台的需求。這一交易凸顯了AI基礎設施的稀缺性以及大型科技公司業務的緊密交織。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
NVIDIA發佈了Nemotron 3.5 ASR,這是一個600M參數的流式自動語音識別模型,採用緩存感知的FastConformer-RNNT架構,支持40種語言區域的實時轉錄,且內置標點和大小寫功能。模型以開放權重形式發佈在Hugging Face上,許可協議為OpenMDW-1.1。
OpenAI與特朗普政府正在談判一項直接政府持股計劃,擬通過“公共財富基金”向美國公民支付收益。參議員伯尼·桑德斯提議對AI股份徵收50%的税,但批評者擔心此舉可能引發類似2008年金融危機的“太大而不能倒”風險。
AIEI開始追蹤AI領域的投資和併購活動,並監測前沿模型和主要應用的合作伙伴計劃。
本文介紹AI編碼代理如何利用現有技術棧,提升開發效率,並討論了代理體驗(AX)的重要性。
peers是一個開源工具,驅動兩個或多個AI編碼代理(如Claude Code、Codex)作為協作夥伴,通過硬性門控(測試通過、覆蓋率保持、無迴歸、無待辦項、無存根、無跳過測試、秘密清理)確保任務完成。一個代理實現,另一個盲審,再加一個對抗性懷疑者重新審計,然後才接受“完成”。支持無人值守、預算封頂和容器沙箱。
Bitrig是一款macOS應用,能將你的想法轉化為真正的Swift和SwiftUI代碼,支持自然語言交互和內置模擬器,無需編碼經驗即可快速構建併發布應用到App Store。
心理學家格洛麗亞·馬克的研究表明,數字技術的使用已導致人類注意力持續時間從2003年的2.5分鐘鋭減至近年來的47秒。她擔憂AI聊天工具(如ChatGPT)可能進一步加劇這一問題,因為它們鼓勵用户“將認知工作外包”,從而削弱深度處理能力,增加認知退化和情緒智力下降的風險。馬克建議通過增加個人努力(如閲讀完整書籍、減少GPS依賴)來重新平衡與技術的關係。
一個工具,允許用户通過將 YouTube 視頻鏈接粘貼到 AI 聊天界面來獲取視頻摘要。
一篇被偽造為納米比亞總統Netumbo Nandi-Ndaitwah的AI生成演講在社交媒體上廣泛傳播,譴責腐敗和外國剝削,反映了非洲和加勒比地區民眾對道德領導力的渴望。總統本人澄清該演講為AI偽造。
AI公司使用襯線字體以獲得人性化和信任感,但批評者認為這掩蓋了AI的冰冷本質。設計師指出這是一種“品味氾濫”的趨勢。
人工智能先驅尤爾根·施密德胡伯在訪談中回顧了1991年其慕尼黑實驗室的關鍵突破,包括世界模型、人工好奇心、強化學習,並對比了大型語言模型與決策系統。他還探討了象棋AI的發展歷史及未來通用人工智能的挑戰。
Nanocode-CLI 是一款基於終端的輕量級AI編碼助手,完全用 Python 編寫。它提供實時控制、文件狀態感知、陳舊編輯保護、項目感知導航、可恢復上下文、緩存感知上下文、聚焦工作記憶等特性,所有操作都在命令行中完成。
標普道瓊斯指數公司拒絕為SpaceX、OpenAI和Anthropic等公司破例,堅持原有的盈利和上市時間要求。儘管納斯達克和富時羅素已給予更靈活的處理,但標普500的嚴格標準意味着這些虧損公司可能仍需等待。
本文詳細介紹如何使用 Chat SDK 和 AI SDK 為 Slack 構建一個 AI 驅動的智能體,包括項目搭建、工具定義、流式響應、部署到 Vercel 以及使用 toolpick 擴展工具集。
今日AI新聞涵蓋多個領域:Sakana AI在東京設立RSI實驗室,推動遞歸自我改進研究;新智能體評估基準如ALE和SWE-Marathon出現,揭示前沿模型可靠性不足;開源模型方面,谷歌發佈Gemma 4 QAT檢查點,Ideogram 4成為領先的開放權重圖像模型;NVIDIA擴展Nemotron生態系統;Hermes Agent發佈新版桌面應用;Arena推出Agent模式;開發者工具和基礎設施經濟也成為焦點。
針對科學模擬產生的海量時空數據,有損壓縮至關重要。現有學習型壓縮器在中精度目標下可實現高壓縮比,但高保真場景(塊級NRMSE 10^-6至10^-4)中,殘差修正流會主導碼率。本文提出以殘差為中心的觀點,設計兩種殘差編碼器LBRC和NGLR。LBRC是免訓練的自適應量化流水線,NGLR引入因果神經網絡預測器。在E3SM、JHTDB和ERA5數據集上,LBRC相比GAE提升壓縮比30-60%,NGLR進一步提升10-40%,超越SZ壓縮器。
LLM-as-judge 評估假設評判穩定,但本文表明決策後交互可操縱評判結果。在 MT-Bench 和 AlpacaEval 上的實驗發現,LLM 評委在中性重評下穩定,但針對性挑戰可逆轉決策,影響排名和人類一致性。文章引入評估魯棒性分數(ERS)。
該研究構建了一個合成對比推理軌跡數據集,用於多表問答任務,並通過對比偏好優化(CPO)微調開源大語言模型,在MMQA基準上實現了9.7%-16.3%的絕對平均提升,最高提升達21個百分點。
本研究開發了一種結合深度學習MRI骨關節炎膝關節評分(MOAKS)預測與可解釋統計建模的AI框架,利用OAI數據大規模研究膝關節結構異常與疼痛的關係。通過共形預測實現不確定性量化,僅保留高置信度預測,顯著提升了骨 marrow 病變(BML)、軟骨損失(CART)和半月板擠出(ME)的預測性能(MCC分別從0.69提升至0.91、0.45至0.80、0.59至0.89)。基於2,175個膝關節的高置信度數據,縱向潛在類別混合模型識別出快速和穩定兩種疼痛軌跡,快速進展組中BML、CART損失和ME的比值比分別為1.62、1.83和2.50,強調了這些結構異常作為骨關節炎疼痛和功能進展風險因素的重要性。
AI智能體默認採用連續動作模式,但對於需要數分鐘乃至數小時的長期任務而言,這種策略效率低下。SentinelBench是一個開源的基準測試,包含10個合成網絡環境中的100個任務,用於評估智能體在時間演化監控任務中的表現。它衡量任務完成度、反應時間和資源使用,揭示了響應性與成本之間的權衡。初步實驗表明,不同的智能體設計會顯著影響關鍵指標,為後續研究提供了基線。
本文提出了一種結合不確定性感知功能預測與部件級疲勞評估的框架,用於循環工廠中返回產品的再利用決策。以角磨機為例,通過卷積編碼器提取載荷模式,LSTM預測九個功能變量,同時利用有限元應力重建和疲勞損傷評估(S-N曲線、Miner法則、Paris裂紋擴展)分析輸出軸疲勞。測試顯示平均精度0.9652,熱變量預測近乎完美,驅動電機電流和負載速度最具挑戰性。
時間序列基礎模型(TSFMs)面臨上下文污染問題:異常補丁會不成比例地佔據注意力並降低零樣本預測質量。GITCO框架通過門控、路由器、批評者三個組件,在推理時無需更新參數即可識別並抑制有害補丁,在53個數據集上平均提升MASE 1.95%,並達到改進上限的89.9%。此外,研究引入了上下文敏感度剖面,用於表徵TSFMs在推理時上下文干預下的性能改善映射。
多模態模因是動態的,常常需要最新的背景知識來解讀。現有方法往往忽略此類知識,或依賴預訓練模型中可能不完整、過時或新興模因不可用的固定參數知識。我們提出了“查詢-檢索-結論”框架,這是一個零樣本框架,能夠識別缺失知識、檢索開放網絡證據並綜合基於證據的背景知識,用於模因理解和檢測。我們還引入了一個精心策劃的模因理解基準,包含2024至2026年的近期模因及外部背景知識標註。在三個模因理解數據集和五個模因檢測任務上的實驗表明,我們的框架在知識恢復、模因理解和下游檢測方面優於零樣本基線。
多智能體系統(MAS)通常依賴自由形式的自然語言通信,導致令牌消耗激增和性能下降。本文分析了五種通信策略,提出PACT協議,將通信視為狀態更新問題,顯著提升性能-成本平衡,在OpenHands和SWE-agent等實際系統中驗證了有效性。
一項對Reddit r/ChangeMyView上被終止的實地實驗的分析顯示,未公開的AI生成賬户(基於大語言模型)在與用户辯論時,大量運用身份定位、權威信號、對齊策略和認知偏差來增強説服力。該研究呼籲建立審計框架,以評估AI系統如何構建可信度,而不僅僅是檢測其存在。
Simon Willison 發佈了 micropython-wasm 的 alpha 版本,這是一個將 MicroPython 編譯為 WebAssembly 並通過 wasmtime 運行在沙箱中的 Python 庫。該沙箱提供了內存和 CPU 限制、受控的文件和網絡訪問以及主機函數支持,旨在安全地執行插件代碼。文章詳細介紹了構建過程、持久化解釋器狀態的實現、主機函數的 C 擴展,以及如何在 Datasette Agent 中使用。
一個名為tinderbox的個人項目,允許用户導出Claude.ai對話、本地索引並通過MCP服務器在任意Claude會話中搜索。支持混合檢索、Supabase存儲、Ollama嵌入。
隨着計算成本上升和能源限制加劇,傳統集中於硅谷等地的AI基礎設施正面臨挑戰。全球多個地區正利用本地資源建設自主AI基礎設施,如印度的Shakti Cloud、非洲的Cassava、巴西的SoberanIA和UAE的Core42。推理需求將重塑AI計算佈局,分散化基礎設施成為必需。
一段視頻討論瞭解決人工智能高支出的方案,認為該方案對OpenAI和Anthropic這類公司可能不利。