從基於座位許可到混合及消費型AI定價的快速轉變,使得企業技術支出更加難以預測和控制。Adam Mansfield探討了新定價模式如何為買家帶來財務風險,以及為何在主要供應商談判中,清晰的預測、透明度和槓桿作用越來越難以實現。他強調了領導者現在必須採取的實際步驟——從審計當前使用情況、識別未充分利用的支出,到儘早與供應商接觸並利用更廣泛的市場環境。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
亞馬遜雲科技技術總監王曉野在2026中國AIGC產業峰會上指出,87%的企業宣稱大規模部署AI,但僅10%獲得實際價值。他強調了個人與企業級Agent落地的巨大差異,提出企業需要關注算力、模型、資料、Agentic平臺和應用五層能力,並指出Token貴往往是因為餵給模型過多無用資訊。
輝達正式宣佈RTX Spark晶片系列,這是其首款面向消費PC的完整計算晶片,將用於筆記本和迷你PC。該晶片基於ARM架構,整合CPU、GPU和AI引擎,號稱能效最高,並支援本地執行大型AI模型。微軟等多家廠商已宣佈推出搭載該晶片的裝置。
深度原理Deep Principle釋出材料基座模型MPA,採用大語言模型的三階段訓練方法,在40個真實工業任務資料集上取得SOTA。MPA透過中期訓練實現物理對齊,並設計混合讀出頭,在預測陌生結構時優勢顯著,標誌著AI for Science領域的重要突破。
當Wix、Snap和Block等公司以AI為由宣佈裁員時,麻省理工學院管理學教授保羅·奧斯特曼表示,這只不過是公司為裁員尋找的藉口,他認為“AI洗白”(AI washing)現象已經持續了20年。
NVIDIA AI雲生態系統正在全球加速建設AI工廠基礎設施,合作伙伴擴充套件容量以滿足企業、初創公司、國家、AI實驗室和開發者對代理式AI應用的需求。這些雲服務與NVIDIA全棧AI基礎設施共同設計,支援訓練、微調、推理、物理AI和主權AI部署。
NVIDIA在GTC Taipei上釋出工廠運營藍圖(FOX),這是一個構建自主工廠管理代理的參考設計,整合即時資料、質量控制、工作指令和運營警報,實現工廠範圍的智慧化。藍圖基於NVIDIA NemoClaw、AI-Q和Nemotron開放模型,可連線工廠系統、自動化模型訓練和執行智慧工作流。臺灣製造商如富士康、和碩、研華和緯創已率先部署,預計可大幅提升生產效率、降低成本。
臺灣擁有超過500家輝達生態系統合作伙伴,超過100萬個用於輝達Vera Rubin基礎設施的MGX機架元件來自臺灣25個工廠。隨著Vera Rubin全面投產以支援全球AI工廠,生態鏈覆蓋從晶圓和晶片合作伙伴(如臺積電、日月光等)到製造和系統領導者(如富士康、廣達等)。這些夥伴不僅建設AI工廠,還將加速計算、模擬、AI智慧體及物理AI應用於自身運營,提高製造效率。臺積電利用CUDA-X庫和AI模型改進光刻和工藝;富士康基於輝達工廠運營藍圖構建MoMClaw智慧體,預計根因分析提速80%,生產率提升15%;廣達使用Omniverse數字孿生加速工廠規劃;緯創透過Omniverse DSX實現佈局分析提速70%並降低電力需求;和碩採用缺陷影像生成智慧體減少AI視覺檢測部署時間67%;英業達透過合成缺陷資料縮短AI部署時間約25%。
為了便捷和速度,我們正在削弱連線和組織社會的能力。我們必須堅持信任人類而非機器。文章透過作家史蒂文·羅森鮑姆的案例,揭示了AI在研究中產生虛假引用的風險,並警告人們應警惕AI的侵蝕。
超過100個難民兒童組織聯合批評英國政府計劃使用AI面部年齡估算技術評估年輕尋求庇護者的年齡,認為此舉可能導致更多兒童被錯誤地送入成人監獄或拘留中心。
Hephaestus' Forge 是一個自託管的Web應用,透過5階段引導式嚮導對您的想法進行訪談,並生成一份完整的、可立即投入構建的文件包,包括專案藍圖、PRD、技術規範和估算,可直接作為上下文提供給AI編碼代理。它支援多種AI引擎(Claude Code、Codex、Gemini CLI、Ollama等),100%本地執行,注重隱私,開源(MIT),並且多語言支援。
NVIDIA釋出RTX Spark超級晶片,專為個人AI代理設計的Windows PC,提供1 petaflop AI效能和128GB統一記憶體。與微軟合作確保安全本地執行,支援120B引數大語言模型、大型3D渲染和高階遊戲。Adobe等軟體廠商正為其最佳化應用,搭載RTX Spark的筆記本和桌面電腦將於今年秋季上市。
NVIDIA 釋出了 Cosmos 3,這是一個開放的世界基礎模型,結合了視覺推理、多模態生成和動作預測,使機器人、自動駕駛汽車和視覺AI代理能夠理解並預測現實世界中的變化。該模型採用混合變換器架構,能夠生成合成影片、機器人動作資料等,並支援從智慧城市到工業自動化等多種應用。Cosmos 3 在多項基準測試中排名第一,並已開放獲取。
Simon Willison釋出了2026年5月的贊助者專屬月度通訊,內容包括AI成本上升、Anthropic表現強勁、模型釋出令人失望、Datasette Agent釋出等。
NVIDIA釋出了Cosmos 3,這是一個統一的世界基礎模型,結合了世界生成、物理推理和行動生成。該模型基於混合Transformer架構,支援多種輸入和輸出模態,包括文本、影像、影片和動作。提供兩個版本:Cosmos 3 Nano(8B引數)和Cosmos 3 Super(32B引數),並已整合到Hugging Face Diffusers庫中。同時釋出了多個用於物理AI的合成資料生成資料集。
Parallax是一種新型注意力機制,保留Softmax注意力並新增一個學習的協方差修正分支,替代了區域性線性注意力(LLA)中的逐查詢求解器。它透過重用FlashAttention的鍵值流,將算術強度提高一倍,並在0.6B和1.7B規模的LLM預訓練中實現了更低的困惑度。然而,其優勢高度依賴於Muon最佳化器,在AdamW下增益顯著縮小。
NVIDIA 在 COMPUTEX 臺北 GTC 上釋出了 RTX Spark——專為個人智慧體打造的新型 Windows PC,並帶來一系列更新,將本地智慧體擴充套件至整個 RTX 和 DGX 生態系統。RTX Spark 擁有 1 petaflop AI 算力和 128GB 統一記憶體,支援安全、私密的本地執行。NVIDIA 與微軟合作,透過新的 Windows 安全基元與 OpenShell 執行時,為智慧體提供身份、策略和隱私保護。同時,llama.cpp 和 vLLM 等開源專案獲得效能最佳化,推理速度提升最高 2.6 倍。Adobe 也將為 RTX Spark 重新架構 Premiere 和 Photoshop,提供更快的 AI 加速創作體驗。
ZAPS-DA是一種新框架,透過解耦執行器與零相位濾波,在不引入相位延遲和後處理的情況下,顯著降低強化學習連續控制策略的高頻動作抖動,在駕駛模擬器中實現14-21倍的轉向抖動減少,且任務成功率幾乎不變。
ARISTO手是一種腱驅動機械手,透過主動遠端過度伸展和混合指尖感測架構(剛性指甲安裝力-扭矩感測器與軟電容觸覺陣列),將薄物體的拔出力提高了2.76倍,併成功完成SD卡插拔任務。
VLM-GLoc提出一種利用開放詞彙視覺語言模型(VLM)作為統一語義觀測前端的分層語義蒙特卡洛定位方法。該方法在幾何模糊且準靜態的環境(如雜貨店、辦公室等)中,透過提取區分性文本特徵、隱式質量過濾和永續性推理實現資料增強,並引入逆語義提議機制。在3500平方英尺雜貨店和3700平方英尺實驗室的實驗中,分別達到70%和74%的全域性定位成功率,顯著優於傳統方法。
CoMo3R-SLAM是首個協作式單目密集RGB SLAM系統,利用學習的前饋三維重建先驗實現戶外多智慧體地圖構建。每個智慧體執行先驗引導的前端進行即時跟蹤和區域性密集融合,協調器執行密集點雲匹配、閉環Sim(3)同步和GPU加速的全域性束調整。無需深度感測器或引數化內參,僅憑單目RGB即可生成魯棒的跨智慧體約束和全域性一致的度量地圖。在Tanks and Temples和Waymo資料集上,CoMo3R-SLAM在四個場景中的三個取得最佳ATE,精度達到或超過最先進的RGB-D方法,同時線上執行速度達8 FPS。
ELAN4D是一個面向機器人操作的訓練框架,透過預測未來機器人關鍵點軌跡為VLA模型提供時空監督,無需額外追蹤器或重建。它採用即插即用的輔助分支,在推理時丟棄,僅依靠前向運動學計算。實驗表明,該方法在多種擾動下均顯著提升基線模型效能。
本文提出了一種結合監督式神經全域性規劃器和學習型DWA區域性規劃器的室內移動機器人導航框架。全域性規劃器透過成本感知的A*專家軌跡訓練,區域性規劃器採用行為克隆初始訓練後經PPO強化學習最佳化。在模擬和真實環境中的實驗表明,該方法能夠生成可行的全域性路徑和可靠的區域性運動指令,實現安全的避障導航。原始碼將公開發布。
本研究透過10個實體機器人的搬運與地圖構建任務,發現將全連線通訊拓撲改為模組化層次結構可使歸一化效能提升47分(0-100分),而將神經網路隱藏層大小加倍最多僅提升9分。巢狀混合效應模型比較顯示拓撲結構對模型擬合的改善遠大於規模擴充套件。結果在獨立SMAC模擬中得到驗證,但異構基準重分析僅提供次要一致性支援。效能在隱藏單元超過1024時出現飽和(基於模擬校準外推)。這表明在所測試的系統和任務中,互動結構可主導效能提升,但更廣泛的定量泛化仍需驗證。
該論文提出了一種隱私優先的視覺監控流水線,所有推理均在邊緣裝置上完成。使用YOLOv5n-seg模型在樹莓派5上透過Hailo-8L加速器進行即時目標檢測,原始畫素緩衝區在推理後立即丟棄。狀態觸發引擎將最小JSON事件載荷傳送至本地執行的Phi-3 Mini大語言模型,生成自然語言警報。整個過程無影像資料跨越網路邊界,符合GDPR資料最小化原則。
研究人員提出了一種名為GCSER-UNet的新型深度學習網路,用於從多模態MRI中精確分割腦腫瘤。該網路融合了空間和通道注意力機制,在TCGA LGG和BraTS 2020資料集上分別達到94%和95%/92%/90%的Dice分數,超越了現有最先進方法。
本研究提出了一種面向北極的超高解析度遙感基礎模型,透過多樣性感知的區域影像篩選和掩碼自編碼器(MAE)自監督預訓練,在Vision Transformer(ViT)上取得了顯著改進。模型在四個北極資料集上相比ImageNet基線提升了5-8%的F1分數,並超越了通用地球觀測基礎模型Prithvi-EO-2.0,凸顯了領域特定預訓練的重要性。
Dex2HOI是一種統一的擴散模型,能夠從文本生成單物件和雙物件的人-物互動(HOI)動作。它採用雙流擴散方法,透過雙向交叉注意力協調雙手操作兩個物體,並引入運動融合網路和手部相對物體表示,實現即時生成任意長度序列,推理速度相比先前最先進方法提升540倍。
本文提出了一種後處理框架,用於融合原始影像與生成式AI增強影像,在保留感知增強的同時強制結構保真度,有效抑制空間錯位、紋理扭曲和內容幻覺。實驗表明,該方法在保持畫素級結構一致性和輸入解析度的同時,更好地保留了美學質量。
本文提出DTG-Restore,一種無需訓練的影片超解析度框架,透過解耦時間引導(DTG)來利用影片擴散模型先驗,增強扭曲和低解析度影片。該方法在更乾淨的擴散時間步評估無條件分支,提供前瞻先驗,保留幾何結構同時抑制扭曲內容的複製。與任何現成的恢復模組即插即用,提升了感知連貫性和結構合理性。同時釋出了包含4400個扭曲480p影片的GenWarp480基準測試,專注於生成式退化如扭曲面部、身體錯位等。實驗表明,該方法在不需重新訓練的情況下顯著提高了結構保真度和時間穩定性。