AI News HubLIVE

AI 新聞即時情報

即時監測

今天 AI 世界最重要的變化

來自 105 個可信來源,最近更新 2026-05-20 12:00 UTC+8。

即時監測

即時更新

即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。

即時更新

重設
用於Transformer模型壓縮的魯棒基樣條解耦方法

本文提出了一種基於B樣條的解耦框架R-CMTF-BSD,透過約束耦合矩陣-張量分解與魯棒交替最小二乘演算法,實現Transformer模型引數的大幅壓縮,同時保持精度。在Vision和Swin Transformer上的實驗表明,該方法能顯著減少引數並維持競爭性準確率。

arXiv Machine Learning模型 / 研究站內正文
維度平衡提升大規模時空預測效能

該研究透過空間和時間熵度量診斷時空複雜度不匹配,提出可擴充套件自適應框架,壓縮空間維度並擴充套件時間範圍,在交通、氣象和疫情資料集上顯著提升預測精度。

arXiv Machine Learning模型 / 研究站內正文
DecisionBench:長視界智慧工作流中的新興委託基準

DecisionBench 是一個用於評估長視界智慧工作流中新興委託能力的基準平臺。它固定了任務套件(GAIA、tau-bench、BFCL multi-turn)、模型池(11個模型,來自7個供應商家族)、委託介面(call_model及可選的read_profile通道)、確定性技能標註層以及多維指標套件(覆蓋質量、成本、延遲、委託率、路由保真度、供應商自我偏好及反事實委託上限)。該基準框架不依賴於代理資訊的生成或傳遞方式,因此可評估學習型路由器、富代理記憶、自適應配置檔案構建以及多步委託等方法。研究團隊在完整模型池上進行了五次條件參考掃描,共涉及23,375個任務例項。主要發現包括:(i) 在四種感知條件下,平均終端任務質量在統計上無顯著差異(|β| = 0.21),因此僅評估質量會忽略關鍵的編排訊號;(ii) 在平均質量接近的情況下,路由保真度(top-1)在7.5%到29.5%之間變化,且傳遞渠道(按需工具 vs. 預載入描述)對結果的影響大於描述內容本身;(iii) 反事實上限表明,完美委託在每項任務套件上的效能比當前測量值高出15到31個百分點,揭示了未來編排方法巨大的未開發空間。研究團隊已公開發布該基準平臺、標註層、參考干預套件、分析流水線以及220個按條件執行的存檔。

arXiv AIAgent / 研究站內正文
干擾感知的多工遺忘學習

機器遺忘學習旨在從訓練模型中移除指定資料的影響,同時保持其餘資料上的效能。現有研究主要集中於單任務場景,而現代模型往往在共享主幹的多工設定中執行,移除一個任務或例項的監督可能會無意中影響其他任務。本文介紹了多工遺忘學習的兩種設定:全任務遺忘和部分任務遺忘,並提出了一種干擾感知框架,結合任務感知梯度投影和例項級梯度正交化,有效減少了任務間和例項間的干擾。實驗表明,該方法在兩種多工計算機視覺基準測試中,相比最強基線,在全任務遺忘中降低了30.3%的UIS,在部分任務遺忘中降低了52.9%。

arXiv AI研究站內正文
可信代理網路:代理網路中的信任必須內建,而非外掛

一篇新的願景論文認為,代理到代理(A2A)網路中的信任無法透過改造現有的個體代理對齊技術來實現。相反,信任必須從協調框架一開始就進行架構設計。該論文提出了一個包含四個設計支柱的概念框架,以應對系統性漏洞,如對抗性組成、語義不對齊和級聯操作故障。

arXiv AI模型 / Agent / 研究站內正文
KAN-MLP-Mixer:Kolmogorov-Arnold網路用於改進基於IMU的人體活動識別的綜合研究

本研究提出一種混合架構KAN-MLP-Mixer,結合Kolmogorov-Arnold網路(KAN)的精度與多層感知機(MLP)的噪聲魯棒性和效率,用於基於IMU的人體活動識別(HAR)。在8個公開資料集上,混合模型相比純MLP模型平均宏F1分數提升5.33%,顯著優於單獨的KAN和MLP基線。該策略還能一致提升其他先進HAR架構的效能。

arXiv AI模型 / 研究站內正文
AgentNLQ: 一種面向自然語言到SQL的通用智慧體

本研究提出一種多智慧體方法AgentNLQ,在BIRD基準上實現了78.1%的語義準確率,透過語義增強的架構表示和業務規則生成準確SQL查詢,其關鍵創新包括最佳化編排器、先進架構增強方法,並證明了其跨域泛化能力。

arXiv AI模型 / Agent / 研究站內正文
Learn-by-Wire訓練控制治理:有界自主訓練在壓力下的穩定性和效率

本文提出Learn-by-Wire Guard(LBW-Guard),一種在AdamW之上執行的有界自主訓練控制治理層,透過觀察訓練遙測、解釋不穩定敏感區域並施加有界控制,在不替換最佳化器的情況下提升大型語言模型訓練的穩定性和效率。在Qwen2.5系列模型上的實驗表明,LBW-Guard可將7B模型的最終困惑度從13.21降至10.74(改善18.7%),同時端到端訓練時間減少約10%。在強學習率壓力下,AdamW完全退化,而LBW-Guard仍能保持可訓練性,困惑度維持在11.57和10.33。

arXiv AI模型 / 政策 / 研究站內正文
評估個人健康記錄在個性化健康AI中的效用

該研究評估了大型語言模型(Gemini 3.0 Flash)在提供個人健康記錄(PHR)上下文時回答使用者健康查詢的能力。使用了2257個查詢和1945份去標識化的PHR,比較了無上下文、基本摘要和完整臨床筆記三種條件下的回答。結果表明,使用PHR資料後,所有型別查詢的回答幫助性顯著提高,並在安全性、準確性、相關性和個性化方面有所提升。同時,新開發的評估框架發現了LLM在理解複雜PHR時的不足,如時間混淆和罕見但重要的幻覺。

arXiv AI模型 / 政策 / 研究站內正文
文件AI生產化:面向OCR與LLM管線的微服務架構

本文提出一種微服務架構,將分類、光學字元識別(OCR)和大語言模型結構化欄位提取管線封裝在一起,並分享了每小時處理數千份多頁文件的生產經驗。關鍵設計包括混合分類、GPU與CPU分離、非同步I/O處理及獨立水平擴充套件。批處理分析揭示兩個意外發現:OCR主導端到端延遲,系統併發由共享GPU推理容量而非工作程序數決定。

arXiv AI模型 / 晶片 / 研究站內正文
將隱性知識轉化為運營績效

製造業勞動力老齡化導致關鍵操作知識流失。本文探討如何利用生成式AI將專家經驗轉化為結構化數字工作指令,從而減少缺陷、提高產量,並確保知識傳承。

Emerj AI ResearchAgent / 晶片 / 政策站內正文
【AINews】Google I/O 2026:Gemini 3.5 Flash、Omni(NanoBanana 影片)、Spark(後臺代理)和 Antigravity 2.0

Google I/O 2026 釋出了 Gemini 3.5 Flash(具備 100 萬 token 上下文、65k 最大輸出、四種思考級別和跨輪思考保留,現已正式可用)、Gemini Omni(用於影片生成和編輯的多模態系列)、Antigravity 2.0(包括桌面應用、CLI、SDK 和託管代理),以及 Search 中的生成式 UI 和後臺資訊代理。谷歌聲稱每月處理 3.2 萬億 token,同比增長 7 倍,Gemini 月活使用者達 9 億。

Latent Space模型 / Agent / 晶片站內正文
生成式AI與藝術的不相容性:與特德·姜的問答

特德·姜在普林斯頓大學的演講中探討生成式AI與藝術的不相容性,認為AI被資本主義用於榨取價值,而人文教育的目標是培養超越工廠工人的畢業生。他質疑AI對創意寫作的幫助,比喻用ChatGPT寫論文如同在舉重房開叉車,並建議學生將作業視為腦力訓練。此外,他稱讚電視劇《安多》是對抗法西斯主義的深刻描繪。

Hacker News AI研究站內正文
為何“快速AI”與“安全AI”從未衝突

AI治理並非減緩採用,而是實現規模化AI的關鍵。快速AI與安全AI的誤判二分法透過認識到安全能透過信任加速部署而得以解決。

Hacker News AIAgent / 政策站內正文
企業AI:神秘程式碼、殺傷區、認知投降、氛圍炸彈

企業AI專案的高失敗率源於缺乏專門最佳化AI系統的企業級架構。員工使用消費級聊天機器人導致敏感資訊洩露。所謂的“氛圍編碼”生成大量漏洞程式碼,造成未來不可預測的安全隱患。

Hacker News AI政策 / 研究站內正文
第二天在TechEx North America證明價值

TechEx North America第二天聚焦AI和大數據,討論了AI實驗難以轉化為持久系統的“AI墓地”現象,強調從實驗到實際影響的轉變。會議涵蓋企業AI實施、投資回報、代理式AI、治理和信任等主題。

Artificial Intelligence NewsAgent / 政策站內正文
GPU遙測異常:A100閒置功耗達146瓦(白皮書)

一份白皮書揭示,NVIDIA A100 GPU在報告利用率0%的情況下,功耗可達146.66瓦,暴露了GPU遙測中的關鍵盲點。作者提出新的能效基準(CEI)和開源最佳化器來檢測此類“幽靈”異常。

Hacker News AIAgent / 晶片站內正文
蘇姿豐上海開講:AI正在重新定義計算的每一層

AMD AI開發者大會首次落地上海,CEO蘇姿豐指出AI正在重新定義計算的每一個層次,競爭焦點從模型能力轉向系統工程與全棧最佳化。中國在開放生態中領跑,AMD持續加碼中國開發者生態建設,提供從雲端到端側的全棧算力方案,以ROCm開源平臺為核心,幫助開發者應對Agent時代的新挑戰。

量子位Agent / 晶片站內正文
StartupStarter – 我們構建了公司大腦,讓AI為你工作

StartupStarter 是一個為創始人打造的AI原生作業系統,整合CRM、郵箱、智慧體、文件、財務和融資於一體。其AI助手S2X能學習業務運作,自動化任務,如管理郵箱、草擬回覆、處理交易、準備資料室等。平臺還提供關係智慧、自適應學習和持續訊號處理功能。

Hacker News AIAgent / 政策站內正文
你的一切行為都在被記錄

隨著AI可穿戴記錄裝置的興起,隱私保護面臨新挑戰。從黑手黨的反監聽措施到現代技術對抗,文章探討了監控與反監控的軍備競賽,並指出科技巨頭可能在這場博弈中佔據上風。

Hacker News AI政策 / 研究站內正文
谷歌首款AI智慧眼鏡今秋釋出,支援iPhone

谷歌宣佈首款AI智慧眼鏡將於今秋釋出,與三星、Gentle Monster和Warby Parker合作。眼鏡執行Android XR,配備攝像頭、揚聲器和麥克風,但無顯示鏡片。整合Gemini AI,支援識別物體、導航、通話、訊息、音樂、拍照、即時翻譯等多種功能,並能與iPhone配合使用。蘋果自家AI眼鏡預計2027年才推出。

Hacker News AI工具站內正文
今日Hacker News的爬蟲使用者代理一覽

本文展示了一份今日爬取Hacker News的使用者代理列表,包括各類瀏覽器、搜尋引擎爬蟲、AI機器人以及自定義爬蟲,反映了HN內容的廣泛影響力。

Hacker News AIAgent / 研究站內正文
在Applied Compute擴充套件強化學習

Applied Compute 使用強化學習為企業(如 DoorDash、Cognition、Mercor)訓練定製 AI 代理,並在 Modal 上執行。其核心理念是“特定智慧”:透過專有資料訓練,每次使用都能改進。本文介紹了他們的 RL 訓練迴圈、基礎設施選擇以及 Modal 如何提供靈活性、效能和可靠性。

Modal BlogAgent / 晶片站內正文
OpenAI教育國家計劃的新階段

OpenAI推進教育國家計劃,透過新的合作伙伴關係、教師培訓和工具,擴大AI在學校中的應用,以改善全球學習成果。

OpenAI News工具站內正文
OpenAI模型推翻離散幾何核心猜想

OpenAI的一個模型成功解決了困擾數學界80年的單位距離問題,推翻了離散幾何中的一個重要猜想,標誌著人工智慧在數學研究領域的里程碑。

OpenAI News模型站內正文