該論文提出了譜對齊分解,解釋了神經網路損失景觀中曲率指數α為何在不同層型別間變化(卷積層約2,Transformer注意力層約1,MLP上投影層小於1)。該分解將α的變化歸因於Kronecker因子特徵基與梯度奇異方向之間的對齊程度。此外,論文推匯出一個譜傳遞恆等式s=αγ,透過獨立擬合α和γ可高精度預測Hessian衰減指數s。基於此,研究者提出架構自適應預條件子T(σ;α),並展示Spectral Newton最佳化器在視覺基準上超越AdamW。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
短租市場動態定價面臨財務風險高、需可解釋性、反饋稀疏等挑戰。本文提出人機協同門控情感老虎機(HITL-GB)框架,演算法給出價格建議,人類運營人員有權接受、修改或拒絕。研究表明,在審批約束下,歷史定價資料(來自先前確定性策略)在結構上等同於用於初始化情感老虎機後驗的在策略預熱資料,從而避免數週至數月的冷啟動期。在真實短租生產資料(匿名城市市場,2間房,2022年4月至2026年4月,1461個夜間定價場景)上驗證,預熱程式將有效冷啟動從約150個場景壓縮至約30個場景。該方法可推廣至臨床用藥、信貸發放、內容稽核、放射診斷等高風險的監管領域。
本文介紹GAMBLe框架,用於分析AI驅動研究系統(ADRS)。該框架將ADRS行為分解為四個引數(生成器、評估器、發現機制、預算)和一個有效景觀。透過760多次實驗發現,不存在完全的排序,正確的元件選擇可大幅提升效能。
本文提出一種用於嵌入式代理系統的模組化參考架構,透過分層設計將裝置端代理與雲端增強代理解耦,並引入跨層治理層,以解決在資源受限的微控制器上部署大型語言模型(LLM)的挑戰,實現即時控制與自主智慧的融合。
大型推理模型透過增加推理步驟提升效能,但研究表明,在獲得正確答案後繼續推理可能導致偏離,引入有害過度思考的概念。透過字首軌跡評估,發現早期停止正確推理可提升準確率高達21%,而常見效率策略無法緩解有害過度思考。
本文探討了三種基於玩家碰撞資訊生成敵人形態的新方法,旨在填補影片遊戲程式化內容生成中敵人形態生成的空白。研究發現每種方法各有優劣,但均優於或等同於從機器人形態學改編的進化基線。
本文介紹Traj-Evolve,一個自進化的多智慧體系統,透過經驗池(ExPool)和多智慧體強化學習(MARL)從縱向電子健康記錄中建模患者軌跡,在肺癌預測任務上超越9個強基線。實驗表明,ExPool提升特異性,MARL提升靈敏度,兩者互補。
ChatHealthAI是一個多模態推理框架,透過任務感知重取樣器將預訓練的EHR基礎模型的結構化表示與凍結的大語言模型語義空間對齊,從而在保留預測效能的同時實現可解釋的自然語言臨床推理。在EHRSHOT基準的三個臨床預測任務上,該框架在保持競爭性預測效能的同時,顯著提升了推理質量和可解釋性。
一項新研究比較了編碼器 Transformer 和 LSTM 在無測站流域進行上游徑流推斷的效能。結果表明,LSTM 整體表現優於 Transformer,而結合下游資訊可令中位數 NNSE 提升超過 60%。研究認為,遞迴記憶架構更適用於此類地形序列推理任務。
AURA-Mem是一種針對機器人策略的恆定大小迴圈記憶,透過動作門控機制僅在觀察改變未來動作時才寫入,顯著減少記憶體寫入次數,同時保持準確性。在合成基準和真實機器人任務中,AURA-Mem匹配或超越基線,且記憶體佔用恆定(4,224位元組),遠小於KV快取。
MIT和MIT-IBM計算研究實驗室的研究人員開發了ChartNet資料集,包含超過一百萬張多樣化圖表,用於訓練視覺語言模型。該資料集使小型開源模型在圖表理解任務上超越大型商業模型,有望幫助預算有限的小型企業更有效地利用AI。
Dropstone 1.5 是一款終端中的AI程式設計代理,每月重新評估頂級模型並切換至最佳者。當前基於DeepSeek和Kimi模型,美國伺服器託管,不儲存資料。每月15美元提供約450次深度程式設計會話,約為Claude Code Pro的兩倍(後者20美元)。注重安全,所有操作需確認。
一項新研究探討了AI編碼代理與傳統人類程式設計師在錯誤訊息消費上的差異,透過控制實驗發現,更詳細的型別錯誤訊息能顯著提升AI代理修復錯誤的能力,並且型別系統的存在優於僅依賴測試套件失敗報告。
透過實際案例,介紹AI應用可觀測性的四個關鍵訊號:版本化提示詞、trace記錄、使用者評分和模型評分。
悉尼科技大學教授Cath Ellis在《悉尼先驅晨報》發表評論文章,敦促學生不要使用AI走捷徑,但文章本身卻被發現是由AI撰寫的。報紙隨後撤下該文,儘管大學認為其使用AI是“恰當的”。這一事件引發了關於學術誠信和AI使用邊界的廣泛討論,凸顯了AI在學術寫作中的倫理困境。
該工具利用AI佈局理解技術,解決傳統提取器輸出亂行的問題,確保標題、表格、標題和圖片在轉換後保持清晰。
韓國Kospi股市因AI需求創歷史新高,但專家警告過度依賴兩家晶片製造商可能帶來繁榮-蕭條週期風險。SK海力士加入三星電子和臺積電,成為亞洲萬億美元俱樂部成員。
LiteHarness 是一個統一的 SDK,為多種 AI 智慧體工具提供單一的 TypeScript 和 Python 介面,包括 Claude Agent SDK 和 OpenAI Agents SDK。它支援輕鬆切換不同的智慧體和模型,並支援流式訊息。該專案目前處於預覽階段。
本文講述作者離開艾倫·圖靈研究所,加入一個被認為具有變革性的人工智慧實驗室的經歷。
Claude Code工程總監Fiona Fung在Code w/ Claude SF 2026上分享了團隊在代理編碼成為預設工作方式後,流程和結構如何變化。她討論了規劃、上下文收集、程式碼審查和團隊組成的轉變,以及如何推出新規範並衡量其效果。
Replicas 今日在 Product Hunt 上線,允許開發者在隔離的雲虛擬機器中執行 Claude Code、Codex 等編碼代理。它整合了 Slack、Linear 和 GitHub,支援後臺代理執行並提供真實的開發環境。創始人 Connor 和 Saai 分享了他們的願景和早期成果。
本教程詳細介紹瞭如何在Google Colab上使用QLoRA、監督微調(SFT)和直接偏好最佳化(DPO)微調Liquid AI的LFM2模型。包括載入模型、準備資料集、訓練LoRA介面卡、合併介面卡以及進行DPO訓練的全流程,最終獲得一個可部署的模型檢查點。
AI搜尋摘要看似進步,實則有害。本文呼籲迴歸僅返回結果的搜尋方式,指出摘要會抹平細節、隱藏分歧、削弱驗證,並損害網站生態。
Instagram近日修復了一個安全漏洞,該漏洞允許攻擊者透過欺騙Meta的AI支援聊天機器人來獲取使用者賬戶的訪問許可權。受影響的賬戶包括歐巴馬時代的白宮Instagram賬號以及美國太空軍首席軍士長的賬號。
谷歌正透過一項秘密試點計劃,向Android應用開發者付費獲取其程式碼庫,用於改進AI編碼工具。開發者保留智慧財產權,但谷歌希望藉此彌補其在AI程式碼生成領域與Anthropic和微軟的差距。此舉也反映出AI公司可能面臨公開訓練資料枯竭的問題。
Brontosaurus是一個基於網路的生成式畫布,透過語音命令幾乎瞬間建立小部件。受Thinking Machines和Ink & Switch的啟發,它強調人機協作,以速度為核心,讓使用者透過語音快速將想法變為現實。
Weaviate 宣佈其專為智慧體應用設計的託管記憶與上下文服務 Engram 正式上線。它透過非同步管道、模板和內建作用域,解決了長上下文退化、原始資料混亂和多智慧體上下文碎片化等問題,幫助智慧體積累經驗、最佳化決策。
Reachy Mini現在可以透過MCP協議呼叫Hugging Face Spaces上的遠端工具,如天氣查詢和網頁搜尋。使用者只需一個命令即可新增工具,無需修改應用程式碼。本文介紹了內建工具、配置檔案控制、遠端工具的工作原理、安裝命令、命名規範、示例配置檔案以及當前限制。
Anthropic 的《大型語言模型的生物學》(2025)是機械可解釋性領域的里程碑。透過電路追蹤等技術,研究人員能夠揭示模型內部的多步推理過程,發現它們使用人類可理解的概念(如“德克薩斯”)進行類符號推理。這項工作有助於識別模型錯誤、引導行為,甚至設計更好的學習演算法。
這部紀錄片探討了人工智慧可能對網際網路帶來的顛覆性影響,包括虛假資訊、演算法操縱和網路生態的變化。