本文提出CARTOGRAPH框架,為AI科學家提供可驗證的實驗引導與拒絕能力。該框架透過未解析子空間實驗引導、顯式模糊閉合和基於殘差的庫不足檢測,在多個測試中優於原始投影方法。在回顧性審計中,成功標記了A-Lab系統中所有後續被認定為不確定的主張。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
擴散語言模型(DLM)中的雙向注意力機制導致傳統KV快取方法失效,模型精度近乎歸零。本文提出雙向字首快取(bicache),透過動態識別安全層深度重用共享字首KV,實現36.3%-98.3%的吞吐量提升,且精度下降僅0-1.8%。
準確監測碳排放對氣候政策至關重要,但城市級高頻監測資料極度稀缺,限制了深度學習模型的應用。TriHead-GAN是一種基於Transformer的對抗框架,其三頭判別器聯合監督聯合分佈的三個互補方面:分佈真實性、跨變數依賴性和時間平滑性。實驗表明,TriHead-GAN在多數設定下優於主流基線,生成的合成視窗能提高低資源碳監測場景的預測準確性。
STARIXNet 是一種輕量級神經網路,透過捕捉多系統指標間的時空關係,在多變數空間內指導資源分配決策,優先保障服務穩定性與成本效率。在沃爾瑪關鍵生產微服務中部署後,實現了 10% 至 50% 的顯著成本節約,並提升了服務穩定性與客戶體驗。
新提出的層級湧現框架(HEF)將湧現建模為機制景觀中的相變,解釋了機器學習、生物學和物理學中獨立演化系統趨向相似高層結構的現象。在111次模算術Transformer實驗中發現,權重範數在突現前系統性達到峰值,所有突現模型收斂到相同的0.9745±0.014準確率,支援HEF的預測。
本文提出了一種去中心化叢集控制框架SPIN,透過將聯合策略張量分解為矩陣乘積狀態鏈,將計算複雜度從指數級降低到線性級,並採用混合神經符號控制管道實現零樣本適應。
研究人員提出MedicalRec,一種基於Transformer的推薦系統,可推薦最優的醫學影像分類模型而無需重新訓練,從而減少能源消耗和試錯浪費。該系統使用了從3000篇論文中收集的超過5000條記錄的基準資料集MedicalRec-Bench,在評估中達到了75.5%的最大HitRate@100。
離線強化學習為利用歷史託卡馬克資料開發等離子體控制器提供了有前景的途徑,但因缺乏標準化基準而難以衡量進展。本文提出RL4F,一個基於DIII-D託卡馬克真實放電資料的離線強化學習基準,涵蓋旋轉、密度、溫度和壓力四個全剖面跟蹤任務。評估表明,離線基於模型的強化學習在多數任務上平均效能最優,但無單一方法統治所有任務,凸顯了複雜長時域等離子體控制中動力學建模的重要性。程式碼、資料集和評估框架已開源。
本文提出了一種名為“最差維度最佳化”的新方法,用於改進多模態推理。傳統的過程獎勵模型(PRM)對所有維度(如視覺基礎、邏輯一致性)等權處理,可能導致個別維度的失敗被主導因素掩蓋。新方法專注於最佳化推理路徑中最薄弱的維度,從而保證整體推理的有效性。
本研究提出了GNOVA框架,一種結合門控迴圈單元和神經常微分方程的變分自編碼器,旨在透過常規臨床資料(無需MRI、PET或CSF)雙向預測阿爾茨海默病患者的認知評分(CDR-SB和MMSE),實現疾病軌跡的重建與預測,並提供不確定性估計。在ADNI資料集的1727名患者中,模型取得了1.35和2.28的平均絕對誤差,年齡、BMI和APOE4狀態是關鍵預測因素。
該研究利用Prithvi-EO-2.0模型分析了19次全球洪水事件(2017-2025)的衛星檢測能力,發現檢測精度取決於土地覆蓋和洪水型別:農田區域一致性最高(IoU=52%),河源洪水檢測最強(F1=0.69),而樹木覆蓋和建築區域幾乎無法檢測(IoU=4%)。雙參考驗證表明部分誤差源於參考產品定義不一致,而非模型失效。研究還識別出23種失敗模式,其中管道工程初期誤差佔主導。
一項跨學科研究探討了聊天機器人在問題解決對話中的本質。研究者認為,基礎聊天機器人(由大型語言模型和簡單介面構成)無法成為真正的人類思維夥伴,因為其訓練資料僅部分模仿了人類的“隱喻問題傳播”過程。該結論與Yann LeCun的觀點一致,即當前AI遠不及人類的學習能力,與大型科技公司的樂觀預期形成對比。論文強調,儘管存在這些侷限,聊天機器人的大規模使用使其社會和政治理解至關重要。
一項新研究評估了開源大語言模型LLaMA 3.1從荷蘭語腦MRI報告中自動提取結構化資訊的能力。模型在視覺評分等分類變數上表現優異,但在數值變數上表現較差,而少樣本提示能顯著提升數值變數的提取準確率。
大型語言模型在數學和多跳規劃任務中展現了強大的推理能力。CoCoNuT正規化允許模型在潛在空間同時探索多條推理路徑,但研究者發現了一個“概念瓶頸”問題:每次推理時中間隱藏狀態被覆蓋,導致模型在深度推理中丟失早期步驟的關鍵事實。為解決此問題,他們提出AGCLR(自適應門控持續潛在推理),透過寫、讀、忘三個門控機制維護持久殘差記憶。在GSM8K、HotpotQA和ProsQA上使用GPT-2的評估顯示,AGCLR在所有資料集上取得一致改進,且隨著課程深度增加,效能差距擴大,直接解決了概念瓶頸。
本實證研究評估了通用編碼代理在果蠅光遺傳學資料到發現流水線上的表現。代理可以解決單個階段,但在缺乏預定義標準、需要科學判斷時表現掙扎。端到端自動化仍超出當前能力。
PathoSage是一個三階段框架,用於病理學中的分塊級多模態推理。它透過結構化證據審議獨立評估來自不同工具的異質證據,進行衝突分析,並在全新上下文中生成最終判斷,以減少錨定偏差。同時引入無需訓練的Beta-Bernoulli經驗系統,利用連續信用分配建模工具的長期可靠性。實驗表明,PathoSage有效緩解了視覺問答中的幻覺問題和分類器之間的分歧,顯著優於現有最強病理學多模態大語言模型及智慧體基線方法。
ClawEase是一款專為中小企業設計的AI預約工具,能夠自動處理客戶預約,節省時間並提高效率。
VirusTotal將Knostic的AgentMesh引擎加入其眾包AI陣容,專門分析VS Code擴充套件檔案,幫助開發者和安全團隊在安裝前檢測供應鏈威脅。
本文探討了當AI和機器人實現物質極大豐富後,人類如何創造價值。文章提出,隨著傳統經濟生產被自動化,價值可能來自獨特慾望、品味工作、社會地位和遊戲等非生產性活動。人類不再是‘上班’,而是‘購物’——透過選擇和消費來定義價值。
Lead Qualifier 是一款研究助手,透過LinkedIn個人資料自動生成潛在客戶檔案,包括公司資訊、技術棧、社交聲音和接觸策略,並幫助起草個性化外聯資訊,讓初次接觸更有效。
本研究系統分析了Claude Code、GitHub Copilot、Cursor、Gemini和Codex等五種智慧體AI編碼工具的配置機制,透過對2853個GitHub倉庫的實證研究,發現上下文檔案(尤其是AGENTS$.md)是最普遍的配置方式,而高階機制如技能和子代理採用率較低,且不同工具間形成了差異化的配置實踐。
Apple開發者現在可以透過Foundation Models框架直接呼叫Gemini模型,並在Xcode中利用Gemini進行多步驟編碼任務,無需切換視窗。該整合基於Firebase AI Logic,提供預覽版。
Deep Memory 是一個開源庫,為 AI 代理提供基於詞彙的知識圖譜結構化、持久化記憶。它透過預定義實體型別、關係和屬性約束,解決了知識圖譜的冷啟動問題,使代理能夠高效建立和遍歷實體。支援多種儲存後端、MCP 伺服器整合和領域入門套件。
AI-noleak 是一個本地反向代理,可攔截AI編碼代理無意中洩露的本地秘密(如API金鑰、令牌),並用確定性佔位符替換它們,防止秘密透過提示洩露給上游AI模型。它透過三層保護(PTY包裝器、HTTP代理、檔案監視器)實現零配置、無需安裝CA證書的本地安全隔離。
一種名為ECG2Stroke的新型人工智慧模型,利用一次10秒的心電圖測試即可預測未來長達10年的卒中風險。該模型由麻省總醫院佈列根和哈佛-麻省理工博德研究所的研究團隊開發,其預測效能與經過驗證的臨床風險評分相當,尤其擅長預測可透過血液稀釋劑預防的心源性栓塞性卒中。
OpenAI 正在重新設計 ChatGPT 的介面,整合編碼工具、影像生成和合作夥伴應用,旨在打造一個全能型 AI 助手。公司面臨 Anthropic 的競爭,並轉向關注企業客戶。
本影片探討了在快速發展的AI時代,如何保持信仰、尊嚴和人類價值。講者從神學與科技交叉的視角,討論了人工智慧對人類獨特性、道德責任和靈性生活的挑戰,並提出了在技術浪潮中聆聽上帝聲音的途徑。
Superhighway是一個專為AI代理設計的網頁搜尋API,無需註冊或API金鑰,代理可透過x402協議自動支付USDC(每次0.001美元)來獲取JSON格式的搜尋結果。整個過程無需人類介入。
阿根廷總統哈維爾·米萊宣佈計劃將阿根廷打造成科技億萬富翁的避風港,提供無監管的AI環境、新型“非人公司”法律框架和低稅率。這呼應了彼得·蒂爾的網路國家理念,並與其關於敵基督的言論相關。
本文詳細介紹瞭如何將 GitHub Actions CI 遷移到 Hugging Face Jobs,以解決 GitHub 託管的 runner 速度慢、無 GPU 等問題。透過建立排程器 Space、GitHub App 以及修改 runs-on 標籤,即可讓 CI 作業在 Hugging Face 基礎設施上執行,支援 CPU 和 GPU 硬體,並即時流式傳輸日誌。Trackio 的實踐表明,CPU 任務時間可縮短約 30%。