該研究探索了多語言大模型中比喻語言生成的內部信號是否跨語言可複用。通過激活引導,從一種語言的比喻-字面激活差異中估計方向並應用於生成。實驗證明這些方向在同語言內可靠引導,且可跨語言遷移,其中德語最易接受。多語言組合的方向可匹敵或超越目標語言自身方向。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
一項新研究通過歷史宇宙學對照實驗,探究了領域適應如何重塑語言模型的解釋行為。研究分為兩個階段:第一階段從頭訓練小型模型於前哥白尼語料庫;第二階段使用QLoRA微調大型預訓練模型。結果發現,領域適應主要改變了模型的解釋框架(前現代與現代),而非直接調整宇宙觀立場。這表明,立場的變化是框架轉變的副產品。
大型語言模型在通用任務上表現出色,但難以適應專業領域。本文提出自主代理數據工程任務,讓LLM作為自主數據工程師,通過端到端數據策劃驅動模型專業化。實驗表明,GPT-5.2通過迭代代理驅動的數據適應,將學生模型性能提升57.29%。
本文提出了一種評估ChatGPT生成疾病相關生物醫學關聯能力的協議。該協議概述瞭如何生成關聯、利用生物醫學本體驗證生物實體以及通過文獻驗證關聯。協議包含跨ChatGPT模型的自一致性策略以評估生成可靠性,並通過檢索增強生成(RAG)結合開源大語言模型實現語義驗證,從而揭示幻覺現象。
本文正式定義了標籤排序中的校準概念,開發了涵蓋全排序、子排序和top-k排序的層次結構,證明全排序校準藴含其他但反之不成立,且子排序和top-k校準不可比。實驗發現流行標籤排序模型校準不佳,且校準與RLHF獎勵模型的基準準確性強相關但不完美,揭示了超越top-1準確性的重要質量維度。
現有基準測試大多評估孤立或短期的交互任務,未能測試智能體在長時間跨度內追蹤不斷變化的分析上下文的能力。為此,研究者提出了LongDS基準,包含68個源自真實Kaggle筆記本的任務,涵蓋2255輪交互,涉及六大領域。評估發現,最佳模型平均準確率僅為48.45%,從早期到後期性能下降近47個百分點,長期錯誤佔失敗原因的52%-69%。額外步驟不一定提升性能,關鍵瓶頸在於維持正確的分析狀態。
本文提出NumLeak框架,用於檢測基礎模型對公共數值基準的記憶。頂級LLM能夠高精度回憶訓練數據中的精確數值,造成虛假的準確性印象。實驗表明模型對金融經濟數據的相關性高達0.99,但在近期發佈的數據上表現驟降。白盒logprob分析比開放式生成更能檢測記憶,簡單系統提示防禦可阻止大多數攻擊。
本論文提出了一種名為海事異常檢測質量指數(MADQI)的新複合指標,用於無需標記數據即可評估無監督學習模型在海事自動識別系統(AIS)數據中的異常檢測性能。該框架整合了四個指標:異常率一致性(ARC)、物理合理性分數(PPS)、分數分佈分離度(SDS)和極端案例證據(ECE),並通過多塊評估和自適應縮放進行自動歸一化。實驗顯示MADQI得分80.37%,其中ECE和ARC分別達到0.907和1.000,表明該框架在檢測極端異常和保持異常率一致性方面表現出色。
提出了一種名為雙頻譜流匹配(DSFM)的新型fMRI生成框架,通過級聯離散小波變換和離散餘弦變換捕捉BOLD信號的多尺度瞬態變化和低頻能量壓縮,再通過頻譜流匹配生成類條件餘弦頻率表示,經逆變換重建生理上可信的時間序列,顯著提升了腦網絡分類性能。該工作已被ICLR 2026接收,代碼已開源。
本文介紹了一種基於徑向基函數(RBF)網絡的新型大語言模型架構,該架構無需深度神經網絡,通過閉式解一次性找到損失函數的全局最優解,消除了繁瑣的訓練步驟,提高了可解釋性和準確性。
本研究通過五種Transformer模型的LoRA微調,引入了一種多模型範式來研究合成欺騙。線性探針能在早期層以接近完美的AUC檢測欺騙,且邏輯迴歸探針優於MLP,支持線性表示假説。跨領域泛化能力強,但不同模型表現出不同的表示退化模式。研究表明,通過適度的監督微調可以快速鞏固魯棒的、領域不變的欺騙表示,對激活監測有重要影響。
Unicorn框架通過潛在原型碼本解耦通道相關性與特定身份,實現跨異構數據集的可擴展預訓練,在少樣本遷移場景中顯著優於現有方法。
研究人員提出了一個深度學習框架Gait2Hip-60,利用LSTM、Transformer和Mamba等模型從步態運動學直接預測髖部肌肉力和關節力矩。在60名健康受試者的基準測試中,Transformer表現最佳,並在零樣本測試中對股骨頭壞死患者保持中等預測能力。該研究為臨牀快速評估髖部動態提供了新方法,但需進一步病理驗證和泛化改進。
量子計算仍處於含噪聲中等規模量子(NISQ)時代,性能受噪聲嚴重製約,需要硬件級功能如中電路測量、經典反饋、精確時序控制和脈衝級波形訪問。OpenQASM-3提供了這些接口,但缺乏針對其硬件特性訓練大語言模型(LLM)的數據集。為此,研究者推出QASM-Eval,首個全面覆蓋OpenQASM-3硬件特性的數據集,包含100個專家驗證的測試任務和4000個訓練任務,涵蓋經典邏輯、時序調度、脈衝控制和複雜工作流,並配有擴展驗證器。評估顯示,現有LLM在OpenQASM-3編碼任務上表現困難,而針對QASM-Eval的微調可顯著提升性能。該數據集為NISQ時代硬件級量子編程的可靠LLM助手開發提供了關鍵基準和訓練基礎。
MAVEN(模塊化智能體驗證與執行網絡)是一種輕量級符號推理框架,旨在通過結構化分解、自適應工具編排和中間驗證來增強智能體在工具調用環境中的泛化能力。在MAVEN-Bench壓力測試中,MAVEN將GPT-OSS-120b基礎模型的準確率從48%提升至71%,且無需額外訓練。該框架在使用開源模型的情況下,成本僅為專有模型的1/10,展現了輕量級驗證中心框架在組合推理方面的潛力。
現有AI醫療基準固定了提供者響應,無法評估機制產生的均衡。該研究將醫院機制設計重新定義為語言模型的程序合成,通過多智能體模擬器Medi-Sim和進化代碼搜索,實現了消除過度編碼、減少拒絕並保留大部分資金的可解釋混合目標程序。
本文提出了三種重路由器設計,通過隱式分解子任務來增強基於子目標的策略樹搜索,避免了顯式子目標生成的開銷,在複雜環境中實現了最先進的在線訓練效率。
EHRBench是一個自動化和可靠的基準測試,利用電子健康記錄(EHR)數據,通過EHR-LLM-知識庫交互流程,生成了近100萬個問答項目,涵蓋診斷、治療和預後三大臨牀決策任務,並在30多個大型語言模型上進行了評估,揭示了當前LLM在臨牀可靠性方面的差距。該研究已被KDD 2026收錄。
LLM代理通過更新外部裝備(如提示、技能、記憶和工具)來適應任務,但模型的基礎任務解決能力是否能預測其裝備自我進化能力尚不明確。研究發現,裝備更新能力與基礎能力無關,而裝備收益能力則呈現非單調性:中等模型受益最大,弱模型和強模型受益較少。建議將能力預算投入任務解決代理而非進化器,並注重裝備調用和長程指令遵循的訓練。
一篇arXiv研究論文探索了使用MAP-Elites(一種質量多樣性算法)程序化生成第一人稱射擊(FPS)遊戲地圖。作者引入了兩種新的地圖表示方法(點線表示法和空間佈局表示法),並定義了一系列拓撲和湧現屬性指標。使用帶有滑動邊界的MAP-Elites(MESB)進化地圖,結果顯示新表示法能夠生成比以往方法更多樣化、更高質量的地圖。
本文研究如何將因子化任務(FTS)編碼為SAT問題,提出了多種編碼策略,並分析了任務轉換和並行性對基於SAT的規劃器性能的影響。
PhyDrawGen是一種神經符號管道,可從文本生成物理圖,嚴格遵循物理定律。它先由大語言模型提取場景圖,再由確定性求解器轉換為平面直線圖,最後通過微調Qwen-VL模型進行驗證。在1449個物理問題基準測試中,其物理準確性顯著優於GPT-5-image等模型。
PayPal和Palantir聯合創始人彼得·蒂爾認為,人工智能對數學和編程等STEM領域的威脅大於對創意和溝通類崗位的影響。LinkedIn報告顯示,溝通和領導力成為最受歡迎的技能,部分公司為故事講述者提供高薪。同時,一些STEM專業的失業率較高,但並非所有技術崗位都面臨風險。蒂爾還指出,AI可能使醫學等領域的數學門檻變得不再必要。
Mistral Vibe是一款AI代理,專為長期運行的多步驟工作和編程任務設計。本文介紹其功能及在Product Hunt上的討論。
近日,Instagram曝出一個嚴重漏洞,攻擊者可以利用Meta AI助手繞過多因素認證,直接重置賬户密碼。該漏洞已被修復,但引發了關於AI集成安全性的擔憂。
Smart Rename 是一款開源工具,利用本地 AI 模型(llava)實時監控文件夾,自動為圖像文件生成描述性名稱。它完全離線運行,保護隱私,並通過系統托盤圖標提供便捷控制。
知名YouTuber PewDiePie宣佈推出一個基於OpenCode構建的AI工作空間,旨在幫助創作者更高效地利用AI工具。
MiniMax 發佈了其多模態基礎模型 MiniMax M3,支持文本、圖像和視頻輸入,擁有 1M 令牌上下文窗口,專為長時間代理任務、編碼和工具使用設計。該模型採用 MiniMax 稀疏注意力機制,在長上下文處理中大幅降低計算成本,並已登陸 OpenRouter 平台,提供有競爭力的定價。
本指南詳細介紹瞭如何使用TestFlight測試iOS、iPadOS、macOS、tvOS、visionOS和watchOS應用的測試版。包括安裝步驟、系統要求、自動更新管理以及如何測試不同構建版本。
英國內政部宣佈在英吉利海峽移民入境點試行AI面部年齡估算技術,引發人權組織強烈批評。文章指出,該技術存在嚴重的準確性問題,對非白人、女性及在惡劣條件下拍攝的青少年誤差更大,且可能違反法律要求。替代方案如Merton合規年齡評估雖耗時但更為可靠。