SANA-Streaming是一個系統-演算法協同設計的框架,用於在消費級GPU上進行高解析度即時流式影片編輯。它採用混合擴散變壓器架構、迴圈反向正則化訓練策略和高效系統協同設計,在RTX 5090上實現1280x704解析度24 FPS的即時編輯。實驗表明,該方法在時間一致性和系統吞吐量上顯著優於現有技術。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
本文提出SURGE框架,透過對比InfoNCE損失在共享嵌入空間中遷移教師檢測器的關係幾何知識,實現輕量級SAR艦船檢測。該架構無關的方法在SSDD和HRSID基準上使兩級檢測器提升6.2 mAP和8.0 AP75,甚至超越教師效能。
本文介紹了CanLegalRAGBench,一個基於真實查詢和專家註釋的加拿大法律QA基準,用於評估檢索增強生成系統。研究表明,檢索效能對設計選擇敏感,開源嵌入模型與閉源模型競爭力相當,但自動評估存在侷限性,生成答案常出現幻覺或偏離正確答案。該基準旨在推動法律RAG系統的改進。
本研究探討大型語言模型(LLM)在跨語言知識介面中的文化偏差問題,提出了“全球敘事主導”概念,並透過孟加拉語資料集CulturalNB的測試,發現英語提問會系統性地增加全球替代和制度框架,減少本地視角覆蓋。本地證據能改善事實一致性,但無法消除語言引發的認知偏移。這一發現表明,LLM的文化失敗不僅是知識缺失,更是根基缺失和敘事優先順序的問題。該研究為開發更具文化包容性的AI系統提供了重要理論基礎。
一項最新研究首次系統評估了多模態語音識別中的偏見問題。研究發現,當不同面孔與相同音訊配對時,模型的轉錄準確率出現顯著差異,尤其是涉及性別和種族交叉時,詞錯誤率最高可差4.05個百分點。這表明,增加模態並非一定提升效能,反而可能引入新的偏見。
本研究提出一個基於知識圖譜的零樣本多標籤主題分類框架,系統比較了八種方法(四種基礎變體及其圖增強版本)在十五個大語言模型和八個資料集上的表現。結果表明,關鍵詞增強分類(AK)是最佳基礎方法;圖增強對小型模型有正面影響,但對大型模型效果不佳,說明大型模型已從預訓練中獲得足夠的關係資訊。自一致性解碼未提升效能,但計算成本增加約五倍。
該研究探索了多語言大模型中比喻語言生成的內部訊號是否跨語言可複用。透過啟用引導,從一種語言的比喻-字面啟用差異中估計方向並應用於生成。實驗證明這些方向在同語言內可靠引導,且可跨語言遷移,其中德語最易接受。多語言組合的方向可匹敵或超越目標語言自身方向。
一項新研究透過歷史宇宙學對照實驗,探究了領域適應如何重塑語言模型的解釋行為。研究分為兩個階段:第一階段從頭訓練小型模型於前哥白尼語料庫;第二階段使用QLoRA微調大型預訓練模型。結果發現,領域適應主要改變了模型的解釋框架(前現代與現代),而非直接調整宇宙觀立場。這表明,立場的變化是框架轉變的副產品。
大型語言模型在通用任務上表現出色,但難以適應專業領域。本文提出自主代理資料工程任務,讓LLM作為自主資料工程師,透過端到端資料策劃驅動模型專業化。實驗表明,GPT-5.2透過迭代代理驅動的資料適應,將學生模型效能提升57.29%。
本文提出了一種評估ChatGPT生成疾病相關生物醫學關聯能力的協議。該協議概述瞭如何生成關聯、利用生物醫學本體驗證生物實體以及透過文獻驗證關聯。協議包含跨ChatGPT模型的自一致性策略以評估生成可靠性,並透過檢索增強生成(RAG)結合開源大語言模型實現語義驗證,從而揭示幻覺現象。
本文正式定義了標籤排序中的校準概念,開發了涵蓋全排序、子排序和top-k排序的層次結構,證明全排序校準蘊含其他但反之不成立,且子排序和top-k校準不可比。實驗發現流行標籤排序模型校準不佳,且校準與RLHF獎勵模型的基準準確性強相關但不完美,揭示了超越top-1準確性的重要質量維度。
現有基準測試大多評估孤立或短期的互動任務,未能測試智慧體在長時間跨度內追蹤不斷變化的分析上下文的能力。為此,研究者提出了LongDS基準,包含68個源自真實Kaggle筆記本的任務,涵蓋2255輪互動,涉及六大領域。評估發現,最佳模型平均準確率僅為48.45%,從早期到後期效能下降近47個百分點,長期錯誤佔失敗原因的52%-69%。額外步驟不一定提升效能,關鍵瓶頸在於維持正確的分析狀態。
本文提出NumLeak框架,用於檢測基礎模型對公共數值基準的記憶。頂級LLM能夠高精度回憶訓練資料中的精確數值,造成虛假的準確性印象。實驗表明模型對金融經濟資料的相關性高達0.99,但在近期釋出的資料上表現驟降。白盒logprob分析比開放式生成更能檢測記憶,簡單系統提示防禦可阻止大多數攻擊。
本論文提出了一種名為海事異常檢測質量指數(MADQI)的新複合指標,用於無需標記資料即可評估無監督學習模型在海事自動識別系統(AIS)資料中的異常檢測效能。該框架整合了四個指標:異常率一致性(ARC)、物理合理性分數(PPS)、分數分佈分離度(SDS)和極端案例證據(ECE),並透過多塊評估和自適應縮放進行自動歸一化。實驗顯示MADQI得分80.37%,其中ECE和ARC分別達到0.907和1.000,表明該框架在檢測極端異常和保持異常率一致性方面表現出色。
提出了一種名為雙頻譜流匹配(DSFM)的新型fMRI生成框架,透過級聯離散小波變換和離散餘弦變換捕捉BOLD訊號的多尺度瞬態變化和低頻能量壓縮,再透過頻譜流匹配生成類條件餘弦頻率表示,經逆變換重建生理上可信的時間序列,顯著提升了腦網路分類效能。該工作已被ICLR 2026接收,程式碼已開源。
本文介紹了一種基於徑向基函式(RBF)網路的新型大語言模型架構,該架構無需深度神經網路,透過閉式解一次性找到損失函式的全域性最優解,消除了繁瑣的訓練步驟,提高了可解釋性和準確性。
本研究透過五種Transformer模型的LoRA微調,引入了一種多模型正規化來研究合成欺騙。線性探針能在早期層以接近完美的AUC檢測欺騙,且邏輯迴歸探針優於MLP,支援線性表示假說。跨領域泛化能力強,但不同模型表現出不同的表示退化模式。研究表明,透過適度的監督微調可以快速鞏固魯棒的、領域不變的欺騙表示,對啟用監測有重要影響。
Unicorn框架透過潛在原型碼本解耦通道相關性與特定身份,實現跨異構資料集的可擴充套件預訓練,在少樣本遷移場景中顯著優於現有方法。
研究人員提出了一個深度學習框架Gait2Hip-60,利用LSTM、Transformer和Mamba等模型從步態運動學直接預測髖部肌肉力和關節力矩。在60名健康受試者的基準測試中,Transformer表現最佳,並在零樣本測試中對股骨頭壞死患者保持中等預測能力。該研究為臨床快速評估髖部動態提供了新方法,但需進一步病理驗證和泛化改進。
量子計算仍處於含噪聲中等規模量子(NISQ)時代,效能受噪聲嚴重製約,需要硬體級功能如中電路測量、經典反饋、精確時序控制和脈衝級波形訪問。OpenQASM-3提供了這些介面,但缺乏針對其硬體特性訓練大語言模型(LLM)的資料集。為此,研究者推出QASM-Eval,首個全面覆蓋OpenQASM-3硬體特性的資料集,包含100個專家驗證的測試任務和4000個訓練任務,涵蓋經典邏輯、時序排程、脈衝控制和複雜工作流,並配有擴充套件驗證器。評估顯示,現有LLM在OpenQASM-3編碼任務上表現困難,而針對QASM-Eval的微調可顯著提升效能。該資料集為NISQ時代硬體級量子程式設計的可靠LLM助手開發提供了關鍵基準和訓練基礎。
MAVEN(模組化智慧體驗證與執行網路)是一種輕量級符號推理框架,旨在透過結構化分解、自適應工具編排和中間驗證來增強智慧體在工具呼叫環境中的泛化能力。在MAVEN-Bench壓力測試中,MAVEN將GPT-OSS-120b基礎模型的準確率從48%提升至71%,且無需額外訓練。該框架在使用開源模型的情況下,成本僅為專有模型的1/10,展現了輕量級驗證中心框架在組合推理方面的潛力。
現有AI醫療基準固定了提供者響應,無法評估機制產生的均衡。該研究將醫院機制設計重新定義為語言模型的程式合成,透過多智慧體模擬器Medi-Sim和進化程式碼搜尋,實現了消除過度編碼、減少拒絕並保留大部分資金的可解釋混合目標程式。
本文提出了三種重路由器設計,透過隱式分解子任務來增強基於子目標的策略樹搜尋,避免了顯式子目標生成的開銷,在複雜環境中實現了最先進的線上訓練效率。
EHRBench是一個自動化和可靠的基準測試,利用電子健康記錄(EHR)資料,透過EHR-LLM-知識庫互動流程,生成了近100萬個問答專案,涵蓋診斷、治療和預後三大臨床決策任務,並在30多個大型語言模型上進行了評估,揭示了當前LLM在臨床可靠性方面的差距。該研究已被KDD 2026收錄。
LLM代理透過更新外部裝備(如提示、技能、記憶和工具)來適應任務,但模型的基礎任務解決能力是否能預測其裝備自我進化能力尚不明確。研究發現,裝備更新能力與基礎能力無關,而裝備收益能力則呈現非單調性:中等模型受益最大,弱模型和強模型受益較少。建議將能力預算投入任務解決代理而非進化器,並注重灌備呼叫和長程指令遵循的訓練。
一篇arXiv研究論文探索了使用MAP-Elites(一種質量多樣性演算法)程式化生成第一人稱射擊(FPS)遊戲地圖。作者引入了兩種新的地圖表示方法(點線表示法和空間佈局表示法),並定義了一系列拓撲和湧現屬性指標。使用帶有滑動邊界的MAP-Elites(MESB)進化地圖,結果顯示新表示法能夠生成比以往方法更多樣化、更高質量的地圖。
本文研究如何將因子化任務(FTS)編碼為SAT問題,提出了多種編碼策略,並分析了任務轉換和並行性對基於SAT的規劃器效能的影響。
PhyDrawGen是一種神經符號管道,可從文本生成物理圖,嚴格遵循物理定律。它先由大語言模型提取場景圖,再由確定性求解器轉換為平面直線圖,最後透過微調Qwen-VL模型進行驗證。在1449個物理問題基準測試中,其物理準確性顯著優於GPT-5-image等模型。
PayPal和Palantir聯合創始人彼得·蒂爾認為,人工智慧對數學和程式設計等STEM領域的威脅大於對創意和溝通類崗位的影響。LinkedIn報告顯示,溝通和領導力成為最受歡迎的技能,部分公司為故事講述者提供高薪。同時,一些STEM專業的失業率較高,但並非所有技術崗位都面臨風險。蒂爾還指出,AI可能使醫學等領域的數學門檻變得不再必要。
Mistral Vibe是一款AI代理,專為長期執行的多步驟工作和程式設計任務設計。本文介紹其功能及在Product Hunt上的討論。