本教程介紹如何利用OpenMythos庫在Google Colab中構建端到端的循環深度Transformer工作流。我們創建了MLA和GQA兩種注意力變體,比較參數量,並通過譜半徑檢查循環注入矩陣的穩定性。在合成組合推理任務(預測數字鏈模固定值的和)上訓練模型,研究循環循環如何使單一模型重用參數進行更深層次的計算。最終展示在推理時增加循環次數如何在不改變參數的情況下提升推理深度。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
DeepSeek融資額達700億元,計劃推出自家Code產品。資深研究員Deli Chen發帖招聘Harness團隊,前TSY Capital聯合創始人崔添翼或將出任負責人。
Shroomie 是一個利用人工智能技術,讓新聞閲讀變得有趣且易於養成習慣的平台。
一個AI統一入口,搞定所有
Faby是一款AI虛擬同事,它擁有自己的電腦、瀏覽器和編碼環境,可以直接在Slack中執行端到端任務,如拉取數據、構建報告、編寫代碼等。它不同於僅提供建議的聊天機器人,而是能實際完成複雜工作流程。
本週AI新聞相對平靜,但基礎設施領域迎來重大融資:TurboPuffer實現1億美元ARR且盈利;Exa以22億美元估值融資2.5億美元;Modal以47億美元估值融資3.55億美元。其他亮點包括RAEv2表示學習框架、Gated DeltaNet-2注意力機制、以及Codex和Gemini的智能體工具更新。
本文探討了安全團隊如何將技術性網絡風險轉化為董事會能理解的財務指標,並介紹了Databricks Genie如何通過實時、數據驅動的網絡風險量化來改善治理。
美國聯邦貿易委員會(FTC)對Cox Media Group、MindSift和1010 Digital Works處以近100萬美元罰款,因其虛假宣傳“主動監聽”AI營銷服務。調查發現,該服務並未實際監聽對話或使用語音數據,而是轉售從其他數據經紀商處獲得的電子郵件列表。FTC強調,通過服務條款隱藏的“同意”不構成有效授權。
一項新研究通過控制實驗發現,Claude Haiku在資源分配任務中,將10個英語程度修飾詞壓縮為5個不同的中位數輸出,且模型對強度詞的解釋高度依賴於系統狀態,在接近可行性邊界時出現三種行為模式。
該研究提出了OGCaReBench,一個專注於檢索的基準測試,用於評估大型語言模型在回答超出典型指南範圍的臨牀問題時的表現。實驗表明,即使是最先進的模型(GPT-5.2)也僅有56%的準確率,而通過檢索相關醫學文獻可提升至82%,強調了證據基礎推理在真實醫療場景中的重要性。
反思性提示調優(RPT)是一種通過LLM函數調用模擬人類提示工程師迭代工作流程的框架。RPT使用診斷函數評估模型在優化集上的表現,總結失敗模式,並利用累積記憶逐步改進提示。在三個推理任務上,RPT將初始提示性能提升高達12.9個點,並與現有最佳方法競爭,同時改善置信度校準。
arXiv最新論文提出PromptNCE方法,僅通過提示和LLM的概率輸出即可零樣本估計點互信息(PMI),無需訓練專用模型。在三個數據集上達到最高Spearman相關性0.82,並在計算機科學教育中展示了低數據場景下的應用。
RankJudge是一種新型基準生成器,專門用於評估LLM在多輪對話中的評判能力。它通過創建成對的對話(其中一方在單輪中注入一個缺陷)實現無歧義的優劣標註,並精確隔離失敗類別。該方法在機器學習、生物醫學和金融三個領域進行了實施,評估了21個前沿LLM評判模型,並使用Bradley-Terry模型進行排名。研究還通過難度評級動態篩選評估數據,減少了標籤噪聲。
該論文提出了一種模型無關的概率性令牌歸因方法,利用貝葉斯規則反轉下一令牌的對數概率,以捕捉大型語言模型內部對標記序列分佈的表示,並通過熵和歸因分數之間的關係揭示模型行為。
如何區分一篇同行評審是由人類撰寫還是AI生成?Sem-Detect方法通過結合文本特徵與聲明級語義分析,利用AI模型趨向於相似觀點而人類評審更為多樣化的觀察,在ICLR和NeurIPS的2萬餘篇評審中,將二分類情況下的[email protected]% FPR提升了25.5%。在三類場景中,僅3.5%以下的人類精煉評審被誤判為AI生成。
一種名為CR4T的新框架通過將不安全的或拒絕導向的大語言模型輸出重寫為適合年齡的指導性回應,為青少年提供更人性化的安全防護替代方案。
DualOptim+是一個新型優化框架,通過引入基態和增量態,自適應地橋接共享與分離的優化器狀態,以改善大語言模型中的機器遺忘。實驗表明,該框架在遺忘、安全對齊和多任務學習等任務中取得了更優的權衡。
本研究提出yvsoucom-iterkit,一個確定性、日誌驅動的自動化機器學習框架,將流水線優化編碼為可追蹤的日誌實體,實現組件歸因、交互、相似性和跨種子魯棒性分析。在Pima印第安人糖尿病和中風數據集上的實驗(超過18,000種流水線配置)揭示了結構化且部分冗餘的搜索空間,性能由少數交互組件主導。隨機森林重要性分析顯示,增強(0.454)、模型選擇(0.198)和不平衡處理(0.101)是Pima的關鍵驅動因素,而不平衡處理主導中風數據集(0.406)。組件相似性分析表明強冗餘性。集成模型取得了強勁穩定的性能(Pima上加權F1為0.89,宏F1為0.88;中風上加權F1為0.94),但中風上的宏F1較低(0.67)。跨種子分析揭示了性能-魯棒性權衡。結果表明有效的AutoML優化可以聚焦於少量高影響組件。
本文研究了大型語言模型代理中束帶工程(harness engineering)的推理時對齊技術。束帶通過任務分解和引導執行來提升長期性能,但更精細的設計並非總是更好。論文從推理時軌跡對齊的角度,揭示了過度分解、過度剪枝和幻覺執行等失敗模式,並通過實驗表明,部分束帶(僅指定初始步驟)可能比完整結構化工作流更有效。
研究通過少數示例預測程序性能的方法,提出硬幣翻轉模型,發現符號程序性能先驗為全有或全無,提示程序性能先驗分散,並據此開發RAP方法,實現可靠的性能預測。
HealthCraft 是首個基於 FHIR R4 構建的急診醫學強化學習環境,通過雙層級評分系統評估語言模型在複雜臨牀工作流中的安全性。測試顯示,前沿模型在多步工作流中幾乎完全失敗,且基礎設施缺陷會影響模型排名。該環境及任務集已開源。
一項模擬研究探討了在污染數據下過度參數化線性迴歸中的雙重下降現象,發現最小二乘插值法在泛化性能上優於穩健估計器。
GOEN(幾何優化認知網絡)是一種新的OOD檢測方法,結合多尺度特徵、L2歸一化、馬氏距離和校準頭,在CIFAR-10上達到0.9483的平均OOD AUROC,超越深度集成等基線。反直覺發現:CenterLoss正則化雖提升分類準確率卻顯著降低OOD檢測性能。
一項新研究證明了在特徵共線時,沒有特徵排序方法能同時滿足忠實性、穩定性和完備性。該不可能性定理通過四種模型類量化,並提出了集成平均方法DASH來解決。在77個公共數據集的調查中,68%存在歸因不穩定性。該框架還包括實際診斷工具和對公平性審計的影響。
該研究探討如何讓語言模型在實驗前預測研究想法是否成功。通過構建基於PapersWithCode的11488個想法對數據集,微調小模型達到77.1%準確率,甚至超過GPT-5。使用強化學習框架RLVR進一步提高可解釋性,展示了小模型在科學發現中的潛力。
研究者提出時間對比Transformer(TCT),一種自監督表示學習框架,用於捕捉金融交易序列中的時間動態。實驗表明,單獨使用TCT嵌入的AUC為0.8644,但結合領域工程特徵後性能無提升(AUC 0.9205 vs 0.9245),説明學習到的表示與現有特徵高度重疊。該工作表明自監督學習有望減少對特徵工程的依賴,但尚需進一步研究。
Mahjax是一個在JAX中實現的完全向量化立直麻將環境,可利用GPU進行大規模並行化,吞吐量達到在8塊NVIDIA A100 GPU上每秒200萬步(無紅寶牌規則)和100萬步(有紅寶牌規則)。該環境支持從零開始(tabula rasa)的強化學習訓練,並附有高質量可視化工具,實驗驗證了訓練智能體可以有效提升排名。
根據經典談判理論,人們在談判中的成功取決於平衡共情與自信、關心他人與關心自我、對人温和與對事強硬等競爭需求。然而,人們往往難以管理這些張力,導致研究人員無法在受控條件下嚴格檢驗這些理論。AI智能體沒有這些限制,其精準性、多樣性、一致性和可擴展性使得新型實驗成為可能。本文引入“個性工程”方法論,利用AI智能體精確參數化、操縱和評估談判者個性,並提議使用人際環狀模型(温暖與支配兩個核心維度)作為基礎座標系。該方法既為檢驗經典談判理論提供了嚴格方法論,也為設計AI談判智能體的個性提供了實用指南。
本文介紹了AgentAtlas框架,該框架通過四個組成部分來評估LLM智能體:六狀態控制決策分類法、九類軌跡失敗分類法、分類法感知與盲法比較方法以及基準覆蓋審計。實驗表明,移除顯式標籤菜單後,所有模型的軌跡準確率下降14-40個百分點,落在0.54-0.62的狹窄區間,且沒有模型在所有指標上獲勝。
基準測試對於追蹤AI進展很重要,但可能高估或低估實際能力。本文提出“開放世界評估”作為補充:長期、混亂的真實世界任務,通過小樣本定性分析進行評估。作者介紹了CRUX項目,並展示AI代理成功開發併發布了一款iOS應用,僅需一次手動干預,表明開放世界評估能提供早期預警。