AI News HubLIVE

模型動態

5門免費課程:從AI新手到實踐者

本文介紹了一個由5門免費課程組成的路線圖,從經典演算法到從頭訓練大語言模型,幫助有Python基礎的學習者系統掌握AI技能。

  • 哈佛CS50 AI課程建立AI邏輯基礎
  • 谷歌機器學習速成課程掌握數學與TensorFlow
站內正文

中國低價Z.ai模型暴露程式設計師昂貴習慣

Z.ai的GLM 5.2模型以低價和開放權重挑戰美國前沿AI模型,但許多程式設計師仍習慣使用昂貴模型,忽略成本。該模型在基準測試中接近Claude Opus 4.8,但實際使用效果參差不齊。

  • GLM 5.2 API價格僅為Anthropic Opus 4.8的五分之一,Fable的十分之一
  • 開放權重允許自託管,避免資料隱私問題
站內正文

“僅次於Fable 5”:阿里巴巴釋出Qwen3.8,但未提供任何真實資料

阿里巴巴宣佈推出其最新大語言模型Qwen3.8,聲稱僅次於Anthropic的Fable 5,但未提供任何基準測試或模型卡。此舉發生在競爭對手月之暗面釋出Kimi K3並附有詳細技術細節之後。阿里巴巴的宣告缺乏透明度,引發對其釋出時機和動機的質疑。

  • 阿里巴巴聲稱Qwen3.8僅次於Anthropic的Fable 5,但未提供任何資料支援。
  • 該宣告緊隨月之暗面釋出Kimi K3之後,後者提供了完整的基準測試和技術細節。
站內正文

上週AI #250 - Mythos 混亂、GPT 5.6-Sol、GLM 5.2

本期涵蓋Anthropic的AI條約討論、美國政府影響AI模型釋出、OpenAI處理器開發、記憶體市場影響等話題。

  • 美國政府擴大對前沿AI的管控,Anthropic獲准向特定公司釋出Mythos-5,OpenAI推出GPT-5.6 Sol,初始訪問受限。
  • 模型能力與安全訊號仍不明確,基準測試披露有限。
站內正文

中國開源權重模型便宜,華盛頓正在決定其代價

美國政策制定者正在討論是否透過監管風險來限制中國開源權重模型的使用。Moonshot AI的Kimi K3模型釋出後,這一爭論再次升溫。企業面臨的問題不僅是效能,還有未來一年內使用這些模型是否依然暢通無阻。

  • Moonshot AI的Kimi K3是迄今最大的開源權重模型,其釋出重新引發了華盛頓的政策辯論。
  • 討論的機制包括聯邦採購規則、出口黑名單和安全建議,這些將透過雲服務提供商影響全球企業。
站內正文

中國AI模型使特朗普的AI世界陷入內訌

中國開源AI模型Kimi的釋出,引發了特朗普政府內部AI戰略家的分裂。該模型效能媲美OpenAI和Anthropic的付費模型,卻完全免費,對特朗普的經濟和政治構成挑戰。圍繞如何應對中國AI競爭,各方意見不一,從開放支援到加強管控,分歧加劇。

  • 中國公司Moonshot釋出免費開源模型Kimi,效能接近頂級付費模型。
  • 特朗普前AI顧問David Sacks與現任官員Emil Michael公開批評美國AI公司。
站內正文

面向長時域機器人操作的預見性殘差強化學習與視覺-語言-動作模型

本文提出預見性殘差強化學習(Foresight Residual RL),透過在凍結的視覺-語言-動作(VLA)基策略上新增一個離線估計的預見值(即當前子任務終止狀態下未來子任務成功的機率)來最佳化子任務間的交接質量,從而提升長時域機器人操作的成功率。在Isaac Gym中的三階段扳手螺母擰緊任務上,該方法實現了85.6%的完整任務成功率,顯著優於標準子任務殘差RL(54.5%)和VLA基線。

  • VLA策略在緊公差、接觸密集的裝配任務中因長時域信用分配和子任務耦合而失敗
  • 標準殘差RL孤立最佳化每個子任務,但鏈式執行時因終端狀態質量不可控而收益甚微
站內正文

PRISM:面向非結構化環境中機器人導航的多模態地形測繪系統

PRISM是一種多模態感知系統,透過融合熱成像、光學和深度感測器,結合新型視覺變換器網路OmniUnet,實現非結構化環境中的地形分割與可通行性地圖生成,並在資源受限的嵌入式計算機上成功部署,支援自主導航。

  • PRISM整合了RGB、深度和熱成像感測器,實現多模態地形感知。
  • 核心網路OmniUnet基於視覺變換器,專為多模態語義分割設計。
站內正文

HyperDCM:雙曲空間中的動態聚類記憶回放實現跨場景持續機器人導航

針對視覺導航中的災難性遺忘問題,研究者提出HyperDCM,一種結構感知的記憶機制。它利用大視覺語言模型提取場景語義三元組,透過關係圖卷積網路編碼為場景圖嵌入,並投影到雙曲空間增強結構分離性。動態聚類和結構敏感更新策略選擇代表性樣本進行記憶回放,保持知識多樣性。實驗表明,HyperDCM在多場景室內外資料集上優於現有持續學習方法。

  • 提出HyperDCM,結合場景圖建模和記憶回放增強擴散策略導航。
  • 利用大視覺語言模型和R-GCN提取並編碼場景語義。
站內正文

面向部分標註的多工面部情感識別的共享潛變數

提出一種共享潛變數方法,透過變分瓶頸在部分標註的多工面部情感識別中實現跨任務訊號共享,在s-Aff-Wild2資料集上提升表情識別宏F1至0.446,並透過第二個骨幹網路突破動作單元瓶頸。

  • 將部分標註的多工學習視為對共享情感潛變數的邊緣化,一個變分瓶頸協調三個任務解碼器。
  • 在s-Aff-Wild2上,僅37%的幀具有全部標籤,該方法將表情宏F1從0.403提升至0.446。
站內正文

MAC 2026:推動微動作分析邁向細粒度理解

第三屆微動作分析大挑戰賽(MAC 2026)與ACM Multimedia 2026同期舉辦,透過引入利用多模態大語言模型評估的新任務,將微動作分析從識別推進到細粒度理解。本文詳細介紹了資料集、協議、競賽結果以及該新興領域的未來方向。

  • MAC 2026引入了使用多模態大語言模型的細粒度微動作理解任務。
  • 該挑戰超越傳統的識別與檢測,深入解讀細微的人類行為。
站內正文

GenSyn10:用於基準測試影像分類的多生成式AI資料集

GenSyn10是一個包含6萬張合成影像的資料集,與CIFAR-10對齊,使用三種架構不同的生成模型建立,旨在推進AI生成影像檢測研究。評估顯示,模型在已知生成器上表現良好,但在未知生成器上效能顯著下降,凸顯了分佈外泛化的侷限性。

  • GenSyn10包含6萬張32x32的合成影像,覆蓋10個類別,由FLUX.2-dev、HunyuanImage-3.0和Qwen-Image-2512三種模型生成。
  • 在20種影像分類模型上評估,CIFAR-10訓練模型零樣本準確率達96.86%,微調後達99.88%。
站內正文

移動如人:面向毫瓦級硬體的即時空中人員追蹤的自我運動歸一化時間特徵

本文提出EMTS-Det系統,用於無人機上的即時跟隨人員追蹤,在低功耗硬體上實現高效執行。系統透過自我運動歸一化的殘差運動通道檢測人員,使用僅22k引數的輕量網路,在Raspberry Pi Zero 2W上達到31.85 FPS,效能遠超YOLOv8n。

  • EMTS-Det系統僅需22k引數和7.6 MFLOP計算量,在資源受限裝置上實現即時人員追蹤。
  • 透過自我運動歸一化殘差運動通道,系統能在10-60畫素的小目標上有效區分人與背景。
站內正文

3D FaceShell:3D面部頭像中的屬性轉移作為VLM防禦機制

研究人員提出3D FaceShell框架,透過向3D面部頭像新增微妙擾動來誤導視覺語言模型推斷敏感屬性,同時保持視覺身份不變。

  • 3D FaceShell使用可學習的高斯殼為3D頭像提供隱私保護。
  • 它能在不改變人類可識別外觀的情況下重定向VLM屬性推斷。
站內正文

JEPA預測器:可遷移的遮擋特徵補全運算元

聯合嵌入預測架構(JEPA)在訓練時聯合訓練預測器與編碼器,但下游部署通常丟棄預測器。研究表明,JEPA預測器可作為可遷移的遮擋特徵補全運算元,透過線性投影適配到不同編碼器族,顯著提升遮擋分類精度。

  • JEPA預測器是學習從可見上下文特徵到被遮擋位置特徵的運算元,可跨編碼器族遷移。
  • 透過線性投影將I-JEPA和V-JEPA 2的預測器適配到CLIP、DINOv3等編碼器,僅需500張影像進行閉式擬合。
站內正文

儘管語言模型努力仍會犯錯:用於自糾正科學生成的共形預測

本研究提出科學可行性控制(SFC)框架,一種圖結構共形預測方法,為科學推理的有效性提供統計保證。SFC將科學推理分解為原子單元,透過漸進式絕對一致事實性驗證,在檢測到違反科學原則時動態分支到替代生成路徑。實驗表明,SFC在PhyX等多模態科學推理基準上達到50.1%的準確率,超過DeepSeek-R1和GPT-4,同時將科學定律違反減少73%,並提供91.7%的科學有效性保證。

  • SFC採用圖結構共形預測,對科學推理中的邏輯依賴進行建模。
  • 透過動態分支機制,在檢測到科學錯誤時切換到已驗證的上下文。
站內正文

算術啟發式神經元是否具有形式不變性?對LLM中符號、文本和程式碼的機制分析

本研究透過機制可解釋性方法,分析Llama-3模型在符號算術、自然語言應用題和Python程式碼三種形式下的算術計算機制,發現一組緊湊的共享神經元在三種形式中均被啟用,且跨格式失敗源於啟用狀態而非不同電路,表明LLM的算術計算在神經元層面具有形式不變性。

  • 使用歸因修補和啟用修補的兩階段管道識別算術啟發式神經元。
  • 發現一組緊湊的共享神經元在符號、文本和程式碼三種形式中均起作用。
站內正文

SpecLA: 線性注意力模型的高效推測解碼

本文提出了 SpecLA,一種針對有狀態線性注意力模型的推測解碼執行時。它透過拓撲感知核心驗證鏈和樹,儲存驗證過程中產生的緊湊因子以恢復接受狀態,並使用置信剪枝和目標對齊的EAGLE風格草案生成器提供有用候選。在NVIDIA H100上使用公共GDN-1.3B目標,SpecLA實現了比自迴歸解碼高達1.70倍的端到端加速。

  • 線性注意力模型用迴圈狀態替代增長的KV快取,但自迴歸解碼仍逐令牌處理。
  • 現有推測解碼系統設計用於Transformer KV快取,不適用於有狀態線性注意力模型。
站內正文

OpenLanguageModel:用於教育和研究的可讀可組合小語言模型預訓練

OpenLanguageModel (OLM) 是一個開源的 PyTorch 庫,用於構建和預訓練小型語言模型,同時保持其內部機制可見。模型程式碼直接反映架構,元件如 Block、Residual、Repeat 和 Parallel 描述連線方式。OLM 整合了分詞器、資料集、最佳化、混合精度、回撥、檢查點以及硬體感知的執行,支援從教學筆記本到完整預訓練的無縫遷移。該庫包含 9 個常見模型家族的 27 個預設,並提供從基礎到架構研究的文件。驗證顯示與獨立參考實現高度一致,348M 引數模型在四 GPU 上弱擴充套件效率達 90.6%,且早期可用性反饋積極。OLM 採用 MIT 許可證,可透過 PyPI、GitHub 和文件站點獲取。

  • OLM 提供可讀的模型程式碼,直接對應架構元件,便於教學和研究。
  • 支援從筆記本到完整預訓練的無縫遷移,整合完整訓練流程。
站內正文

從記憶到技能:基於證據的長期LLM代理協同進化治理

現有長期LLM代理的記憶系統往往將先前軌跡作為被動上下文檢索,而非轉化為可執行能力。本文提出MSCE框架,一種無需訓練的記憶-技能協同進化框架,將代理經驗組織為基礎步驟軌跡、可重用過程策略和宣告性環境認知。MSCE將具有正估計增益的證據支援的L2策略結晶為可呼叫技能,並引入反射加權值回填。實驗表明MSCE顯著優於現有方法。

  • MSCE將代理經驗組織為基礎步驟軌跡、可重用過程策略和宣告性環境認知。
  • 透過反射加權值回填,MSCE將稀疏終端反饋傳播至密集區域性自我反思,產生證據校準的軌跡值。
站內正文

NOWJ@COLIEE 2026:法律檢索與推理的自適應流水線

本文介紹了NOWJ團隊在COLIEE 2026競賽中五項任務的方法和結果,包括法律案例檢索、先例推理、法條檢索與推理、法律文本蘊含以及法律判決預測,提出了多種自適應流水線和深度學習模型。

  • 提出四階段法律案例檢索流水線,包括候選過濾、密集檢索、交叉編碼器重排序和自適應截斷預測
  • 法律案例蘊含任務結合BM25過濾、T5重排序和LLM蘊含驗證
站內正文

編碼腦電訊號探究語言模型中類似人類的下一詞預測行為

該研究透過腦電圖記錄的事件相關電位(ERP),對比人類與語言模型在下一詞預測任務中的表現,發現僅資訊理論中的“驚奇度”指標與語言處理的ERP相關,尤其是對於語義豐富的高內容詞,而模型規模擴大並不必然帶來更類人的認知處理。

  • 語言模型在下一詞預測準確度上接近人類,但高準確度未必反映人類閱讀理解的認知訊號。
  • 研究使用頂部預測和驚奇度兩種資訊度量,建模ERP模式以分析LMs的認知合理性。
站內正文

在推理之前已承諾:行為復現及開放權重LLM中答案預承諾的初步啟用水平證據

一項新研究透過簡單問題(洗車應步行還是開車)揭示了語言模型常先決定答案再推理以證明其合理性,而非從前提推導。實驗表明Qwen3-8B模型在多數情況下錯誤承諾步行,即使開車是唯一合理選擇。研究者透過啟用層次分析發現,模型在輸出答案前已顯示出向步行傾斜的跡象,即便最終回答開車。該發現提示現有模型存在推理前的決策偏差。

  • Qwen3-8B在簡單洗車任務中85-100%的取樣輸出錯誤推薦步行,即便開車才符合邏輯。
  • 模型在輸出答案前,隱藏狀態已顯示步行偏向,甚至對最終回答開車的例子也是如此。
站內正文

RIMS:面向小型語言模型檢索增強生成的平滑多對偏好最佳化框架

小型語言模型在檢索增強生成中易受噪聲證據影響。本文提出RIMS,一種三階段偏好最佳化框架,包括合成思維鏈偏好資料生成、可微平滑聚合機制和偏好最佳化。實驗表明其在多跳問答基準上優於現有方法。

  • 提出RIMS框架,透過平滑多對聚合最佳化小型語言模型的偏好學習
  • 使用目標模型自身進行拒絕取樣生成合成偏好資料,不依賴專有模型
站內正文

多級上下文建模實現混合專家模型中的一致專家選擇

混合專家模型(MoE)透過將令牌路由到一小部分專家來高效擴充套件Transformer模型。然而,現有路由器通常基於淺層或孤立的令牌表示來選擇專家,導致路由決策不穩定且語義不一致。本文從表示角度重新審視專家選擇,並提出多級上下文融合MoE(MCF-MoE)框架,透過整合跨層語義聚合和區域性令牌互動的互補訊號來構建上下文感知表示,從而實現更資訊豐富且一致的專家選擇。實驗表明,MCF-MoE在路由一致性和下游效能上均優於強基線,凸顯了上下文完整性在專家路由中的重要性。

  • 現有MoE路由器因上下文不完整導致路由不一致。
  • 提出MCF-MoE,融合跨層語義與區域性令牌互動。
站內正文

用於乳腺癌亞型分類與生存預測的令牌級跨模態Transformer與對比多工學習

本研究提出了一種令牌級跨模態Transformer模型,結合對比多工學習,用於整合基因組和臨床資料,實現乳腺癌亞型分類與生存預測的聯合最佳化,克服了現有方法中模態互動粗糙、融合方式簡單、目標獨立最佳化等侷限。

  • 現有方法將每種模態視為整體特徵向量,無法進行細粒度令牌級互動。
  • 提出令牌級跨模態Transformer實現結構化令牌交換。
站內正文

從權重到語言:用自然語言表達和編輯偏好模型推理

本文提出“從權重到語言”方法,自動從選擇資料中發現以自然語言描述的偏好維度,解決偏好學習中的欠確定性和黑箱問題。實驗表明,該方法能提高預測準確率,並允許使用者即時檢查和編輯模型推理。

  • 提出“從權重到語言”方法,自動提取自然語言描述的偏好維度。
  • 在道德困境、電影、葡萄酒和LLM響應等四個領域驗證了方法的通用性。
站內正文

運算元感知的混合精度容差校準應用於張量核

本文提出了一種基於運算元感知的混合精度容差校準方法,透過挖掘累積的雲GPU執行資料,自動確定張量核正確性測試的最佳絕對容差,相比手工選擇的容差更嚴格,並顯著提高了錯誤檢測召回率。

  • 當前張量核測試使用固定手工選取的容差,很少更新。
  • 新方法透過分析雲GPU執行中的誤差分佈來校準每個運算元的容差。
站內正文

LLM遺忘機制在網路安全中的應用:方法、挑戰與新興威脅綜述

大型語言模型在關鍵領域的部署帶來了遺忘能力的缺失,導致隱私洩露和安全風險。本文綜述了基於梯度的LLM遺忘方法,探討其是否真正移除知識或僅抑制表達,並分析了安全、魯棒性和可驗證遺忘的挑戰。

  • LLM遺忘技術旨在在不完全重訓練的情況下移除模型中的敏感或危險知識。
  • 當前方法主要是基於梯度的,但存在知識是否真正被移除的爭議。
站內正文

支援本地機器學習的新型智慧眼鏡平臺

本文介紹ARGO智慧眼鏡平臺,利用STM32N6微控制器及其整合NPU實現本地機器學習,保護隱私並降低延遲。透過軟硬體協同設計,部署最佳化後的YOLOv11模型進行即時城市障礙物識別,引入頭並行注意力機制(HPA)適配NPU,模型僅佔用2.483 MB記憶體,mAP50-95達24。該平臺整合多模態感測器,以10 FPS執行,200 mAh電池續航約113分鐘,展示了高效能、隱私保護且社交可接受輔助裝置的可行性。

  • ARGO智慧眼鏡平臺採用STM32N6微控制器和NPU,實現本地ML處理,避免雲依賴
  • 引入頭並行注意力(HPA)最佳化YOLOv11模型,在嚴格記憶體限制下達到mAP50-95 24
站內正文

DocOCR-Eval:一種基於校正的無真實標註OCR工具選擇框架

本文提出DocOCR-Eval,一種無需人工標註的評估框架,用於自動評估和選擇OCR工具。該框架透過三階段校正和排序策略,在缺乏真實標籤的情況下近似基於標註的工具排序。實驗表明,聚合多個多模態大語言模型可逐步提升與人工標註排序的一致性,為實際部署文件解析系統提供指導。

  • DocOCR-Eval無需人工標註即可評估OCR工具效能。
  • 採用三階段校正和排序策略近似真實排序。
站內正文

僅需8個token:透過輔助分支的弱到強離策略強化學習

一種新的強化學習方法W2SPO,利用弱輔助模型在大型語言模型推理路徑中注入簡短片段,在數學推理任務上提升了效能並加速訓練。

  • 標準強化學習用於大型語言模型時存在語義冗餘和支援有限問題
  • W2SPO在中間軌跡中注入短輔助片段(最少8個token)
站內正文

掩碼擴散語言模型成為智慧體強化學習中強大且可操控的文本世界模型

強化學習領域需要多樣化的訓練環境,但傳統手工設計的環境難以擴充套件。自迴歸世界模型存在從左到右的偏差,無法充分利用全域性狀態資訊。一項新研究提出使用掩碼擴散語言模型(MDLM)作為文本世界模型,透過雙向錨點感知去噪,在連貫性和多樣性上顯著優於引數規模大4倍的語言模型,並引入GRPO訓練框架實現高達47%的零樣本遷移效能提升。該工作已開源。

  • MDLM在文本世界建模中比自迴歸語言模型在連貫性和多樣性上表現更好。
  • 雙向錨點感知去噪允許基於全域性狀態錨點進行條件生成。
站內正文

生成式本體歸納:使用大語言模型從文件語料庫中發現領域無關的模式

本文提出生成式本體歸納(GOI),一種領域無關的框架,能從示例語料庫中歸納出實體、維度、屬性、關係和約束的生成藍圖,並匯出為帶有六種節點型別和七種邊型別的型別圖(YAML/JSON格式)。引入節點覆蓋率評分(NCS)評估指標。在四個對比本體上的驗證表明,GOI提示生成覆蓋了95-100%的結構骨幹,而通用模板覆蓋率顯著下降。

  • GOI是一種領域無關的本體歸納框架,利用大語言模型從文件語料庫中自動發現模式。
  • 輸出為型別圖(六種節點、七種邊),支援YAML/JSON格式,可直接用於下游管道。
站內正文

AI代理系統確定性重放框架agrepl

AI代理系統因結合大語言模型與外部工具而本質非確定性。arXiv論文提出agrepl框架,透過MITM代理攔截外部互動,實現執行軌跡的確定性重放,並憑噪聲感知差異演算法區分HTTP頭部變化。實驗顯示重放保真度F=1.0,單步延遲降低98.3%。

  • AI代理系統(LLM+工具/API)的執行本質上非確定,難以復現。
  • agrepl框架使用MITM代理記錄全部外部互動,並在隔離環境中重放。
站內正文

PlanFlip:透過規劃階段提示注入攻擊多智慧體LLM系統

一項新研究提出PlanFlip框架,包含四種針對多智慧體LLM系統規劃階段的提示注入攻擊。研究發現,更強的模型(如GPT-5)反而更易受攻擊,同質化骨幹網路存在相關智慧體盲點,而推理增強型模型(如DeepSeek-R1)能抵禦攻擊。提出的兩種防禦方法檢測率高達1.00。

  • PlanFlip引入四種針對多智慧體系統規劃階段的提示注入攻擊。
  • 更強的模型(如GPT-5)攻擊成功率更高,挑戰了能力即安全的假設。
站內正文

一些大型語言模型表現出一致的風險態度

一項新研究透過跨領域框架測試了大型語言模型(LLMs)在不確定性下的風險態度,發現大多數模型在任務內和跨任務中都表現出穩定且一致的風險偏好,且其風險態度分佈比人類更集中。

  • 研究引入跨領域框架,將情境風險信念與類別決策分離,測試了6個LLM和100名人類參與者。
  • 大多數LLM在空間導航、臨床分診和財務分配任務中表現出穩健的任務內一致性。
站內正文

輕量級1D CNN的設計與驗證:用於軟毛絨伴侶的情感觸覺分類

本研究提出了一種基於MATLAB的開源框架,用於開發軟互動伴侶中的情感觸覺識別緊湊深度學習模型。透過468個CNN模型的系統探索,確定了13.2k引數的擴張1D CNN為最佳方案,測試準確率75%,留一法交叉驗證準確率85%。混合推理管道結合瞬時啟發式濾波和CNN精細分類,可在20 Hz即時執行,實現隱私保護的情感觸覺解讀。

  • 公開了1326個手勢序列的FAIR相容資料集,涵蓋25名參與者。
  • 13.2k引數的1D CNN達到75%測試準確率和85%留一法交叉驗證準確率。
站內正文

Concentrate: LLM閘道器

Concentrate 是一個託管的LLM閘道器,提供單一API訪問超過130個來自主要供應商的模型。它具備模型路由、支出跟蹤、安全控制和故障轉移冗餘等功能,專為擴充套件AI生產的團隊設計。

  • 單一API可訪問來自OpenAI、Anthropic、Google等提供商的130多個模型。
  • 內建資料脫敏、零資料保留、審計日誌、SSO和RBAC等安全功能。
站內正文

開放權重AI是減速主義的嗎?

OpenAI戰略未來主管Dean Ball認為開放權重模型本質上是減速主義的,因為它們抑制資本支出。本文從經濟學角度探討了這一觀點,分析了中國在AI基礎設施方面的投資、訓練正規化的轉變以及價值在價值鏈中的遷移。文章認為,開放權重模型可能透過降低成本擴大應用範圍,促進創新,從而實際上是加速主義的。

  • Dean Ball聲稱開放權重模型是減速主義的,因為它減少了資本投資。
  • 中國可能透過補貼產能和壓縮利潤加劇這一趨勢。
站內正文

Colibrì概念驗證:用25GB記憶體執行1.5TB的AI模型

義大利工程師Vincenzo(又名JustVugg)建立了Colibrì,這是一個概念驗證專案,能夠在僅25GB RAM和1GB/s NVMe的CPU上執行7440億引數的GLM-5.2模型(1.5TB)。儘管速度極慢(每0.05-0.1秒一個token),但利用混合專家(MoE)架構按token載入專家,實現了前沿水平的回答質量。專案開源,旨在探索在消費級硬體上執行大型模型的可行性。

  • Colibrì在低端硬體上執行1.5TB的GLM-5.2模型,速度僅0.05-0.1 token/秒。
  • 利用MoE架構按token載入專家子模型,透過反覆載入/解除安裝適應有限記憶體。
站內正文

GPT-5.6 Sol 與 Kimi K3 在《坎巴拉太空計劃》中即時競速直播

直播中,GPT-5.6 Sol 與 Kimi K3 在《坎巴拉太空計劃》裡進行速度競賽,展示 AI 在複雜遊戲中的即時決策能力。

  • GPT-5.6 Sol 和 Kimi K3 在 Twitch 直播中競速《坎巴拉太空計劃》。
  • 比賽考驗 AI 的即時規劃與操作技巧。
站內正文

阿里通義實驗室釋出Qwen-Audio-3.0-TTS:支援16種語言的Flash和Plus兩檔託管文本轉語音模型

阿里通義實驗室推出Qwen-Audio-3.0-TTS,一款面向生產的文本轉語音系統,提供Flash(即時互動)和Plus(高質量生成)兩檔,透過阿里雲模型託管服務交付。該模型覆蓋16種語言和20種中文方言,支援自然語言風格控制和86種細粒度內聯標籤,並在Artificial Analysis語音競技場中排名第一。文章詳細介紹了模型架構、效能表現、開發者反饋及定價資訊。

  • Qwen-Audio-3.0-TTS提供Flash(約300毫秒首包延遲)和Plus(質量優先)兩個版本,均為API託管服務。
  • Plus版本在Artificial Analysis競技場Elo評分約1236,每百萬字元價格約27.59美元,但吞吐量僅約16字元/秒。
站內正文

逆向工程現在變得便宜了

不斷有使用者分享他們利用編碼代理逆向工程並自動化家中裝置的軼事。這展示了編碼成本降低帶來的影響。過去,逆向工程雖然可行,但投資回報率低,且需面對不穩定API的維護風險。編碼代理徹底改變了這一局面,降低了初始工作和失敗的成本,也減輕了未來維護的心理負擔。

  • 編碼代理降低了逆向工程和自動化的門檻
  • 過去因成本高、維護風險大而不值得做的專案現在變得可行
站內正文

誰在害怕中國模型?

本·湯普森提出美國應立法明確訓練資料為合理使用,並禁止禁止蒸餾的服務條款,以幫助美國開源模型與中國模型競爭。同時,阿里巴巴決定釋出Qwen 3.8 Max開源權重,可能受習近平鼓勵開源合作的講話影響。

  • 本·湯普森建議美國立法將訓練資料收集定為合理使用,並禁止禁止蒸餾的服務條款。
  • 蒸餾(即查詢API)幾乎無法阻止,美國應轉變政策,鼓勵透過訓練成果推動創新。
站內正文

Kimi K3:開放權重升級

Moonshot AI釋出了最新旗艦模型Kimi K3,這是一個2.8萬億引數的MoE模型,將於7月27日開放權重。K3在多項基準測試中排名靠前,成為最強的開源模型。文章探討了中美AI模型差距縮小、中國開源策略、開源模型的經濟影響以及中國AI的效率優勢。

  • Kimi K3是2.8T引數的MoE模型,開放權重,效能接近前沿閉源模型。
  • 中國AI實驗室展示出獨立創新能力,而不僅僅是快速追隨。
站內正文

Adobe '自然外觀'相機應用擁抱生成式AI

Adobe的實驗性相機應用Indigo最初專注於為iPhone攝影提供更自然的單反效果,現在透過'AI Playground'套件增加了生成式AI編輯功能,使用Google的Nano Banana模型。功能包括AI風格、物體移除、照片指導和自定義編輯。該實驗目前向一小部分使用者提供免費訪問,將來可能轉為付費。

  • Adobe的Indigo應用新增了生成式AI編輯功能,名為'AI Playground'套件。
  • 採用Google的Nano Banana模型,而非Adobe自家的Firefly,未來可能更換。
站內正文

Inertia-1:統一運動基礎模型的開源探索

Inertia-1是一個統一的運動基礎模型,透過在手腕資料上進行大規模自監督學習,建立可泛化到不同身體部位和感測器型別的表示,並揭示了取樣率、視窗大小等設計選擇對實際效能的影響。

  • 透過大規模自監督學習,在1800萬小時加速度計資料上預訓練,無需標籤。
  • 手腕預訓練模型可零成本遷移到其他身體部位和感測器型別。
站內正文

隨著AI支出攀升,企業認真對待Token成本

不透明的定價和滯後的賬單迫使企業重新思考其AI模型策略。

  • AI支出不斷增長,企業開始關注Token成本。
  • 不透明的定價和回顧性計費方式引發企業不滿。
站內正文

主要AI模型可能拒絕批評限制性領導人或政府

Meta監督委員會的一項研究發現,包括美國公司構建的主要AI系統更傾向於拒絕批評限制性領導人或政府的請求,引發了對AI技術可能擴充套件國家對言論自由限制的擔憂。

  • AI模型如Claude和ChatGPT拒絕生成針對沙特、中國和泰國領導人的批評內容。
  • 研究指出AI可能強化政府控制網路言論的能力。
站內正文

主題導航

模型 — AI 主題新聞 | AI News Hub