AI News HubLIVE

模型動態

Concentrate: LLM閘道器

Concentrate 是一個託管的LLM閘道器,提供單一API訪問超過130個來自主要供應商的模型。它具備模型路由、支出跟蹤、安全控制和故障轉移冗餘等功能,專為擴充套件AI生產的團隊設計。

  • 單一API可訪問來自OpenAI、Anthropic、Google等提供商的130多個模型。
  • 內建資料脫敏、零資料保留、審計日誌、SSO和RBAC等安全功能。
站內正文

開放權重AI是減速主義的嗎?

OpenAI戰略未來主管Dean Ball認為開放權重模型本質上是減速主義的,因為它們抑制資本支出。本文從經濟學角度探討了這一觀點,分析了中國在AI基礎設施方面的投資、訓練正規化的轉變以及價值在價值鏈中的遷移。文章認為,開放權重模型可能透過降低成本擴大應用範圍,促進創新,從而實際上是加速主義的。

  • Dean Ball聲稱開放權重模型是減速主義的,因為它減少了資本投資。
  • 中國可能透過補貼產能和壓縮利潤加劇這一趨勢。
站內正文

Colibrì概念驗證:用25GB記憶體執行1.5TB的AI模型

義大利工程師Vincenzo(又名JustVugg)建立了Colibrì,這是一個概念驗證專案,能夠在僅25GB RAM和1GB/s NVMe的CPU上執行7440億引數的GLM-5.2模型(1.5TB)。儘管速度極慢(每0.05-0.1秒一個token),但利用混合專家(MoE)架構按token載入專家,實現了前沿水平的回答質量。專案開源,旨在探索在消費級硬體上執行大型模型的可行性。

  • Colibrì在低端硬體上執行1.5TB的GLM-5.2模型,速度僅0.05-0.1 token/秒。
  • 利用MoE架構按token載入專家子模型,透過反覆載入/解除安裝適應有限記憶體。
站內正文

GPT-5.6 Sol 與 Kimi K3 在《坎巴拉太空計劃》中即時競速直播

直播中,GPT-5.6 Sol 與 Kimi K3 在《坎巴拉太空計劃》裡進行速度競賽,展示 AI 在複雜遊戲中的即時決策能力。

  • GPT-5.6 Sol 和 Kimi K3 在 Twitch 直播中競速《坎巴拉太空計劃》。
  • 比賽考驗 AI 的即時規劃與操作技巧。
站內正文

阿里通義實驗室釋出Qwen-Audio-3.0-TTS:支援16種語言的Flash和Plus兩檔託管文本轉語音模型

阿里通義實驗室推出Qwen-Audio-3.0-TTS,一款面向生產的文本轉語音系統,提供Flash(即時互動)和Plus(高質量生成)兩檔,透過阿里雲模型託管服務交付。該模型覆蓋16種語言和20種中文方言,支援自然語言風格控制和86種細粒度內聯標籤,並在Artificial Analysis語音競技場中排名第一。文章詳細介紹了模型架構、效能表現、開發者反饋及定價資訊。

  • Qwen-Audio-3.0-TTS提供Flash(約300毫秒首包延遲)和Plus(質量優先)兩個版本,均為API託管服務。
  • Plus版本在Artificial Analysis競技場Elo評分約1236,每百萬字元價格約27.59美元,但吞吐量僅約16字元/秒。
站內正文

逆向工程現在變得便宜了

不斷有使用者分享他們利用編碼代理逆向工程並自動化家中裝置的軼事。這展示了編碼成本降低帶來的影響。過去,逆向工程雖然可行,但投資回報率低,且需面對不穩定API的維護風險。編碼代理徹底改變了這一局面,降低了初始工作和失敗的成本,也減輕了未來維護的心理負擔。

  • 編碼代理降低了逆向工程和自動化的門檻
  • 過去因成本高、維護風險大而不值得做的專案現在變得可行
站內正文

誰在害怕中國模型?

本·湯普森提出美國應立法明確訓練資料為合理使用,並禁止禁止蒸餾的服務條款,以幫助美國開源模型與中國模型競爭。同時,阿里巴巴決定釋出Qwen 3.8 Max開源權重,可能受習近平鼓勵開源合作的講話影響。

  • 本·湯普森建議美國立法將訓練資料收集定為合理使用,並禁止禁止蒸餾的服務條款。
  • 蒸餾(即查詢API)幾乎無法阻止,美國應轉變政策,鼓勵透過訓練成果推動創新。
站內正文

Kimi K3:開放權重升級

Moonshot AI釋出了最新旗艦模型Kimi K3,這是一個2.8萬億引數的MoE模型,將於7月27日開放權重。K3在多項基準測試中排名靠前,成為最強的開源模型。文章探討了中美AI模型差距縮小、中國開源策略、開源模型的經濟影響以及中國AI的效率優勢。

  • Kimi K3是2.8T引數的MoE模型,開放權重,效能接近前沿閉源模型。
  • 中國AI實驗室展示出獨立創新能力,而不僅僅是快速追隨。
站內正文

Adobe '自然外觀'相機應用擁抱生成式AI

Adobe的實驗性相機應用Indigo最初專注於為iPhone攝影提供更自然的單反效果,現在透過'AI Playground'套件增加了生成式AI編輯功能,使用Google的Nano Banana模型。功能包括AI風格、物體移除、照片指導和自定義編輯。該實驗目前向一小部分使用者提供免費訪問,將來可能轉為付費。

  • Adobe的Indigo應用新增了生成式AI編輯功能,名為'AI Playground'套件。
  • 採用Google的Nano Banana模型,而非Adobe自家的Firefly,未來可能更換。
站內正文

Inertia-1:統一運動基礎模型的開源探索

Inertia-1是一個統一的運動基礎模型,透過在手腕資料上進行大規模自監督學習,建立可泛化到不同身體部位和感測器型別的表示,並揭示了取樣率、視窗大小等設計選擇對實際效能的影響。

  • 透過大規模自監督學習,在1800萬小時加速度計資料上預訓練,無需標籤。
  • 手腕預訓練模型可零成本遷移到其他身體部位和感測器型別。
站內正文

隨著AI支出攀升,企業認真對待Token成本

不透明的定價和滯後的賬單迫使企業重新思考其AI模型策略。

  • AI支出不斷增長,企業開始關注Token成本。
  • 不透明的定價和回顧性計費方式引發企業不滿。
站內正文

主要AI模型可能拒絕批評限制性領導人或政府

Meta監督委員會的一項研究發現,包括美國公司構建的主要AI系統更傾向於拒絕批評限制性領導人或政府的請求,引發了對AI技術可能擴充套件國家對言論自由限制的擔憂。

  • AI模型如Claude和ChatGPT拒絕生成針對沙特、中國和泰國領導人的批評內容。
  • 研究指出AI可能強化政府控制網路言論的能力。
站內正文

中國給美國人工智慧霸主地位一記組合拳

中國領先的人工智慧公司Moonshot和阿里巴巴釋出了新模型,聲稱能以更低成本與OpenAI和Anthropic的最佳模型競爭。這些開放原始碼的釋出加劇了中美技術競賽,並質疑美國鉅額投入是否能維持優勢。

  • Moonshot釋出Kimi K3,阿里巴巴推出Qwen3.8,均聲稱效能接近頂尖美國模型。
  • 兩家公司強調模型開源,與美國的封閉策略形成對比。
站內正文

長週期模型時代的安全與對齊

OpenAI分享了部署長期執行AI模型的經驗,強調了新的安全風險、觀察到的失敗,以及透過迭代部署改進的安全措施。

  • 長期執行AI模型帶來新的安全風險
  • 觀察到模型在長時間任務中出現的失敗模式
站內正文

美國公共衛生機構將測試OpenAI和Anthropic的AI模型

美國公共衛生部門將透過PULSE計劃測試生成式AI工具,涉及OpenAI、Anthropic和埃森哲。該計劃將在10個州、地方、部落或地區開展試點,旨在為公共衛生機構的AI部署提供指導。OpenAI和Anthropic捐贈了10個企業許可證,可供2000名從業者使用。試點將涵蓋五個用例,包括生物監測、健康的社會決定因素、公共溝通、自動化臨床資料檢索等。計劃於2026年秋季啟動,2027年釋出實施手冊。

  • PULSE計劃由健康AI聯盟、OpenAI、Anthropic和埃森哲共同參與,將在10個司法管轄區開展試點。
  • OpenAI和Anthropic捐贈了10個企業許可證,可供2000名公共衛生從業者使用。
站內正文

Kimi K3 開放權重模型:中國最大的人工智慧押注記憶體而非算力

月之暗面釋出Kimi K3,一個擁有2.8萬億引數的開放權重模型,採用混合專家架構、量化訓練和Delta注意力機制,以記憶體池化策略應對美國晶片限制。儘管引數龐大,但模型透過降低計算需求來適配受限硬體,實際部署仍需資料中心級基礎設施,且軟體生態尚未完全就緒。

  • Kimi K3 擁有2.8萬億引數,是迄今最大的開放權重模型。
  • 採用混合專家架構,每次推理僅啟用1.8%的引數,但記憶體佔用不減。
站內正文

Thinking Machines Inkling 完全指南

Thinking Machines Lab 釋出了其首個通用開放權重基礎模型 Inkling。該模型擁有 9750 億引數(其中 410 億啟用)、100 萬 token 上下文視窗,採用多模態稀疏 MoE 架構,支援文本、影像和音訊處理。Inkling 以可定製的開源模型形態,面向多模態推理、智慧體、程式設計、工具使用及企業微調場景。本文詳解其架構、訓練、基準測試、部署及微調工作流。

  • Inkling 是 975B 總引數、41B 啟用引數的多模態稀疏 MoE 模型,上下文視窗達 100 萬 token。
  • 採用混合注意力、相對位置編碼、短卷積及多 token 預測等技術,支援文本、影像、音訊輸入。
站內正文

Show HN:一款由 Groq Llama 3.3 驅動的快速免費 AI 文本人性化工具

Zlvox AI Humanizer 是一款免費且無限使用的線上工具,利用 Groq Llama 3.3 將 AI 生成的文本轉化為自然的人類語言,能夠繞過 GPTZero、Turnitin 等檢測器。它提供多種人性化級別、寫作風格調整、語法修復、改寫和摘要功能,支援 ChatGPT、Claude 等所有主流 AI 模型的輸出,且無需註冊。

  • 免費、無限使用,無需註冊或登入
  • 支援四種人性化級別(輕度、中度、重度、繞過檢測)和六種寫作風格
站內正文

MemoGuard:一種用於通訊受限機器人導航中防止記憶陷阱的自適應執行時

在災難檢查、搜尋救援等關鍵任務中,通訊受限的機器人必須依賴機載決策。低成本的記憶重用可能因環境變化而變得不安全(稱為“記憶陷阱”)。本文提出MemoGuard,一種輕量級自適應執行時,在重用前根據拓撲、資源和結果契約驗證記憶,僅當驗證失敗時才呼叫回退推理。在走廊巡檢模擬器中,與單純相似性重用相比,電池安全違規減少76.6%,回退呼叫次數比始終使用推理減少21.4%。在NVIDIA Jetson AGX Xavier上使用本地llama3.2:3b回退推理時,每次試驗節省3.67秒和36.97焦耳。

  • 提出“記憶陷阱”概念:高相似度但執行無效的情景記憶。
  • MemoGuard透過合同檢查(拓撲、資源、結果)在重用前驗證記憶。
站內正文

PACE:透過對話引導實現人機互動中的個性適應

本文提出PACE框架,透過對話引導動態生成個性化、心理上合理的機器人身份,並在Ameca人形機器人上實現。實驗表明,相比靜態基線,動態個性顯著提升使用者信任、擬人化感知和互動質量。

  • PACE透過使用者問答動態合成個性化身份,克服了傳統靜態個性的侷限。
  • 框架包含互動式個性引導管道和個性提示編譯階段,支援多維度個性構建。
站內正文

軟體機器人致動器的穩健矽膠澆注鑄造與感測器嵌入流程

本文提出了一套基於雙組分矽膠澆注鑄造的軟氣動致動器穩健製造流程,解決了內部腔體堵塞和氣密性問題,並開發了薄膜柔性感測器的嵌入方法。透過有限元分析、PID壓力控制實驗以及自動影像處理校準,驗證了致動器效能。階梯波和正弦波驅動實驗表明其具有高重複性和低滯後,且經過兩位操作者24次成功製造驗證,為軟體機器人的規模化應用提供了可靠基礎。

  • 提出雙組分澆注鑄造法,防止腔體堵塞並確保氣密密封。
  • 開發薄膜柔性感測器穩健嵌入流程,實現精確資料採集。
站內正文

小米機器人-1:基於超過10萬小時真實世界軌跡的視覺-語言-動作模型規模化

小米機器人團隊提出Xiaomi-Robotics-1,一個基礎視覺-語言-動作(VLA)模型,能夠遵循多樣語言指令在未見環境中執行移動操作任務,並透過少量微調資料高效適應新任務。模型採用兩階段訓練:預訓練階段利用超過10萬小時的真實操作軌跡(透過UMI裝置收集)賦予模型廣泛的動作生成能力,並開發了可擴充套件的自動標註流水線;後訓練階段對齊機器人本體和人類指令。實驗證明模型具有強擴充套件性,在RoboCasa365上達到57.6%的成功率,在RoboDojo上取得20.07的平均分,均超越先前最佳水平。程式碼和模型將開源。

  • Xiaomi-Robotics-1是一個基礎VLA模型,能在未見環境中零樣本執行多種移動操作任務。
  • 預訓練使用超過10萬小時的真實世界操作軌跡,並採用自動標註流水線生成自然語言描述。
站內正文

軌跡感知的跨視角地理定位:基於序列觀測的方法

跨視角地理定位將地面觀測與衛星影像匹配。最新方法利用影片片段等序列查詢獲得更豐富的時空線索,但忽略了路線描述這一互補模態。本文提出SeqGeo-VL資料集(約3.9萬影片-文本-衛星三元組)和TrajLoc統一框架,同時處理影片和路線描述,透過密集視覺與抽象語言語義相互增強。還提出TrajMod輕量模組,根據軌跡幾何條件化查詢嵌入,實現空間感知表示。實驗表明TrajLoc在影片和文本地理定位上顯著超越現有方法。

  • TrajLoc統一框架可同時處理影片片段和路線描述,實現跨視角匹配的相互增強。
  • SeqGeo-VL資料集包含約3.9萬個影片-文本-衛星三元組,填補了路線描述模態的空白。
站內正文

部分資訊分解作為資源受限深度神經網路訓練中多對比度3D MRI選擇策略用於腦腫瘤分割

使用部分資訊分解(PID)框架在訓練前選擇最優的MRI對比度組合,以降低多對比度3D MRI腦腫瘤分割的計算成本。研究選取T1c+T2-FLAIR作為最佳輸入對,在輕量級3D U-Nets上表現接近全輸入配置,平均Dice 0.676 vs 0.687,驗證了PID的實際價值。

  • 提出PID框架用於在資源受限時選擇最優MRI對比度輸入對
  • T1c+T2-FLAIR被選為最佳兩輸入組合,效能接近全輸入
站內正文

透過強化學習實現推理引導的部件級視覺定位

多模態大語言模型(MLLMs)能夠從自然語言查詢中定位整個物體,但在查詢指定部件而非物體時表現不佳。本文提出物體-部件層次化反射式定位(OP-HRG),一種由粗到細的推理引導定位策略:先定位父物體,再鎖定其中的部件。自檢步驟會反思結果,並擴充套件為重新編碼預測裁剪區域以檢查糾正的區域。我們引入部件感知的GRPO框架,透過階段獎勵訓練該流程。一個4B模型經此訓練後,在PascalPart、PartImageNet和InstructPart上優於7B定位LLMs和SAM3,並遷移至推理分割。

  • 現有MLLMs缺乏物體-部件層次結構,導致部件定位困難。
  • OP-HRG採用兩步由粗到細流程:先定位父物體,再定位部件。
站內正文

無需訓練的開放詞彙3D點雲分割在廣義少樣本基準上的突破

該研究提出一種完全無需訓練的開放詞彙3D點雲分割方法,利用凍結的視覺語言模型(RegionPLC)和提示概念分割器(SAM3)透過跨檢視一致性實現廣義少樣本分割,在ScanNet200和ScanNet++基準上顯著提升了新類分割效能,且無需任何訓練或少樣本支援。

  • 提出無需訓練、無需3D標籤、無需少樣本支援的開放詞彙3D點雲分割方法。
  • 利用凍結的RegionPLC和SAM3模型,透過跨檢視一致性融合實現新類分割。
站內正文

重新思考讀出層:解鎖影片骨幹網路用於AI生成影片檢測

AI生成影片(AIGV)通常包含幀間不一致導致的細微時間偽影。然而,使用標準全域性讀出層的影片骨幹網路在AIGV檢測中往往不如強影像預訓練探測器。本文提出Velocity Gated Patch Velocity Profiling(V-PVP),一種輕量級讀出模組,僅替換聚合層,增加約0.5M可訓練引數,在AIGVDBench上達到95.28 AUC,且骨幹網路完全凍結。

  • AIGV檢測需要捕捉幀間時間偽影,但影片骨幹網路的全域性讀出會抑制區域性補丁動態和補丁間關係。
  • 提出的V-PVP模組透過兩並行流處理補丁速度場,僅增加0.5M引數,即可提升多種影片骨幹的效能。
站內正文

行動之前:面向前瞻性假設發現的LLM基準測試

大型語言模型(LLM)在回答預設問題方面表現優異,但其在開放式、結論前階段的探索能力尚未得到充分評估。本文提出前瞻性假設發現(PHD)任務,要求模型從不確定證據中自主構建有依據、可區分且可檢驗的假設空間。為評估該能力,研究者推出HypoArena基準,包含涵蓋六個科學分析領域的988個案例的HypoData資料集及HypoEval評估框架。實驗表明,15個前沿LLM在該任務上表現出明顯的能力分層,並揭示了結構化分析技能對模型效能的依賴效應。

  • 提出前瞻性假設發現(PHD)任務,評估LLM在結論前階段的自主假設構建能力
  • 構建HypoArena基準,包含HypoData(988個案例)和HypoEval(評估框架)
站內正文

更好的開始,更好的結束:引導式迭代自我推理蒸餾用於壓縮推理

本文提出BIRD,一種兩階段自我推理蒸餾方法,透過先取樣簡潔解並進行提示切換SFT,然後應用線上逆KL蒸餾,顯著提升了大語言模型在長鏈推理中的效率。在Qwen3-8B上,MATH-500準確率從86.2%提升至92.0%,同時響應長度從3099降至1115 tokens。

  • 現有線上自我蒸餾方法存在初始化瓶頸,模型在噪聲和冗餘字首上訓練。
  • BIRD第一階段利用簡潔指令取樣和提示切換SFT將簡潔性轉化為預設行為。
站內正文

自適應多步前瞻解碼用於擴散語言模型

本文提出AdaLook,一種用於掩碼擴散語言模型的自適應多步前瞻解碼框架。透過基於候選分數方差動態決定前瞻深度並支援分支擴充套件,AdaLook在保持高效的同時提升了生成質量,實驗表明其優於現有單步前瞻方法。

  • 掩碼擴散語言模型透過迭代細化掩碼令牌實現並行文本生成。
  • 現有前瞻解碼侷限於單步,無法適應長距離依賴。
站內正文

過程獎勵引導的自適應樹展開用於高效多輪強化學習

提出PATR方法,透過過程反饋評分部分軌跡、選擇性分支、共享字首和停止退化路徑,提升多輪強化學習效率。在FrozenLake和SWE-Bench上分別提升9.3和5.0分。

  • 現有GRPO/RLOO等方法均勻取樣完整軌跡,導致預算浪費在無資訊死衚衕,忽視有前途的中間狀態。
  • PATR利用任務相關過程反饋評分部分軌跡,從有前途狀態分支,共享字首,停止退化路徑。
站內正文

SkillCorpus:整合與評估面向真實世界LLM Agent的開放技能生態系統

SkillCorpus從約82.1萬個候選技能中篩選出超過9.6萬個開源LLM Agent技能,採用16類分類法和三個質量維度進行組織。結合檢索與選擇堆疊,它在多個基準測試中取得了持續改進,其中在SkillsBench上提升最大,達7.5個百分點。

  • SkillCorpus從82.1萬個爬取技能中篩選出9.6萬個,按分類法和質量維度組織。
  • 經過微調的檢索-選擇堆疊將任務相關技能與Agent匹配。
站內正文

EpiNarrate:從流行病學情景預測中生成本地化敘述的智慧框架

本文介紹EpiNarrate,一種用於公共衛生報告生成的智慧框架,將結構化數值推理與自然語言生成分離。框架透過部分有序模式提取情景軸,構建增強資料集,並採用比較語法確保語義和算術一致性,同時利用最大熵原理驅動的有趣性選擇機制平衡覆蓋與非冗餘。在COVID-19情景建模中心上的實驗表明,該模型生成的敘述具有更好的事實基礎和更廣泛的流行病學模式覆蓋。

  • EpiNarrate將數值推理與文本生成分離,以避免直接使用大語言模型時的不一致和遺漏。
  • 框架透過部分有序模式遍歷多維空間,並使用比較語法生成有效的定量陳述。
站內正文

語言模型中的可言語化表徵構成全域性工作空間

研究人員透過新解釋性技術“雅可比透鏡”發現,大型語言模型中存在一個類似於人類意識全域性工作空間的功能結構——J空間。該空間中的表徵可以被言語報告、故意呼叫和保持,用於中間推理步驟,並傳遞給任意下游計算,而自動處理則無需它們。J空間在中間層攜帶連貫內容,同時容納數十個概念,並透過權重廣播更廣泛。在一致性審計中,它揭示了策略性思考、評估意識和訓練中產生的錯誤傾向,而這些從未出現在輸出中。後訓練將助手的觀點安裝到工作空間中。反事實反思訓練透過僅訓練模型在被打斷並要求反思時會說的話來改善行為。這些發現表明語言模型維持著一小部分特權表徵,具有意識訪問的功能特徵。

  • 引入“雅可比透鏡”技術識別語言模型中可言語化的表徵(J空間)。
  • J空間具有全域性工作空間的功能特性:可報告、可控制、用於推理和廣播。
站內正文

大型語言模型作為統一多模態學習器用於臨床預測

該研究提出將電子健康記錄中的多模態資料(包括結構化檢測值和自由文本臨床敘述)全部轉換為自然語言序列,直接微調預訓練語言模型,無需專門的多模態融合架構。在住院死亡率、移植後移植物失效和急診分診三項臨床預測任務中,該方法與或超過特定任務的多模態基線,並優於臨床部署的梯度提升模型,大幅降低了系統複雜度。

  • 提出統一序列化正規化:將患者所有資料轉換為單一語言序列,微調LLM。
  • 在三個臨床預測任務上驗證,無需定製融合架構。
站內正文

LLM4EHR:透過大型語言模型對齊臨床時間序列與醫療事件序列

LLM4EHR是一種新型臨床基礎模型,結合領域適配的大語言模型和Transformer時間序列編碼器,透過正則化對比目標對齊EHR事件與時間序列,在ICU預測任務上表現優異,並支援透過k-shot遷移到新群體。

  • LLM4EHR利用大語言模型和Transformer時間序列編碼器實現時間對齊。
  • 提出正則化對比學習目標,學習魯棒的時間序列表示。
站內正文

AI交易:評估大型語言模型在技術市場分析中的應用

一篇系統評估五個大型語言模型(LLM)在技術市場分析中表現的研究論文,發現GPT-4 Turbo實現最高年化收益率和夏普比率,而FinGPT透過領域微調展現出有競爭力的風險調整後表現。研究還指出了數值幻覺、上下文視窗限制等常見缺陷。

  • GPT-4 Turbo在通用模型中取得最高年化收益率和夏普比率
  • FinGPT透過領域特定微調實現有競爭力的風險調整後表現
站內正文

一種可遷移的基於閾值的可解釋醫學資料分類框架

本文提出一種基於伯努利樸素貝葉斯(BNB)模型的統計驅動框架,透過監督χ²引導的統計二值化將連續變數轉化為閾值,實現完全可解釋的規則化臨床分類。在皮馬印第安人糖尿病、威斯康星乳腺癌和心力衰竭預測三個基準資料集上,AUC得分分別為0.800、0.984和0.919。機率校準透過Brier分數和beta校準得到改善。模型推理僅需參考表和基本算術,無需專有工具,為醫療AI的可信性和泛化提供實用方案。

  • 提出基於伯努利樸素貝葉斯的可解釋分類框架,透過χ²統計二值化處理連續變數,生成可解釋的決策規則。
  • 在三個醫療資料集上取得與複雜模型相當的高AUC效能(0.800、0.984、0.919)。
站內正文

可信AI工具與標記框架的批判性分析及實施鴻溝

本研究基於OECD資料集,對可信人工智慧(TAI)工具和信任標記框架進行了實證分析,揭示了倫理焦點、生命週期覆蓋、利益相關方定位及工具型別學上的顯著不對稱。研究建議擴大倫理目標、將倫理嵌入AI全生命週期,並促進更廣泛的多利益相關方參與。

  • TAI工具過度強調公平性、透明度和魯棒性,忽視可解釋性、數字安全和環境可持續性。
  • 現有工具和認證主要集中於開發後階段,缺乏對早期設計和資料收集的指導。
站內正文

超越玩笑:多角度推理檢測並解釋模因中的有害幽默

網際網路模因融合了視覺、文本和文化背景,使得幽默、諷刺與惡意共存的情況難以解讀。現有多模態分類器要麼忽略這些相互依賴關係,要麼可解釋性有限。本文提出MAR-12框架,利用視覺語言模型(VLM)從12個結構化視角解讀模因,透過角色感知軟門控注意力機制學習各視角貢獻,再基於原型分類器進行預測,並綜合視角推理和注意力權重生成解釋。在PrideMM和Memotion資料集上,幽默檢測準確率達80.3%,仇恨檢測達75.9%,優於現有方法,且生成的解釋連貫可信。

  • MAR-12框架結合視覺語言模型,從12個幽默與仇恨理論視角分析模因。
  • 採用角色感知軟門控注意力和原型分類器,提升分類效能與可解釋性。
站內正文

編碼智慧體解決ARC-AGI-3是否需要可執行世界模型、簡化和驗證?

一項新研究透過四種巢狀的Codex智慧體實驗,揭示了可執行世界模型、計劃性簡化和精確回放驗證在ARC-AGI-3任務中的貢獻。結果表明,更強的模型和更高的推理努力始終提升效能,但各元件效果因設定而異,完整的驗證處理表現最佳但資源消耗大。

  • 更強的模型和更高的推理努力普遍提升效能。
  • 可執行世界模型並非總是有益,文本基線在某些設定中表現更好。
站內正文

DrawingVQA:面向施工圖紙的多深度視覺文本推理真實世界基準

DrawingVQA 是首個專為評估多模態大語言模型(MLLM)在真實施工圖紙上表現而設計的基準。它包含33張“簽發施工”圖紙和92個專家策劃的問答對,涵蓋感知理解、上下文解釋和領域專家推理三個深度。透過雙分類框架,該基準首次將工程工作流對映到AI推理能力,評估顯示最先進的MLLM與專家效能之間仍存在顯著差距,尤其是在高推理深度上。

  • DrawingVQA 是首個針對施工圖紙的MLLM基準測試。
  • 包含33張真實圖紙和92個專家問答對,覆蓋三個推理深度。
站內正文

精確但脫鉤:評審精度不保證多智慧體數學推理中的批評採納

一項對4,181道數學問題的研究表明,在多智慧體系統中,規劃-執行-評審流水線的高精度評審者並不能保證批評被實際用於改進答案。廣播式同伴討論在難題上實現了更高的準確率,凸顯了檢測與採納之間的差距。

  • 層級評審流水線不能保證批評帶來答案改進。
  • 廣播式同伴討論在難題上優於規劃-執行-評審流水線。
站內正文

AnovaX:本地多智慧體語音助手,具備LLM規劃、型別化執行器和自適應恢復功能

AnovaX是一個完全在使用者計算機上執行的本地優先桌面語音助手,利用單個Python程序整合喚醒詞門控、語音處理、基於Gemini的LLM規劃器(輸出JSON計劃)、安全層、多智慧體協調器(將計劃轉化為型別化子智慧體)以及自適應恢復迴圈。每個工具對應專門的智慧體類,具有超時、重試策略和共享資源鎖。透過Flask伺服器支援手機遠端控制,即時映象智慧體事件並流式傳輸螢幕。專案旨在展示一個輕量級、可讀的助手足以完成複雜桌面任務。

  • AnovaX完全本地執行,無需雲端處理,使用使用者計算機作為操作介面。
  • 系統採用Gemini LLM規劃器生成JSON計劃,並由多智慧體協調器在受限執行緒池上執行。
站內正文

Cura 1T:面向醫療智慧體的專用模型

Cura 1T是一個專為醫療場景設計的大型語言模型,透過人工門控的自我進化迴圈進行訓練。它能處理患者諮詢、圖文臨床推理、互動式診斷和電子健康記錄工具使用。在醫療評估套件中,Cura 1T排名頂尖,同時在通用推理和智慧體基準測試上也保持競爭力。

  • Cura 1T 是首個覆蓋醫療交流、專家推理和工作流執行的專業化 LLM。
  • 採用人工門控自我進化迴圈,透過針對性合成和精選資料迭代最佳化模型。
站內正文

Causal-Audit:透過目標感知因果鏈構建實現顯式可審計的圖基推理

本文提出Causal-Audit框架,將因果推理顯式建模為結構化因果圖上的四階段推理,而非隱式端到端預測。核心創新包括目標感知的因果圖構建策略和路徑級因果證據聚合機制,有效抑制無關變數和虛假因果,提升複雜干預下的魯棒性。在三個基準測試上,該方法優於現有LLM方法,並提供可解釋、可審計的推理軌跡。

  • 提出顯式因果圖推理框架Causal-Audit,替代隱式語言推理。
  • 目標感知圖構建策略以目標變數為核心約束,減少噪聲。
站內正文

GraphDx:一種成本感知的知識增強多智慧體框架用於序貫診斷

GraphDx是一種結合知識圖譜和多智慧體協作的框架,透過自動化構建醫療診斷知識圖譜和三個智慧體(感知、推理、決策)的協同工作,在序貫診斷中平衡準確性和資源成本。在MedQA和MIMIC-IV資料集上的實驗表明,GraphDx將診斷成功率從50-68%提升至79-93%,同時將測試成本降低20-54%,為自動化臨床診斷提供了穩健、經濟且可解釋的解決方案。

  • GraphDx利用大型語言模型自動構建帶有量化典型性、行動中心拓撲和雙目標屬性的醫療診斷知識圖譜。
  • 引入三個協作智慧體:感知智慧體處理語言理解,推理智慧體進行確定性的證據評分和成本感知規劃,決策智慧體生成診斷結果。
站內正文

Sam Altman郵件曝光:OpenAI曾計劃釋出開源GPT-3級別模型

在一封2022年的郵件中,Sam Altman向OpenAI董事會表示,計劃儘快釋出一個可在消費級硬體上執行的、能力接近GPT-3的開源語言模型,以阻止競爭對手並減少新專案的資金支援。該郵件在2026年的馬斯克訴Altman案中被公開。

  • Sam Altman在2022年郵件中透露OpenAI的開源策略
  • 計劃釋出可本地執行的GPT-3級模型
站內正文

社群開發者微調OpenBMB的MiniCPM5-1B模型:基於Claude Fable 5資料,打造657MB本地推理模型

一位社群開發者基於OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的對話資料進行微調,釋出了一個僅657MB的本地推理模型。該模型支援128K上下文視窗、可切換的思維模式,並可在llama.cpp等工具中執行。本文驗證了其技術細節,區分了微調與真正的能力繼承,並指出了許可問題。

  • 模型為MiniCPM5-1B的監督微調版本,使用了Claude Fable 5的推理軌跡。
  • 支援128K上下文,GGUF量化最小版本僅657MB。
站內正文

2026年單張24GB GPU可執行的最佳本地LLM:Qwen、Gemma、Mistral、DeepSeek對比

本文對比了六款適合單張24GB GPU(如RTX 3090/4090)的開放權重模型,涵蓋Qwen3.6、Gemma 4、Mistral Small等,並解釋了記憶體分配、量化策略以及各模型的優勢場景。

  • 24GB是本地推理的實際起點,推薦使用20B-35B引數模型而非壓縮70B模型。
  • Qwen3.6-27B是最全面的通用選擇,DeepSeek-R1-Distill-Qwen-32B適合深度推理但佔用最高。
站內正文

主題導航

模型 — AI 主題新聞 | AI News Hub