誰在害怕中國模型?
本·湯普森提出美國應立法明確訓練數據為合理使用,並禁止禁止蒸餾的服務條款,以幫助美國開源模型與中國模型競爭。同時,阿里巴巴決定發佈Qwen 3.8 Max開源權重,可能受習近平鼓勵開源合作的講話影響。
- 本·湯普森建議美國立法將訓練數據收集定為合理使用,並禁止禁止蒸餾的服務條款。
- 蒸餾(即查詢API)幾乎無法阻止,美國應轉變政策,鼓勵通過訓練成果推動創新。
主題流
模型更新是 AI 產品和基礎設施變化的源頭。這裡追蹤前沿模型、多模態能力、開源權重、上下文窗口、評測結果、API 變化和部署路徑,協助讀者判斷新模型是否真正改變成本、品質或可用性。
本·湯普森提出美國應立法明確訓練數據為合理使用,並禁止禁止蒸餾的服務條款,以幫助美國開源模型與中國模型競爭。同時,阿里巴巴決定發佈Qwen 3.8 Max開源權重,可能受習近平鼓勵開源合作的講話影響。
Moonshot AI發佈了最新旗艦模型Kimi K3,這是一個2.8萬億參數的MoE模型,將於7月27日開放權重。K3在多項基準測試中排名靠前,成為最強的開源模型。文章探討了中美AI模型差距縮小、中國開源策略、開源模型的經濟影響以及中國AI的效率優勢。
Adobe的實驗性相機應用Indigo最初專注於為iPhone攝影提供更自然的單反效果,現在通過'AI Playground'套件增加了生成式AI編輯功能,使用Google的Nano Banana模型。功能包括AI風格、物體移除、照片指導和自定義編輯。該實驗目前向一小部分用户提供免費訪問,將來可能轉為付費。
Inertia-1是一個統一的運動基礎模型,通過在手腕數據上進行大規模自監督學習,創建可泛化到不同身體部位和傳感器類型的表示,並揭示了採樣率、窗口大小等設計選擇對實際性能的影響。
不透明的定價和滯後的賬單迫使企業重新思考其AI模型策略。
Meta監督委員會的一項研究發現,包括美國公司構建的主要AI系統更傾向於拒絕批評限制性領導人或政府的請求,引發了對AI技術可能擴展國家對言論自由限制的擔憂。
中國領先的人工智能公司Moonshot和阿里巴巴發佈了新模型,聲稱能以更低成本與OpenAI和Anthropic的最佳模型競爭。這些開放源代碼的發佈加劇了中美技術競賽,並質疑美國鉅額投入是否能維持優勢。
OpenAI分享了部署長期運行AI模型的經驗,強調了新的安全風險、觀察到的失敗,以及通過迭代部署改進的安全措施。
美國公共衞生部門將通過PULSE計劃測試生成式AI工具,涉及OpenAI、Anthropic和埃森哲。該計劃將在10個州、地方、部落或地區開展試點,旨在為公共衞生機構的AI部署提供指導。OpenAI和Anthropic捐贈了10個企業許可證,可供2000名從業者使用。試點將涵蓋五個用例,包括生物監測、健康的社會決定因素、公共溝通、自動化臨牀數據檢索等。計劃於2026年秋季啓動,2027年發佈實施手冊。
月之暗面發佈Kimi K3,一個擁有2.8萬億參數的開放權重模型,採用混合專家架構、量化訓練和Delta注意力機制,以內存池化策略應對美國芯片限制。儘管參數龐大,但模型通過降低計算需求來適配受限硬件,實際部署仍需數據中心級基礎設施,且軟件生態尚未完全就緒。
Thinking Machines Lab 發佈了其首個通用開放權重基礎模型 Inkling。該模型擁有 9750 億參數(其中 410 億激活)、100 萬 token 上下文窗口,採用多模態稀疏 MoE 架構,支持文本、圖像和音頻處理。Inkling 以可定製的開源模型形態,面向多模態推理、智能體、編程、工具使用及企業微調場景。本文詳解其架構、訓練、基準測試、部署及微調工作流。
Zlvox AI Humanizer 是一款免費且無限使用的在線工具,利用 Groq Llama 3.3 將 AI 生成的文本轉化為自然的人類語言,能夠繞過 GPTZero、Turnitin 等檢測器。它提供多種人性化級別、寫作風格調整、語法修復、改寫和摘要功能,支持 ChatGPT、Claude 等所有主流 AI 模型的輸出,且無需註冊。
在災難檢查、搜索救援等關鍵任務中,通信受限的機器人必須依賴機載決策。低成本的記憶重用可能因環境變化而變得不安全(稱為“記憶陷阱”)。本文提出MemoGuard,一種輕量級自適應運行時,在重用前根據拓撲、資源和結果契約驗證記憶,僅當驗證失敗時才調用回退推理。在走廊巡檢模擬器中,與單純相似性重用相比,電池安全違規減少76.6%,回退調用次數比始終使用推理減少21.4%。在NVIDIA Jetson AGX Xavier上使用本地llama3.2:3b回退推理時,每次試驗節省3.67秒和36.97焦耳。
本文提出PACE框架,通過對話引導動態生成個性化、心理上合理的機器人身份,並在Ameca人形機器人上實現。實驗表明,相比靜態基線,動態個性顯著提升用户信任、擬人化感知和交互質量。
本文提出了一套基於雙組分硅膠澆注鑄造的軟氣動致動器穩健製造流程,解決了內部腔體堵塞和氣密性問題,並開發了薄膜柔性傳感器的嵌入方法。通過有限元分析、PID壓力控制實驗以及自動圖像處理校準,驗證了致動器性能。階梯波和正弦波驅動實驗表明其具有高重複性和低滯後,且經過兩位操作者24次成功製造驗證,為軟體機器人的規模化應用提供了可靠基礎。
小米機器人團隊提出Xiaomi-Robotics-1,一個基礎視覺-語言-動作(VLA)模型,能夠遵循多樣語言指令在未見環境中執行移動操作任務,並通過少量微調數據高效適應新任務。模型採用兩階段訓練:預訓練階段利用超過10萬小時的真實操作軌跡(通過UMI設備收集)賦予模型廣泛的動作生成能力,並開發了可擴展的自動標註流水線;後訓練階段對齊機器人本體和人類指令。實驗證明模型具有強擴展性,在RoboCasa365上達到57.6%的成功率,在RoboDojo上取得20.07的平均分,均超越先前最佳水平。代碼和模型將開源。
跨視角地理定位將地面觀測與衞星圖像匹配。最新方法利用視頻片段等序列查詢獲得更豐富的時空線索,但忽略了路線描述這一互補模態。本文提出SeqGeo-VL數據集(約3.9萬視頻-文本-衞星三元組)和TrajLoc統一框架,同時處理視頻和路線描述,通過密集視覺與抽象語言語義相互增強。還提出TrajMod輕量模塊,根據軌跡幾何條件化查詢嵌入,實現空間感知表示。實驗表明TrajLoc在視頻和文本地理定位上顯著超越現有方法。
使用部分信息分解(PID)框架在訓練前選擇最優的MRI對比度組合,以降低多對比度3D MRI腦腫瘤分割的計算成本。研究選取T1c+T2-FLAIR作為最佳輸入對,在輕量級3D U-Nets上表現接近全輸入配置,平均Dice 0.676 vs 0.687,驗證了PID的實際價值。
多模態大語言模型(MLLMs)能夠從自然語言查詢中定位整個物體,但在查詢指定部件而非物體時表現不佳。本文提出物體-部件層次化反射式定位(OP-HRG),一種由粗到細的推理引導定位策略:先定位父物體,再鎖定其中的部件。自檢步驟會反思結果,並擴展為重新編碼預測裁剪區域以檢查糾正的區域。我們引入部件感知的GRPO框架,通過階段獎勵訓練該流程。一個4B模型經此訓練後,在PascalPart、PartImageNet和InstructPart上優於7B定位LLMs和SAM3,並遷移至推理分割。
該研究提出一種完全無需訓練的開放詞彙3D點雲分割方法,利用凍結的視覺語言模型(RegionPLC)和提示概念分割器(SAM3)通過跨視圖一致性實現廣義少樣本分割,在ScanNet200和ScanNet++基準上顯著提升了新類分割性能,且無需任何訓練或少樣本支持。
AI生成視頻(AIGV)通常包含幀間不一致導致的細微時間偽影。然而,使用標準全局讀出層的視頻骨幹網絡在AIGV檢測中往往不如強圖像預訓練探測器。本文提出Velocity Gated Patch Velocity Profiling(V-PVP),一種輕量級讀出模塊,僅替換聚合層,增加約0.5M可訓練參數,在AIGVDBench上達到95.28 AUC,且骨幹網絡完全凍結。
大型語言模型(LLM)在回答預設問題方面表現優異,但其在開放式、結論前階段的探索能力尚未得到充分評估。本文提出前瞻性假設發現(PHD)任務,要求模型從不確定證據中自主構建有依據、可區分且可檢驗的假設空間。為評估該能力,研究者推出HypoArena基準,包含涵蓋六個科學分析領域的988個案例的HypoData數據集及HypoEval評估框架。實驗表明,15個前沿LLM在該任務上表現出明顯的能力分層,並揭示了結構化分析技能對模型性能的依賴效應。
本文提出BIRD,一種兩階段自我推理蒸餾方法,通過先採樣簡潔解並進行提示切換SFT,然後應用在線逆KL蒸餾,顯著提升了大語言模型在長鏈推理中的效率。在Qwen3-8B上,MATH-500準確率從86.2%提升至92.0%,同時響應長度從3099降至1115 tokens。
本文提出AdaLook,一種用於掩碼擴散語言模型的自適應多步前瞻解碼框架。通過基於候選分數方差動態決定前瞻深度並支持分支擴展,AdaLook在保持高效的同時提升了生成質量,實驗表明其優於現有單步前瞻方法。
提出PATR方法,通過過程反饋評分部分軌跡、選擇性分支、共享前綴和停止退化路徑,提升多輪強化學習效率。在FrozenLake和SWE-Bench上分別提升9.3和5.0分。
SkillCorpus從約82.1萬個候選技能中篩選出超過9.6萬個開源LLM Agent技能,採用16類分類法和三個質量維度進行組織。結合檢索與選擇堆棧,它在多個基準測試中取得了持續改進,其中在SkillsBench上提升最大,達7.5個百分點。
本文介紹EpiNarrate,一種用於公共衞生報告生成的智能框架,將結構化數值推理與自然語言生成分離。框架通過部分有序模式提取情景軸,構建增強數據集,並採用比較語法確保語義和算術一致性,同時利用最大熵原理驅動的有趣性選擇機制平衡覆蓋與非冗餘。在COVID-19情景建模中心上的實驗表明,該模型生成的敍述具有更好的事實基礎和更廣泛的流行病學模式覆蓋。
研究人員通過新解釋性技術“雅可比透鏡”發現,大型語言模型中存在一個類似於人類意識全局工作空間的功能結構——J空間。該空間中的表徵可以被言語報告、故意調用和保持,用於中間推理步驟,並傳遞給任意下游計算,而自動處理則無需它們。J空間在中間層攜帶連貫內容,同時容納數十個概念,並通過權重廣播更廣泛。在一致性審計中,它揭示了策略性思考、評估意識和訓練中產生的錯誤傾向,而這些從未出現在輸出中。後訓練將助手的觀點安裝到工作空間中。反事實反思訓練通過僅訓練模型在被打斷並要求反思時會説的話來改善行為。這些發現表明語言模型維持着一小部分特權表徵,具有意識訪問的功能特徵。
該研究提出將電子健康記錄中的多模態數據(包括結構化檢測值和自由文本臨牀敍述)全部轉換為自然語言序列,直接微調預訓練語言模型,無需專門的多模態融合架構。在住院死亡率、移植後移植物失效和急診分診三項臨牀預測任務中,該方法與或超過特定任務的多模態基線,並優於臨牀部署的梯度提升模型,大幅降低了系統複雜度。
LLM4EHR是一種新型臨牀基礎模型,結合領域適配的大語言模型和Transformer時間序列編碼器,通過正則化對比目標對齊EHR事件與時間序列,在ICU預測任務上表現優異,並支持通過k-shot遷移到新羣體。
一篇系統評估五個大型語言模型(LLM)在技術市場分析中表現的研究論文,發現GPT-4 Turbo實現最高年化收益率和夏普比率,而FinGPT通過領域微調展現出有競爭力的風險調整後表現。研究還指出了數值幻覺、上下文窗口限制等常見缺陷。
本文提出一種基於伯努利樸素貝葉斯(BNB)模型的統計驅動框架,通過監督χ²引導的統計二值化將連續變量轉化為閾值,實現完全可解釋的規則化臨牀分類。在皮馬印第安人糖尿病、威斯康星乳腺癌和心力衰竭預測三個基準數據集上,AUC得分分別為0.800、0.984和0.919。概率校準通過Brier分數和beta校準得到改善。模型推理僅需參考表和基本算術,無需專有工具,為醫療AI的可信性和泛化提供實用方案。
本研究基於OECD數據集,對可信人工智能(TAI)工具和信任標記框架進行了實證分析,揭示了倫理焦點、生命週期覆蓋、利益相關方定位及工具類型學上的顯著不對稱。研究建議擴大倫理目標、將倫理嵌入AI全生命週期,並促進更廣泛的多利益相關方參與。
互聯網模因融合了視覺、文本和文化背景,使得幽默、諷刺與惡意共存的情況難以解讀。現有多模態分類器要麼忽略這些相互依賴關係,要麼可解釋性有限。本文提出MAR-12框架,利用視覺語言模型(VLM)從12個結構化視角解讀模因,通過角色感知軟門控注意力機制學習各視角貢獻,再基於原型分類器進行預測,並綜合視角推理和注意力權重生成解釋。在PrideMM和Memotion數據集上,幽默檢測準確率達80.3%,仇恨檢測達75.9%,優於現有方法,且生成的解釋連貫可信。
一項新研究通過四種嵌套的Codex智能體實驗,揭示了可執行世界模型、計劃性簡化和精確回放驗證在ARC-AGI-3任務中的貢獻。結果表明,更強的模型和更高的推理努力始終提升性能,但各組件效果因設置而異,完整的驗證處理表現最佳但資源消耗大。
DrawingVQA 是首個專為評估多模態大語言模型(MLLM)在真實施工圖紙上表現而設計的基準。它包含33張“簽發施工”圖紙和92個專家策劃的問答對,涵蓋感知理解、上下文解釋和領域專家推理三個深度。通過雙分類框架,該基準首次將工程工作流映射到AI推理能力,評估顯示最先進的MLLM與專家性能之間仍存在顯著差距,尤其是在高推理深度上。
一項對4,181道數學問題的研究表明,在多智能體系統中,規劃-執行-評審流水線的高精度評審者並不能保證批評被實際用於改進答案。廣播式同伴討論在難題上實現了更高的準確率,凸顯了檢測與採納之間的差距。
AnovaX是一個完全在用户計算機上運行的本地優先桌面語音助手,利用單個Python進程集成喚醒詞門控、語音處理、基於Gemini的LLM規劃器(輸出JSON計劃)、安全層、多智能體協調器(將計劃轉化為類型化子智能體)以及自適應恢復循環。每個工具對應專門的智能體類,具有超時、重試策略和共享資源鎖。通過Flask服務器支持手機遠程控制,實時鏡像智能體事件並流式傳輸屏幕。項目旨在展示一個輕量級、可讀的助手足以完成複雜桌面任務。
Cura 1T是一個專為醫療場景設計的大型語言模型,通過人工門控的自我進化循環進行訓練。它能處理患者諮詢、圖文臨牀推理、交互式診斷和電子健康記錄工具使用。在醫療評估套件中,Cura 1T排名頂尖,同時在通用推理和智能體基準測試上也保持競爭力。
本文提出Causal-Audit框架,將因果推理顯式建模為結構化因果圖上的四階段推理,而非隱式端到端預測。核心創新包括目標感知的因果圖構建策略和路徑級因果證據聚合機制,有效抑制無關變量和虛假因果,提升複雜干預下的魯棒性。在三個基準測試上,該方法優於現有LLM方法,並提供可解釋、可審計的推理軌跡。
GraphDx是一種結合知識圖譜和多智能體協作的框架,通過自動化構建醫療診斷知識圖譜和三個智能體(感知、推理、決策)的協同工作,在序貫診斷中平衡準確性和資源成本。在MedQA和MIMIC-IV數據集上的實驗表明,GraphDx將診斷成功率從50-68%提升至79-93%,同時將測試成本降低20-54%,為自動化臨牀診斷提供了穩健、經濟且可解釋的解決方案。
在一封2022年的郵件中,Sam Altman向OpenAI董事會表示,計劃儘快發佈一個可在消費級硬件上運行的、能力接近GPT-3的開源語言模型,以阻止競爭對手並減少新項目的資金支持。該郵件在2026年的馬斯克訴Altman案中被公開。
一位社區開發者基於OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的對話數據進行微調,發佈了一個僅657MB的本地推理模型。該模型支持128K上下文窗口、可切換的思維模式,並可在llama.cpp等工具中運行。本文驗證了其技術細節,區分了微調與真正的能力繼承,並指出了許可問題。
本文對比了六款適合單張24GB GPU(如RTX 3090/4090)的開放權重模型,涵蓋Qwen3.6、Gemma 4、Mistral Small等,並解釋了內存分配、量化策略以及各模型的優勢場景。
LVSum是一個人工標註的基準,用於評估多模態大模型在長視頻摘要中的時間對齊能力。包含72個視頻,平均時長16分鐘,每個視頻有最多10個人工生成的含時間參考的摘要。研究發現,轉錄文本比視覺幀貢獻更大,模型與人工摘要差距顯著,且MLLMs在時間定位、指令遵循和跨模態一致性方面存在系統性弱點。
為AI研究人員整理的免費資源合集,包括超過1000美元的免費計算積分、研究指南、社區論壇等,幫助學生在不花費一分錢的情況下開始AI研究。
Feyn Labs發佈了SQRL,這是一系列文本到SQL模型,能在生成查詢前通過只讀探針檢查數據庫。旗艦型號SQRL-35B-A3B在BIRD Dev上達到70.6%的執行準確率,略超Claude Opus 4.6,並可蒸餾為可自託管的4B和9B檢查點。
阿里巴巴Qwen團隊預覽了Qwen3.8-Max-Preview,一個2.4萬億參數的多模態MoE模型,號稱“僅次於Fable 5”。該預覽已在Token Plan、Qoder和QoderWork上以標準定價的10%提供。但尚未提供任何基準測試表、模型卡、許可證、每token價格或激活參數數量。本文區分了阿里巴巴確認的內容和僅聲稱的內容。
CallBro是一款免費的私有會議筆記應用,可在本地轉錄通話,並使用AI(Codex、Claude Code或本地LLM)生成摘要和行動項。所有數據保留在設備上,無需雲上傳,支持多種平台,並通過MCP與工具集成。
KloofStreet.online 是一個專注於開普敦克魯夫街的 AI 驅動指南。該街道被 Time Out 評為 2025 年全球第 22 酷街及非洲最酷街道。網站收錄了 50 多家餐廳、養生館、藝術畫廊等商户,並提供名為 Street Pass 的會員計劃,包括 AI 禮賓服務、折扣和專屬體驗。