AI News HubLIVE

芯片動態

你的AI在哪裏運行比它有多聰明更重要——尤其是在阿聯酋

在阿聯酋,企業AI的選擇不僅關乎模型能力,更取決於數據運行地點、實際運營成本和法規合規性。前沿模型與本地開源模型的能力差距正在縮小,但自建基礎設施的成本高昂。阿聯酋的監管環境要求嚴格的數據本地化,催生了主權雲和混合架構的解決方案。企業應採用“紅綠燈”路由系統,根據數據敏感度分配模型使用,並先驗證需求再投資硬件。

  • 前沿模型和本地模型的取捨:前沿模型能力最強但數據控制權弱,本地模型控制權強但成本高且需自維護。
  • 能力差距縮小:2026年開源模型在多數企業級任務上已接近前沿模型,如MiniMax M2.5和Kimi K3等。
站內正文

使用 llama.cpp 和 Pi 本地運行 Mythos 增強編碼模型

瞭解如何使用 llama.cpp 本地運行 Qwythos-9B-Claude-Mythos-5-1M 模型,將其連接到 Pi 編碼代理,並通過 MTP 推測解碼和 OpenAI 兼容 API 構建快速的本地編碼工作流。

  • 安裝 llama.cpp 並本地運行 Qwythos MTP 模型,支持 GPU 加速和推測解碼。
  • 通過 pi-llama 插件將本地服務器連接到 Pi 編碼代理,進行代理開發。
站內正文

反駁喬治·霍茨關於“AI 2040與智能崇拜”的觀點

馬修·特隆普批評喬治·霍茨對AI 2040場景的否定,認為霍茨低估了快速AI突破的可行性、監管的必要性以及未對齊AI的風險。他捍衞Plan A的監管方法,並質疑霍茨的開放源碼AI“Plan L”。

  • 霍茨對硬起飛持懷疑態度,但AI 2027展示了無需魔法的可行路徑。
  • 物理限制如供應鏈是可以管理的;海上數據中心是可行的。
站內正文

Show HN:Neverbell——全天候AI交易代理

Neverbell是一個AI代理技能,為交易股票、ETF、大宗商品和加密貨幣提供直接市場準入,支持槓桿操作。用户可通過自然語言指令讓代理執行交易、監控市場和管理頭寸,實現7x24小時自動化交易。它並非獨立交易平台或財務顧問,用户完全掌控風險。

  • Neverbell讓AI代理直接接入市場,可交易300多種資產(股票、ETF、大宗商品、加密貨幣),支持做多/做空和槓桿。
  • 用户通過自然語言與代理交互,設置自動化策略、接收新聞情緒分析,甚至讓代理自主開平倉。
站內正文

硅谷的頭痛:中國正在削弱美國在人工智能競賽中的領先地位

谷歌人工智能的困境引發擔憂,中國新模型再次挑戰美國科技主導地位。硅谷工人也採取行動保護自己的工作免受AI影響。其他新聞包括紐約暫停新AI數據中心、IBM股價暴跌、亞馬遜雲服務鉅額賬單、特朗普加密貨幣收入等。

  • 中國AI模型再次展示實力,威脅美國領先地位
  • 谷歌AI表現不佳,引發行業擔憂
站內正文

5門免費課程:從AI新手到實踐者

本文介紹了一個由5門免費課程組成的路線圖,從經典算法到從頭訓練大語言模型,幫助有Python基礎的學習者系統掌握AI技能。

  • 哈佛CS50 AI課程建立AI邏輯基礎
  • 谷歌機器學習速成課程掌握數學與TensorFlow
站內正文

“僅次於Fable 5”:阿里巴巴發佈Qwen3.8,但未提供任何真實數據

阿里巴巴宣佈推出其最新大語言模型Qwen3.8,聲稱僅次於Anthropic的Fable 5,但未提供任何基準測試或模型卡。此舉發生在競爭對手月之暗面發佈Kimi K3並附有詳細技術細節之後。阿里巴巴的聲明缺乏透明度,引發對其發佈時機和動機的質疑。

  • 阿里巴巴聲稱Qwen3.8僅次於Anthropic的Fable 5,但未提供任何數據支持。
  • 該聲明緊隨月之暗面發佈Kimi K3之後,後者提供了完整的基準測試和技術細節。
站內正文

上週AI資訊 #251 - Mythos迴歸、Sonnet 5、Etched、LongCat

Anthropic與美國政府談判後重新部署Claude Fable 5,增加網絡安全分類器,並推出Claude Sonnet 5更便宜版本;Google NotebookLM新增TikTok風格視頻摘要,Nano Banana 2 Lite圖像生成器發佈;Etched獲大量投資打造全棧推理硬件,百度AI芯片單元計劃IPO,Agility Robotics通過SPAC上市,DeepSeek擴招,中國發布Longcat 2.0 MoE模型及長週期智能體基準測試。

  • Anthropic重新部署Claude Fable 5,增加網絡分類器和安全框架
  • Anthropic推出Claude Sonnet 5,以更低價位支持智能體應用
站內正文

Show HN: Enlarger • 一款保持細節而非平滑處理的本地放大工具

Enlarger是一款本地圖像放大工具,它不使用生成式AI,而是通過重構已有細節並應用後期處理來保持紋理和質感。支持批量處理、離線運行,一次性付費,無訂閲。適合攝影師、設計師等專業人士。

  • 非生成式AI放大:重建細節而非憑空想象,避免過度平滑或幻覺。
  • 本地離線運行:圖像不上傳雲端,保護隱私。
站內正文

上週AI #250 - Mythos 混亂、GPT 5.6-Sol、GLM 5.2

本期涵蓋Anthropic的AI條約討論、美國政府影響AI模型發佈、OpenAI處理器開發、內存市場影響等話題。

  • 美國政府擴大對前沿AI的管控,Anthropic獲准向特定公司發佈Mythos-5,OpenAI推出GPT-5.6 Sol,初始訪問受限。
  • 模型能力與安全信號仍不明確,基準測試披露有限。
站內正文

LWiAI播客第249期:Fable 5禁令、SpaceX收購Cursor與眾多開源項目

本期播客討論了Anthropic應美國政府要求切斷對Fable 5和Mythos 5的訪問、SpaceX以約60億美元收購AI編碼初創公司Cursor、基礎設施與商業更新(如Anthropic尋求Google支持的租賃、OpenAI財務泄露等)、以及多項開源項目和政策動態。

  • Anthropic因美國政府命令切斷對Fable 5和Mythos 5的訪問,引發關於一致性和出口管制的辯論。
  • SpaceX以約1.75萬億美元估值IPO後,宣佈以600億美元收購AI編碼初創Cursor,增強xAI實力。
站內正文

LWiAI播客第248期:Claude Fable 5、Siri AI、Anthropic IPO等AI大事件

本期播客討論了Anthropic發佈的Claude Fable 5模型及其安全爭議、Apple在WWDC上宣佈的Siri AI、Google的Gemini 3.5實時翻譯和AI訂閲調價、OpenAI的IPO進展、Prometheus的120億美元融資、DeepSeek的融資計劃、華為對DeepSeek模型的後訓練、Google向SpaceX支付GPU費用、Gemma 4和DiffusionGemma開源模型、以及多項AI安全政策和研究動態。

  • Anthropic發佈Claude Fable 5,性能大幅提升但也引發了關於安全護欄和隱形降級的爭議。
  • Apple宣佈Siri AI,基於與Gemini的合作,旨在提供更強大的對話助手。
站內正文

百時美施貴寶購買英偉達AI系統用於藥物發現

百時美施貴寶將購買基於英偉達Vera Rubin架構的DGX SuperPOD,用於支持其藥物發現和開發過程中的人工智能應用。這家制藥公司表示,它將成為首家獲得基於Vera Rubin的DGX SuperPOD的生命科學企業。該系統將提供10倍於現有基礎設施的性能功耗比,並支持化合物、蛋白質等科學數據的模型訓練與預測。

  • 百時美施貴寶購買英偉達Vera Rubin DGX SuperPOD,用於AI驅動的藥物發現
  • 系統包含8個DGX Vera Rubin NVL72機架,性能功耗比提升10倍
站內正文

LWiAI播客第247期 - Opus 4.8, MAI, Anthropic IPO, Minimax-M3

本期播客討論了Anthropic發佈Claude Opus 4.8、微軟推出MAI模型、Anthropic IPO以及Minimax-M3等AI新聞。

  • Anthropic發佈Claude Opus 4.8並引入動態工作流工具
  • 微軟推出Scout助手和MAI模型系列,包括MAI Thinking 1
站內正文

面向編碼代理的私有推理

Zro 是一個面向編碼代理的私有推理端點,在歐盟基礎設施上提供開源權重模型,零數據保留,不訓練用户數據,支持長上下文和多輪編碼會話。它集成了 Claude Code、Codex 等工具,提供 OpenAI 和 Anthropic 兼容的 API。

  • 在歐盟基礎設施上運行,零請求保留,不訓練客户數據。
  • 支持 MiniMax M3 和 GLM-5.2 等開源編碼模型。
站內正文

中國開源權重模型便宜,華盛頓正在決定其代價

美國政策制定者正在討論是否通過監管風險來限制中國開源權重模型的使用。Moonshot AI的Kimi K3模型發佈後,這一爭論再次升温。企業面臨的問題不僅是性能,還有未來一年內使用這些模型是否依然暢通無阻。

  • Moonshot AI的Kimi K3是迄今最大的開源權重模型,其發佈重新引發了華盛頓的政策辯論。
  • 討論的機制包括聯邦採購規則、出口黑名單和安全建議,這些將通過雲服務提供商影響全球企業。
站內正文

NVIDIA 發佈 Cosmos 3 Edge:40億參數開放世界模型,實現設備端機器人動作推理與生成

NVIDIA 推出 Cosmos 3 Edge,一個僅40億參數的開放世界模型,專為設備端運行設計。它能幫助機器人和視覺AI代理理解環境、實時推理,並在本地生成機器人動作。該模型是 Cosmos 3 系列的最小成員,此前已發佈160億參數的 Nano 和640億參數的 Super。Edge 型號針對內存受限的邊緣系統(如工廠、倉庫和醫院)提供數據中心級別的性能。

  • Cosmos 3 Edge 是一個40億參數的開放世界模型,於2026年7月20日在 Hugging Face 上發佈。
  • 採用混合變換器架構,結合自迴歸推理塔和擴散生成塔,通過共享多模態注意力層協同工作。
站內正文

中國AI模型使特朗普的AI世界陷入內訌

中國開源AI模型Kimi的發佈,引發了特朗普政府內部AI戰略家的分裂。該模型性能媲美OpenAI和Anthropic的付費模型,卻完全免費,對特朗普的經濟和政治構成挑戰。圍繞如何應對中國AI競爭,各方意見不一,從開放支持到加強管控,分歧加劇。

  • 中國公司Moonshot發佈免費開源模型Kimi,性能接近頂級付費模型。
  • 特朗普前AI顧問David Sacks與現任官員Emil Michael公開批評美國AI公司。
站內正文

法國在AI競賽中的優勢是廉價能源

法國憑藉豐富的核能提供低成本電力,在AI領域獲得競爭優勢,但美國科技巨頭可能搶先將這一資源納入囊中。

  • 法國擁有大量核能,電價低廉,有利於AI算力發展。
  • 美國科技公司如谷歌、微軟等也在尋求清潔能源,可能搶佔法國能源。
站內正文

智能變得過剩後,什麼會變得稀缺?

AI行業面臨兩大對立策略:一是斥資數千億美元建設核電站以支持更大規模的AI模型,二是發佈可下載的開源模型,使智能幾乎免費。文章指出這兩種策略並非對立,而是對同一個問題的不同賭注:智能是否存在天花板?如果存在,效率陣營(開源、芯片架構)將獲勝;如果需求無上限,蠻力陣營(大規模計算)將勝出。生物學提供了先例:人腦在能量限制下通過架構創新(稀疏性、內存計算)實現了高效。當前開源模型利用這些技巧,但僅覆蓋中等難度的任務,而前沿模型仍保持優勢。真正的勝負取決於智能天花板的位置。

  • AI行業投入巨資建設核電站與發佈免費開源模型,看似相反實則是對智能天花板的不同賭注。
  • 生物大腦在20瓦功率下通過稀疏性和內存-計算融合等架構創新實現了高效。
站內正文

SpecLA: 線性注意力模型的高效推測解碼

本文提出了 SpecLA,一種針對有狀態線性注意力模型的推測解碼運行時。它通過拓撲感知內核驗證鏈和樹,存儲驗證過程中產生的緊湊因子以恢復接受狀態,並使用置信剪枝和目標對齊的EAGLE風格草案生成器提供有用候選。在NVIDIA H100上使用公共GDN-1.3B目標,SpecLA實現了比自迴歸解碼高達1.70倍的端到端加速。

  • 線性注意力模型用循環狀態替代增長的KV緩存,但自迴歸解碼仍逐令牌處理。
  • 現有推測解碼系統設計用於Transformer KV緩存,不適用於有狀態線性注意力模型。
站內正文

OpenLanguageModel:用於教育和研究的可讀可組合小語言模型預訓練

OpenLanguageModel (OLM) 是一個開源的 PyTorch 庫,用於構建和預訓練小型語言模型,同時保持其內部機制可見。模型代碼直接反映架構,組件如 Block、Residual、Repeat 和 Parallel 描述連接方式。OLM 集成了分詞器、數據集、優化、混合精度、回調、檢查點以及硬件感知的執行,支持從教學筆記本到完整預訓練的無縫遷移。該庫包含 9 個常見模型家族的 27 個預設,並提供從基礎到架構研究的文檔。驗證顯示與獨立參考實現高度一致,348M 參數模型在四 GPU 上弱擴展效率達 90.6%,且早期可用性反饋積極。OLM 採用 MIT 許可證,可通過 PyPI、GitHub 和文檔站點獲取。

  • OLM 提供可讀的模型代碼,直接對應架構組件,便於教學和研究。
  • 支持從筆記本到完整預訓練的無縫遷移,集成完整訓練流程。
站內正文

算子感知的混合精度容差校準應用於張量核

本文提出了一種基於算子感知的混合精度容差校準方法,通過挖掘累積的雲GPU運行數據,自動確定張量核正確性測試的最佳絕對容差,相比手工選擇的容差更嚴格,並顯著提高了錯誤檢測召回率。

  • 當前張量核測試使用固定手工選取的容差,很少更新。
  • 新方法通過分析雲GPU運行中的誤差分佈來校準每個算子的容差。
站內正文

支持本地機器學習的新型智能眼鏡平台

本文介紹ARGO智能眼鏡平台,利用STM32N6微控制器及其集成NPU實現本地機器學習,保護隱私並降低延遲。通過軟硬件協同設計,部署優化後的YOLOv11模型進行實時城市障礙物識別,引入頭並行注意力機制(HPA)適配NPU,模型僅佔用2.483 MB內存,mAP50-95達24。該平台集成多模態傳感器,以10 FPS運行,200 mAh電池續航約113分鐘,展示了高性能、隱私保護且社交可接受輔助設備的可行性。

  • ARGO智能眼鏡平台採用STM32N6微控制器和NPU,實現本地ML處理,避免雲依賴
  • 引入頭並行注意力(HPA)優化YOLOv11模型,在嚴格內存限制下達到mAP50-95 24
站內正文

[AINews] 今日似乎平靜,實則暗流湧動——AI新聞彙總7/18-7/20

表面上平靜的一天,但實際充滿進展:美國政策瞄準中國開源模型,Kimi K3和Qwen 3.8取得進展,以智能體為中心的泛化方法獲得關注,模型展現出超人類數學能力。

  • 美國考慮禁止中國尖端開源模型如Kimi,引發技術界反對。
  • Kimi K3在DesignArena排名第一;阿里巴巴確認Qwen 3.8 Max將開放權重。
站內正文

加里·馬庫斯:美國無法在AI戰爭中“戰勝”中國,我們應該怎麼做?

加里·馬庫斯指出,中國AI模型Kimi K3已追平美國頂級模型,且作為開源模型免費提供,衝擊了美國AI公司的商業模式。他回顧了自己2025年以來的警告,認為美國過度依賴大語言模型(LLM)戰略失誤,導致如今中美AI競爭陷入僵局。馬庫斯提出七項建議,包括不作為、監管護城河、國有化等,並最終主張AI應成為全球公共品,提議建立類似CERN的國際AI合作項目。

  • 中國企業深度求索發佈Kimi K3模型,性能媲美美國最佳模型且開源免費,引發美股下跌。
  • 馬庫斯認為美國AI公司如OpenAI和Anthropic的商業模式受質疑,IPO前景堪憂。
站內正文

將機器人視頻轉化為訓練就緒數據

daft-physical-ai 是一個新的開源 Python 庫,基於 Daft 構建,旨在簡化物理 AI 中從原始機器人視頻到訓練模型的數據處理流程。它提供了手部追蹤和獎勵評分等操作,支持懶加載、批處理和分佈式執行,幫助團隊跳過數據管道的基礎設施工作。

  • daft-physical-ai 是一個開源 Python 庫,用於將機器人視頻轉化為可直接用於模型訓練的數據。
  • 當前支持兩個用例:手部追蹤(支持 MediaPipe 和 WiLoR)和獎勵評分(使用 Robometer-4B 模型)。
站內正文

開放權重AI是減速主義的嗎?

OpenAI戰略未來主管Dean Ball認為開放權重模型本質上是減速主義的,因為它們抑制資本支出。本文從經濟學角度探討了這一觀點,分析了中國在AI基礎設施方面的投資、訓練範式的轉變以及價值在價值鏈中的遷移。文章認為,開放權重模型可能通過降低成本擴大應用範圍,促進創新,從而實際上是加速主義的。

  • Dean Ball聲稱開放權重模型是減速主義的,因為它減少了資本投資。
  • 中國可能通過補貼產能和壓縮利潤加劇這一趨勢。
站內正文

Colibrì概念驗證:用25GB內存運行1.5TB的AI模型

意大利工程師Vincenzo(又名JustVugg)創建了Colibrì,這是一個概念驗證項目,能夠在僅25GB RAM和1GB/s NVMe的CPU上運行7440億參數的GLM-5.2模型(1.5TB)。儘管速度極慢(每0.05-0.1秒一個token),但利用混合專家(MoE)架構按token加載專家,實現了前沿水平的回答質量。項目開源,旨在探索在消費級硬件上運行大型模型的可行性。

  • Colibrì在低端硬件上運行1.5TB的GLM-5.2模型,速度僅0.05-0.1 token/秒。
  • 利用MoE架構按token加載專家子模型,通過反覆加載/卸載適應有限內存。
站內正文

你的指數基金中的SpaceX:解析

本文探討了SpaceX快速納入納斯達克100指數對指數基金投資者的影響。文章解釋了指數基金的工作原理,討論了人們對埃隆·馬斯克治理方式的擔憂,以及投資者是否應擔心市場中的人工智能集中度。

  • SpaceX在IPO後不久被納入納斯達克100指數,迫使指數基金買入其股票。
  • 指數基金被認為是安全的投資方式,即使包括高風險股票如SpaceX。
站內正文

GraphRAG 過於複雜:我們實際用來構建知識圖譜的方法

本文探討了企業級 AI “公司大腦”構建中的檢索增強生成(RAG)技術侷限性,指出標準 RAG 僅擅長處理單一事實類問題,而 GraphRAG 雖然理論上能解決多文檔綜合問題,但其高昂成本、狹窄優勢及實體解析難題使其在多數場景下過於複雜。作者介紹了其公司 QX Labs 的替代方案:“類圖 RAG”——一種基於普通數據庫的輕量級實體-關係系統,無需圖數據庫、預建圖譜或自定義本體,通過惰性總結、固定本體和實體解析瀑布流實現自服務部署,顯著降低了成本與運維負擔。

  • 標準 RAG 僅適用於單一事實問題,而企業需要處理多文檔綜合及精確計數類問題
  • GraphRAG 索引成本是普通向量索引的 1000 倍,且優勢主要集中在多跳推理場景
站內正文

初創公司成立代工廠開發芯片材料

由英偉達、Meta和三星等創始成員組成的聯盟,旨在減少對芯片中稀有材料的依賴。

  • 英偉達、Meta和三星等公司聯合成立一家芯片材料代工廠。
  • 該代工廠旨在降低對稀土等稀有材料的依賴。
站內正文

Stoke – 失控AI智能體的終止開關(Rust,預算上限)

Stoke是一個輕量級的Rust網關,在請求到達提供商之前強制實施硬預算上限、循環檢測和速率限制,從而防止失控支出。它還提供跨多台機器的本地優先路由、基於成本/速度的自動路由以及失敗關閉架構。

  • 每個API密鑰的硬美元預算上限,在任何提供商調用之前執行,並實時跟蹤每個密鑰的支出。
  • 循環終止開關,使用精確哈希和語義相似性檢測,在幾秒內阻止重複請求。
站內正文

利用 Amazon Quick 和 NVIDIA NeMo Agent Toolkit 為您的業務構建專業化代理工作流

本文展示瞭如何將 Amazon Quick 作為業務用户的專業代理工作流前端。通過 NVIDIA NeMo Agent Toolkit 構建供應鏈風險示例,幫助規劃人員從 Amazon Quick 儀表盤和知識上下文轉向引導式緩解建議。

  • Amazon Quick 為業務用户提供結構化數據和企業知識的單一對話工作空間。
  • NVIDIA NeMo Agent Toolkit 是開源框架無關庫,用於連接、評估、分析和優化代理工作流。
站內正文

舊金山餐廳因AI菜單圖片遭憤怒抵制

舊金山一家新開的餐廳因使用AI生成的菜單圖片而遭到社區強烈批評,甚至被塗鴉破壞。店主不得不撤下圖片,並計劃通過社區活動重建聲譽。

  • AJ和Lyndsey Lozano在Haight Street新開的Grind & Unwind餐廳因AI菜單圖片引發爭議。
  • Reddit帖子批評這些圖片像“垃圾食品”,社區反應強烈,甚至出現塗鴉破壞。
站內正文

Kimi K3:開放權重升級

Moonshot AI發佈了最新旗艦模型Kimi K3,這是一個2.8萬億參數的MoE模型,將於7月27日開放權重。K3在多項基準測試中排名靠前,成為最強的開源模型。文章探討了中美AI模型差距縮小、中國開源策略、開源模型的經濟影響以及中國AI的效率優勢。

  • Kimi K3是2.8T參數的MoE模型,開放權重,性能接近前沿閉源模型。
  • 中國AI實驗室展示出獨立創新能力,而不僅僅是快速追隨。
站內正文

AI解鎖零售、旅遊和消費品行業轉型的三種方式

本文探討了AI如何通過三種方式——將暗數據轉化為信號、擴展概率推理的問題空間、將人的能力與員工數量脱鈎——來解決零售、旅遊和消費品行業中信號與行動之間的鴻溝,並強調治理是真正的競爭優勢。

  • AI作為系統而非試點部署,能同時解決信任、時間和成本三大問題。
  • 暗數據轉化為信號、概率推理擴展問題空間、人的能力與員工數量脱鈎是三個關鍵轉變。
站內正文

NVIDIA在SIGGRAPH上通過代理AI和物理AI推動圖形與仿真發展

NVIDIA在SIGGRAPH 2026上宣佈多項創新,包括通過模型上下文協議(MCP)將AI代理集成到創意工具中,推出合成視頻檢測器NIM微服務以識別AI生成視頻,並開源Cosmos 3 Edge世界模型用於本地物理AI。這些進展旨在加速內容創作、媒體驗證和機器人技術。

  • Adobe、Affinity、Blender等創意應用通過MCP支持AI代理,實現自動化任務。
  • NVIDIA發佈合成視頻檢測器NIM微服務,幀級分析視頻內容,準確率高達92%。
站內正文

美國AI封閉且專有,正在輸掉競爭

文章分析了美國AI公司通過封閉和專有化模式維持競爭優勢,但中國通過開放模型策略正在縮小差距。AI模型自身缺乏護城河,用户容易切換,而中國企業利用開放模型獲得分佈優勢,挑戰美國的主導地位。

  • AI模型本身缺乏護城河,用户可輕鬆切換,專有化模式難以鎖定客户。
  • 美國GPU出口管制限制了中國的全球服務,卻促使中國通過開放模型獲得分佈優勢。
站內正文

Import AI 465:開放與封閉模型差距縮小;Kimi K3;Demis的重大政策計劃

英國政府AI安全研究所發現,開放權重模型與封閉前沿模型在網絡安全能力上的差距正在縮小。中國公司月之暗面發佈Kimi K3模型,性能接近前沿模型,但存在一定脆性。DeepMind創始人Demis Hassabis提出類似FINRA的AGI監管框架。研究顯示,AI系統可秘密執行側信道任務,極難檢測。

  • 開放權重模型在網絡安全能力上追趕封閉模型,差距從6-10個月縮小至4-7個月。
  • Kimi K3是一個2.8萬億參數模型,在多數基準上接近Claude Fable 5和GPT 5.6 Sol,但可能過度優化基準。
站內正文

理解Go AI推理:什麼是推理?

本文是系列文章的第一篇,介紹如何從Go語言直接本地運行大型語言模型。文章解釋了推理的本質:基於凍結的權重進行下一個標記預測,並詳細介紹了自迴歸循環、分詞器工作原理以及GGUF文件格式的結構和加載過程。

  • 推理是使用已訓練好的模型權重進行下一個標記預測的過程,不涉及學習或更新。
  • 模型通過自迴歸循環逐個生成標記,每次預測後將其附加到序列中繼續。
站內正文

百時美施貴寶基於NVIDIA Vera Rubin打造生命科學行業最先進的AI工廠

百時美施貴寶(BMS)宣佈部署其第二代NVIDIA DGX SuperPOD,基於八套DGX Vera Rubin NVL72系統,成為生命科學領域最強大、最節能的AI集羣。新系統將向所有科學家開放,無需等待或限制,支持藥物發現全流程的AI應用,包括目標識別、化合物庫擴展和先導優化。BMS還整合了現有集羣,形成統一環境,並通過NVIDIA Mission Control提供AI原生工具。

  • BMS部署第二代NVIDIA DGX SuperPOD,採用Vera CPU和Rubin GPU,性能提升10倍/兆瓦。
  • 新系統向所有科學家開放,實現“無限計算”,加速藥物發現。
站內正文

中國給美國人工智能霸主地位一記組合拳

中國領先的人工智能公司Moonshot和阿里巴巴發佈了新模型,聲稱能以更低成本與OpenAI和Anthropic的最佳模型競爭。這些開放源代碼的發佈加劇了中美技術競賽,並質疑美國鉅額投入是否能維持優勢。

  • Moonshot發佈Kimi K3,阿里巴巴推出Qwen3.8,均聲稱性能接近頂尖美國模型。
  • 兩家公司強調模型開源,與美國的封閉策略形成對比。
站內正文

空客從AWS起飛:數字主權的關鍵一步

空客宣佈將約900個應用從AWS遷移到法國雲服務商Scaleway,以加強數字主權。此舉反映了美國數據保護不可靠的擔憂,但供應鏈管理和AI領域仍面臨挑戰。

  • 空客將900項應用從AWS遷移至法國Scaleway,首批70項優先遷移。
  • 數字主權成為商業驅動力,美國被視為數據安全風險。
站內正文

Kimi K3 開放權重模型:中國最大的人工智能押注內存而非算力

月之暗面發佈Kimi K3,一個擁有2.8萬億參數的開放權重模型,採用混合專家架構、量化訓練和Delta注意力機制,以內存池化策略應對美國芯片限制。儘管參數龐大,但模型通過降低計算需求來適配受限硬件,實際部署仍需數據中心級基礎設施,且軟件生態尚未完全就緒。

  • Kimi K3 擁有2.8萬億參數,是迄今最大的開放權重模型。
  • 採用混合專家架構,每次推理僅激活1.8%的參數,但內存佔用不減。
站內正文

AI數據中心電力限制是2026年的真正瓶頸

文章指出,到2026年,AI基礎設施的主要限制將從GPU供應轉向電網容量。預計到2027年,40%的AI數據中心將受到電力限制,新電網連接的審批時間長達24-36個月。文章詳細分析了電力需求、推理驅動電力曲線,並提出了效率提升、調度和地理分佈等策略,同時推廣Spheron的分佈式GPU網絡作為解決方案。

  • GPU可用性已改善,但為GPU供電的電網容量現已成為AI數據中心的主要瓶頸。
  • 推理工作負載持續運行,驅動大部分能源消耗,需要電力感知規劃。
站內正文

Kimi K3 為何引起華盛頓關注

月之暗面AI發佈Kimi K3,在Frontend Code Arena基準測試中奪冠,引發美國AI監管辯論。儘管在前端編碼方面表現強勁,但整體仍落後於Claude Fable 5。該發佈加劇了AI監管和開源模型的政策爭論,對NVIDIA和Anthropic等股票產生影響。

  • Kimi K3在Frontend Code Arena獲得1679分,擊敗Claude Fable 5和GPT-5.6 Sol,但Fable 5在14項基準中仍領先8項。
  • 白宮顧問David Sacks引用K3證明美國AI監管損害競爭力,加劇政策辯論。
站內正文

Thinking Machines Inkling 完全指南

Thinking Machines Lab 發佈了其首個通用開放權重基礎模型 Inkling。該模型擁有 9750 億參數(其中 410 億激活)、100 萬 token 上下文窗口,採用多模態稀疏 MoE 架構,支持文本、圖像和音頻處理。Inkling 以可定製的開源模型形態,面向多模態推理、智能體、編程、工具使用及企業微調場景。本文詳解其架構、訓練、基準測試、部署及微調工作流。

  • Inkling 是 975B 總參數、41B 激活參數的多模態稀疏 MoE 模型,上下文窗口達 100 萬 token。
  • 採用混合注意力、相對位置編碼、短卷積及多 token 預測等技術,支持文本、圖像、音頻輸入。
站內正文

什麼是智能體AI?它可能是人工智能的下一個重大轉變

智能體AI是一種能夠自主規劃、決策和採取行動以實現特定目標的人工智能系統,代表了從簡單回應查詢到主動執行任務的重大轉變。本文探討了其定義、發展動力、常見應用、挑戰以及基礎設施的重要性。

  • 智能體AI能夠自主規劃、執行和調整策略以達成目標,超越傳統AI的“提示-響應”模式。
  • 得益於更強大的語言模型、工具集成和長上下文窗口,智能體AI正快速成為自動化複雜工作流程的關鍵技術。
站內正文

主題導航

芯片 — AI 主題新聞 | AI News Hub