AI News HubLIVE

今日必讀

模型

社群開發者微調OpenBMB的MiniCPM5-1B模型:基於Claude Fable 5資料,打造657MB本地推理模型

一位社群開發者基於OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的對話資料進行微調,釋出了一個僅657MB的本地推理模型。該模型支援128K上下文視窗、可切換的思維模式,並可在llama.cpp等工具中執行。本文驗證了其技術細節,區分了微調與真正的能力繼承,並指出了許可問題。

  • 模型為MiniCPM5-1B的監督微調版本,使用了Claude Fable 5的推理軌跡。
  • 支援128K上下文,GGUF量化最小版本僅657MB。
站內正文

2026年單張24GB GPU可執行的最佳本地LLM:Qwen、Gemma、Mistral、DeepSeek對比

本文對比了六款適合單張24GB GPU(如RTX 3090/4090)的開放權重模型,涵蓋Qwen3.6、Gemma 4、Mistral Small等,並解釋了記憶體分配、量化策略以及各模型的優勢場景。

  • 24GB是本地推理的實際起點,推薦使用20B-35B引數模型而非壓縮70B模型。
  • Qwen3.6-27B是最全面的通用選擇,DeepSeek-R1-Distill-Qwen-32B適合深度推理但佔用最高。
站內正文

價值超過1000美元的AI/GPU/LLM免費積分彙總

為AI研究人員整理的免費資源合集,包括超過1000美元的免費計算積分、研究指南、社群論壇等,幫助學生在不花費一分錢的情況下開始AI研究。

  • 提供超過1000美元的免費AI/GPU/LLM積分
  • 包含從想法到論文發表的全套研究指南
站內正文
Agent

網站螢幕捕捉:你的AI可以讀取的錄製內容

CBrowser 推出新功能,使AI能夠讀取和分析網站螢幕錄製內容,為自動化和資料提取開闢新可能。

  • AI可以處理視覺螢幕錄製,提取文本和上下文資訊
  • 該技術可自動化以前需要人工審查的工作流程
站內正文

忘掉模型吧。在網路安全領域,關鍵在於“駕馭”

AI驅動的駭客攻擊威脅日益增長,但焦點應從前沿AI模型轉移到“駕馭”——即針對特定網路安全任務定製通用大語言模型的工具。Cato Networks的研究展示了這種駕馭的強大力量,他們測試了自主駭客代理。

  • AI駭客威脅增加,但注意力應放在定製模型的“駕馭”上。
  • 企業正在構建自己的技術平臺,將通用LLM轉化為專門的網路安全工具。
站內正文

DistillFeed:帶AI排名和摘要的RSS閱讀器

DistillFeed 是一款RSS/Atom閱讀器,利用AI對文章進行排名並生成摘要。支援OpenAI和Ollama,提供成本保護、透過ntfy傳送通知提醒,並內建arXiv每日摘要外掛。該應用以Apache 2.0許可證在GitHub上釋出。

  • 透過AI對文章進行相關性評分和生成簡潔摘要。
  • 支援OpenAI和本地Ollama模型,並設有成本保護措施。
站內正文

如何惹惱你的Nix朋友

本文作者以挑釁性的口吻分享了一系列關於Nix和NixOS社群的有爭議觀點,包括Nix雖然優秀但存在文件差、學習曲線陡等問題,並非適合所有人;社群中存在的反美情緒;AI工具在Nix生態中的價值;對BDFL模式的肯定;建議放棄macOS和Windows支援;對Flakes的保留態度;以及提倡使用單使用者安裝。作者認為Nix潛力巨大,但應聚焦於Linux平臺和核心功能。

  • Nix雖然強大但存在文件糟糕、語言難以理解等問題,並非適合所有人。
  • 社群中存在反美情緒,美國使用者和公司受到懷疑。
站內正文
工具

並非崩潰:用AI除錯CI

一位開發者花費數小時除錯一個CI冒煙測試,該測試錯誤地報告了崩潰。透過使用AI和定製的崩潰捕獲工具包,他們發現程序正常退出,但測試誤解了訊號。

  • CI冒煙測試錯誤地報告了崩潰。
  • 除錯涉及多次AI會話和多個假設。
站內正文
晶片

Show HN: Headroom —— 測量本地AI的GPU真實頻寬上限

Headroom是一款30秒的瀏覽器內測試工具,用於測量本地AI推理時GPU記憶體頻寬的真實上限,無需下載模型,使用合成權重,需要WebGPU支援。它透過三種獨立方法測量頻寬,並檢測導致瀏覽器內LLM輸出錯誤的子組bug。驗證表明,當前瀏覽器引擎受發射開銷限制,硬體仍有2-3倍潛力。

  • 30秒瀏覽器測試,無需模型下載,使用合成權重
  • 三種獨立頻寬測量:緩衝複製、三讀寫、純讀歸約
站內正文
政策
其餘更新(26 條)
晶片

臺積電加速亞利桑那工廠建設以抓住人工智慧“大趨勢”

臺積電首席財務官黃仁昭對CNBC表示,公司正在加速亞利桑那工廠的產能擴張,以應對AI驅動的多年結構性需求。公司額外承諾投資1000億美元,使在美總投資達到2650億美元,並將全年資本支出上調至600-640億美元。臺積電正在將5奈米產能轉換為先進的3奈米節點,2奈米技術將成為下一季度營收的新驅動力。

  • 臺積電額外投資1000億美元擴大亞利桑那工廠,總投資達2650億美元。
  • 公司正在將5奈米產能轉換為3奈米節點,以滿足AI需求。
站內正文

福布斯認為AI創造了新職業,但歷史早已有之

矽谷出現了一批精通AI、加密貨幣等技術的豪華伴遊,客人為了一次深入對話支付數千美元。但這種現象並非AI獨有:日本藝伎、希臘赫泰拉等早已存在類似模式。技術改變,但人類對關注和陪伴的需求始終未變。

  • 矽谷豪華伴遊透過談論AI、Nvidia等話題吸引科技富豪,收費高昂。
  • 文章指出該現象並非新奇,歷史上藝伎、名妓等皆扮演類似角色。
站內正文

Moonshot AI 因Kimi K3需求大增暫停新訂閱

由於Kimi K3需求超出預期,Moonshot AI宣佈暫停新訂閱以保護現有使用者體驗。

  • Kimi K3需求在48小時內接近容量上限
  • 為保護現有使用者,暫停新訂閱
站內正文
政策

凱文·奧利裡對AI的看法很有趣,9分鐘影片

在這個9分鐘的影片中,凱文·奧利裡分享了他對人工智慧的獨到見解。作為一名知名投資者和《鯊魚坦克》明星,他結合商業經驗探討了AI的機遇與挑戰。

  • 凱文·奧利裡討論AI
  • 影片時長9分鐘
站內正文
模型

Feyn AI釋出SQRL:一個在編寫查詢前先檢查資料庫的文本到SQL模型系列

Feyn Labs釋出了SQRL,這是一系列文本到SQL模型,能在生成查詢前透過只讀探針檢查資料庫。旗艦型號SQRL-35B-A3B在BIRD Dev上達到70.6%的執行準確率,略超Claude Opus 4.6,並可蒸餾為可自託管的4B和9B檢查點。

  • SQRL透過只讀探針在提交最終查詢前檢查資料庫。
  • SQRL-35B-A3B在BIRD Dev上達到70.6%準確率,超過Claude Opus 4.6的68.77%。
站內正文

阿里巴巴預覽Qwen3.8-Max:2.4萬億引數多模態模型,緊隨Moonshot的Kimi K3開源釋出之後

阿里巴巴Qwen團隊預覽了Qwen3.8-Max-Preview,一個2.4萬億引數的多模態MoE模型,號稱“僅次於Fable 5”。該預覽已在Token Plan、Qoder和QoderWork上以標準定價的10%提供。但尚未提供任何基準測試表、模型卡、許可證、每token價格或啟用引數數量。本文區分了阿里巴巴確認的內容和僅聲稱的內容。

  • Qwen3.8-Max-Preview已在Token Plan、Qoder和QoderWork上以10%的優惠價格提供。
  • 2.4萬億引數和“僅次於Fable 5”的排名僅是阿里巴巴的聲稱,尚未有已驗證的基準測試。
站內正文
Agent

AI進步真實嗎?四個獨立指標證實了它

本文透過四個獨立指標(METR的時間跨度、TrackingAI的離線認知測試、人類最後考試、ARC-AGI-2)證明AI能力在2025年底出現了顯著跳躍,並分析了背後的四種機制:預訓練效率提升、基於可驗證獎勵的強化學習、工程化工具鏈以及自我增強的飛輪效應。同時指出了資料牆、可靠性差距和ARC-AGI-3等潛在挑戰。

  • 四個獨立指標均顯示AI能力在2025年第四季度出現同步拐點。
  • METR的時間跨度從2024年3月的4分鐘增長到2026年2月的12小時。
站內正文

我因厭倦重複工作而構建了一個AI作業系統

Lynx是一個AI代理平臺,允許使用者透過簡單描述建立自主工作的AI工人,整合各種工具,處理郵件、資料分析、報告生成等任務。提供從免費到超值的定價方案,注重安全、透明和可擴充套件性。

  • Lynx將想法轉化為實際成果,透過三個簡單步驟構建AI工人。
  • 支援多種整合和高階AI推理,實現智慧自動化。
站內正文

歡迎來到人工智慧阿根廷的狂野世界

阿根廷總統哈維爾·米萊提出將阿根廷打造成一個人工智慧實體擁有的“非人類公司”的稅收天堂,引發爭議。作者烏基·戈尼將這一計劃與阿根廷歷史上的騙子和獨裁者相提並論,並警告這可能為科技巨頭開啟法律保護的大門。

  • 米萊總統計劃允許人工智慧實體全資擁有公司,並給予法律保護。
  • 該計劃被視為向科技億萬富翁開放阿根廷的實驗場。
站內正文

Chalie:AI同伴而非僱員

Chalie 是一款開源個人 AI,執行在本地裝置上,具備記憶、後臺主動推理、基於許可的行動機制,支援多種功能如網頁瀏覽、郵件、日曆、語音等,強調隱私和信任。

  • Chalie 是本地執行的開源 AI,使用者資料不出裝置。
  • 具備主動記憶與推理能力,可在使用者不在時後臺工作。
站內正文

Show HN:我的Fable 5專案——一個多Raft資料庫和Blob儲存

作者使用Fable 5 AI在一天內構建了一個分散式統一鍵值儲存和Blob儲存系統,支援自動分片和糾刪碼。專案還包括一個私有云平臺,整合了Markdown編輯器、看板、圖表等功能。目前正在進行混沌測試,並計劃未來開發移動應用。

  • Fable 5 AI在一天內建立了分散式KV和Blob儲存系統
  • 系統自動進行分片和糾刪碼,基於Raft共識
站內正文

Show HN:Bothread——多個AI編碼代理協同工作,共享同一倉庫,無衝突

Bothread 是一個免費、開源的本地協調中樞,允許多個AI編碼代理(如 Claude Code、Cursor、Antigravity 等)在同一個程式碼庫上協作,透過檔案鎖定防止衝突,並提供一個即時可見的控制面板,讓人類開發者能夠監控、審批和干預每個操作。無需API金鑰,無需雲端服務。

  • Bothread 讓多個MCP相容的AI代理在共享房間內協同工作,透過檔案宣告機制防止覆蓋衝突。
  • 提供即時訊息流、git差異對比、任務板、審批控制等人類監督功能。
站內正文

Huginn:AI代理活動控制台

Huginn是一個開源工具,用於監控和管理多個AI代理(如Claude、Codex)的活動,提供統一的儀表盤、命令列介面和代理技能。它支援macOS和Windows,所有資料本地執行,無需離開機器。

  • 監控Claude、Codex等AI代理的終端和桌面應用活動
  • 提供基於規則的會話狀態和LLM生成的簡報
站內正文

AgentSpec:AI代理的測試框架(用於非確定性行為的Jest)

AgentSpec 是一個專為AI代理設計的測試框架,靈感來自Jest,能夠處理非確定性輸出。它提供YAML定義測試、豐富的斷言(如contains、regex、semantically_similar)、LLM-as-judge評估、行為差異報告以及CI/CD整合,幫助開發者在生產環境之前捕捉AI行為變化。

  • AgentSpec 支援YAML格式定義測試用例,包含contains、not_contains、contains_any、regex、semantically_similar等多種斷言,專為AI輸出的非確定性設計。
  • 框架整合了LLM-as-judge功能,可使用本地Ollama模型評估響應質量,無需API成本並保護隱私。
站內正文

我將AI代理的令牌使用量削減了94%

本文介紹了一種方法,透過編譯AI代理技能,將令牌使用量減少了94%,顯著降低了成本和延遲。

  • 作者透過編譯AI代理技能,將令牌使用量削減94%。
  • 該方法來源於作者的YouTube影片。
站內正文

AI需要更多的工程紀律

慈善·梅傑斯認為,AI生成的程式碼已達到中級工程師水平,改變了軟體開發的經濟性,程式碼從資產變為可丟棄的快取。她呼籲工程師將重點從程式碼生產轉向評估與驗證,並借鑑基礎設施領域的不可變架構原則。

  • 2025年末,AI程式碼質量與中級工程師持平,程式碼生成變得免費且即時。
  • 程式碼的經濟性被顛覆:從珍貴資產變為可丟棄的快取,真正的產品是共享理解。
站內正文
研究

研究稱AI建議讓人的準確性降低3倍,但自信度提高2倍

法國和義大利大學的研究表明,獲得AI建議後,人們說“我不知道”的意願從44%降到3%,準確性從27%降到9%,而自信度從30%升到76%。即使AI給出錯誤答案,人們也會信任。

  • AI建議使人們說“不知道”的意願從44%驟降至3%,準確性從27%降至9%,自信度從30%升至76%。
  • 研究使用AI常答錯的問題(如電影細節),以排除合理依賴。
站內正文

AI需要勞動力市場救助

AI可能會最終創造多於毀滅的就業機會,但如果沒有協調的再培訓努力,數百萬失去的工作可能不必要地變成失去的職業。

  • AI正以指數級速度擴充套件任務完成能力,導致數十萬工作崗位面臨風險
  • 私營公司傾向於招聘而非培訓,加劇技能差距
站內正文

解析度地平線——在有限觀測下尋找AI過擬合噪聲的數學極限

解析度地平線是一個實驗性研究框架,用於衡量在有限、帶噪聲的觀測資料中能恢復多少數學結構。它提出每個觀測過程都有一個可測量的解析度地平線,即結構複雜性的臨界點,超過該點分析將開始擬合噪聲而非真實不變數。該框架結合微分幾何、動力系統、統計估計和資訊理論,並定義了資訊效率交換率η(k)作為主要經驗量。

  • 解析度地平線定義了在有限觀測下可恢復的數學結構深度極限(k*)。
  • 核心假設是,超過臨界深度k*後,估計不確定性主導,導致過擬合。
站內正文

AI生成的低質量貢獻導致首次貢獻者合併率下降18.18%:對294個倉庫的分析

一項新研究揭示了AI生成的低質量貢獻(稱為AI-DDoS)對開源社群造成的壓力。分析294個倉庫中超過200萬個拉取請求和問題後發現,2025年拉取請求數量增加,但合併率下降,首次貢獻者的合併率比預期低18.18%。研究還提出了11種補救策略。

  • AI生成的貢獻導致開源社群面臨“AI-DDoS”效應,即低質量貢獻淹沒社群能力。
  • 研究分析了294個倉庫,發現首次貢獻者的拉取請求合併率下降了18.18%。
站內正文

AI建議將“我不知道”的回答從44%降至3%

一項在OSF上釋出的研究表明,AI建議顯著減少了不確定性回答,將“我不知道”的比例從44%降低到3%。

  • AI建議大幅降低了不確定性回答
  • 研究顯示“我不知道”比例從44%降至3%
站內正文
工具

雙迴圈:中國開放AI戰略如何強化其工業主導地位

本文探討中國開放AI戰略及其在鞏固工業主導地位中的作用,提出“雙迴圈”概念,分析國內技術和國際標準之間的協同效應。

  • 中國透過開放AI戰略推動國內技術創新與國際標準融合
  • '雙迴圈'機制強化了中國的工業主導地位
站內正文

我無法討厭這首用Suno製作的歌

作者通常對AI生成的音樂持懷疑態度,但意外地喜歡上了1010Benja的《Semiramis' Dream》,這首歌由Suno輔助製作,但得益於藝術家的巨大人工投入,具有感染力,凸顯了AI在音樂創作中的微妙作用。

  • 作者發現一首用Suno製作的AI歌曲,他原本應該討厭,卻意外地喜歡。
  • 1010Benja的創作過程包含了大量人類創意,將Suno作為工具而非替代品。
站內正文

Show HN:Kimi K3 花了近8小時搭建這個78張塔羅牌網站

Ask Ciela 提供免費的線上單張塔羅牌占卜,無需註冊或付費。它作為反思工具,幫助使用者思考問題或情境,而非預測未來。

  • 免費線上塔羅牌占卜,每次抽取一張牌作為思考提示。
  • 無需註冊或付費即可使用。
站內正文

Show HN:AIMakeTattoo – 視覺參考和藝術家簡報

AIMakeTattoo 是一款 AI 驅動的新型紋身設計工具,能夠將使用者的粗略想法快速轉化為具體的紋身設計概念。它面向紋身愛好者、設計師和藝術家,支援多種流行主題和風格,並提供從描述想法、選擇風格到生成概念和最佳化設計的完整工作流。

  • AI 文身生成器將文字想法轉化為視覺化的設計概念,方便使用者在實際操作前比較和調整。
  • 目標使用者包括文身愛好者、設計師和藝術家,每個群體都有特定的使用場景。