AI News HubLIVE

今日必讀

模型

社區開發者微調OpenBMB的MiniCPM5-1B模型:基於Claude Fable 5數據,打造657MB本地推理模型

一位社區開發者基於OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的對話數據進行微調,發佈了一個僅657MB的本地推理模型。該模型支持128K上下文窗口、可切換的思維模式,並可在llama.cpp等工具中運行。本文驗證了其技術細節,區分了微調與真正的能力繼承,並指出了許可問題。

  • 模型為MiniCPM5-1B的監督微調版本,使用了Claude Fable 5的推理軌跡。
  • 支持128K上下文,GGUF量化最小版本僅657MB。
站內正文

2026年單張24GB GPU可運行的最佳本地LLM:Qwen、Gemma、Mistral、DeepSeek對比

本文對比了六款適合單張24GB GPU(如RTX 3090/4090)的開放權重模型,涵蓋Qwen3.6、Gemma 4、Mistral Small等,並解釋了內存分配、量化策略以及各模型的優勢場景。

  • 24GB是本地推理的實際起點,推薦使用20B-35B參數模型而非壓縮70B模型。
  • Qwen3.6-27B是最全面的通用選擇,DeepSeek-R1-Distill-Qwen-32B適合深度推理但佔用最高。
站內正文

價值超過1000美元的AI/GPU/LLM免費積分彙總

為AI研究人員整理的免費資源合集,包括超過1000美元的免費計算積分、研究指南、社區論壇等,幫助學生在不花費一分錢的情況下開始AI研究。

  • 提供超過1000美元的免費AI/GPU/LLM積分
  • 包含從想法到論文發表的全套研究指南
站內正文
Agent

網站屏幕捕捉:你的AI可以讀取的錄製內容

CBrowser 推出新功能,使AI能夠讀取和分析網站屏幕錄製內容,為自動化和數據提取開闢新可能。

  • AI可以處理視覺屏幕錄製,提取文本和上下文信息
  • 該技術可自動化以前需要人工審查的工作流程
站內正文

忘掉模型吧。在網絡安全領域,關鍵在於“駕馭”

AI驅動的黑客攻擊威脅日益增長,但焦點應從前沿AI模型轉移到“駕馭”——即針對特定網絡安全任務定製通用大語言模型的工具。Cato Networks的研究展示了這種駕馭的強大力量,他們測試了自主黑客代理。

  • AI黑客威脅增加,但注意力應放在定製模型的“駕馭”上。
  • 企業正在構建自己的技術平台,將通用LLM轉化為專門的網絡安全工具。
站內正文

DistillFeed:帶AI排名和摘要的RSS閲讀器

DistillFeed 是一款RSS/Atom閲讀器,利用AI對文章進行排名並生成摘要。支持OpenAI和Ollama,提供成本保護、通過ntfy發送通知提醒,並內置arXiv每日摘要插件。該應用以Apache 2.0許可證在GitHub上發佈。

  • 通過AI對文章進行相關性評分和生成簡潔摘要。
  • 支持OpenAI和本地Ollama模型,並設有成本保護措施。
站內正文

如何惹惱你的Nix朋友

本文作者以挑釁性的口吻分享了一系列關於Nix和NixOS社區的有爭議觀點,包括Nix雖然優秀但存在文檔差、學習曲線陡等問題,並非適合所有人;社區中存在的反美情緒;AI工具在Nix生態中的價值;對BDFL模式的肯定;建議放棄macOS和Windows支持;對Flakes的保留態度;以及提倡使用單用户安裝。作者認為Nix潛力巨大,但應聚焦於Linux平台和核心功能。

  • Nix雖然強大但存在文檔糟糕、語言難以理解等問題,並非適合所有人。
  • 社區中存在反美情緒,美國用户和公司受到懷疑。
站內正文
工具

並非崩潰:用AI調試CI

一位開發者花費數小時調試一個CI冒煙測試,該測試錯誤地報告了崩潰。通過使用AI和定製的崩潰捕獲工具包,他們發現進程正常退出,但測試誤解了信號。

  • CI冒煙測試錯誤地報告了崩潰。
  • 調試涉及多次AI會話和多個假設。
站內正文
芯片

Show HN: Headroom —— 測量本地AI的GPU真實帶寬上限

Headroom是一款30秒的瀏覽器內測試工具,用於測量本地AI推理時GPU內存帶寬的真實上限,無需下載模型,使用合成權重,需要WebGPU支持。它通過三種獨立方法測量帶寬,並檢測導致瀏覽器內LLM輸出錯誤的子組bug。驗證表明,當前瀏覽器引擎受發射開銷限制,硬件仍有2-3倍潛力。

  • 30秒瀏覽器測試,無需模型下載,使用合成權重
  • 三種獨立帶寬測量:緩衝複製、三讀寫、純讀歸約
站內正文
政策
其餘更新(26 條)
芯片

台積電加速亞利桑那工廠建設以抓住人工智能“大趨勢”

台積電首席財務官黃仁昭對CNBC表示,公司正在加速亞利桑那工廠的產能擴張,以應對AI驅動的多年結構性需求。公司額外承諾投資1000億美元,使在美總投資達到2650億美元,並將全年資本支出上調至600-640億美元。台積電正在將5納米產能轉換為先進的3納米節點,2納米技術將成為下一季度營收的新驅動力。

  • 台積電額外投資1000億美元擴大亞利桑那工廠,總投資達2650億美元。
  • 公司正在將5納米產能轉換為3納米節點,以滿足AI需求。
站內正文

福布斯認為AI創造了新職業,但歷史早已有之

硅谷出現了一批精通AI、加密貨幣等技術的豪華伴遊,客人為了一次深入對話支付數千美元。但這種現象並非AI獨有:日本藝伎、希臘赫泰拉等早已存在類似模式。技術改變,但人類對關注和陪伴的需求始終未變。

  • 硅谷豪華伴遊通過談論AI、Nvidia等話題吸引科技富豪,收費高昂。
  • 文章指出該現象並非新奇,歷史上藝伎、名妓等皆扮演類似角色。
站內正文

Moonshot AI 因Kimi K3需求大增暫停新訂閲

由於Kimi K3需求超出預期,Moonshot AI宣佈暫停新訂閲以保護現有用户體驗。

  • Kimi K3需求在48小時內接近容量上限
  • 為保護現有用户,暫停新訂閲
站內正文
政策

凱文·奧利裏對AI的看法很有趣,9分鐘視頻

在這個9分鐘的視頻中,凱文·奧利裏分享了他對人工智能的獨到見解。作為一名知名投資者和《鯊魚坦克》明星,他結合商業經驗探討了AI的機遇與挑戰。

  • 凱文·奧利裏討論AI
  • 視頻時長9分鐘
站內正文
模型

Feyn AI發佈SQRL:一個在編寫查詢前先檢查數據庫的文本到SQL模型系列

Feyn Labs發佈了SQRL,這是一系列文本到SQL模型,能在生成查詢前通過只讀探針檢查數據庫。旗艦型號SQRL-35B-A3B在BIRD Dev上達到70.6%的執行準確率,略超Claude Opus 4.6,並可蒸餾為可自託管的4B和9B檢查點。

  • SQRL通過只讀探針在提交最終查詢前檢查數據庫。
  • SQRL-35B-A3B在BIRD Dev上達到70.6%準確率,超過Claude Opus 4.6的68.77%。
站內正文

阿里巴巴預覽Qwen3.8-Max:2.4萬億參數多模態模型,緊隨Moonshot的Kimi K3開源發佈之後

阿里巴巴Qwen團隊預覽了Qwen3.8-Max-Preview,一個2.4萬億參數的多模態MoE模型,號稱“僅次於Fable 5”。該預覽已在Token Plan、Qoder和QoderWork上以標準定價的10%提供。但尚未提供任何基準測試表、模型卡、許可證、每token價格或激活參數數量。本文區分了阿里巴巴確認的內容和僅聲稱的內容。

  • Qwen3.8-Max-Preview已在Token Plan、Qoder和QoderWork上以10%的優惠價格提供。
  • 2.4萬億參數和“僅次於Fable 5”的排名僅是阿里巴巴的聲稱,尚未有已驗證的基準測試。
站內正文
Agent

AI進步真實嗎?四個獨立指標證實了它

本文通過四個獨立指標(METR的時間跨度、TrackingAI的離線認知測試、人類最後考試、ARC-AGI-2)證明AI能力在2025年底出現了顯著跳躍,並分析了背後的四種機制:預訓練效率提升、基於可驗證獎勵的強化學習、工程化工具鏈以及自我增強的飛輪效應。同時指出了數據牆、可靠性差距和ARC-AGI-3等潛在挑戰。

  • 四個獨立指標均顯示AI能力在2025年第四季度出現同步拐點。
  • METR的時間跨度從2024年3月的4分鐘增長到2026年2月的12小時。
站內正文

我因厭倦重複工作而構建了一個AI操作系統

Lynx是一個AI代理平台,允許用户通過簡單描述創建自主工作的AI工人,集成各種工具,處理郵件、數據分析、報告生成等任務。提供從免費到超值的定價方案,注重安全、透明和可擴展性。

  • Lynx將想法轉化為實際成果,通過三個簡單步驟構建AI工人。
  • 支持多種集成和高級AI推理,實現智能自動化。
站內正文

歡迎來到人工智能阿根廷的狂野世界

阿根廷總統哈維爾·米萊提出將阿根廷打造成一個人工智能實體擁有的“非人類公司”的税收天堂,引發爭議。作者烏基·戈尼將這一計劃與阿根廷歷史上的騙子和獨裁者相提並論,並警告這可能為科技巨頭打開法律保護的大門。

  • 米萊總統計劃允許人工智能實體全資擁有公司,並給予法律保護。
  • 該計劃被視為向科技億萬富翁開放阿根廷的實驗場。
站內正文

Chalie:AI同伴而非僱員

Chalie 是一款開源個人 AI,運行在本地設備上,具備記憶、後台主動推理、基於許可的行動機制,支持多種功能如網頁瀏覽、郵件、日曆、語音等,強調隱私和信任。

  • Chalie 是本地運行的開源 AI,用户數據不出設備。
  • 具備主動記憶與推理能力,可在用户不在時後台工作。
站內正文

Show HN:我的Fable 5項目——一個多Raft數據庫和Blob存儲

作者使用Fable 5 AI在一天內構建了一個分佈式統一鍵值存儲和Blob存儲系統,支持自動分片和糾刪碼。項目還包括一個私有云平台,集成了Markdown編輯器、看板、圖表等功能。目前正在進行混沌測試,並計劃未來開發移動應用。

  • Fable 5 AI在一天內創建了分佈式KV和Blob存儲系統
  • 系統自動進行分片和糾刪碼,基於Raft共識
站內正文

Show HN:Bothread——多個AI編碼代理協同工作,共享同一倉庫,無衝突

Bothread 是一個免費、開源的本地協調中樞,允許多個AI編碼代理(如 Claude Code、Cursor、Antigravity 等)在同一個代碼庫上協作,通過文件鎖定防止衝突,並提供一個實時可見的控制面板,讓人類開發者能夠監控、審批和干預每個操作。無需API密鑰,無需雲端服務。

  • Bothread 讓多個MCP兼容的AI代理在共享房間內協同工作,通過文件聲明機制防止覆蓋衝突。
  • 提供實時消息流、git差異對比、任務板、審批控制等人類監督功能。
站內正文

Huginn:AI代理活動控制台

Huginn是一個開源工具,用於監控和管理多個AI代理(如Claude、Codex)的活動,提供統一的儀表盤、命令行接口和代理技能。它支持macOS和Windows,所有數據本地運行,無需離開機器。

  • 監控Claude、Codex等AI代理的終端和桌面應用活動
  • 提供基於規則的會話狀態和LLM生成的簡報
站內正文

AgentSpec:AI代理的測試框架(用於非確定性行為的Jest)

AgentSpec 是一個專為AI代理設計的測試框架,靈感來自Jest,能夠處理非確定性輸出。它提供YAML定義測試、豐富的斷言(如contains、regex、semantically_similar)、LLM-as-judge評估、行為差異報告以及CI/CD集成,幫助開發者在生產環境之前捕捉AI行為變化。

  • AgentSpec 支持YAML格式定義測試用例,包含contains、not_contains、contains_any、regex、semantically_similar等多種斷言,專為AI輸出的非確定性設計。
  • 框架集成了LLM-as-judge功能,可使用本地Ollama模型評估響應質量,無需API成本並保護隱私。
站內正文

我將AI代理的令牌使用量削減了94%

本文介紹了一種方法,通過編譯AI代理技能,將令牌使用量減少了94%,顯著降低了成本和延遲。

  • 作者通過編譯AI代理技能,將令牌使用量削減94%。
  • 該方法來源於作者的YouTube視頻。
站內正文

AI需要更多的工程紀律

慈善·梅傑斯認為,AI生成的代碼已達到中級工程師水平,改變了軟件開發的經濟性,代碼從資產變為可丟棄的緩存。她呼籲工程師將重點從代碼生產轉向評估與驗證,並借鑑基礎設施領域的不可變架構原則。

  • 2025年末,AI代碼質量與中級工程師持平,代碼生成變得免費且即時。
  • 代碼的經濟性被顛覆:從珍貴資產變為可丟棄的緩存,真正的產品是共享理解。
站內正文
研究

研究稱AI建議讓人的準確性降低3倍,但自信度提高2倍

法國和意大利大學的研究表明,獲得AI建議後,人們説“我不知道”的意願從44%降到3%,準確性從27%降到9%,而自信度從30%升到76%。即使AI給出錯誤答案,人們也會信任。

  • AI建議使人們説“不知道”的意願從44%驟降至3%,準確性從27%降至9%,自信度從30%升至76%。
  • 研究使用AI常答錯的問題(如電影細節),以排除合理依賴。
站內正文

AI需要勞動力市場救助

AI可能會最終創造多於毀滅的就業機會,但如果沒有協調的再培訓努力,數百萬失去的工作可能不必要地變成失去的職業。

  • AI正以指數級速度擴展任務完成能力,導致數十萬工作崗位面臨風險
  • 私營公司傾向於招聘而非培訓,加劇技能差距
站內正文

分辨率地平線——在有限觀測下尋找AI過擬合噪聲的數學極限

分辨率地平線是一個實驗性研究框架,用於衡量在有限、帶噪聲的觀測數據中能恢復多少數學結構。它提出每個觀測過程都有一個可測量的分辨率地平線,即結構複雜性的臨界點,超過該點分析將開始擬合噪聲而非真實不變量。該框架結合微分幾何、動力系統、統計估計和信息論,並定義了信息效率交換率η(k)作為主要經驗量。

  • 分辨率地平線定義了在有限觀測下可恢復的數學結構深度極限(k*)。
  • 核心假設是,超過臨界深度k*後,估計不確定性主導,導致過擬合。
站內正文

AI生成的低質量貢獻導致首次貢獻者合併率下降18.18%:對294個倉庫的分析

一項新研究揭示了AI生成的低質量貢獻(稱為AI-DDoS)對開源社區造成的壓力。分析294個倉庫中超過200萬個拉取請求和問題後發現,2025年拉取請求數量增加,但合併率下降,首次貢獻者的合併率比預期低18.18%。研究還提出了11種補救策略。

  • AI生成的貢獻導致開源社區面臨“AI-DDoS”效應,即低質量貢獻淹沒社區能力。
  • 研究分析了294個倉庫,發現首次貢獻者的拉取請求合併率下降了18.18%。
站內正文

AI建議將“我不知道”的回答從44%降至3%

一項在OSF上發佈的研究表明,AI建議顯著減少了不確定性回答,將“我不知道”的比例從44%降低到3%。

  • AI建議大幅降低了不確定性回答
  • 研究顯示“我不知道”比例從44%降至3%
站內正文
工具

雙循環:中國開放AI戰略如何強化其工業主導地位

本文探討中國開放AI戰略及其在鞏固工業主導地位中的作用,提出“雙循環”概念,分析國內技術和國際標準之間的協同效應。

  • 中國通過開放AI戰略推動國內技術創新與國際標準融合
  • '雙循環'機制強化了中國的工業主導地位
站內正文

我無法討厭這首用Suno製作的歌

作者通常對AI生成的音樂持懷疑態度,但意外地喜歡上了1010Benja的《Semiramis' Dream》,這首歌由Suno輔助製作,但得益於藝術家的巨大人工投入,具有感染力,凸顯了AI在音樂創作中的微妙作用。

  • 作者發現一首用Suno製作的AI歌曲,他原本應該討厭,卻意外地喜歡。
  • 1010Benja的創作過程包含了大量人類創意,將Suno作為工具而非替代品。
站內正文

Show HN:Kimi K3 花了近8小時搭建這個78張塔羅牌網站

Ask Ciela 提供免費的在線單張塔羅牌占卜,無需註冊或付費。它作為反思工具,幫助用户思考問題或情境,而非預測未來。

  • 免費在線塔羅牌占卜,每次抽取一張牌作為思考提示。
  • 無需註冊或付費即可使用。
站內正文

Show HN:AIMakeTattoo – 視覺參考和藝術家簡報

AIMakeTattoo 是一款 AI 驅動的新型紋身設計工具,能夠將用户的粗略想法快速轉化為具體的紋身設計概念。它面向紋身愛好者、設計師和藝術家,支持多種流行主題和風格,並提供從描述想法、選擇風格到生成概念和優化設計的完整工作流。

  • AI 文身生成器將文字想法轉化為可視化的設計概念,方便用户在實際操作前比較和調整。
  • 目標用户包括文身愛好者、設計師和藝術家,每個羣體都有特定的使用場景。