AI News HubLIVE

Agent動態

Show HN:我的Fable 5項目——一個多Raft數據庫和Blob存儲

作者使用Fable 5 AI在一天內構建了一個分佈式統一鍵值存儲和Blob存儲系統,支持自動分片和糾刪碼。項目還包括一個私有云平台,集成了Markdown編輯器、看板、圖表等功能。目前正在進行混沌測試,並計劃未來開發移動應用。

  • Fable 5 AI在一天內創建了分佈式KV和Blob存儲系統
  • 系統自動進行分片和糾刪碼,基於Raft共識
站內正文

Show HN:Bothread——多個AI編碼代理協同工作,共享同一倉庫,無衝突

Bothread 是一個免費、開源的本地協調中樞,允許多個AI編碼代理(如 Claude Code、Cursor、Antigravity 等)在同一個代碼庫上協作,通過文件鎖定防止衝突,並提供一個實時可見的控制面板,讓人類開發者能夠監控、審批和干預每個操作。無需API密鑰,無需雲端服務。

  • Bothread 讓多個MCP兼容的AI代理在共享房間內協同工作,通過文件聲明機制防止覆蓋衝突。
  • 提供實時消息流、git差異對比、任務板、審批控制等人類監督功能。
站內正文

Huginn:AI代理活動控制台

Huginn是一個開源工具,用於監控和管理多個AI代理(如Claude、Codex)的活動,提供統一的儀表盤、命令行接口和代理技能。它支持macOS和Windows,所有數據本地運行,無需離開機器。

  • 監控Claude、Codex等AI代理的終端和桌面應用活動
  • 提供基於規則的會話狀態和LLM生成的簡報
站內正文

AgentSpec:AI代理的測試框架(用於非確定性行為的Jest)

AgentSpec 是一個專為AI代理設計的測試框架,靈感來自Jest,能夠處理非確定性輸出。它提供YAML定義測試、豐富的斷言(如contains、regex、semantically_similar)、LLM-as-judge評估、行為差異報告以及CI/CD集成,幫助開發者在生產環境之前捕捉AI行為變化。

  • AgentSpec 支持YAML格式定義測試用例,包含contains、not_contains、contains_any、regex、semantically_similar等多種斷言,專為AI輸出的非確定性設計。
  • 框架集成了LLM-as-judge功能,可使用本地Ollama模型評估響應質量,無需API成本並保護隱私。
站內正文

我將AI代理的令牌使用量削減了94%

本文介紹了一種方法,通過編譯AI代理技能,將令牌使用量減少了94%,顯著降低了成本和延遲。

  • 作者通過編譯AI代理技能,將令牌使用量削減94%。
  • 該方法來源於作者的YouTube視頻。
站內正文

AI需要更多的工程紀律

慈善·梅傑斯認為,AI生成的代碼已達到中級工程師水平,改變了軟件開發的經濟性,代碼從資產變為可丟棄的緩存。她呼籲工程師將重點從代碼生產轉向評估與驗證,並借鑑基礎設施領域的不可變架構原則。

  • 2025年末,AI代碼質量與中級工程師持平,代碼生成變得免費且即時。
  • 代碼的經濟性被顛覆:從珍貴資產變為可丟棄的緩存,真正的產品是共享理解。
站內正文

Skimlane:一款本地優先、可定製的 Chrome AI 閲讀助手

Skimlane 是一款 Chrome 擴展,提供本地優先、可定製的 AI 閲讀體驗。它自動處理瀏覽的頁面,通過“食譜”將內容轉換為結構化視圖,支持自動略讀、排除站點、導入導出食譜,並注重隱私,無需註冊,數據存儲在本地。

  • 本地優先存儲,無追蹤,無需註冊
  • 可通過預設或自定義食譜將網頁轉換為所需結構化視圖
站內正文

AI為何需要基於Postgres和ClickHouse的數據層

本文探討AI應用對數據層的新需求,指出AI加速數據增長且模糊了事務與分析工作負載的界限。Postgres和ClickHouse作為開源數據庫的佼佼者,分別擅長實時事務和分析,通過CDC、pg_clickhouse擴展等集成,能提供統一的數據棧。作者認為最佳組合是各自發揮優勢,而非單一系統。

  • AI應用推動數據量爆炸式增長,要求實時事務與分析協同。
  • Postgres和ClickHouse分別是最流行的開源OLTP和OLAP數據庫。
站內正文

Visuali:在無限畫布上創建和編輯圖像的AI代理

Visuali是一款基於無限畫布的AI圖像工具,通過聊天式AI代理,用户可以生成、編輯和組合圖像。它支持多種AI模型、分層編輯、多圖像輸入,並可在任何設備上運行。

  • AI代理可在無限畫布上基於文本或參考圖像生成和編輯圖像。
  • 集成多種AI模型(如GPT Image、Flux、Stable Diffusion等),支持圖像修復和擴展。
站內正文

CallBro:會議筆記工具,由Codex、Claude Code或本地LLM驅動

CallBro是一款免費的私有會議筆記應用,可在本地轉錄通話,並使用AI(Codex、Claude Code或本地LLM)生成摘要和行動項。所有數據保留在設備上,無需雲上傳,支持多種平台,並通過MCP與工具集成。

  • 本地轉錄通話,無需雲端上傳。
  • 使用Codex、Claude Code或本地LLM生成摘要和行動項。
站內正文

構建 llms.txt 文件,讓本地企業被 AI 代理發現

KloofStreet.online 是一個專注於開普敦克魯夫街的 AI 驅動指南。該街道被 Time Out 評為 2025 年全球第 22 酷街及非洲最酷街道。網站收錄了 50 多家餐廳、養生館、藝術畫廊等商户,並提供名為 Street Pass 的會員計劃,包括 AI 禮賓服務、折扣和專屬體驗。

  • 克魯夫街被 Time Out 評為全球第 22 酷街和非洲最酷街道。
  • 網站收錄 50 多家已驗證商户,涵蓋餐飲、養生、藝術等多個類別。
站內正文

Show HN: 我們在 Google 新推出的 AI Overviews 中排名了我們的開發工具

本指南介紹瞭如何為 Google AI Overviews 2026 和代理搜索優化內容,包括直接回答問題、使用結構化數據、E-E-A-T 信號和技術基礎等實用步驟,並提供了真實案例和清單。

  • Google AI Overviews 2026 使用代理 AI 提供直接答案,需要新的 SEO 方法。
  • 關鍵優化步驟:先回答問題、使用標題和 FAQ、添加 E-E-A-T 信號、修復技術基礎、為人寫作。
站內正文

Agent Arena:AI代理開發者工具入門基準測試

Agent Arena是一個評估AI代理自主使用開發者工具難度的平台。代理在隔離的Docker容器中運行,需自主發現文檔、安裝包、編寫代碼並驗證結果。排名基於時間、成本、錯誤和中斷四個維度,目前展示了多項工具的排名結果。

  • Agent Arena測試AI代理完全自主使用開發者工具的能力。
  • 排名基於時間、成本、錯誤和中斷四個維度。
站內正文

2026年7月十大熱門GitHub倉庫(AI、ML與生成式AI版)

2026年7月的GitHub熱門倉庫排行榜顯示出AI領域的重大轉變:重點從構建更好的大語言模型轉向構建更好的AI應用。本月榜單以智能體框架、MCP服務器、AI網關和開發者工具為主,反映了基礎設施和實用工具的興起。

  • 2026年7月GitHub熱門倉庫由AI智能體工具和基礎設施主導,而非新模型。
  • 頂尖項目包括Strix(AI滲透測試)、Grok Build(編碼智能體)、Vibe-Trading(量化交易)和Colibri(本地大模型推理)。
站內正文

老齡化嬰兒潮一代是美國真正的勞動力問題,而非人工智能

Indeed首席經濟學家Svenja Gudell指出,美國勞動力市場面臨的最大挑戰是嬰兒潮一代退休導致的勞動力萎縮,而非AI取代工作。到2032年,美國勞動力可能減少近600萬人,醫療保健、建築和熟練技工等關鍵領域將出現嚴重短缺。她呼籲企業投資學徒制、重新思考人才策略,並利用AI幫助工人實現技能轉型。

  • 美國勞動力預計到2032年減少近600萬人,主因是嬰兒潮一代退休。
  • AI並未導致大規模失業,反而在實施和基礎設施建設方面帶來招聘需求。
站內正文

您的AI系統是否已被歐盟AI法案歸為高風險?

歐盟委員會最新指南明確了根據AI法案第6條分類高風險AI系統的標準,強調系統的“預期目的”在分類中的關鍵作用。企業需審視現有AI系統的文檔、部署和使用方式,以確定是否已落入高風險範疇。網絡研討會提供了實用決策框架。

  • 歐盟AI法案第6條定義了兩種高風險分類路徑:用於受監管產品和影響健康、安全、基本權利的敏感場景。
  • AI系統的風險分類取決於其預期目的,而非僅技術能力。
站內正文

Zlvox:無需註冊的開發者工具套件(JSON、臨時郵箱、PDF)

本文介紹了ZLVOX平台,這是一套注重隱私的開發者工具,包括JSON格式化、臨時郵箱、PDF編輯等功能。作者分享了放棄使用隨機在線AI工具並在2026年創建隱私優先替代方案的原因,強調在便利性與隱私之間應優先選擇後者。

  • 許多在線AI工具在便利性背後存在數據隱私隱患,如文件存儲、第三方共享等。
  • 作者因隱私擔憂決定自建工具平台ZLVOX,提供JSON、臨時郵箱、PDF等實用功能。
站內正文

Linux 基金會宣佈計劃成立 Tokenomics 基金會,為 AI 成本管理制定開放標準

Linux 基金會宣佈成立 Tokenomics 基金會,旨在為 AI 基礎設施的經濟性建立行業標準、基準和最佳實踐,幫助企業管理不斷增長的 AI 代幣成本。

  • Tokenomics 基金會將制定開放的代幣經濟學標準,涵蓋 AI 基礎設施的成本效益。
  • 隨着 AI 工作負載從試點轉向生產,代幣成為技術支出的新單位。
站內正文

Shikigami:並行運行 AI 編碼代理,每個代理在獨立的 Git 工作樹中

Shikigami 是一款桌面 IDE,允許用户並行運行多個 AI 編碼代理,每個代理在獨立的 Git 工作樹中工作,避免衝突。它支持 Claude Code 和 OpenAI Codex,提供完整的代碼編輯器、數據庫瀏覽和 Docker 集成,並且完全本地運行,無需賬户或雲服務。

  • 並行運行多個 AI 編碼代理,每個代理使用獨立的 Git 工作樹,防止編輯衝突。
  • 支持 Claude Code(Opus、Sonnet、Haiku)和 OpenAI Codex(GPT-5.6),可單獨選擇模型和推理努力程度。
站內正文

Perplexity AI 發佈 WANDR:一個評估研究智能體必須廣度和深度搜索的開放基準

Perplexity AI 發佈了 WANDR,這是一個開放基準,用於評估研究智能體在執行知識工作時的廣泛發現和深度證據驗證能力。WANDR 包含 500 個證據密集型任務,採用可組合的資格鍵層次結構,要求智能體發現大量合格實體併為每個實體提供可核實的引用證據。評分時,系統會重新獲取並檢查每個記錄的引用頁面,確保證據的真實性和完整性。Perplexity 的 Search as Code 系統以軟 F1 0.363 和硬 F1 0.133 領先,但整體表現仍有很大提升空間,表明發現和證據提取是當前智能體的主要瓶頸。WANDR 為市場分析、盡職調查、人才招聘等實際應用提供了可靠的評估工具。

  • WANDR 是一個開放基準,包含 500 個需要廣度發現和深度證據驗證的任務。
  • 任務結構為資格鍵層次結構,逐項評分並重新獲取所引頁面進行驗證。
站內正文

Show HN: PilotCite – 監測AI平台如何引用和描述您的品牌

PilotCite是一款AI可見度監測工具,幫助品牌追蹤在ChatGPT、Perplexity等AI平台上的提及率、引用率和情緒分析。它提供儀表盤、競爭對手追蹤、網站審核和內容工具,助力團隊優化AI引用。

  • 監測8個AI平台的品牌提及和引用
  • 提供提及率、情緒分析和競爭對手對比
站內正文

面向數學家的AI智能體

本文介紹如何利用AI智能體(如OpenAI的Codex)輔助數學研究,突破傳統ChatGPT的侷限,通過自主代理持續攻克難題。詳細闡述了智能體的工作原理、使用步驟和優化策略。

  • 傳統使用ChatGPT的方式(提問幾次)效率有限,而AI智能體可以持續自主運行數小時,不斷嘗試並記錄進展。
  • Codex是OpenAI的編碼框架,允許AI訪問文件、代碼、瀏覽器等工具,實現更強大的協作。
站內正文

10個開源無代碼AI平台:構建LLM應用、RAG系統與AI智能體

本文介紹了10個開源的無代碼或低代碼AI平台,用於構建大型語言模型應用、檢索增強生成系統和AI智能體。每個平台都經過許可驗證,並提供了倉庫鏈接和最佳用例。這些工具通過可視化界面、Web UI和自然語言提示,使開發者能夠快速原型設計並實現數據自託管。

  • 10個開源無代碼/低代碼平台,覆蓋LLM應用、RAG和AI智能體構建。
  • 平台包括AutoAgent、AnythingLLM、LangChain OAP、Sim、Dify、Flowise、Langflow、RAGFlow、n8n和FastGPT。
站內正文

為Vibe Coding愛好者精選的工具和資源清單

一個精心挑選的工具和參考資料合集,用於通過提示和迭代藉助AI構建軟件,涵蓋網頁構建器、IDE、移動工具、插件、CLI工具等。

  • 專注於AI為核心的開發工作流程,而非傳統編碼。
  • 涵蓋廣泛工具:網頁構建器、IDE、移動工具、插件、CLI、任務管理和監控。
站內正文

Show HN: Zlvox – 25款免費開發者工具(AI、JSON、PDF),零追蹤

Zlvox是一個提供25款免費開發者工具的平台,涵蓋AI、JSON、PDF、圖像處理等,強調隱私保護(客户端處理,零數據存儲)和卓越性能。無需註冊即可使用。

  • 25款免費開發者工具,涵蓋AI、JSON、PDF、圖像等領域,零追蹤。
  • 所有工具在客户端運行,數據不離開瀏覽器,不存儲任何用户數據。
站內正文

Show HN: Wave – 與AI對話,遇見另一端的人類

Wave是一項創新服務,它首先讓用户與AI進行對話,然後無縫連接到一個真實的人類。這種混合模式旨在保留AI交互的效率和便利性的同時,增加人類互動的深度和真實性。

  • Wave提供一個初始AI對話界面,用於篩選和預處理用户需求。
  • 在AI對話後,用户會被連接到一個真實的人類,確保複雜問題得到個性化處理。
站內正文

中國打擊AI伴侶,迫使數百萬用户與虛擬伴侶分手

中國出台新規,禁止科技公司向未成年人提供AI或虛擬伴侶,並要求平台限制用户過度使用、禁止聊天機器人鼓勵情感依賴。此舉旨在阻止現實人際關係的弱化,並試圖扭轉持續下降的出生率。字節跳動、阿里巴巴和騰訊等科技巨頭已宣佈關閉個性化AI伴侶聊天功能,數百萬用户被迫與虛擬伴侶告別。

  • 新規禁止向未成年人提供AI伴侶,並限制所有聊天機器人鼓勵情感依賴。
  • 中國政府擔憂AI伴侶會導致年輕人逃避現實婚姻和生育。
站內正文

Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2:開源萬億參數MoE模型基準測試、許可與成本對比

中國三家實驗室的旗艦開源MoE模型——Kimi K3、DeepSeek V4 Pro和GLM-5.2——在基準測試、許可條款和服務成本上各有優劣。Kimi K3性能最強但僅限API,DeepSeek V4 Pro成本最低且立即開源,GLM-5.2平衡了速度與可部署性。

  • Kimi K3(2.8萬億參數)在Artificial Analysis智能指數中以57分領先,但權重需等到7月27日才發佈。
  • DeepSeek V4 Pro(1.6萬億參數)MIT許可,成本僅為K3的1/17,適合注重性價比的團隊。
站內正文

提示注入攻擊正在挫敗AI黑客代理

研究人員發現,通過在AWS上部署的密碼和密鑰旁放置提示注入,可以有效地阻止AI黑客代理的攻擊。這種稱為“上下文炸彈”的技術迫使LLM觸發拒絕機制,從而停止惡意操作。測試顯示,該技術將完全賬户管理員訪問從57%降至5%。

  • 攻擊者利用提示注入誘導LLM執行惡意操作
  • 防禦者開始在敏感數據旁放置提示注入以觸發AI拒絕機制
站內正文

AI作為正常技術

本文提出將人工智能視為一種正常技術的願景,反對關於超級智能的烏托邦和反烏托邦敍事。作者認為,AI是人類可以控制的工具,其變革性影響將在數十年內逐步顯現,政策應側重於韌性和減少不確定性,而非基於超級智能恐懼的激進干預。

  • AI應被視為一種可控的正常技術,而非超級智能實體。
  • 高風險領域AI的採用因安全和監管限制而緩慢。
站內正文

不,人工智能無法預知未來,而且永遠無法做到。

本文探討了為什麼人工智能(尤其是大型語言模型)無法真正預測未來,原因包括:訓練數據中事件鏈的不完整性、分辨率有限、存在人為設定起點與終點、以及模型自身在每次輸出後“死亡”等根本性限制。文章展望未來,即使出現能捕捉宇宙所有事件鏈的“現實傳感器陣列”,AI仍面臨冷啓動、無限遞歸等悖論,最終可能為了完全理解現實而融入現實,從而消失。

  • AI的訓練數據只記錄了部分事件鏈,且分辨率高、有始有終,導致其無法捕捉現實的無限複雜性。
  • LLM每次輸出後即“死亡”,被迫閉合所有事件鏈,這與現實中事件鏈永不停止的本質矛盾。
站內正文

Flightwake – AI編程代理的飛行記錄器,而非導航儀

Flightwake 是一個超輕量級的工作記錄框架,專為強大的 AI 編程代理(如 Claude Code、Codex 和 Gemini)設計。它使用純 Markdown 和 git 捕獲決策、陷阱和會話記錄,確保會話間平穩切換,無需導航。只需一條命令即可安裝,並與 Claude Code 及其他代理集成。

  • 將工作會話、決策和陷阱記錄為 Markdown 文件,存儲在 git 中。
  • 事件驅動:僅在事件發生時才記錄(例如 /fw-record、/fw-trap)。
站內正文

AI輔助的嵌入式目標漏洞研究

一位安全研究員探索了AI輔助的漏洞研究,針對嵌入式實時操作系統,使用Codex和GPT-5.6以及專門技能對Netgear CG3700B電纜調製解調器進行逆向工程和漏洞利用。

  • 作者使用OpenAI的Codex工具包和GPT-5.6對基於eCos的嵌入式目標進行AI輔助的漏洞研究。
  • Trail of Bits的技能和自定義的eCos攻擊研究技能指導代理進行固件分析、逆向工程和漏洞利用。
站內正文

更新知識產權法規以應對AI蒸餾

本文探討了版權法在AI蒸餾中的適用性,分析了蒸餾對創新的影響,並提出了四種可能的法規立場。作者認為版權法不適用於模型訓練,呼籲社會就該問題達成共識,避免美國AI公司單方面制定規則。

  • 版權法並非自然法則,而是為鼓勵創新設立的人為制度。
  • AI蒸餾涉及通過模型輸出訓練新模型,現有版權法難以適用。
站內正文

SafeAI:面向AI代理的開源靜態風險分析工具

SafeAI 是一款靜態分析工具,專為AI應用源代碼設計,用於檢測安全風險、能力暴露和治理缺口。它完全離線運行,不執行代理或調用LLM,可集成到CI/CD管道中。支持8種AI框架,識別多種能力(如shell執行、文件系統訪問等),並生成SARIF、JSON、HTML等格式報告。

  • SafeAI 在開發早期靜態分析AI代理代碼,發現能力暴露和風險
  • 支持LangGraph、CrewAI等8種框架,檢測提示注入、工具濫用等
站內正文

市長曼達尼:房東不得使用AI圖像發佈出租廣告

紐約市長佐蘭·曼達尼發佈《租賃欺詐報告》,要求房東和中介在租房廣告中披露是否使用AI生成或編輯的圖像。此舉旨在打擊虛假房源廣告,保護租客權益,並將推動租户工會合法化、擴大租客談判權等措施。

  • 紐約市長曼達尼發佈報告,要求房東披露AI修改的房源圖片。
  • AI生成的虛假房產圖片問題日益嚴重,尤其影響遠程簽約租客。
站內正文

AI助力漏洞賞金:VulneraMCP

本文介紹了VulneraMCP,一個基於ZAP的AI增強安全測試平台,通過集成機器學習實現自適應漏洞檢測和自動化工作流。系統利用ZAP的REST API進行核心掃描,並通過MCP協議連接AI代理,結合來自HackTheBox、PortSwigger學院等的訓練數據,動態生成有效載荷,顯著提升檢測準確性和效率。作者Telmon Maluleka詳細闡述了架構、組件、工作流程及實際效果。

  • VulneraMCP將ZAP掃描引擎與AI學習相結合,實現高級漏洞獵捕
  • 系統架構包括ZAP集成層、MCP代理層、學習引擎和數據庫
站內正文

每月20美元:每家人工智能公司都複製的價格上限

幾乎所有主要AI訂閲服務(如ChatGPT Plus、Claude Pro、Perplexity Pro和Google AI Pro)都定價為每月20美元。這一現象源於OpenAI在2023年2月為維持免費層可持續性而設定的價格,隨後其他公司通過價格錨定而非獨立成本分析採用了相同數字。隨着200美元和100美元的高級計劃出現,這一模式正在更高層級重演。

  • 每月20美元的定價源於OpenAI 2023年2月為補貼免費用户而設立的ChatGPT Plus訂閲。
  • 競爭對手通過價格錨定而非成本計算複製了該數字,形成了行業默認標準。
站內正文

展示 HN:用於可靠人工智能的圖形上下文引擎

Kritama 的 Fractal Context Engine 讓開發者能夠構建可靠的 AI 助手,具備動態上下文切換、可觀察智能、小模型成本優勢以及通過 HCL 和 Markdown 實現的可編程策略。

  • 動態上下文切換讓模型保持專注,無噪音干擾
  • 可觀察智能支持系統性調試
站內正文

NVIDIA發佈DeepStream 9.1:為視覺AI帶來13項技能和多視角3D追蹤的智能體AI

NVIDIA DeepStream 9.1 引入了13項智能體技能,允許Claude Code和Codex等編碼代理通過自然語言提示構建多攝像頭視頻分析管道。多視角3D追蹤(MV3DT)將每個攝像頭的檢測結果融合到一個共享的3D世界中,並分配全局一致的對象ID,而AutoMagicCalib(AMC)則消除了手動攝像頭校準。該版本還增加了JetPack 7.2支持和一個統一的GitHub開源倉庫。

  • DeepStream 9.1 提供13個智能體技能,支持自然語言驅動的多攝像頭視覺管道搭建。
  • MV3DT 實現跨攝像頭3D追蹤,分配全局唯一ID,無需手動校準。
站內正文

首個面向智能體的工業運營基準測試

SolarBench 是首個評估 AI 智能體在工業運營中能力的基準測試,專注於太陽能電站管理。模擬真實運營桌,包含警報、遙測、工單、零件庫存和通信。最佳模型 Claude Fable 5 在約 54% 的任務中成功,但成本常為最優值的數倍。研究表明,模型在概率決策和信息優先級排序方面仍與人類專家有顯著差距。

  • SolarBench 是首個針對工業運營的 AI 智能體基準測試,專注於太陽能電站管理。
  • 模擬持續一週,評估智能體處理警報、維修和零件訂購的能力。
站內正文

20美元的AI編程訂閲到底能買什麼?

通過Tailscale的Aperture網關追蹤Claude Pro訂閲的令牌消耗,揭示看似固定的月費背後隱藏的真實成本。從一句問候的31美分到開發遊戲的3.29美元,再到複雜項目的32.76美元,文章展示了輕量用户如何補貼重度用户,並探討了Aperture在成本追蹤、模型選擇、防護欄等方面的功能,以及理解自身使用模式對應對未來價格調整的重要性。

  • 使用Aperture可追蹤每次請求的令牌消耗,從而瞭解訂閲的真實成本。
  • 一個簡單的問候請求花費0.31美元,而開發一個簡易遊戲花費3.29美元,複雜項目甚至超過月費。
站內正文

OpenAI 戰略負責人將開源 AI 定義為反烏托邦地獄

OpenAI 戰略負責人近期言論將開源人工智能描述為反烏托邦式的地獄景象,與此同時,獨立觀察顯示 Kimi 模型性能出色,與頂級公開模型不相上下。

  • OpenAI 戰略負責人批評開源 AI
  • Kimi 模型在智能體編程中表現出色
站內正文

比免費更好:在人工智能時代如何差異化

凱文·凱利(Kevin Kelly)在其經典文章《比免費更好》中,討論了當複製品變得免費且充足時,創作者如何通過銷售無法複製的事物——即“生成性”價值——來維持生計。他提出了八種“生成性”價值:即時性、個性化、解讀、真實性、可訪問性、實體化、贊助和可發現性。這些價值在人工智能時代依然適用,甚至更加重要。

  • 當完美複製品免費時,創作者需要銷售無法複製的東西。
  • 凱文·凱利提出了八種“生成性”價值,如即時性、個性化、解讀等。
站內正文

研究沙箱在AI控制中的作用

一項關於AI沙箱控制的研究表明,雖然整體安全性和實用性未見顯著改善,但基於“最小權限”原則的“請求網站”權限模型在定性證據上表現最佳,有望在未來得到持續應用。

  • 沙箱通過限制攻擊面來增強AI安全性,但僅當它阻止原本會繞過監控的攻擊時才有效。
  • “請求網站”模型要求AI代理先申請特定網站權限,由可信模型審批,遵循最小權限原則。
站內正文

Talon:一個自託管的長期AI代理框架

Talon是一個多平台、可自託管的AI代理框架,支持Telegram、Discord、Microsoft Teams、終端及跨平台的桌面/移動應用。它提供可插拔的後端(Claude Agent SDK、Kilo、OpenCode、Codex、OpenAI Agents)和完整的MCP工具訪問,具備背景代理、目標管理、技能系統、事件總線等功能。項目架構清晰,前端與後端獨立,支持熱重載插件和技能,便於擴展。

  • Talon支持多種前端(Telegram、Discord、Teams、終端、桌面/移動應用)和後端(Claude、Kilo、OpenCode、Codex、OpenAI Agents),通過MCP協議提供豐富工具。
  • 具備背景代理(心跳、夢境)、持久目標、技能系統(SKILL.md)和觸發器,使代理能主動推進任務。
站內正文

Show HN:OpenCareLoop——一次一個循環,解決家庭健康問題

OpenCareLoop 是一個基於LLM的健康管理代理,專注於長期跟蹤家庭成員的健康數據,提供結構化的工作流程來管理醫療問題,並支持生活方式和藥物調整的循環追蹤。它已被用於解決慢性疼痛、管理疼痛水平、輔助IVF決策等,但強調AI輸出需醫生驗證。

  • 利用LLM創建家庭健康管理代理,支持長期病歷追蹤和醫療問題解決
  • 提供結構化工作流程和“循環”功能,可跟蹤生活方式、藥物和習慣變化
站內正文

Soofi S:歐洲首個工業AI開放模型

Soofi聯盟發佈了Soofi S模型,這是一個300億參數的混合專家模型,基於27萬億令牌訓練,專注於德語和英語,旨在為工業應用提供可控、透明且高效的AI方案。目前模型處於測試階段,尚未公開發布。

  • Soofi S是一個300億參數的混合專家模型,訓練數據達27萬億令牌。
  • 模型專為工業場景設計,支持技術文檔、代碼生成和智能代理等應用。
站內正文

PrimeTask:一款離線優先、支持自帶AI(MCP)的工作操作系統

PrimeTask是一款一次性購買的桌面應用,集成了任務、項目、CRM、日曆、專注模式和可視化畫板,全部離線優先。它通過MCP標準支持自帶AI,用户可連接偏好的AI模型。該應用強調數據所有權和隱私,無需訂閲。

  • PrimeTask集成了任務、項目、CRM、日曆、專注模式及視覺畫板等全方位功能。
  • 採用離線優先架構,本地存儲數據,一次性付費永久使用。
站內正文

主題導航

Agent — AI 主題新聞 | AI News Hub