AI News HubLIVE

研究動態

AgentSpec:AI代理的測試框架(用於非確定性行為的Jest)

AgentSpec 是一個專為AI代理設計的測試框架,靈感來自Jest,能夠處理非確定性輸出。它提供YAML定義測試、豐富的斷言(如contains、regex、semantically_similar)、LLM-as-judge評估、行為差異報告以及CI/CD整合,幫助開發者在生產環境之前捕捉AI行為變化。

  • AgentSpec 支援YAML格式定義測試用例,包含contains、not_contains、contains_any、regex、semantically_similar等多種斷言,專為AI輸出的非確定性設計。
  • 框架整合了LLM-as-judge功能,可使用本地Ollama模型評估響應質量,無需API成本並保護隱私。
站內正文

AI需要勞動力市場救助

AI可能會最終創造多於毀滅的就業機會,但如果沒有協調的再培訓努力,數百萬失去的工作可能不必要地變成失去的職業。

  • AI正以指數級速度擴充套件任務完成能力,導致數十萬工作崗位面臨風險
  • 私營公司傾向於招聘而非培訓,加劇技能差距
站內正文

解析度地平線——在有限觀測下尋找AI過擬合噪聲的數學極限

解析度地平線是一個實驗性研究框架,用於衡量在有限、帶噪聲的觀測資料中能恢復多少數學結構。它提出每個觀測過程都有一個可測量的解析度地平線,即結構複雜性的臨界點,超過該點分析將開始擬合噪聲而非真實不變數。該框架結合微分幾何、動力系統、統計估計和資訊理論,並定義了資訊效率交換率η(k)作為主要經驗量。

  • 解析度地平線定義了在有限觀測下可恢復的數學結構深度極限(k*)。
  • 核心假設是,超過臨界深度k*後,估計不確定性主導,導致過擬合。
站內正文

AI生成的低質量貢獻導致首次貢獻者合併率下降18.18%:對294個倉庫的分析

一項新研究揭示了AI生成的低質量貢獻(稱為AI-DDoS)對開源社群造成的壓力。分析294個倉庫中超過200萬個拉取請求和問題後發現,2025年拉取請求數量增加,但合併率下降,首次貢獻者的合併率比預期低18.18%。研究還提出了11種補救策略。

  • AI生成的貢獻導致開源社群面臨“AI-DDoS”效應,即低質量貢獻淹沒社群能力。
  • 研究分析了294個倉庫,發現首次貢獻者的拉取請求合併率下降了18.18%。
站內正文

AI建議將“我不知道”的回答從44%降至3%

一項在OSF上釋出的研究表明,AI建議顯著減少了不確定性回答,將“我不知道”的比例從44%降低到3%。

  • AI建議大幅降低了不確定性回答
  • 研究顯示“我不知道”比例從44%降至3%
站內正文

AI需要更多的工程紀律

慈善·梅傑斯認為,AI生成的程式碼已達到中級工程師水平,改變了軟體開發的經濟性,程式碼從資產變為可丟棄的快取。她呼籲工程師將重點從程式碼生產轉向評估與驗證,並借鑑基礎設施領域的不可變架構原則。

  • 2025年末,AI程式碼質量與中級工程師持平,程式碼生成變得免費且即時。
  • 程式碼的經濟性被顛覆:從珍貴資產變為可丟棄的快取,真正的產品是共享理解。
站內正文

AI為何需要基於Postgres和ClickHouse的資料層

本文探討AI應用對資料層的新需求,指出AI加速資料增長且模糊了事務與分析工作負載的界限。Postgres和ClickHouse作為開源資料庫的佼佼者,分別擅長即時事務和分析,透過CDC、pg_clickhouse擴充套件等整合,能提供統一的資料棧。作者認為最佳組合是各自發揮優勢,而非單一系統。

  • AI應用推動資料量爆炸式增長,要求即時事務與分析協同。
  • Postgres和ClickHouse分別是最流行的開源OLTP和OLAP資料庫。
站內正文

CallBro:會議筆記工具,由Codex、Claude Code或本地LLM驅動

CallBro是一款免費的私有會議筆記應用,可在本地轉錄通話,並使用AI(Codex、Claude Code或本地LLM)生成摘要和行動項。所有資料保留在裝置上,無需雲上傳,支援多種平臺,並透過MCP與工具整合。

  • 本地轉錄通話,無需雲端上傳。
  • 使用Codex、Claude Code或本地LLM生成摘要和行動項。
站內正文

YouTube的S-CTS:AI垃圾清理已經到來

谷歌釋出研究報告,詳細描述了YouTube如何大規模打擊低質量“垃圾”內容。同時,另一家公司因Facebook演算法變化受挫,以及買方市場的光明面。

  • 谷歌釋出研究報告,揭示YouTube打擊垃圾內容的策略
  • Facebook演算法變化導致一家公司受挫
站內正文

Agent Arena:AI代理開發者工具入門基準測試

Agent Arena是一個評估AI代理自主使用開發者工具難度的平臺。代理在隔離的Docker容器中執行,需自主發現文件、安裝包、編寫程式碼並驗證結果。排名基於時間、成本、錯誤和中斷四個維度,目前展示了多項工具的排名結果。

  • Agent Arena測試AI代理完全自主使用開發者工具的能力。
  • 排名基於時間、成本、錯誤和中斷四個維度。
站內正文

2026年7月十大熱門GitHub倉庫(AI、ML與生成式AI版)

2026年7月的GitHub熱門倉庫排行榜顯示出AI領域的重大轉變:重點從構建更好的大語言模型轉向構建更好的AI應用。本月榜單以智慧體框架、MCP伺服器、AI閘道器和開發者工具為主,反映了基礎設施和實用工具的興起。

  • 2026年7月GitHub熱門倉庫由AI智慧體工具和基礎設施主導,而非新模型。
  • 頂尖專案包括Strix(AI滲透測試)、Grok Build(編碼智慧體)、Vibe-Trading(量化交易)和Colibri(本地大模型推理)。
站內正文

從演算法到自主:AI如何重寫軟體與移動出行架構

人工智慧正從基於規則的程式設計(軟體1.0)演變為機器學習(軟體2.0),再到如今具有湧現推理能力的自然語言介面(軟體3.0)。大規模語言模型(LLM)是一種通用技術,影響廣泛,但缺乏物理根基。下一個前沿是空間智慧與物理AI,推動自動駕駛和人形機器人發展。

  • AI經歷了從人類編寫邏輯到機器學習,再到自然語言介面的三個階段。
  • LLM作為通用技術,類似於電力,具有廣泛的適用性和變革性。
站內正文

老齡化嬰兒潮一代是美國真正的勞動力問題,而非人工智慧

Indeed首席經濟學家Svenja Gudell指出,美國勞動力市場面臨的最大挑戰是嬰兒潮一代退休導致的勞動力萎縮,而非AI取代工作。到2032年,美國勞動力可能減少近600萬人,醫療保健、建築和熟練技工等關鍵領域將出現嚴重短缺。她呼籲企業投資學徒制、重新思考人才策略,並利用AI幫助工人實現技能轉型。

  • 美國勞動力預計到2032年減少近600萬人,主因是嬰兒潮一代退休。
  • AI並未導致大規模失業,反而在實施和基礎設施建設方面帶來招聘需求。
站內正文

使用AI讓人更不願承認自己不知道

研究發現,即使AI建議錯誤,人們也會減少承認不懂的情況,並更自信地重複錯誤資訊,準確性下降而自信提高。

  • 44%的參與者在沒有AI時承認不知道,而有AI時僅3%承認。
  • 準確率從27%降至9%,而自信度從30%升至76%。
站內正文

Linux 基金會宣佈計劃成立 Tokenomics 基金會,為 AI 成本管理制定開放標準

Linux 基金會宣佈成立 Tokenomics 基金會,旨在為 AI 基礎設施的經濟性建立行業標準、基準和最佳實踐,幫助企業管理不斷增長的 AI 代幣成本。

  • Tokenomics 基金會將制定開放的代幣經濟學標準,涵蓋 AI 基礎設施的成本效益。
  • 隨著 AI 工作負載從試點轉向生產,代幣成為技術支出的新單位。
站內正文

AI模擬面試工具:免費使用,無需註冊,為你的面試答案評分

一款由AI驅動的模擬面試工具,上傳簡歷和職位描述後即可獲得定製化問題,支援語音或文字回答,並得到0-100分的評分及具體改進建議。每天免費使用一次,無需信用卡。

  • 上傳簡歷和職位描述,AI自動生成針對性的面試問題
  • 支援語音或文字回答,即時轉錄並可編輯
站內正文

審查AI程式碼並非可行論點

作者質疑LLM編碼助手能提高開發效率的說法,指出科學證據表明程式碼審查存在每小時400行、1小時等限制,因此“只需審查程式碼”的論點不成立。此外,人類審查LLM生成的程式碼效果可能更差,且開發者常將最難審查的程式碼(如Bash指令碼)交給LLM,加劇了問題。

  • 程式碼審查實證研究表明,超過1小時或400行/小時後效率驟降。
  • LLM編碼助手生成的程式碼需大量審查時間,實際生產力提升有限。
站內正文

Perplexity AI 釋出 WANDR:一個評估研究智慧體必須廣度和深度搜尋的開放基準

Perplexity AI 釋出了 WANDR,這是一個開放基準,用於評估研究智慧體在執行知識工作時的廣泛發現和深度證據驗證能力。WANDR 包含 500 個證據密集型任務,採用可組合的資格鍵層次結構,要求智慧體發現大量合格實體併為每個實體提供可核實的引用證據。評分時,系統會重新獲取並檢查每個記錄的引用頁面,確保證據的真實性和完整性。Perplexity 的 Search as Code 系統以軟 F1 0.363 和硬 F1 0.133 領先,但整體表現仍有很大提升空間,表明發現和證據提取是當前智慧體的主要瓶頸。WANDR 為市場分析、盡職調查、人才招聘等實際應用提供了可靠的評估工具。

  • WANDR 是一個開放基準,包含 500 個需要廣度發現和深度證據驗證的任務。
  • 任務結構為資格鍵層次結構,逐項評分並重新獲取所引頁面進行驗證。
站內正文

Show HN: PilotCite – 監測AI平臺如何引用和描述您的品牌

PilotCite是一款AI可見度監測工具,幫助品牌追蹤在ChatGPT、Perplexity等AI平臺上的提及率、引用率和情緒分析。它提供儀表盤、競爭對手追蹤、網站稽核和內容工具,助力團隊最佳化AI引用。

  • 監測8個AI平臺的品牌提及和引用
  • 提供提及率、情緒分析和競爭對手對比
站內正文

10個開源無程式碼AI平臺:構建LLM應用、RAG系統與AI智慧體

本文介紹了10個開源的無程式碼或低程式碼AI平臺,用於構建大型語言模型應用、檢索增強生成系統和AI智慧體。每個平臺都經過許可驗證,並提供了倉庫連結和最佳用例。這些工具透過視覺化介面、Web UI和自然語言提示,使開發者能夠快速原型設計並實現資料自託管。

  • 10個開源無程式碼/低程式碼平臺,覆蓋LLM應用、RAG和AI智慧體構建。
  • 平臺包括AutoAgent、AnythingLLM、LangChain OAP、Sim、Dify、Flowise、Langflow、RAGFlow、n8n和FastGPT。
站內正文

Claude Code 現在使用 Rust 編寫的 Bun

Jarred Sumner 宣稱 Claude Code v2.1.181 及更高版本使用了 Bun 的 Rust 移植版。透過檢查二進位制檔案中的字串,發現其中包含 Rust 原始檔路徑,證實了 Bun 確實以 Rust 版本在生產環境中執行。

  • Claude Code v2.1.181 開始使用 Bun 的 Rust 版本。
  • Rust 版 Bun 在 Linux 上啟動速度提升 10%,但使用者幾乎無感知。
站內正文

不,人工智慧無法預知未來,而且永遠無法做到。

本文探討了為什麼人工智慧(尤其是大型語言模型)無法真正預測未來,原因包括:訓練資料中事件鏈的不完整性、解析度有限、存在人為設定起點與終點、以及模型自身在每次輸出後“死亡”等根本性限制。文章展望未來,即使出現能捕捉宇宙所有事件鏈的“現實感測器陣列”,AI仍面臨冷啟動、無限遞迴等悖論,最終可能為了完全理解現實而融入現實,從而消失。

  • AI的訓練資料只記錄了部分事件鏈,且解析度高、有始有終,導致其無法捕捉現實的無限複雜性。
  • LLM每次輸出後即“死亡”,被迫閉合所有事件鏈,這與現實中事件鏈永不停止的本質矛盾。
站內正文

AI輔助的嵌入式目標漏洞研究

一位安全研究員探索了AI輔助的漏洞研究,針對嵌入式即時作業系統,使用Codex和GPT-5.6以及專門技能對Netgear CG3700B電纜數據機進行逆向工程和漏洞利用。

  • 作者使用OpenAI的Codex工具包和GPT-5.6對基於eCos的嵌入式目標進行AI輔助的漏洞研究。
  • Trail of Bits的技能和自定義的eCos攻擊研究技能指導代理進行韌體分析、逆向工程和漏洞利用。
站內正文

受啟發而起步:生成式AI如何改變創業格局 [pdf]

本研究論文探討了生成式AI對創業的變革性影響,分析了AI工具如何降低創業門檻、增強決策能力並重塑初創企業動態。

  • 生成式AI透過自動化關鍵任務降低創業成本。
  • 創業者利用AI進行創意構思、原型製作和市場分析。
站內正文

每月20美元:每家人工智慧公司都複製的價格上限

幾乎所有主要AI訂閱服務(如ChatGPT Plus、Claude Pro、Perplexity Pro和Google AI Pro)都定價為每月20美元。這一現象源於OpenAI在2023年2月為維持免費層可持續性而設定的價格,隨後其他公司透過價格錨定而非獨立成本分析採用了相同數字。隨著200美元和100美元的高階計劃出現,這一模式正在更高層級重演。

  • 每月20美元的定價源於OpenAI 2023年2月為補貼免費使用者而設立的ChatGPT Plus訂閱。
  • 競爭對手透過價格錨定而非成本計算複製了該數字,形成了行業預設標準。
站內正文

ADA:一款基於CSV和Excel的AI商業智慧軟體(不止於LLM)

ADA 是一個開源自動資料分析工具,使用者上傳 CSV 或 Excel 檔案後,可自動清洗、檢測業務模式、生成互動式儀表盤、標記異常、預測趨勢,並支援自然語言提問,所有計算過程透明可見。無需 API 金鑰即可使用,資料不離開本地。

  • 零配置分析:上傳即可獲得儀表盤、異常檢測和預測
  • 透明計算:每個答案都顯示其計算過程
站內正文

AI Karma Tracker:AI限額管理工具

一個一站式儀表盤,即時追蹤Claude、ChatGPT等AI工具的使用限額、重置時間和峰值時段,智慧預警避免中斷。所有資料在本地執行,無需API金鑰。

  • 即時顯示剩餘token、訊息數和重置時間,無需API金鑰
  • 智慧預警:在限額耗盡前和高峰時段傳送提醒
站內正文

SQLite查詢直譯器

一個在瀏覽器中執行SQLite查詢並解釋查詢計劃的互動式工具,由Simon Willison藉助Fable構建,幫助理解SQLite的執行過程。

  • 工具在瀏覽器中執行SQLite並顯示EXPLAIN和EXPLAIN QUERY PLAN的逐行解釋
  • 基於Pyodide將Python和SQLite編譯為WebAssembly
站內正文

AI新政治捐助階層已超越上一代科技巨頭

Anthropic和OpenAI的員工在政治捐款上的參與率和金額遠超谷歌、Facebook和Airbnb在IPO後的同期水平。他們的協調捐款聚焦於支援AI安全立法的候選人,並已在聯邦和州選舉中產生影響。這些捐助者主要集中在舊金山,正在為長期政治影響力奠定基礎。

  • AI實驗室員工的捐款率高於谷歌、Facebook和Airbnb在IPO後的同期水平。
  • 捐助者透過線上論壇協調捐款,以最大化對AI安全候選人的影響。
站內正文

Soofi S:歐洲首個工業AI開放模型

Soofi聯盟釋出了Soofi S模型,這是一個300億引數的混合專家模型,基於27萬億令牌訓練,專注於德語和英語,旨在為工業應用提供可控、透明且高效的AI方案。目前模型處於測試階段,尚未公開發布。

  • Soofi S是一個300億引數的混合專家模型,訓練資料達27萬億令牌。
  • 模型專為工業場景設計,支援技術文件、程式碼生成和智慧代理等應用。
站內正文

Teya:開源AI家庭助手,基於壁掛式安卓手機

Teya 是一個開源的AI家庭代理,利用廉價安卓手機作為硬體,透過雲端AI模型實現語音互動、記憶、日程管理、購物清單、費用記錄等功能,旨在成為家庭的“第二大腦”。它完全本地化執行,注重隱私和安全,並支援多語言。

  • Teya 基於廉價安卓手機,壁掛式安裝,無需額外伺服器。
  • 支援語音互動,可識別家庭成員,並保留個性化記憶。
站內正文

Show HN: SlopSift – 一款基於依存句法圖的本地化AI寫作檢查工具

SlopSift 是一款本地執行的寫作檢查工具,透過自定義訓練的依存句法分析器,檢測AI寫作中的套話、無依據的主張和填充內容。它並非AI檢測器,而是識別結構性問題,支援CLI和代理整合,所有處理均在裝置端完成,保護隱私。

  • 使用小型依存句法分析器,解析詞語關係,定位套話和模糊表述。
  • 完全本地執行,模型和規則均在裝置端,不上傳資料。
站內正文

人工智慧繁榮建立在債務之上,投資者需求驟降,超大規模企業加速債券發行

人工智慧(AI)繁榮日益依賴債務融資,但隨著超大規模企業加大債券發行,投資者需求卻在下降。亞馬遜最近的債券發行不得不提高收益率,訂單倍數下降。AI債券供應激增,但投資者要求更高利差。同時,中國AI模型Kimi K3的突破性效能引發對美國AI支出可持續性的擔憂,可能導致經濟衰退。

  • 自2025年初以來,Alphabet、Meta、亞馬遜、甲骨文等公司已發行超過3000億美元債券。
  • 投資者對AI債券的需求下降,亞馬遜債券訂單倍數從3.2倍降至2.5倍。
站內正文

PixelUp:一款完全離線、輕量級的AI影片放大軟體(Windows)

PixelUp 是一款專為 Windows 設計的輕量級 AI 影片放大工具,利用 FSRCNN 和 ESPCN 深度學習模型,在本地硬體上快速將低解析度影片提升至高畫質畫質。它支援 Nvidia CUDA、Vulkan 和 CPU 處理,提供批次任務管理、無損音訊同步,並採用終身許可證模式,一次性付費 $19,無需訂閱,完全保護使用者隱私。

  • 完全本地執行,無需聯網或註冊賬戶,保障資料隱私。
  • 採用最佳化的 FSRCNN 和 ESPCN 模型,快速重建細節。
站內正文

控制LLM中的推理努力程度

本文探討了如何開發具有多種推理努力模式的模型,涵蓋從o1和DeepSeek-R1到GPT-5.6的推理模型演變,以及RLVR訓練、推理縮放、思考標記和推理模式切換等關鍵技術。

  • 推理模型透過輸出中間推理軌跡逐步解決問題,與普通LLM不同。
  • RLVR訓練僅基於最終答案的正確性獎勵,不利用中間軌跡。
站內正文

為什麼AI公司的logo看起來像屁眼?

AI公司的logo普遍採用帶有中心開口的圓形漸變色設計,被調侃為像肛門。文章分析了這種現象背後的設計心理學、生物模仿和跟風效應,並回顧了科技設計的潮流演變。

  • 許多AI公司logo具有圓形、漸變和中心開口特徵,被戲稱為“肛門風格”。
  • 這種現象源於圓形帶來的安全感、無意識的生物模仿以及行業跟風。
站內正文

持續瞄準略高於當前水平的目標(2007)

本文中,數學家陶哲軒借用國際象棋和數學研究的例子,闡述了個人成長的最佳策略:不斷挑戰略高於當前能力的目標。他警告了兩種極端:只做容易的事(導致停滯)和直接挑戰極難的問題(導致挫敗)。建議採用“中等風險、中等回報”的策略,例如選擇只需新思路就能解決的難題、限制自己使用某些方法、教學相長、以及與鄰近領域的專家合作。

  • 最佳成長策略是持續挑戰略高於當前能力的問題。
  • 避免只做容易的事或直接挑戰極難的問題。
站內正文

BaseRT - Apple M5最佳化版

BaseRT在Apple M5晶片上實現顯著效能提升,比llama.cpp快6.4倍,比MLX快3.9倍。

  • BaseRT針對Apple M5晶片進行了最佳化,提供超高速推理效能。
  • 效能基準測試顯示,比llama.cpp快6.4倍,比MLX快3.9倍。
站內正文

Google Cloud 的 Always-On Memory Agent:用持續的 LLM 整合取代 RAG 和嵌入,基於 Gemini 3.1 Flash-Lite

Google Cloud 的生成式 AI 儲存庫釋出了一個參考實現——Always-On Memory Agent,它將記憶視為一個持續執行的程序。該系統基於 Google ADK 和 Gemini 3.1 Flash-Lite,不使用向量資料庫或嵌入,而是透過編排器將請求路由到攝取、整合和查詢子代理,這些代理持續地讀取、連線和將結構化記憶寫入 SQLite。

  • Always-On Memory Agent 是一個輕量級的後臺程序,全天候執行,使用 Google ADK 和 Gemini 3.1 Flash-Lite。
  • 它不使用向量資料庫或嵌入,而是透過 LLM 將結構化記憶寫入 SQLite。
站內正文

舊金山要求蘋果和谷歌從應用商店移除“脫衣”應用

舊金山市檢察官邱信福致信蘋果和谷歌,要求移除多款利用AI技術生成非自願親密影像的“脫衣”應用,並援引加州深度偽造法律。研究顯示70%的換臉應用可被用於色情化處理。同時,xAI的Grok因生成兒童性虐待材料而受到關注,給應用商店帶來更大壓力。

  • 舊金山市檢察官要求蘋果和谷歌移除違反深度偽造法律的脫衣應用
  • 研究發現70%的換臉應用可能被用於生成不雅影像
站內正文

代理式AI正在接管執行,而非僅僅內容生成

從副駕駛式AI到代理式AI的轉變正在重塑營銷領域。自主代理現在無需人工干預即可執行多步驟活動,最佳化預算和渠道。儘管強大,但成功仍需人類對目標和邊界進行監督。

  • 代理式AI系統自主執行營銷目標,不同於需要提示的副駕駛工具。
  • 例子包括Salesforce Agentforce、HubSpot Breeze、Adobe Agent Orchestrator和Braze Operator。
站內正文

Sakana AI 的誤差擴散訓練符合戴爾原則的雙流網路,無需反向傳播即可在MNIST上達到96.7%,在CIFAR-10上達到61.7%

Sakana AI 提出的誤差擴散(Error Diffusion)是一種區域性學習規則,無需權重傳輸或反向傳播即可訓練神經網路,並遵循戴爾原則(Dale's principle)。該方法採用雙流架構,將每一層分為興奮性和抑制性流,並透過模誤差路由擴充套件到多類分類,在MNIST上達到96.7%,在CIFAR-10上達到61.7%。研究還發現,三項分類創新在不同任務上的重要性截然不同,併成功將誤差擴散應用於強化學習。

  • 誤差擴散無需反向傳播或權重傳輸,即可訓練符合戴爾原則的網路。
  • 模誤差路由將誤差擴散從二分類擴充套件到MNIST和CIFAR-10多類分類。
站內正文

Anthropic 宣佈 Claude Fable 5 永久納入訂閱計劃

Anthropic 決定自2026年7月20日起,將 Claude Fable 5 永久納入 Max 和 Team Premium 訂閱計劃(額度為50%),併為 Pro 和 Team Standard 使用者提供一次性100美元積分。此舉逆轉了此前因算力限制而計劃移除 Fable 5 的決定,主要受到 GPT-5.6 Sol 等競爭對手的壓力。

  • Claude Fable 5 將於7月20日起永久包含在 Max 和 Team Premium 訂閱中,使用額度限制為50%。
  • Pro 和 Team Standard 使用者可透過使用積分繼續訪問,並獲得一次性100美元信用額度。
站內正文

瀏覽器內的智慧代理:批次豐富任何網頁資料

Retriever 推出瀏覽器內的代理式資料集豐富功能,無需匯出 CSV 或使用傳統工具,即可直接從瀏覽器頁面(如 Luma 活動頁面)提取並豐富聯絡人資訊,包括 LinkedIn 資料和工作郵箱,並根據理想客戶畫像評分後自動聯絡前 10 名。費用僅為每條記錄 0.25 積分(1 積分=0.01 美元),且零匹配不收費。

  • 直接在瀏覽器頁面上執行,利用頁面的登入狀態訪問員工列表或活動嘉賓名單。
  • 透過自然語言指令,自動從預索引的 LinkedIn 資料集、即時網頁抓取等多個來源豐富資料。
站內正文

批判性思維已成為AI時代的熱詞,但它到底意味著什麼?

隨著AI工具的普及,批判性思維的定義需要擴充套件。本文提出批判性思維包括反思和判斷兩個步驟,並強調智識謙遜的重要性。教育應培養學生在不確定中做出明智判斷的能力。

  • 批判性思維分為反思與判斷兩個階段,數字環境削弱了反思所需的時間和空間。
  • 智識謙遜是批判性思維的核心,幫助人們認識自身理解的侷限。
站內正文

Mozilla 推出的 Tabstack:一鍵呼叫管理 Web API

Tabstack 是 Mozilla 支援的一項服務,提供統一的 API 來提取結構化資料、進行帶引用的研究以及自動化瀏覽器任務,無需自行管理 LLM、瀏覽器或管道。其特色包括隱私保護(不訓練模型、資料及時清除)以及使用開源瀏覽器引擎 Pilo 減少令牌消耗。

  • Tabstack 提供 /extract/json、/research、/automate 等端點,支援資料提取、研究問答和瀏覽器自動化。
  • 所有請求均執行在 Mozilla 支援的基礎設施上,資料和頁面不會用於訓練模型,且會及時清除。
站內正文

PenEcho:帶AI的開源畫布

PenEcho 是一款開源共享畫布工具,支援手寫、公式、圖表和空間語境與AI互動。它透過瀏覽器畫布、伺服器驗證和多種執行器(OpenAI API、Codex CLI、Claude CLI)生成可編輯的AI草稿,使用者可移動、縮放、接受或拒絕。畫布大小達20000x20000點,支援本地快照和稀疏渲染。安裝簡單,需Node.js 18.17+和API金鑰或CLI工具。文章詳細介紹了配置、執行器選擇、安全部署和成本估算。

  • PenEcho 是一個開源的AI驅動共享畫布,支援手寫、公式和圖表。
  • 它透過瀏覽器捕獲內容,伺服器驗證後交由AI執行器生成草稿。
站內正文

AI並未將瓶頸從編碼轉移到程式碼審查

儘管許多人認為AI將瓶頸從編碼轉移到了程式碼審查,但本文指出真正的瓶頸在於部署批次。研究顯示超過90%的團隊以批次方式交付,而非單次變更。AI加速了程式碼編寫,但變更在審查後堆積,導致下游瓶頸加劇。

  • AI並未轉移瓶頸,程式碼審查並非真正的約束。
  • 超過90%的團隊以批次方式交付,批次大小是關鍵問題。
站內正文

面部價值:AI如何重塑信任、身份與詐騙

Malwarebytes釋出的2026年報告顯示,85%的人難以區分真實與AI生成內容,50%遭遇過AI驅動的詐騙,Z世代風險最高。人們因AI威脅而減少線上分享,但行動不足。報告還揭示了AI使用中的道德矛盾:許多人既害怕深度偽造,又認為使用AI進行個人用途是可以接受的。

  • 85%的受訪者表示現在難以區分真偽,較去年的66%大幅上升。
  • 50%的成年人遭遇過AI驅動的詐騙,Z世代接觸率高達67%。
站內正文

主題導航

研究 — AI 主題新聞 | AI News Hub