Mate Security的CEO Asaf Wiener在面對高昂的AI推理成本時,沒有選擇簡單削減開支,而是徹底重構了公司的技術結構,讓每個後端工程師都負責自己工作負載的模型選擇、評估和路由。這種將成本可見性下放到工作負載所有者的做法,使公司在保持質量的同時最佳化成本,甚至發現開源模型在某些任務上優於前沿API。Wiener強調,AI原生公司的競爭優勢在於能夠迅速切換到當天最好的模型,而這需要一種不接受“AI拒絕者”的快速執行文化。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
作者在工作中被要求探索AI的實際應用,於是讓AI幫忙做DIY。AI給出了糟糕的建議,但也讓作者意識到人類判斷力的價值。
文章探討人工智慧將如何把軟體開發變為一種像電力一樣的廉價公用事業,從而推動人類的下一個前沿——解決物理世界中的重大問題,如氣候變化和醫療保健。作者同時介紹了自己建立的ProductNow專案,致力於解決混合人機團隊中的對齊問題。
KushoAI釋出了一份基準測試報告,評估了7個AI系統在僅提供JSON模式和有效樣本載荷的情況下,檢測API中埋入的功能性漏洞的能力。KushoAI以83%的綜合得分排名第一,在複雜漏洞檢測上顯著領先。報告指出通用LLM和程式設計代理透過提示工程提升了廣度,但跨欄位業務邏輯仍是關鍵差距。
該模型採用Apache 2.0許可釋出,是雲提供商讓企業能夠在本地裝置上執行模型以支援代理工作流的又一例證。
一個非營利研究聯盟,透過開放同行評審和AI輔助,致力於研究人類面臨的最重大挑戰,任何人都可以貢獻研究或資助團隊。
本文探討了AI智慧體如何重塑資料科學工作流程,自動化日常任務,並需要系統設計、工具整合和智慧體可觀測性等新技能。介紹了LangGraph、AutoGen和smolagents等框架,以及從程式性到評估性工作的轉變和新興角色。
SpaceX的IPO即將到來,估值近2萬億美元,但這一過程中許多市場規則被打破或放寬。X(原Twitter)業務全面下滑,收入不到收購前的40%,但馬斯克的財富和影響力卻持續增長。本文與《紐約時報》記者瑞安·麥克的訪談,探討了馬斯克如何透過超級投票股、縮短指數基金納入時間等方式規避公司治理約束,以及Starlink作為唯一盈利業務的表現。投資者表面上是在投資基本面,實則是在押注馬斯克的承諾。
Microsoft 365 Premium是Copilot Pro的繼任者,每月20美元,為現有訂閱者提供首年50%折扣。它捆綁了高階AI功能、更高的使用限制和家庭訂閱,與ChatGPT Plus直接競爭,非常適合頻繁使用AI的Microsoft 365使用者。
組織透過工程流程引入AI時,設計工作被拉入管道,變成程式碼提示生成器或加速產出的工具。設計師被迫適應這些流程,但偏離了設計本應關注的決策質量。文章強調設計在風險識別、問題框架和共享理解方面的獨特價值,並呼籲AI的應用應由工程、設計和產品共同領導,以平衡速度與決策質量。
Hello Inbox是一個AI驅動的郵件送達率平臺,幫助企業和營銷人員測試並修復郵件送達問題,避免郵件進入垃圾箱。它提供9種工具和一個由人類專家訓練的AI助手,支援DMARC監控、列表驗證、垃圾詞檢測等功能。免費套餐可用。
Databricks宣佈Agent Bricks知識助手重大更新,透過Instructed-Retriever-1模型實現搜尋速度提升3倍以上,答案生成時間減半,首Token時間降至約2秒。該模型採用並行測試時擴充套件,同時進行查詢生成和重排序,在不犧牲質量的前提下顯著降低延遲。
OpenAI CEO山姆·奧特曼概述了AI產品的下一階段:一種“主動式AI”,它在後臺持續執行,主動採取行動,而不是等待使用者提示。同時,企業正面臨AI成本飆升和員工不知如何提問AI的基本問題。奧特曼承諾:“我們可以幫助人們以更少的支出獲得更多的價值。”
Computex 2026上,Nvidia釋出了RTX Spark處理器,引發了一波新的高效能超極本浪潮。同時,各大品牌推出了599美元起的“廉價高階”筆記本,與MacBook Neo競爭。本文介紹了最引人注目的五款產品:Nvidia RTX Spark晶片、微軟Surface Ultra、ROG XReal R1 AR眼鏡、戴爾XPS 13和宏碁Swift Air 14。
微軟釋出了Azure Linux 4.0通用伺服器版、Azure Container Linux,以及為Linux開發者最佳化的Windows 11和Surface RTX Spark Dev Box AI工作站,表明其深度擁抱Linux。
NVIDIA 釋出了 Nemotron 3.5 ASR,這是一個 600M 引數的流式多語言語音轉文本模型,支援 40 種語言區域,具有低延遲、高準確度,並內建標點和大小寫處理。文章詳細介紹瞭如何透過微調將該模型適應特定語言、領域或口音,並以希臘語和保加利亞語為例展示了顯著的詞錯誤率降低。
本文介紹如何透過Ollama和Scikit-LLM Python庫,免費使用本地託管的開源大語言模型(如Llama 3、Mistral和Gemma)進行文本分類任務。
德國宣佈投入1.25億歐元啟動一項人工智慧競賽,旨在幫助歐洲建立自己的前沿AI實驗室,以在全球AI競賽中保持競爭力。
Ultorg 的“用 AI 填充”功能利用大型語言模型(如 GPT-4.1-mini)自動編輯資料庫中的資料。在示例中,透過連線國家美術館資料庫中的藝術作品和時間線條目,結合自定義提示,實現了藝術品的美元估值。該功能支援多種資料型別,可分批處理大量資料,並直接連線到 Anthropic 或 OpenAI 的 API。
數字智慧進入企業並非奇蹟,而是像開發者一樣,揭示出系統中早已存在的秩序、混亂、資料、責任和空白。這本書剖析了13個導致企業誤用數字智慧的迷思,旨在幫助正確認識AI,既不盲目信任也不畏懼。
選擇合適的AI模型不再簡單。本文指出依賴基準測試的誤區,並提供基於個人工作流的評估框架。作者透過測試GPT、Claude和Gemini,展示瞭如何根據實際任務選擇模型。
網上充斥著AI生成內容,但平臺雖已開始新增標籤,卻未提供過濾選項。使用者無法有效避開這些內容,而平臺出於商業利益,不願意讓使用者輕易遮蔽AI內容。
EVA-Bench Data 2.0 將企業語音代理基準測試從單一領域擴充套件到三個領域:航空客戶服務管理、企業IT服務管理和醫療人力資源服務交付。新版本包含213個評估場景和121個工具,覆蓋範圍增加了約4倍。資料集透過SyGra管道生成,並經過手動驗證和前沿模型測試,確保質量和公平性。即將推出多語言支援。
AI行業的多位領袖聯合致信美國立法者,要求對合成DNA和RNA的銷售實施強制性篩查,以防止AI技術被用於開發生物武器。他們警告,當前的生物安全漏洞可能助長全球大流行病的發生。
本文詳細介紹了使用Python進行時間序列分析和預測的7個關鍵步驟,從理解時間序列資料的獨特性到部署監控系統,涵蓋了經典統計模型、機器學習模型和深度學習模型的實踐方法。
瞭解Endava如何利用AI智慧體、ChatGPT Enterprise和Codex加速軟體交付、自動化工作流,並在企業內建立AI原生文化。
Leni是一款專為嚴肅投資者打造的、準確度最高且可驗證的AI平臺。它基於超過21,000條決策軌跡,每天處理超過1億行資料,透過驗證層、決策溯源和統一資料模型,確保輸出的財務級結果完全可審計。Leni在獨立基準測試中準確率、建模和估值能力均超越GPT、Claude和Manus,已支援超過800億美元資產。作為Google啟動計劃成員,Leni今天在Product Hunt正式釋出,並提供首發優惠。
微軟在Build大會上宣佈擴大其新Autopilot功能的測試。Autopilot是一類能代表使用者自主工作的代理,每個Autopilot有獨立身份,可共存於不同規則集。首個Autopilot名為Scout,已在部分內部使用者中測試,現向選定的客戶和前沿組織推出。Scout最初將在Microsoft 365應用中工作,跨Outlook、OneDrive、SharePoint和Teams協調資料,安排會議、標記重要訊息、生成日曆事件,並學習使用者偏好和工作模式。Scout基於OpenClaw構建,具備企業級安全和控制,微軟計劃貢獻回開源專案。管理員可驗證Scout操作的安全性,代理身份透過Entra條目驗證。資料保護採用Microsoft Purview,敏感操作需人工批准。早期內部測試暴露了風險並進行了調整。Scout可自動識別截止日期、封鎖日曆、提供所需材料。公告由企業副總裁Omar Shahine撰寫。早期採用者需加入Frontier計劃、配置Intune策略、提供選擇加入證明並擁有GitHub Copilot許可證。
消費者權益倡導者艾琳·布羅科維奇推出新網站,追蹤美國AI資料中心的建設情況,並收集居民的擔憂報告,揭示資料中心對環境和社群的潛在影響。
Zorv是一款自託管的自主AI工具,可在CI/CD流水線中自動修復CVE漏洞。它不僅掃描依賴項中的漏洞,還能在版本升級導致測試失敗時自動分析錯誤、重寫過時的API用法,並提交可合併的PR。支援多種LLM提供商,並在隔離的沙箱中執行,確保安全合規。