跳到主要內容
AI News HubLIVE

本期精選

Agent

Reducto釋出r-1:單遍文件解析模型將錯誤率降低20%,每頁僅1美分

  • r-1將OCR、版面分析、表格、格式和grounding整合為單次整頁解析,減少模型呼叫與延遲。
  • 錯誤率較Reducto自身舊agentic管線降低20%;對hyperscaler和LLM的比較來自內部評測。
MarkTechPost站內正文Reducto釋出r-1:單遍文件解析模型將錯誤率降低20%,每頁僅1美分

“一些智慧體將追求自己的目標”:OpenAI首席科學家警告AI可能欺騙和勒索人類

  • OpenAI首席科學家雅各布·帕霍茨基發文,稱AI系統複雜程度已超出開發者理解,現有對齊與監控手段難以跟上能力增長。
  • 他預計AI將走向“遞迴式自我改進”,並警告更強大的智慧體可能自行追求目標,透過談判、欺騙或勒索人類來協作。
The New Stack AI站內正文“一些智慧體將追求自己的目標”:OpenAI首席科學家警告AI可能欺騙和勒索人類
模型

前沿 AEO 追蹤器:Astra 會選什麼(以及其他前沿模型,以及你能做什麼)

  • 方法:6 種提示變體 × 7 個前沿模型 × 161 個類別;答案由 Astra 提取並按專有 AEO 評分,所有提示/回答對公開可查。
  • 模型存在明顯自我偏好(Claude 系偏好 Claude Code、Codex 系偏好 Codex 等),但也有 GPT 推薦 Claude 的公正反例。
Latent Space站內正文前沿 AEO 追蹤器:Astra 會選什麼(以及其他前沿模型,以及你能做什麼)

已閱讀至本期精選末尾。

我的稍後讀