AI News HubLIVE
站内改写2 分钟阅读

OpenAI企业AI论文中的零结果

OpenAI与哥伦比亚大学、沃顿商学院合作的工作论文显示,企业采用ChatGPT后使用量增长七倍;但作者认为真正值得关注的是一个被低估的无效结果:大公司员工的活跃使用强度与中小企业无异,说明企业AI差距主要在普及率而非参与度,并且组织管理能力是早期采用的最强预测因素。

来源Hacker News AI作者: aicoding

OpenAI本周与哥伦比亚大学和沃顿商学院发布了一篇工作论文,数据来自截至2026年3月的ChatGPT Enterprise遥测。摘要给出的头条结果——采用AI后使用量增长七倍、采用者以大企业为主、任务分布广泛——并不让人意外。但论文中真正值得花时间看的,是Table 2里的一个系数:在企业规模与使用强度的回归中,第三项显著为负,第四项却是一个“零结果”。

具体而言,在已采用AI的企业中,员工人数越多,人均消息数、人均周活跃用户数和人均输出Token数都显著更低,系数分别为-0.266、-0.032和-0.667,且在1%水平上显著。然而第四项指标——每名周活跃用户发送的消息数——的估计值几乎是零(-0.002),标准误差是估计值的四倍,统计上不显著。换句话说,一家20万人的公司与一家500人公司相比,那些真正在用的用户,其参与深度没有差别。这个零结果意味着,大型企业的人均使用差距不是来自“用起来之后用得深不深”,而是来自“到底有多少人在用”。

如果把问题定义为参与度,你会去买培训、优化提示词、做内部布道和用例库——这正是当下整个enablement产业在做的事。但论文给出的证据是,这未必能解决普及率问题。更容易出现的情况是,你测量了参与度,却以为它解释了普及率。数据无法回答的是那些“没有第二次登录”的人为什么不回来;而这个问题发生在所有培训机制发挥作用之前,对围绕入职后阶段建立的产业来说是个尴尬的发现。

论文还考察了哪些因素预测企业是否率先采用AI。他们用2021财年的三类无形资产做预测:人均研发存量、人均资本化软件、人均SG&A存量(作为组织与管理能力的粗略代理)。结果显示,SG&A存量最强且最稳健;而物质资本密集度在控制规模后反而与采用负相关。也就是说,最早行动的企业不是技术最强或软件资产最深的,而是那些早已在“重新设计工作方式”的管理职能上投入多年的公司。吸收新技术的能力与建设新技术的能力是两种不同的资产。这也暗示一个令人不安的动态:如果最能吸收AI的企业恰好是最大、最有价值的公司,那么模型的普遍可用并不会拉平差距,反而可能扩大它。

另一个值得内部审视的发现是,采用六个月后,使用强度与职级的关系和多数治理设计的假设相反:初级员工和受训者比公司内平均活跃用户每周多发送约8到9条消息,高管、创始人和合伙人则更少。任务类型也沿同一条线分化:文档和技术写作覆盖超过一半的活跃用户,是绝对主力;高管则集中在主题概览、事实与数字、法律监管、财务税务等消费与综合类任务上。这意味着最缺乏经验的员工正在借助模型大量生产书面材料,而最资深的员工在阅读摘要,二者之间的审核层却仍按“初级产出更慢、更费力”的时代设计。

论文还提示了一个监控盲点:法律、监管、财务和税务任务“覆盖面广但消息占比小”。很多用户偶尔会用到,但如果组织按消息量监控——管理后台通常只能这样做——这些类别恰恰是抽样最少的,而它们出错的代价又最高。此外,论文是一组相关性分析:只覆盖ChatGPT Enterprise,不包含API、内部工具、其他供应商或个人账户;非采用企业可能也在用AI,只是数据看不到;职位数据不完整;财务分析仅限美国上市公司;且用量不等于产出或生产力。作者也承认,用量高不代表价值高。其真正站得住的结论是:采用只是部署的开始。未来两年的差距不会来自谁能访问模型,而来自合同签署后18个月里组织如何消化它,而这个阶段几乎没有被好好测量。