OpenAI 让所有人都能问数据了,但准确率这道考题还没交卷
OpenAI 又往企业数据分析市场迈了一步:当地时间 9 月 10 日,它在 ChatGPT Work 里正式推出了“数据智能体”。说白了,就是让企业员工不用写 SQL、不用手动扒各种数据源,直接用一句自然语言提问,智能体就能连上公司获授权的数据和文档,自己动手调查数据发生了什么变化,生成分析和互动式 Dashboard,需要执行后续动作时还会先来问你一声。看到这个描述,我脑子里第一反应是,过去那种“找分析师排期等报告”的日常,可能真的要变天了。
有意思的是,这款产品并不是从零开始的新东西。OpenAI 内部的数据智能体已经跑了挺久,服务超过 3500 名用户,覆盖超过 600PB 数据和约 7 万个数据集,几乎全部产品团队成员加上三分之二的 GTM 团队都在用。据他们说,大约一年前,公司里几乎没有什么数据问题能在没有人工介入的情况下端到端解决,如今员工已经能自己搞定大量数据问题。这次等于是把内部验证过的工作流拿出来产品化。对接的生态也铺得很开,Redshift、BigQuery、Snowflake、Databricks 这些主流数据平台都支持,还能读 Google Drive 和 SharePoint 里的文档,跟 Tableau、Power BI 这些 BI 工具协同。更关键的一点,它试图理解的不是“这张表里有什么”,而是企业内部究竟怎么定义收入、客户这些指标,权限体系也完全沿用原有的表级、行级和列级控制,这一点对企业客户来说比功能本身还重要。
真正值得玩味的,反倒是发布会上没说的那部分:OpenAI 没有公布面向外部客户的公开准确率基准。内部确实做过对比测试,但具体成绩一个数字都没往外给。这件事看似只是发布会的留白,其实戳中了企业级 AI 产品最深的一层矛盾。闲聊问错了顶多浪费几秒钟,数据分析的错误却是静默的——一个算错的指标,配上漂亮的图表,照样能一路绿灯地流进管理层的决策。更麻烦的是,企业场景里的“准确”根本不是一道对错题:同一个“活跃用户”,市场部和财务部的口径可能完全不同,答案散落在几十张表、一堆 Dashboard 和历史文档里,模型要做的不是简单检索,而是先替你完成一次指标定义的仲裁。这也是为什么 Databricks 的反差格外扎眼——它主动拿出了自测研究,宣称在特定企业检索任务上的回答质量能对齐头部模型,平均回答时间 5.8 秒左右。成绩虽然没经过独立验证,但至少姿态上,对手已经更早想明白了一件事:在企业市场,“可信”本身就是卖点。
再往深一层看,这场竞争争的其实不是模型,而是企业数据的解释权。过去十年,BI 工具把“做报表”的门槛降了又降,可“问对问题”这件事始终卡在数据团队手里——自助分析喊了十年,瓶颈从来不在工具而在人。数据智能体第一次把“调查”这个环节也交给了机器,理论上任何员工都能直接和数据对话,但硬币的另一面是,当全公司都从同一个智能体嘴里拿答案,一个错误的口径就会被无限放大。Databricks 和 Snowflake 的底气也在这儿:数据躺在他们的平台上,语义层和权限体系攥在他们手里,哪怕模型再强,也得先过得了接入这一关。所以那份没公布的准确率基准,与其说是发布会的遗憾,不如说是整个行业还没解开的题——谁先给出一个公开、可复现的量化标准,谁就攥住了企业敢把数据交给智能体的那把钥匙。