近日,OceanBase 团队提交的 Data Agent 方案登顶国际数据智能体基准 Data Agent Benchmark(简称 DAB),以 90.62%的准确率位列第一,成为该榜单首个准确率突破 90% 的参评方案。值得关注的是,这一成绩由国产数据库 OceanBase 基于国产大模型 GLM-5.2 构建,超过多项基于 GPT、Claude Opus、Claude Fable 等海外模型构建的 Data Agent 方案。
本次参评方案内部代号为 Scout,相关能力将融入 OceanBase DataPilot。 (图说:OceanBase 登顶国际 Data Agent 榜单,成为首个准确率突破 90%的参评方案) DAB 由 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 合作推出,评测覆盖互联网/本地生活、金融股票、生物医学、知识产权、企业运营、政务/公共管理、媒体/文娱等多个领域,并涉及 PostgreSQL、MongoDB、SQLite、DuckDB 等多种数据库。
与传统 Text-to-SQL 主要考察 AI 能否将自然语言转换成 SQL 不同,DAB 更关注 AI 进入真实数据环境后,能否从复杂、分散、形态各异的数据中找到正确答案。一个完整任务中,Data Agent 需要理解数据、选择数据、规划分析路径、完成查询计算,并对结果进行验证,考验的是从“理解数据”到“拿到答案”的完整能力。
也正因此,DAB 考验的不只是底层模型,而是“模型+Agent+数据系统”的综合能力。模型负责理解和推理,Agent 负责规划和执行,数据系统则要支撑数据发现、关联计算和结果校验。
三者能否协同,直接影响 AI 能不能真正把企业数据用起来。 OceanBase 此次参评方案,正是围绕这一能力构建。
系统通过 DataLens 构建数据画像,识别字段和数据关系;再根据任务复杂程度规划执行路径,完成数据选择、筛选、关联和计算;得到结果后,还会通过证据追踪和答案校验检查计算过程和结果,发现问题时调整方案并重新验证,形成“数据理解—规划执行—验证修复”的闭环。这也解释了此次 90.62%成绩的含金量:它不是单纯证明国产模型能够完成数据查询,而是验证了国产数据库与国产模型结合后,能够共同支撑复杂的数据分析任务。
在底层模型采用 GLM-5.2 的情况下,OceanBase 方案最终超过了多项采用 GPT、Claude Opus、Claude Fable 等海外模型构建的 Data Agent 方案。对 OceanBase 而言,这也是其 AI 能力的一次新验证。
过去,数据库主要负责存储、查询和处理数据。随着 AI Agent 成为新的数据使用者,数据库需要解决的问题也在变化:AI 不仅要拿到数据,还要理解数据、关联数据、分析数据,并验证结果是否可靠。
AI 时代的数据底座,也因此开始从“把数据交给 AI”,走向“帮助 AI 把数据用起来”。这正是 OceanBase 从数据库向 AI 数据平台演进的方向。
OceanBase DataPilot 是面向 AI 数据分析场景的产品方向。本次 DAB 评测以内部代号 Scout 的方案提交,相关技术能力后续将沉淀到 DataPilot 产品中,进一步承接数据理解、任务规划、分析执行和结果验证等能力,让 AI 从“调用数据”走向“用数据完成任务”。
从数据库到 AI 数据平台,变化的不只是产品形态,更是数据库与 AI 的关系:过去数据库负责把数据存好、算好、取出来,如今还要帮助 AI 理解数据、组织数据并完成分析。此次登顶 DAB,是 OceanBase 将数据库能力进一步延伸到 AI 数据分析环节的一次验证,也意味着数据库正在从 AI 的数据底座,走向 AI 的数据工作引擎。