
这项研究由香港科技大学(广州)联合清华大学的研究团队共同完成,发表于2026年8月,论文题目为《DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces》,论文编号为arXiv:2608.03451v1 [cs.AI]。这项研究同时也是KDD Cup 2026"复杂数据分析数据智能体"竞赛的官方评测基准。感兴趣的读者可以通过这个编号在arXiv网站上查询到完整论文。
先说一个场景。假设你是一名基金公司的分析师,老板突然问你:"哪些基金在2023年跑赢了行业基准,同时又触发了我们那份风控视频里定义的最大回撤警报?把基金名称、类别、回报率、基准、最大回撤和严重程度排名都给我列出来。"
这个问题听起来简单,但要回答它,你得打开五六个完全不同的文件:一份记录基金分类的JSON文件,一份两千多行的CSV表格,一个存了两年每日净值数据的数据库,一份九十多页的PDF基准报告,还有一段八分多钟的风控简报视频。你需要从视频里听出警报的触发条件是"最大回撤不超过12%",从PDF里翻出每个类别的基准收益率,从数据库里查出每日净值再计算实际回撤,最后把这些散落在不同地方、不同语言、不同格式的信息拼接起来,才能给出老板要的那张完整表格。
这正是香港科技大学(广州)团队想要考验人工智能"数据智能体"(可以理解为一个能自主查资料、算数据、写报告的AI助手)的场景。他们发现,现在市面上评测这类AI助手的"考试题",大多只考察某一项单独的能力——有的只考数据库查询,有的只考文档阅读理解,很少有测试要求AI像真正的分析师一样,在一堆杂乱无章、多语言混杂的文件堆里,自己去发现线索、拼凑证据、算出答案,还要交出一份格式规范、内容完整、可以直接核对对错的表格。于是他们造了一个新的"考场",取名DataSpace,中文可以理解为"数据空间"。这个考场里放了410道题目,配套了7439个各种类型的文件,总容量约15GB,涵盖CSV表格、JSON文件、SQLite数据库、Markdown文档、PDF文件和视频六种载体,题目和资料里还经常混杂中文和英文。他们用这套考场测试了六款目前最先进的多模态大模型和五种常见的AI助手运行框架,结果发现,即便是表现最好的组合,正确率也只有66.34%,远没有到"通关"的水平。
接下来,我们就用侦探破案的方式,把这项研究从头到尾讲一遍——研究者们是怎么造出这个考场的,AI侦探们又是怎么在里面栽跟头的。
一、案发现场:为什么现有的考场都不够真实
要理解DataSpace这个新考场的价值,得先看看之前的考场都长什么样。
在这项研究之前,AI数据分析能力的测试大体分成三类。第一类叫"结构化数据测试
富灯网提示:文章来自网络,不代表本站观点。