事件专题 · 多源确认

新基准DataSpace:数据智能体异构任务最佳准确率66.34%

新研究发布DataSpace基准,用于评估数据智能体在异构数据工作区生成可验证表格结果的能力。该基准包含410个跨语言任务,覆盖7439个工件,总数据量15.01GB,涉及CSV、JSON、SQLite、Markdown、PDF和视频等格式。在六个前沿多模态模型和五个常用智能体框架的测试中,最佳准确率为66.34%。固定模型主干时,更换框架可使准确率变动15.36个百分点。多模态证据整合和连接操作在六个骨干模型上均降低了准确率。

当前结论

想知道数据智能体怎么选?DataSpace测了6个模型和5个框架,换框架能让准确率差15个点,值得看。

3 个信源53° AI 热度最后更新 2026/8/5 19:15:02

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情