首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

ESQ-Bench:用于评估 NL2SQL 方言泛化和无声语义分歧的多层企业 Oracle 基准

摘要

arXiv:2608.23569v1 Announce Type: new Abstract: State-of-the-art Natural Language to SQL (NL2SQL) models report execution accuracy exceeding 89 percent on established benchmarks such as Spider and BIR...

and percent schema linked the with tiers queries SQL execution
2026-08-26 1 阅读 约2分钟阅读 Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik
分享:
字号:
arXiv:2608.23569v1 公告类型:新 摘要:最先进的自然语言到 SQL (NL2SQL) 模型报告执行精度在 Spider 和 BIRD 等既定基准上超过 89%。然而,这些基准测试依赖于简化的学术模式和开源 SQL 方言,无法反映企业数据库环境的复杂性。我们推出 ESQ-Bench,这是 Oracle 首个 NL2SQL 基准测试,具有系统复杂性层和跨三个企业模式复杂性层的静默分歧评估。我们构建并发布了六个填充模式(465 个表、164,682 行、零个空表),在 Oracle、PostgreSQL、MySQL 和 SQL Server 上具有相同的种子数据、四个指标评估工具(EM、EX、SR、SD)和 550 个经过黄金验证的问题查询对(第 1 层:95;第 2 层:228;第 3 层:227)。使用 GPT-4o 的架构链接提示显示了跨层的单调执行匹配降级:已执行查询(2026 年 6 月)的 EX 为 79.8%、60.3% 和 57.2%,而早期 142 个问题试点切片的 EX 为 75.6%、80.4% 和 95.8%。新兴市场全线占比保持在 7% 以下; EX 传递查询中的操作静默分歧达到 73% 到 99%。故障分析表明错误结果语义在较高层占主导地位。具有架构链接提示的 Claude Sonnet 4.6 的 EX(执行查询)达到 87.4%、74.9 和 68.7%,在每一层上都超过了 GPT-4o 架构链接。由于零样本分析与模式链接分析中的执行率较低和幸存者偏差,执行查询上的 GPT-4o 零样本 EX(78.7%、73.5% 和 77.8%)会在第 2 层到第 3 层反转模式链接。本地 Llama 3.2 模式链接仅达到全银行 EX 的 13.3%(550 个中的 73 个),凸显了封闭式 API 模型与企业 Oracle 模式的开放权重基线之间的差距。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱