智能AI
morning
SCAFFOLD:计算机科学研究数据的大规模结构化数据集,带有图表 QA 和思维链推理轨迹
摘要
arXiv:2609.00018v1 Announce Type: new Abstract: Computer science papers rely heavily on diagrams: architecture drawings, system flowcharts, and pipeline schematics that often carry more information th...
dataset
and
SCAFFOLD
pairs
with
science
papers
step
sized
arXiv
2026-09-02
1 阅读
约1分钟阅读
Ranjit Raut, Aarav Subedi, Sagun Rai, Sudan Jha
字号:
arXiv:2609.00018v1 公告类型:新 摘要:计算机科学论文严重依赖图表:架构图、系统流程图和管道原理图,这些图表通常比周围的文本包含更多信息。目前还没有公共数据集将这种特定类型的图形与标题、上下文、问题、答案和逐步推理配对,而这正是训练视觉语言模型来理解它们所需要的。我们提出了 \textbf{SCAFFOLD}\footnote{https://github.com/theranjitraut/scaffold},这是一个包含图表 QA 和思想链推理轨迹的计算机科学研究数据的大规模结构化数据集。该数据集由来自 arXiv 计算机科学论文的(图像、标题、上下文、问题答案、思想链)元组组成,这些元组使用布局检测和 PDF 解析准备,并具有人工智能辅助的问题生成步骤。由此产生的大型 SCAFFOLD-157K 数据集涵盖 3,058 篇论文,包含 29,887 个图(157,387 对)、一个中型 SCAFFOLD-37K 数据集(36,797 对)和一个小型 SCAFFOLD-12K 数据集(12,000 对)。我们使用 SCAFFOLD-12K 在 Qwen2.5-VL-3B-Instruct 上进行基线实验。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱