StackOverflow编程问答与代码片段数据集-多答案标注版-krzysztofbaran

StackOverflow编程问答与代码片段数据集-多答案标注版-krzysztofbaran 数据来源:互联网公开数据 标签:Stack Overflow,编程问答,代码片段,数据集,多答案标注,高技术,教育,编程学习

数据概述: 本数据集(StaQC)收录自Stack Overflow网站上的问题及其关联代码片段。数据集由T.Yao等人创建,原始数据以pickle格式发布在GitHub上。StaQC数据集包含以下字段:

question_id: 每个问题在数据集中的唯一标识符。 code_index: 代码片段在回答中的位置的数字索引。 code_snippet: 从回答中提取的代码片段。 question_title: Stack Overflow问题的标题。 is_correct_to_do: 手动标注的二进制标签,表示代码片段是否正确解决给定问题(详情参见相关论文)。

StaQC数据集允许单个问题关联多个代码片段,通过相同question_id但不同code_index值的多行记录实现。这使得数据集能够捕捉Stack Overflow上编程问题的多种代码解决方案。

数据用途概述: 该数据集适用于编程教育、编程问答系统的开发与评估、代码推荐算法的研究、以及编程问题解决策略的分析等场景。教育者可以利用此数据集进行编程教学与练习;研究人员可以基于数据集进行代码质量评估、代码推荐模型训练等研究。此外,该数据集也是学习编程和理解编程问题解决过程的宝贵资源。

packageimg

数据与资源

附加信息

字段
版本 1.0
数据集大小 0.48 MiB
最后更新 2025年4月23日
创建于 2025年4月23日
声明 当前数据集部分源数据来源于公开互联网,如果有侵权,请24小时联系删除(400-600-6816)。