机器学习领域ArXiv论文数据集-2021年5月11日至2023年5月11日-practiceportfolio

机器学习领域ArXiv论文数据集-2021年5月11日至2023年5月11日-practiceportfolio 数据来源:互联网公开数据 标签:机器学习,NLP,ArXiv,论文数据集,Kaggle,人工智能挑战,科学研究,学术论文

数据概述: 本数据集包含来自ArXiv的超过200万条论文记录,其中近50万条(25%)是最近两年内发布的,近10万条(20%)特别标注了Kaggle2023人工智能挑战的相关主题。数据涵盖的ArXiv标签包括'nlin.AO'、'stat.ML'、'stat.ME'、'nlin.CG'、'math.ST'以及所有以'cs.'或'eess.'开头的类别。数据集包含97220条有效条目,每条记录包括论文的唯一ID、作者信息、标题、分类、摘要、版本数量、更新日期、年份、月份和日期等字段。

数据用途概述: 该数据集适用于机器学习、自然语言处理、学术研究和数据科学教育等多种场景。研究人员可以利用此数据进行机器学习领域的文献回顾、主题分析和趋势研究;教育机构可以使用数据集进行相关课程的教学和实验;数据科学爱好者可以通过分析摘要和分类信息来了解最新的学术动态和研究成果。此外,该数据集在人工智能挑战和竞赛中也具有重要意义,可以为参赛者提供丰富的数据资源。

packageimg

数据与资源

附加信息

字段
版本 1.0
数据集大小 73.92 MiB
最后更新 2025年5月31日
创建于 2025年5月31日
声明 当前数据集部分源数据来源于公开互联网,如果有侵权,请24小时联系删除(400-600-6816)。