泰国文本摘要数据集

泰国文本摘要数据集 数据来源:互联网公开数据
标签:文本摘要,泰语,新闻分类,摘要生成,自然语言处理,新闻标题,语言建模

数据概述:
本数据集是目前最大的泰语文本摘要数据集,包含从2014年至2020年期间从泰国多家主流新闻网站(如泰国国家电视台、泰国每日新闻、标准报等)爬取的358,868篇文章及其摘要。数据集以CSV格式存储,包含标题、正文、摘要、类型、标签和URL字段,总大小约为2.9 GB。数据经过清洗和预处理,确保摘要与正文的相关性,去除噪音内容如星座运势、小说、视频摘要等。此外,数据集提供了预训练的文本摘要模型(如BertSum和ARedSum),并附带了相关代码和模型检查点,便于进一步研究和应用。

数据用途概述:
该数据集适用于泰语文本摘要模型的训练和评估,支持提取式和生成式摘要任务。研究人员可以利用此数据集进行模型性能基准测试、文本摘要算法优化以及语言建模研究。此外,数据集还可用于新闻分类(多标签和单标签)、新闻标题生成、语言建模等任务。数据集的开放共享旨在推动泰语自然语言处理领域的发展,为学术研究和实际应用提供高质量的数据支持。

packageimg

数据与资源

附加信息

字段
版本 1.0
数据集大小 618.53 MiB
最后更新 2025年6月1日
创建于 2025年6月1日
声明 当前数据集部分源数据来源于公开互联网,如果有侵权,请24小时联系删除(400-600-6816)。