DataLearner 标志

业界首个大规模中文科学文献数据集——CSL发布

1,475 阅读

这是中国地质大学研究人员联合深圳大学和腾讯AI实验室的研究人员发布了一个大规模中文科学文献数据集。


包含 2010-2020 年发表的期刊论文元信息(标题、摘要和关键词)。根据中文核心期刊目录进行筛选, 并标注学科和门类标签,分为 13 个门类(一级标签)和 67 个学科(二级标签)。 数据总量为 396,209 条。具体的类别结果如下:

Category#dlen(T)len(A)num(K)#SamplesDiscipline Examples
Engineering2719.1210.94.4177,600Mechanics,Architecture,Electrical Science
Science920.7254.44.335,766Mathematics,Physics,Astronomy,Geography
Agriculture717.1177.17.139,560Crop Science,Horticulture,Forestry
Medicine520.7269.54.736,783Clinical Medicine,Dental Medicine,Pharmacy
Management418.7157.76.223,630Business Management,Public Administration
Jurisprudence418.9174.46.121,554Legal Science,Political Science,Sociology
Pedagogy317.7179.44.316,720Pedagogy,Psychology,Physical Education
Economics219.5177.24.511,558Theoretical Economics,Applied Economics
Literature218.8158.28.310,501Chinese Literature,Journalism
Art117.8170.85.45,201Art
History117.6181.06.06,270History
Strategics117.5169.34.03,555Military Science
Philosophy118.0176.58.07,511Philosophy
All67396,209

为了推动中文科学文献 NLP 研究,本项目提供一系列测评基准任务。 测评任务数据集从 CSL 中抽样 10,000 条,按照 0.8: 0.1: 0.1的比例划分训练、验证和测试集。 为了提供公平的多任务学习设置,各任务使用相同的训练、验证和测试集。 任务数据集以 text2text 的形式提供,可以直接在基线模型(例如 T5)上进行多任务训练。

目前包括的任务基准有:

  1. 文本摘要
  2. 关键词生成
  3. 论文分类
  4. 论文学科分类

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码
业界首个大规模中文科学文献数据集——CSL发布 | DataLearnerAI