业界首个大规模中文科学文献数据集——CSL发布
1,475 阅读
这是中国地质大学研究人员联合深圳大学和腾讯AI实验室的研究人员发布了一个大规模中文科学文献数据集。

包含 2010-2020 年发表的期刊论文元信息(标题、摘要和关键词)。根据中文核心期刊目录进行筛选, 并标注学科和门类标签,分为 13 个门类(一级标签)和 67 个学科(二级标签)。 数据总量为 396,209 条。具体的类别结果如下:
为了推动中文科学文献 NLP 研究,本项目提供一系列测评基准任务。 测评任务数据集从 CSL 中抽样 10,000 条,按照 0.8: 0.1: 0.1的比例划分训练、验证和测试集。 为了提供公平的多任务学习设置,各任务使用相同的训练、验证和测试集。 任务数据集以 text2text 的形式提供,可以直接在基线模型(例如 T5)上进行多任务训练。
目前包括的任务基准有:
- 文本摘要
- 关键词生成
- 论文分类
- 论文学科分类
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
