标签

「MADLAD-400」相关文章

汇总「MADLAD-400」相关的原创 AI 技术文章与大模型实践笔记，持续更新。

标签:#MADLAD-400

Google发布迄今为止公开可用的最大的多语言网络数据集MADLAD-400，覆盖419种语言

Google DeepMind与Google Research的研究人员推出了一个全新的多语言数据集——MADLAD-400！这个数据集汇集了来自全球互联网的419种语言的大量文本数据，其规模和语言覆盖范围在公开可用的多语言数据集中应该是最大的。研究人员从Common Crawl这个庞大的网页爬虫项目中提取了大量数据，并进行了人工审核，删除了许多噪音，使数据集的质量得到了显著提升。

2023/09/13 07:26:541,871

#MADLAD-400 #公开网络数据集