HyperAI
Command Palette
Search for a command to run...
Firefly 中文 Llama2 增量预训练数据集
该数据集为 Firefly-LLaMA2-Chinese 项目 的增量预训练数据,一共约 22GB 文本,主要包含 CLUE 、 ThucNews 、 CNews 、 COIG 、维基百科等开源数据集,以及研究团队收集的古诗词、散文、文言文等,数据分布如下图。

firefly-pretrain-dataset.torrent
做种 1正在下载 0已完成 169总下载量 276
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。