Skip to content

数据集与工具档案

本页速览 深度学习数据集档案:图像(MNIST/CIFAR/ImageNet/COCO)、文本(GLUE/SQuAD/Wikipedia/The Pile)、语音、多模态与分子图数据集,每项给规模/任务/获取方式/注意点;附 PyTorch、HuggingFace、peft 等工具档案与选数据集原则。

本页含时效性内容,数据截止于 2026-08;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

数据集与工具档案

一句话定义:一份「去哪拿数据、用什么工具处理」的实操档案——按模态分组的经典数据集(规模、任务、获取方式、注意点)+ 常用工具的一句话档案 + 选数据集的决策原则

时效说明:数据集规模、版本等数据截止 2026-08,引用前核对。下载链接均指向官方渠道。

数据是深度学习的原料:模型上限由数据决定,见数据与数据工程。本页解决实操中的三个问题:练手该用哪个数据集、下载去哪、用什么工具跑起来。

一、图像数据集

数据集规模任务获取方式注意点
MNIST7 万张 28×28 手写数字10 类分类官网/Torchvision 直接下载太「干净」、过拟合不到,适合跑通流程而非刷分
CIFAR-10/1006 万张 32×32 彩色图10/100 类分类官网/Torchvision低分辨率,是快速验证网络结构的标准战场
ImageNet约 1400 万张、2.2 万类图像分类、预训练基准官网申请下载体积大(数百 GB),学术用需遵守协议;大多数人在 ImageNet-1K 上做预训练对比
COCO33 万张、250 万标注实例检测/分割/关键点/描述官网分文件下载标注文件格式(JSON)需要解析,TorchVision 有内置加载器
Open Images900 万+ 张图检测/分割/视觉关系Google 存储分片下载规模大,标注噪声高于 COCO,适合预训练

提示:所有图像数据集都可以先用 TorchVision 内置接口跑通流程,再考虑全量下载;处理大规模数据时使用 DataLoader 多进程与缓存,细节见训练配方与调参

二、文本数据集

数据集规模任务获取方式注意点
GLUE9 个 NLU 任务的集合(含 SST-2、MNLI、QQP 等)句子分类、蕴含、相似度等HuggingFace datasets中文场景可找 CLUE 对照;是模型通用语言能力的经典基准
SuperGLUEGLUE 的强化版(8 个更难任务)推理、常识等HuggingFace datasets样本少,注意指标计算细节
SQuAD10 万+ 问答对(SQuAD1.1);含不可回答问题(SQuAD2.0)抽取式问答官网/HuggingFace2.0 版多了不可回答样本,考验模型「拒答」能力
Wikipedia(英文)数十亿 token预训练语料、RAG 知识源官方 dump 按月发布体积巨大,一般按需下载子集;RAG 实践常用它做知识库,见大语言模型(LLM)
Common Crawl数百 TB 网页数据大规模预训练语料官方按月快照需大量清洗与去重,个人难以全量使用,多用其子集
The Pile800GB 多源文本开源预训练语料官网/HuggingFace组件多样(论文、GitHub、书籍、对话等),是研究大规模预训练的常用语料

提示:中文语料可从 HuggingFace 的中文数据集(如 C4 中文版、CLUECorpus)获取。任何预训练语料都要做去重、过滤、隐私清洗,见数据与数据工程

三、语音与音频数据集

数据集规模任务获取方式注意点
LibriSpeech约 1000 小时英文朗读语音语音识别(ASR)OpenSLR 分片下载采样率 16kHz、标注对齐质量好,是 ASR 标准基准
Common Voice多语言众包语音(持续增长)ASR、多语言Mozilla 官方下载噪音大、口音杂,真实但标注质量不均,见语音与音频

四、多模态与分子/图数据集

数据集规模任务获取方式注意点
LAION-5B58 亿图文对图文预训练、CLIP 训练官方按分片索引下载未经过滤的爬取数据,含有害/低质内容,研究使用需注意合规与内容审查
Conceptual Captions (CC)约 330 万图文对图文预训练GitHub 官方链接需自行下载原图,链接有效性需自检
QM913.4 万有机分子分子性质回归官网图/分子机器学习入门标准集,见图神经网络
OGB(Open Graph Benchmark)多任务图基准(节点/边/图级)图学习 benchmark官网/HuggingFace有官方评测协议与排行榜,注意不要用测试集调参

五、工具档案

工具一句话介绍用途
PyTorch主流深度学习框架建模与训练主力
TorchVisionPyTorch 官方视觉工具包图像数据集加载、预训练模型、变换
Hugging Face Transformers统一 API 加载数千预训练模型文本/视觉/语音模型加载与微调
Hugging Face datasets数据集加载与处理库流式加载大语料、统一预处理
diffusers扩散模型官方工具库生成式模型训练与推理,见扩散模型与生成式 AI
peft参数高效微调工具库LoRA 等微调方法开箱即用
accelerate分布式训练简化工具几行代码跑多卡/混合精度训练
ONNX Runtime跨平台推理引擎模型导出部署,见MLOps 与模型部署
TensorBoard / W&B可视化与实验跟踪曲线监控、实验对比
OpenAI CLIP图文对比学习模型图文检索、零样本分类、特征提取

工具选型建议

新人用「PyTorch + HuggingFace 全家桶(Transformers/datasets/peft/accelerate)」一条龙最顺;研究效率导向可学 JAX;生产部署再加 ONNX/推理框架。更完整的选型方法论见框架与工具怎么选

六、选数据集的原则

原则 1:任务先于数据

先明确「要解决什么任务、用什么指标评估」,再选数据。指标选择错了,数据集再大也没用,见深度学习评估与实验

原则 2:规模匹配阶段

  • 学原理/跑通流程:MNIST、CIFAR——几分钟内验证想法;
  • 做正经项目/作品集:COCO、GLUE、LibriSpeech——规模与标注质量够写进简历;
  • 预训练/研究:ImageNet、The Pile、LAION——需要算力与工程支撑。

原则 3:注意数据的三类问题

  1. 泄露:训练/测试混用、时间上未来信息泄漏——导致指标虚高,见常见陷阱与反模式
  2. 分布:数据集与实际场景分布不同——模型上线即失效,见评估实践
  3. 合规:爬取数据、人物图片、版权文本的授权与伦理问题——尤其 LAION 类数据集,见可解释性与公平性

原则 4:优先「有生态」的数据集

有官方加载器(TorchVision/HF datasets)、有公开 baseline 分数、有社区讨论的数据集,能让你的结果可对照、可解释——这也是 ImageNet、GLUE 成为事实标准的原因。

延伸阅读

参考资料