外观
数据集与工具档案
一句话定义:一份「去哪拿数据、用什么工具处理」的实操档案——按模态分组的经典数据集(规模、任务、获取方式、注意点)+ 常用工具的一句话档案 + 选数据集的决策原则。
时效说明:数据集规模、版本等数据截止 2026-08,引用前核对。下载链接均指向官方渠道。
数据是深度学习的原料:模型上限由数据决定,见数据与数据工程。本页解决实操中的三个问题:练手该用哪个数据集、下载去哪、用什么工具跑起来。
一、图像数据集
| 数据集 | 规模 | 任务 | 获取方式 | 注意点 |
|---|---|---|---|---|
| MNIST | 7 万张 28×28 手写数字 | 10 类分类 | 官网/Torchvision 直接下载 | 太「干净」、过拟合不到,适合跑通流程而非刷分 |
| CIFAR-10/100 | 6 万张 32×32 彩色图 | 10/100 类分类 | 官网/Torchvision | 低分辨率,是快速验证网络结构的标准战场 |
| ImageNet | 约 1400 万张、2.2 万类 | 图像分类、预训练基准 | 官网申请下载 | 体积大(数百 GB),学术用需遵守协议;大多数人在 ImageNet-1K 上做预训练对比 |
| COCO | 33 万张、250 万标注实例 | 检测/分割/关键点/描述 | 官网分文件下载 | 标注文件格式(JSON)需要解析,TorchVision 有内置加载器 |
| Open Images | 900 万+ 张图 | 检测/分割/视觉关系 | Google 存储分片下载 | 规模大,标注噪声高于 COCO,适合预训练 |
提示:所有图像数据集都可以先用 TorchVision 内置接口跑通流程,再考虑全量下载;处理大规模数据时使用 DataLoader 多进程与缓存,细节见训练配方与调参。
二、文本数据集
| 数据集 | 规模 | 任务 | 获取方式 | 注意点 |
|---|---|---|---|---|
| GLUE | 9 个 NLU 任务的集合(含 SST-2、MNLI、QQP 等) | 句子分类、蕴含、相似度等 | HuggingFace datasets | 中文场景可找 CLUE 对照;是模型通用语言能力的经典基准 |
| SuperGLUE | GLUE 的强化版(8 个更难任务) | 推理、常识等 | HuggingFace datasets | 样本少,注意指标计算细节 |
| SQuAD | 10 万+ 问答对(SQuAD1.1);含不可回答问题(SQuAD2.0) | 抽取式问答 | 官网/HuggingFace | 2.0 版多了不可回答样本,考验模型「拒答」能力 |
| Wikipedia(英文) | 数十亿 token | 预训练语料、RAG 知识源 | 官方 dump 按月发布 | 体积巨大,一般按需下载子集;RAG 实践常用它做知识库,见大语言模型(LLM) |
| Common Crawl | 数百 TB 网页数据 | 大规模预训练语料 | 官方按月快照 | 需大量清洗与去重,个人难以全量使用,多用其子集 |
| The Pile | 800GB 多源文本 | 开源预训练语料 | 官网/HuggingFace | 组件多样(论文、GitHub、书籍、对话等),是研究大规模预训练的常用语料 |
提示:中文语料可从 HuggingFace 的中文数据集(如 C4 中文版、CLUECorpus)获取。任何预训练语料都要做去重、过滤、隐私清洗,见数据与数据工程。
三、语音与音频数据集
| 数据集 | 规模 | 任务 | 获取方式 | 注意点 |
|---|---|---|---|---|
| LibriSpeech | 约 1000 小时英文朗读语音 | 语音识别(ASR) | OpenSLR 分片下载 | 采样率 16kHz、标注对齐质量好,是 ASR 标准基准 |
| Common Voice | 多语言众包语音(持续增长) | ASR、多语言 | Mozilla 官方下载 | 噪音大、口音杂,真实但标注质量不均,见语音与音频 |
四、多模态与分子/图数据集
| 数据集 | 规模 | 任务 | 获取方式 | 注意点 |
|---|---|---|---|---|
| LAION-5B | 58 亿图文对 | 图文预训练、CLIP 训练 | 官方按分片索引下载 | 未经过滤的爬取数据,含有害/低质内容,研究使用需注意合规与内容审查 |
| Conceptual Captions (CC) | 约 330 万图文对 | 图文预训练 | GitHub 官方链接 | 需自行下载原图,链接有效性需自检 |
| QM9 | 13.4 万有机分子 | 分子性质回归 | 官网 | 图/分子机器学习入门标准集,见图神经网络 |
| OGB(Open Graph Benchmark) | 多任务图基准(节点/边/图级) | 图学习 benchmark | 官网/HuggingFace | 有官方评测协议与排行榜,注意不要用测试集调参 |
五、工具档案
| 工具 | 一句话介绍 | 用途 |
|---|---|---|
| PyTorch | 主流深度学习框架 | 建模与训练主力 |
| TorchVision | PyTorch 官方视觉工具包 | 图像数据集加载、预训练模型、变换 |
| Hugging Face Transformers | 统一 API 加载数千预训练模型 | 文本/视觉/语音模型加载与微调 |
| Hugging Face datasets | 数据集加载与处理库 | 流式加载大语料、统一预处理 |
| diffusers | 扩散模型官方工具库 | 生成式模型训练与推理,见扩散模型与生成式 AI |
| peft | 参数高效微调工具库 | LoRA 等微调方法开箱即用 |
| accelerate | 分布式训练简化工具 | 几行代码跑多卡/混合精度训练 |
| ONNX Runtime | 跨平台推理引擎 | 模型导出部署,见MLOps 与模型部署 |
| TensorBoard / W&B | 可视化与实验跟踪 | 曲线监控、实验对比 |
| OpenAI CLIP | 图文对比学习模型 | 图文检索、零样本分类、特征提取 |
工具选型建议
新人用「PyTorch + HuggingFace 全家桶(Transformers/datasets/peft/accelerate)」一条龙最顺;研究效率导向可学 JAX;生产部署再加 ONNX/推理框架。更完整的选型方法论见框架与工具怎么选。
六、选数据集的原则
原则 1:任务先于数据
先明确「要解决什么任务、用什么指标评估」,再选数据。指标选择错了,数据集再大也没用,见深度学习评估与实验。
原则 2:规模匹配阶段
- 学原理/跑通流程:MNIST、CIFAR——几分钟内验证想法;
- 做正经项目/作品集:COCO、GLUE、LibriSpeech——规模与标注质量够写进简历;
- 预训练/研究:ImageNet、The Pile、LAION——需要算力与工程支撑。
原则 3:注意数据的三类问题
- 泄露:训练/测试混用、时间上未来信息泄漏——导致指标虚高,见常见陷阱与反模式;
- 分布:数据集与实际场景分布不同——模型上线即失效,见评估实践;
- 合规:爬取数据、人物图片、版权文本的授权与伦理问题——尤其 LAION 类数据集,见可解释性与公平性。
原则 4:优先「有生态」的数据集
有官方加载器(TorchVision/HF datasets)、有公开 baseline 分数、有社区讨论的数据集,能让你的结果可对照、可解释——这也是 ImageNet、GLUE 成为事实标准的原因。
延伸阅读
- 数据与数据工程——数据清洗、标注、不平衡处理
- 训练配方与调参——数据加载与训练管线优化
- 深度学习评估与实验——选对指标再选数据
- 大语言模型(LLM)——预训练语料与 RAG 数据实践
- 框架与工具怎么选——工具链选型方法论
- 作品集项目——用数据集做出能写进简历的项目