外观
前沿进展
一句话定义:前沿进展是深度学习"正在进行时"的地图——从扩展定律、MoE 到推理时计算与 AI Agent,本页帮你快速定位近年重要突破"是什么、为什么重要、谁做的、去哪里深入"。它补在论文地图的尾巴上,是地图的"最新一页"。
一、如何使用本页(先读)
时效性声明
本页内容截至 2025 年 12 月。深度学习进展以月计,模型名、参数量、榜单分数、公司名都会快速过期。请按以下方式阅读:
- 每项记住"机制与趋势",不背具体数字;
- 引用时标注"截至 2025-12",并去精选资源清单找持续更新的来源交叉验证;
- 判断"真前沿"的方法见第十一节——这是比任何时效数据更值钱的能力。
下面每项按"是什么 / 为什么重要 / 代表工作 / 关联站内页"展开。九大趋势先给一张速览表(关联站内页为纯文本指引,详细链接见各节):
| 趋势 | 一句话是什么 | 代表工作 | 关联站内页 |
|---|---|---|---|
| 扩展定律与合成数据 | 损失随数据/参数/算力幂律下降,真实数据近耗尽后用合成数据续命 | Kaplan 2020 / Chinchilla 2022 | 数据与数据工程 |
| MoE 稀疏专家 | 每次只激活部分专家参数,固定成本换超大容量 | Mixtral / DeepSeek-V3 | 大语言模型(LLM) |
| 多模态统一模型 | 文本、图像、音频、视频统一进一个模型 | CLIP / GPT-4o / Gemini | 多模态模型 |
| RLHF 与对齐 | 让模型听话诚实无害;DPO 简化流程、RLVR 激发推理 | InstructGPT / DPO / DeepSeek-R1 | 深度强化学习 |
| 扩散应用扩展 | 加噪-去噪框架外推到视频、3D、音频 | Sora / Stable Diffusion | 扩散模型与生成式 AI |
| 推理时计算 | 把算力花在"想"上,训练算力与推理算力可互换 | o1 / DeepSeek-R1 | 表征学习与预训练 |
| Agent 与工具使用 | 模型从问答机变成规划执行者 | ReAct / Toolformer | MLOps 与模型部署 |
| 效率革命 | 量化、蒸馏、投机采样让大模型"用得动" | FlashAttention / GPTQ / AWQ | MLOps 与模型部署 |
| 科学发现 | AI 反哺蛋白质结构、数学定理等科学问题 | AlphaFold2 / AlphaGeometry | 深度强化学习应用 |
二、大模型扩展定律与合成数据
是什么:扩展定律(Scaling Laws)用幂律关系描述"损失随数据量、参数量、算力的增长而下降"——Kaplan 2020 先给形式,Chinchilla 2022 提出"计算最优"配比(参数量与数据量按比例同步增长)。2023-2025 年的新趋势是合成数据:当真实数据接近"耗尽",用模型生成的数据参与训练(自训练、蒸馏、混合配比)成为主流做法。
为什么重要:扩展定律把"模型该做多大、数据要多少"从玄学变成可预算的工程问题;合成数据的兴起意味着"数据墙"不再是硬约束,但也带来分布偏移、模型崩溃(Model Collapse)等新风险。
代表工作:Kaplan et al. 2020;Hoffmann et al. (Chinchilla) 2022;OpenAI 与 DeepSeek 等 2024-2025 年合成数据实践。公开数据与工具见数据集与工具档案。
关联站内页:数据侧见数据与数据工程,模型侧见大语言模型(LLM)。
三、MoE 稀疏专家
是什么:混合专家(Mixture-of-Experts)把模型拆成多个"专家"子网络,每次推理只激活其中一部分(稀疏激活),用路由网络决定 token 去哪个专家。源于 Shazeer 2017,复兴于 Switch Transformer 2021,成熟于 2024-2025 年的 Mixtral、DeepSeek-V3。
为什么重要:用固定成本换超大容量——总参数量翻数倍,但每次推理/训练的计算量几乎不变。这让"百亿激活、万亿总参"成为可能,是把扩展定律继续推下去的关键工程杠杆。
代表工作:Shazeer et al. 2017(Sparsely-Gated MoE);Fedus et al. 2021(Switch Transformer);Mixtral 8x7B(2024);DeepSeek-V3(2024)。
关联站内页:架构视角见大语言模型(LLM)。
四、多模态统一模型
是什么:把文本、图像、音频、视频统一进一个模型:从"视觉编码器 + 投影 + LLM"的 VLM(CLIP 2021、LLaVA 2023)到原生多模态(GPT-4o、Gemini),再到"任意输入 → 任意输出"的统一 token 化。
为什么重要:单一模态的进步受限于信息源;多模态让模型获得"世界感"——图文的联合训练互相补强,也是 Agent 感知真实世界的前提。
代表工作:CLIP(2021);Flamingo(2022);GPT-4V / GPT-4o(2023-2024);Gemini(2023-2024);LLaVA 系开源方案。
关联站内页:架构与演进见多模态模型。
五、RLHF 与对齐(DPO / RLVR)
是什么:对齐(alignment)让模型"听话、诚实、无害"。InstructGPT(2022)确立 RLHF 三步:SFT → 人类偏好训练奖励模型 → 强化学习(PPO)。DPO(2023)用闭式解省掉奖励模型,把对齐变成简单分类损失;RLVR(可验证奖励的强化学习,2025)用"答案对错可判"的任务(数学、代码)做纯 RL,是推理模型的核心训练法。
为什么重要:模型能力越强,对齐越重要——能力是"能不能",对齐是"愿不愿、对不对"。RLVR 更意外地证明:纯粹靠 RL 就能激发模型推理能力,而不只是纠正行为。
代表工作:Ouyang et al. 2022(InstructGPT);Rafailov et al. 2023(DPO);DeepSeek-R1(2025,RLVR 推理);OpenAI o 系列。
关联站内页:强化学习基础见深度强化学习,RL 应用见深度强化学习应用,评估对齐效果的方法论见『评估实践』。
六、扩散模型应用扩展(视频 / 3D / 音频)
是什么:扩散的"加噪-去噪"框架从图像(DDPM 2020、Stable Diffusion 2022)外推到视频(逐帧联合去噪 + 时间注意力)、3D(多视角渲染约束)、音频(频谱图扩散)。机制解读见扩散模型与生成式 AI。
为什么重要:生成从"静态图"走向"动态世界"。视频生成(Sora 2024)首次展示对物理一致性的建模;3D 生成让"一句话建模"成为现实;音频生成让语音、音乐创作平民化。
代表工作:Sora(2024);DreamFusion / TripoSR(2023-2024);AudioLDM(2023);Stable Video Diffusion(2023)。
关联站内页:生成式模型全景见生成式模型,音频应用见语音与音频。
七、推理时计算(o1 类)
是什么:与其"一次生成答案",不如让模型在推理时多想几步——生成思维链、自我校验、搜索与回溯,把更多算力花在"想"上(test-time compute)。OpenAI o1(2024)与 DeepSeek-R1(2025)是标志性系统。
为什么重要:它打破了"模型能力 = 训练时参数+数据"的单一思路,开辟"训练算力与推理算力可以互换"的新维度——小模型 + 长思考也能解决大问题,这是继扩展定律之后最重要的能力增长范式。
代表工作:OpenAI o1 / o3(2024-2025);DeepSeek-R1(2025);各类"推理时搜索"研究。
关联站内页:机制基础见表征学习与预训练,评估推理能力的方法见『评估实践』。
八、Agent 与工具使用
是什么:让模型不仅能对话,还能调用工具、规划步骤、执行操作:函数调用(Toolformer 2023)、检索(RAG)、浏览网页、控制电脑/浏览器、多 Agent 协作。
为什么重要:LLM 从"问答机"变成"执行者"。Agent 是把模型知识转化为现实行动的系统层——也把问题从"模型行不行"转移到"系统可靠性与评估难不难"。
代表工作:ReAct(2022);Toolformer(2023);GPT 函数调用 / OpenAI Computer Use(2024);Claude Computer Use、Manus 等(2024-2025)。
关联站内页:可靠性与评估见评估实践,工程部署见MLOps 与模型部署。
九、效率革命(量化 / 蒸馏 / 投机采样)
是什么:让大模型"用得起"的一整套技术:量化把权重压到 4-bit 甚至更低(GPTQ 2022、AWQ 2023);蒸馏让小模型学大模型(知识蒸馏 2015 起);投机采样用小模型草稿+大模型验证加速推理;FlashAttention 让注意力显存线性化、速度快数倍。
为什么重要:能力边界由算力决定,而效率决定"能力能不能到普通人手里"。量化让百亿模型跑在单卡/手机端,蒸馏让开源社区追赶闭源,推理加速直接决定 Agent 的实时性。
代表工作:FlashAttention(2022);GPTQ(2022);AWQ(2023);Leviathan et al. 投机采样(2023);DeepSeek 蒸馏系列(2025)。
关联站内页:训练侧配方见训练配方与调参,部署与推理优化见MLOps 与模型部署。
十、科学发现(AlphaFold / AlphaGeometry)
是什么:深度学习反哺科学:AlphaFold2(2021)把蛋白质结构预测精度推到实验级,AlphaFold3(2024)扩展到底物-配体复合物;AlphaGeometry(2024)在国际数学奥林匹克级别解题;ESM 等蛋白语言模型按"语言"建模蛋白质序列。
为什么重要:这是 AI 价值最大的出口——不是替代人类判断,而是把"穷举空间"交给模型,把人留在假设与验证层。"AI for Science"从口号变成常规生产力。
代表工作:AlphaFold2 / AlphaFold3(2021/2024);AlphaGeometry(2024);ESM 系列(2021-2024)。
十一、如何甄别"真前沿"与"热点炒作"
读前沿内容(本页或媒体)时,用这四个问题过滤:
- 有论文或技术报告吗? 只有新闻通稿没有可验证材料的多半是营销;
- 和基线比了吗? 声称"全面超越"却没说和谁比、比多少的,一律存疑;
- 开源吗? 开源(权重/代码)意味着可复现、可检验——这是科学诚信的底线;
- 机制可解释吗? 能说出"为什么有效"的进展,比"意外刷榜"更接近真前沿。
判断论文好坏的完整方法论见阅读纪律与 FAQ;甄别模型能力虚实的评估技术见评估实践。
十二、权衡与取舍
- 追新 vs 扎根:前沿进展大多建立在经典论文精读的地基上。优先读穿经典,再花 20% 精力跟前沿,效率最高。
- 能力 vs 安全:推理时计算、Agent 让模型更强,也让"失控风险"与评估难度指数上升。对齐不是可选项,是能力的一部分(见可解释性与公平性)。
- 效率 vs 质量:量化、蒸馏总伴随精度折损,"用得动"与"用得好"需要按场景权衡,量化的正确打开方式见『MLOps 与模型部署』。
- 时代感 vs 误导:本页所有"代表工作"都带着截止时间戳。请把它们当作"当时的坐标",而非"永恒的排名"——这正是数据驱动的领域应有的科学态度。
延伸阅读
参考资料
- Kaplan et al. Scaling Laws for Neural Language Models (2020)
- Hoffmann et al. Training Compute-Optimal Large Language Models (NeurIPS 2022)
- Shazeer et al. Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer (ICLR 2017)
- Fedus, Zoph, Shazeer. Switch Transformers: Scaling to Trillion Parameter Models (JMLR 2022)
- Ouyang et al. Training language models to follow instructions with human feedback (NeurIPS 2022)
- Rafailov et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model (NeurIPS 2023)
- DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (2025)
- Ho et al. Denoising Diffusion Probabilistic Models (NeurIPS 2020)
- Rombach et al. High-Resolution Image Synthesis with Latent Diffusion Models (CVPR 2022)
- Brooks et al. Video Generation Models as World Simulators (Sora) (2024)
- Yao et al. ReAct: Synergizing Reasoning and Acting in Language Models (ICLR 2023)
- Dao et al. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness (NeurIPS 2022)
- Frantar et al. GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers (2022)
- Leviathan, Kalman, Matias. Fast Inference from Transformers via Speculative Decoding (ICML 2023)
- Jumper et al. Highly accurate protein structure prediction with AlphaFold (Nature 2021)
- Trinh et al. Solving olympiad geometry without human demonstrations (Nature 2024)