循环神经网络(Recurrent Neural Network,RNN)是一类专为处理序列数据设计的深度学习模型。其核心特征是神经元之间存在循环连接,通过在时间步之间传递隐藏状态来捕捉序列的上下文依赖关系。广泛应用于自然语言处理、语音识别、时间序列预测等领域。基础RNN存在梯度消失和梯度爆炸问题,由此衍生出LSTM(长短期记忆网络)和GRU等改进变体,以更有效地建模长程依赖。
RNN的串行结构导致其无法通过并行计算加速训练,因为第t步的计算必须等待第t-1步完成
在Transformer出现之前,主流的序列建模方法是循环神经网络(RNN)及其变体LSTM和GRU
相比RNN/LSTM架构,Transformer支持大规模并行计算
The self-attention mechanism allows the model to attend to information at all positions simultaneously, eliminating the sequential dependency limitations of RNNs/LSTMs
Transformer的无状态特性源于多头自注意力机制,模型权重在推理阶段严格冻结,不存在跨请求的隐状态传递
RNN存在梯度消失/爆炸问题,梯度跨越大量时间步传递时会指数级衰减或膨胀,导致难以学习远距离依赖
Transformer每层包含多头自注意力和前馈神经网络两个核心子模块
Google的Quick, Draw!项目于2016年发布,是一个基于循环神经网络(RNN)的涂鸦识别系统
The self-attention mechanism allows the model to attend to information at all positions simultaneously, eliminating the sequential dependency limitations of RNNs/LSTMs
95%待验证Google的Quick, Draw!项目于2016年发布,是一个基于循环神经网络(RNN)的涂鸦识别系统
90%待验证在Transformer出现之前,主流的序列建模方法是循环神经网络(RNN)及其变体LSTM和GRU
50%待验证RNN的串行结构导致其无法通过并行计算加速训练,因为第t步的计算必须等待第t-1步完成
50%待验证相比RNN/LSTM架构,Transformer支持大规模并行计算
50%待验证Transformer的无状态特性源于多头自注意力机制,模型权重在推理阶段严格冻结,不存在跨请求的隐状态传递
50%待验证RNN存在梯度消失/爆炸问题,梯度跨越大量时间步传递时会指数级衰减或膨胀,导致难以学习远距离依赖
50%待验证Transformer每层包含多头自注意力和前馈神经网络两个核心子模块
50%