【现代深度学习技术】现代循环神经网络03：深度循环神经网络

编程

更新时间：2025-05-175

admin管理员组
文章数量:1436988

【现代深度学习技术】现代循环神经网络03：深度循环神经网络

深度学习 (DL, Deep Learning) 特指基于深层神经网络模型和方法的机器学习。它是在统计机器学习、人工神经网络等算法模型基础上，结合当代大数据和大算力的发展而发展出来的。深度学习最重要的技术特征是具有自动提取特征的能力。神经网络算法、算力和数据是开展深度学习的三要素。深度学习在计算机视觉、自然语言处理、多模态数据分析、科学探索等领域都取得了很多成果。本专栏介绍基于PyTorch的深度学习算法实现。

到目前为止，我们只讨论了具有一个单向隐藏层的循环神经网络。其中，隐变量和观测值与具体的函数形式的交互方式是相当随意的。只要交互类型建模具有足够的灵活性，这就不是一个大问题。然而，对一个单层来说，这可能具有相当的挑战性。之前在线性模型中，我们通过添加更多的层来解决这个问题。而在循环神经网络中，我们首先需要确定如何添加更多的层，以及在哪里添加额外的非线性，因此这个问题有点棘手。

事实上，我们可以将多层循环神经网络堆叠在一起，通过对几个简单层的组合，产生了一个灵活的机制。特别是，数据可能与不同层的堆叠有关。例如，我们可能希望保持有关金融市场状况（熊市或牛市）的宏观数据可用，而微观数据只记录较短期的时间动态。

图1描述了一个具有

L

个隐藏层的深度循环神经网络，每个隐状态都连续地传递到当前层的下一个时间步和下一层的当前时间步。

图1 深度循环神经网络结构

一、函数依赖关系

我们可以将深度架构中的函数依赖关系形式化，这个架构是由图1中描述了

L

个隐藏层构成。后续的讨论主要集中在经典的循环神经网络模型上，但是这些讨论也适应于其他序列模型。

假设在时间步

t

有一个小批量的输入数据

\mathbf{X}_t \in \mathbb{R}^{n \times d}

（样本数：

n

，每个样本中的输入数：

d

）。同时，将

l^\mathrm{th}

隐藏层（

l=1,\ldots,L

）的隐状态设为

\mathbf{H}_t^{(l)} \in \mathbb{R}^{n \times h}

（隐藏单元数：

h

），输出层变量设为

\mathbf{O}_t \in \mathbb{R}^{n \times q}

（输出数：

q

）。设置

\mathbf{H}_t^{(0)} = \mathbf{X}_t

，第

l

个隐藏层的隐状态使用激活函数

\phi_l

，则

\mathbf{H}_t^{(l)} = \phi_l(\mathbf{H}_t^{(l-1)} \mathbf{W}_{xh}^{(l)} + \mathbf{H}_{t-1}^{(l)} \mathbf{W}_{hh}^{(l)} + \mathbf{b}_h^{(l)}) \tag{1}

其中，权重

\mathbf{W}_{xh}^{(l)} \in \mathbb{R}^{h \times h}

，

\mathbf{W}_{hh}^{(l)} \in \mathbb{R}^{h \times h}

和偏置

\mathbf{b}_h^{(l)} \in \mathbb{R}^{1 \times h}

都是第

l

个隐藏层的模型参数。

最后，输出层的计算仅基于第

l

个隐藏层最终的隐状态：

\mathbf{O}_t = \mathbf{H}_t^{(L)} \mathbf{W}_{hq} + \mathbf{b}_q \tag{2}

其中，权重

\mathbf{W}_{hq} \in \mathbb{R}^{h \times q}

和偏置

\mathbf{b}_q \in \mathbb{R}^{1 \times q}

都是输出层的模型参数。

与多层感知机一样，隐藏层数目

L

和隐藏单元数目

h

都是超参数。也就是说，它们可以由我们调整的。另外，用门控循环单元或长短期记忆网络的隐状态来代替式(1)中的隐状态进行计算，可以很容易地得到深度门控循环神经网络或深度长短期记忆神经网络。

二、简洁实现

实现多层循环神经网络所需的许多逻辑细节在高级API中都是现成的。简单起见，我们仅示范使用此类内置函数的实现方式。以长短期记忆网络模型为例，该代码与之前在长短期记忆网络（LSTM）中使用的代码非常相似，实际上唯一的区别是我们指定了层的数量，而不是使用单一层这个默认值。像往常一样，我们从加载数据集开始。

代码语言：javascript代码运行次数：0运行复制

import torch
from torch import nn
from d2l import torch as d2l

batch_size, num_steps = 32, 35
train_iter, vocab = d2l.load_data_time_machine(batch_size, num_steps)

选择超参数这类架构决策也跟长短期记忆网络（LSTM）中的决策非常相似。因为我们有不同的词元，所以输入和输出都选择相同数量，即vocab_size。隐藏单元的数量仍然是

256

。唯一的区别是，我们现在通过num_layers的值来设定隐藏层数。

代码语言：javascript代码运行次数：0运行复制

vocab_size, num_hiddens, num_layers = len(vocab), 256, 2
num_inputs = vocab_size
device = d2l.try_gpu()
lstm_layer = nn.LSTM(num_inputs, num_hiddens, num_layers)
model = d2l.RNNModel(lstm_layer, len(vocab))
model = model.to(device)

三、训练与预测

由于使用了长短期记忆网络模型来实例化两个层，因此训练速度被大大降低了。

代码语言：javascript代码运行次数：0运行复制

num_epochs, lr = 500, 2
d2l.train_ch8(model, train_iter, vocab, lr*1.0, num_epochs, device)

小结

在深度循环神经网络中，隐状态的信息被传递到当前层的下一时间步和下一层的当前时间步。
有许多不同风格的深度循环神经网络，如长短期记忆网络、门控循环单元、或经典循环神经网络。这些模型在深度学习框架的高级API中都有涵盖。
总体而言，深度循环神经网络需要大量的调参（如学习率和截断）来确保合适的收敛，模型的初始化也需要谨慎。

本文参与腾讯云自媒体同步曝光计划，分享自作者个人站点/博客。原始发表：2025-05-02，如有侵权请联系 cloudcommunity@tencent 删除数据网络循环神经网络深度学习模型

本文标签：现代深度学习技术现代循环神经网络03深度循环神经网络

版权声明：本文标题：【现代深度学习技术】现代循环神经网络03：深度循环神经网络内容由网友自发贡献，该文观点仅代表作者本人，转载请联系作者并注明出处：http://www.betaflare.com/biancheng/1747414442a2695341.html，本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容，一经查实，本站将立刻删除。

编程频道|软件玩家 - 软件改变生活！

【现代深度学习技术】现代循环神经网络03：深度循环神经网络

【现代深度学习技术】现代循环神经网络03：深度循环神经网络

一、函数依赖关系

二、简洁实现

三、训练与预测

小结

更多相关文章

【现代深度学习技术】现代循环神经网络03：深度循环神经网络

发表评论

推荐文章

javascript - Executing a function onclick via ejs template - Stack Overflow

python - understanding loss in tf keras model fit - Stack Overflow

javascript - CKEditor 4 getEditor not working - Stack Overflow

javascript - Get nested JSONobject value without needing many intermediate checks? - Stack Overflow

联想昭阳X5-14 ABP R7 7730U40GB1TB参数报价

热门文章

cloudbees - API changes after Jenkins Core Version 2.462.2.2 upgrade - Stack Overflow

jquery - javascript button toggle only one at a time - Stack Overflow

angular - JSON.stringify blocking UI loader - Stack Overflow

c# - How to style components in the Blazor Bootstrap Component library - Stack Overflow

javascript - Is it possible to get list of current markers on leaflet Map? - Stack Overflow

javascript - How to loop through JSON object together with an if-statement? - Stack Overflow

categories - Category pagination not working in category.php please help me

python - How to convert pytorch segmentation to CoreML - Stack Overflow

神舟战神Z7 D6 i7-12650H64GB1TBRTX4050旗舰版参数报价

联想拯救者 Y9000P 2024 i9 14900HX32GB2TBRTX4090参数报价

最新文章

26. Python函数值传递和引用传递详解

软件设计师速通其一：计算机内部数据表示

基于Python的携程国际机票价格抓取与分析

TF卡速度测评

【Statsmodels和SciPy介绍与常用方法】

javascript - Type &#39;undefined&#39; is not assignable to type &#39;menuItemProps[]&#39; - Stack Overflow

javascript - VS 2015 Angular 2 import modules cannot be resolved - Stack Overflow

javascript - Get the JSON objects that are not present in another array - Stack Overflow

javascript - How to dismiss a phonegap notification programmatically - Stack Overflow

c - Solaris 10 make Error code 1 Fatal Error when trying to build python 2.7.16 - Stack Overflow

ThinkPad 翼465 20翼X000PCD 参数报价

ThinkPad X1 隐士 20MFA01ECD 参数报价

华硕F8H575Sp-SL参数报价

HUWI HW02 11代酷睿版 i5 11300H12GB512GB集显 参数报价

HUWI HW02 11代酷睿版 i5 11300H16GB128GB集显 参数报价

javascript - Type 'undefined' is not assignable to type 'menuItemProps[]' - Stack Overflow

HUWI HW02 11代酷睿版 i5 11300H12GB512GB集显参数报价

HUWI HW02 11代酷睿版 i5 11300H16GB128GB集显参数报价