京公网安备 11010802034615号
经营许可证编号:京B2-20210330
导读:深度学习已经存在了几十年,不同的结构和架构针对不同的用例而进行演变。其中一些是基于我们对大脑的想法,另一些是基于大脑的实际工作。本文将简单介绍几个业界目前使用的先进的架构。
作者:谢林·托马斯(Sherin Thomas)、苏丹舒·帕西(Sudhanshu Passi)
来源:大数据DT(ID:hzdashuju)
01 全连接网络
全连接、密集和线性网络是最基本但功能强大的架构。这是机器学习的直接扩展,将神经网络与单个隐藏层结合使用。全连接层充当所有架构的最后一部分,用于获得使用下方深度网络所得分数的概率分布。
如其名称所示,全连接网络将其上一层和下一层中的所有神经元相互连接。网络可能最终通过设置权重来关闭一些神经元,但在理想情况下,最初所有神经元都参与训练。
02 编码器和解码器
编码器和解码器可能是深度学习另一个最基本的架构之一。所有网络都有一个或多个编码器–解码器层。你可以将全连接层中的隐藏层视为来自编码器的编码形式,将输出层视为解码器,它将隐藏层解码并作为输出。通常,编码器将输入编码到中间状态,其中输入为向量,然后解码器网络将该中间状态解码为我们想要的输出形式。
编码器–解码器网络的一个规范示例是序列到序列 (seq2seq)网络(图1.11),可用于机器翻译。一个句子将被编码为中间向量表示形式,其中整个句子以一些浮点数字的形式表示,解码器根据中间向量解码以生成目标语言的句子作为输出。
▲图1.11 seq2seq 网络
自动编码器(图1.12)是一种特殊的编码器–解码器网络,属于无监督学习范畴。自动编码器尝试从未标记的数据中进行学习,将目标值设置为输入值。
例如,如果输入一个大小为100×100的图像,则输入向量的维度为10 000。因此,输出的大小也将为 10 000,但隐藏层的大小可能为 500。简而言之,你正在尝试将输入转换为较小的隐藏状态表示形式,从隐藏状态重新生成相同的输入。
▲图1.12 自动编码器的结构
你如果能够训练一个可以做到这一点的神经网络,就会找到一个好的压缩算法,其可以将高维输入变为低维向量,这具有数量级收益。
如今,自动编码器正被广泛应用于不同的情景和行业。
03 循环神经网络
循环神经网络(RNN)是最常见的深度学习算法之一,它席卷了整个世界。我们现在在自然语言处理或理解方面几乎所有最先进的性能都归功于RNN的变体。在循环网络中,你尝试识别数据中的最小单元,并使数据成为一组这样的单元。
在自然语言的示例中,最常见的方法是将一个单词作为一个单元,并在处理句子时将句子视为一组单词。你在整个句子上展开RNN,一次处理一个单词(图1.13)。RNN 具有适用于不同数据集的变体,有时我们会根据效率选择变体。长短期记忆 (LSTM)和门控循环单元(GRU)是最常见的 RNN 单元。
▲图1.13 循环网络中单词的向量表示形式
04 递归神经网络
顾名思义,递归神经网络是一种树状网络,用于理解序列数据的分层结构。递归网络被研究者(尤其是 Salesforce 的首席科学家理查德·索彻和他的团队)广泛用于自然语言处理。
字向量能够有效地将一个单词的含义映射到一个向量空间,但当涉及整个句子的含义时,却没有像word2vec这样针对单词的首选解决方案。递归神经网络是此类应用最常用的算法之一。
递归网络可以创建解析树和组合向量,并映射其他分层关系(图1.14),这反过来又帮助我们找到组合单词和形成句子的规则。斯坦福自然语言推理小组开发了一种著名的、使用良好的算法,称为SNLI,这是应用递归网络的一个好例子。
▲图1.14 递归网络中单词的向量表示形式
05 卷积神经网络
卷积神经网络(CNN)(图1.15)使我们能够在计算机视觉中获得超人的性能,它在2010年代早期达到了人类的精度,而且其精度仍在逐年提高。
卷积网络是最容易理解的网络,因为它有可视化工具来显示每一层正在做什么。
Facebook AI研究(FAIR)负责人Yann LeCun早在20世纪90年代就发明了CNN。人们当时无法使用它,因为并没有足够的数据集和计算能力。CNN像滑动窗口一样扫描输入并生成中间表征,然后在它到达末端的全连接层之前对其进行逐层抽象。CNN也已成功应用于非图像数据集。
▲图1.15 典型的 CNN
Facebook的研究小组发现了一个基于卷积神经网络的先进自然语言处理系统,其卷积网络优于RNN,而后者被认为是任何序列数据集的首选架构。虽然一些神经科学家和人工智能研究人员不喜欢CNN(因为他们认为大脑不会像CNN那样做),但基于CNN的网络正在击败所有现有的网络实现。
06 生成对抗网络
生成对抗网络(GAN)由 Ian Goodfellow 于 2014 年发明,自那时起,它颠覆了整个 AI 社群。它是最简单、最明显的实现之一,但其能力吸引了全世界的注意。GAN的配置如图1.16所示。
▲图1.16 GAN配置
在GAN中,两个网络相互竞争,最终达到一种平衡,即生成网络可以生成数据,而鉴别网络很难将其与实际图像区分开。
一个真实的例子就是警察和造假者之间的斗争:假设一个造假者试图制造假币,而警察试图识破它。最初,造假者没有足够的知识来制造看起来真实的假币。随着时间的流逝,造假者越来越善于制造看起来更像真实货币的假币。这时,警察起初未能识别假币,但最终他们会再次成功识别。
这种生成–对抗过程最终会形成一种平衡。GAN 具有极大的优势。
07 强化学习
通过互动进行学习是人类智力的基础,强化学习是领导我们朝这个方向前进的方法。过去强化学习是一个完全不同的领域,它认为人类通过试错进行学习。然而,随着深度学习的推进,另一个领域出现了“深度强化学习”,它结合了深度学习与强化学习。
现代强化学习使用深度网络来进行学习,而不是由人们显式编码这些规则。我们将研究Q学习和深度Q学习,展示结合深度学习的强化学习与不结合深度学习的强化学习之间的区别。
强化学习被认为是通向一般智能的途径之一,其中计算机或智能体通过与现实世界、物体或实验互动或者通过反馈来进行学习。训练强化学习智能体和训练狗很像,它们都是通过正、负激励进行的。当你因为狗捡到球而奖励它一块饼干或者因为狗没捡到球而对它大喊大叫时,你就是在通过积极和消极的奖励向狗的大脑中强化知识。
我们对AI智能体也做了同样的操作,但正奖励将是一个正数,负奖励将是一个负数。尽管我们不能将强化学习视为与 CNN/RNN 等类似的另一种架构,但这里将其作为使用深度神经网络来解决实际问题的另一种方法,其配置如图1.17所示。
▲图1.17 强化学习配置
关于作者:谢林·托马斯(Sherin Thomas)的职业生涯始于信息安全专家,后来他将工作重心转移到了基于深度学习的安全系统。他曾帮助全球多家公司建立AI流程,并曾就职于位于印度班加罗尔的一家快速成长的初创公司CoWrks。
苏丹舒·帕西(Sudhanshu Passi)是CoWrks的技术专家。在CoWrks ,他一直是机器学习的一切相关事宜的驱动者。在简化复杂概念方面的专业知识使他的著作成为初学者和专家的理想读物。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在统计学分析、实验研究、业务数据复盘过程中,单因素方差分析是检验自变量对因变量是否存在显著影响的核心方法。其中,两个水平 ...
2026-05-26【核心关键词】算法、客户、大数据、互联网、调优、建模、模型优化、机器学习、评分卡模型、模型开发、智能风控、业务场景、数 ...
2026-05-26 很多数据分析师写过无数个 SELECT,但当被问到“新建一张表,该如何定义字段类型来保证数据质量”“创建视图和存储物理表有 ...
2026-05-26在数据清洗、统计分析与数据质量检测工作中,箱型图(又称箱线图、Box Plot)是最直观、最高效的可视化分析工具之一。相较于柱状 ...
2026-05-25在大数据分析、数据清洗、质量管控、风险监测等领域,异常数据识别是保障数据质量、确保分析结论精准、规避业务决策失误的核心基 ...
2026-05-25 很多数据分析师精通Excel函数和透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么关系 ...
2026-05-25数字化经营时代,企业的市场竞争早已从经验决策转向数据决策。门店营收、用户转化、产品销量、成本损耗、存量资产等所有经营行为 ...
2026-05-22在MySQL数据库日常运维、业务数据校验、数据迁移与数据清洗场景中,自增主键ID的连续性校验是一项基础且关键的工作。MySQL的Auto ...
2026-05-22 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-05-22【核心关键词】大数据、可视化、存储、架构、客户、离线、产品、同步、实时、数据仓库、数据分析、数据可视化、存储数据、离线 ...
2026-05-21在电商流量红利消退、公域获客成本持续走高的当下,存量用户深度挖掘已成为店铺增收增效的核心抓手。相较于付费投放获取的陌生新 ...
2026-05-21 很多数据分析师每天盯着几十个指标,但当被问到“这套指标要支撑什么业务目标”“指标之间是什么逻辑关系”“业务变化时如何 ...
2026-05-21在数据驱动决策的时代,数据质量直接决定分析结果的可靠性与准确性,而异常值作为数据清洗中的核心痛点,往往会扭曲分析结论、误 ...
2026-05-20 很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标在所有行业都适用”“哪些指标只对电商有意义”“二者如何搭 ...
2026-05-20Agent的能力边界,很大程度上取决于其掌握的Skill质量和数量。传统做法是靠人工编写和维护Skill,但这条路很快会遇到瓶颈。业务 ...
2026-05-20在统计分析中,方差分析(ANOVA)是一种常用的假设检验方法,核心用于分析“一个或多个自变量对单个因变量的影响”,广泛应用于 ...
2026-05-19 很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“什么是指标”“指标和维度有什么区别”“如何定义指标值的计算规则和 ...
2026-05-19想高效备考 CDA 一级,拒绝盲目刷题、冗余学习?《CDA 一级教材知识手册》重磅来袭!以官方教材为核心,浓缩 13 章 103 个核心考 ...
2026-05-19在数据统计分析中,卡方检验是一种常用的非参数检验方法,核心用于判断两个或多个分类变量之间是否存在显著关联,广泛应用于市场 ...
2026-05-18在企业数字化转型的浪潮中,很多企业陷入了“技术堆砌”的误区——上线了ERP、CRM、BI等各类系统,积累了海量数据,却依然面临“ ...
2026-05-18