当前位置:首页 > 解决方案 > 正文内容

Transformer,一个架构,如何改变了整个AI世界?

管理员4周前 (07-04)解决方案53

你有没有想过,ChatGPT为什么能跟你聊天?Sora为什么能生成视频?Midjourney为什么能画出惊艳的图片?

答案只有两个字——Transformer

2017年,Google的一篇论文《Attention Is All You Need》横空出世,提出了一种全新的神经网络架构,当时没有人想到,这个看似简单的模型,会在短短几年内彻底颠覆整个人工智能领域,甚至重新定义了人类与机器交互的方式。

我们就来聊聊这个改变世界的架构,到底牛在哪里。


在Transformer之前,AI是怎么处理序列的?

在Transformer出现之前,处理语言、语音、视频这类"序列数据"的主流方法是RNN(循环神经网络)和它的升级版LSTM(长短期记忆网络)

它们的思路很直观:像人读书一样,一个字一个字地读,读到后面的时候,把前面的信息",然后综合起来理解整句话的意思。

听起来很合理对吧?但问题来了——太慢了,而且记不住太多东西。

RNN是串行处理的,必须等前一个词处理完才能处理下一个词,这就意味着你没法并行计算,训练速度极慢,而且当句子很长的时候,前面的信息传到后面就已经"衰减"得差不多了,这就是所谓的"长距离依赖问题"。

打个比方:你让一个人听一段1000字的演讲,然后问他第一个字说了什么,他大概率已经忘了,RNN就是这个"记性不好的听众"。


Transformer的核心武器:自注意力机制(Self-Attention)

Transformer直接抛弃了"一个字一个字读"的思路,它说:我要一眼看到所有的字,然后自己判断哪些字之间有关系。

这就是自注意力机制(Self-Attention)的精髓。

举个例子:"小明把苹果递给了小红,因为饿了。"

当模型读到"她"这个字的时候,它需要知道"她"指的是谁,通过自注意力机制,模型会自动计算"她"和句子中每个词的关联程度,然后发现"她"和"小红"的关联度最高,于是正确理解了这句话的含义。

更厉害的是,Transformer用了多头注意力(Multi-Head Attention),相当于让模型从多个不同的"角度"去理解句子,一个头关注语法关系,一个头关注语义关系,一个头关注指代关系……最后把这些信息综合起来,得到一个极其丰富的理解。

因为不需要按顺序一个字一个字处理,Transformer可以完全并行计算,训练速度比RNN快了几十倍甚至上百倍,这就是为什么后来的GPT、BERT这些大模型能够在海量数据上训练的根本原因。


从Transformer到大模型:一条清晰的进化之路

Transformer架构诞生之后,AI领域迅速分化出了两条主线:

第一条线:编码器路线(Encoder)——以BERT为代表。

BERT的思路是"双向理解",它同时看左边和右边的上下文,特别擅长做理解类任务,比如文本分类、情感分析、问答系统,Google搜索早就在用BERT了,你可能每天都在用,只是不知道。

第二条线:解码器路线(Decoder)——以GPT为代表。

GPT的思路是"单向生成",它只看左边的上下文,然后预测下一个字是什么,一个字一个字地生成,就像人说话一样,这条路线最终诞生了GPT-3、GPT-4,以及让全世界震惊的ChatGPT。

而到了2022年,OpenAI又把这两条线合在了一起,推出了InstructGPT和ChatGPT,用人类反馈强化学习(RLHF)让模型不仅能生成文本,还能按照人类的意图来生成——这才是真正让AI走进千家万户的关键一步。


Transformer不止于语言:它正在吞噬一切

很多人以为Transformer只是用来处理文字的,那就太小看它了。

Vision Transformer(ViT) 把图片切成一个个小块,当成"单词"一样喂给Transformer,结果在图像分类任务上直接超越了CNN。

Audio Spectrogram Transformer(AST) 把音频的频谱图当成图像来处理,实现了音频分类的突破。

Sora 更是直接用Transformer架构来生成视频,把视频也切成一个个"时空补丁(spacetime patches)",然后用Transformer来学习这些补丁之间的关系。

甚至在蛋白质结构预测(AlphaFold)药物发现数学推理等领域,Transformer都展现出了惊人的能力。

可以说,Transformer已经不是一个模型了,它是一种通用的计算范式,正在成为AI时代的"操作系统"。


Transformer的局限与未来

Transformer也不是完美的。

最大的问题就是计算量太大,GPT-4的参数量据传超过万亿级别,训练一次的成本高达数千万甚至上亿美元,而且Transformer的注意力机制是全局计算,序列长度每增加一倍,计算量就增加四倍,这让处理超长文本变得极其昂贵。

所以现在学术界也在探索各种改进方案:比如线性注意力(Linear Attention)Mamba(状态空间模型SSM)RWKV等等,试图在保持Transformer性能的同时降低计算成本。

但不管怎么变,Transformer奠定的"注意力机制+大规模预训练"这条路线,在可预见的未来,依然是AI发展的主旋律。


写在最后

2017年,那篇只有8页的论文,可能是人工智能历史上最具影响力的论文之一。

它没有用什么花里胡哨的技巧,就是一句话:Attention Is All You Need(注意力就是你所需要的一切)。

七年过去了,这句话不仅没有过时,反而越来越被验证是对的。

如果你是一个AI从业者、创业者、或者只是一个对未来感兴趣的普通人,我建议你一定要深入理解Transformer,因为在这个时代,理解Transformer,就是理解AI的现在和未来。


觉得有用的话,点个赞、转发一下,让更多人看到,我们下期见! 🚀

重庆服务器托管 重庆服务器租用 租用服务器 托管服务器 主机租用 主机托管 云服务器 机柜租用 大带宽 企业建站 小程序开发

扫描二维码推送至手机访问。

版权声明:本文由重庆服务器发布,如需转载请注明出处。

本文链接:http://www.aaidc.net/news/?id=572

标签: Transformer

“Transformer,一个架构,如何改变了整个AI世界?” 的相关文章

网站型服务器托管,专业服务与高效管理的完美结合

随着互联网的飞速发展,网站型服务器的托管已经成为企业信息化建设不可或缺的一部分,作为自媒体作者,今天就来为大家介绍网站型服务器托管的相关知识,帮助大家更好地选择合适的托管服务。什么是网站型服务器托管网站型服务器托管是指将企业的服务器设备、网络资源以及相关的技术支持和服务进行集中管理和运营,通过专业的...

大足区企业建站的成本分析

随着互联网的普及和技术的不断发展,越来越多的企业开始重视网站建设,将其作为宣传和推广的重要渠道,对于位于重庆市的大足区企业来说,建立一个具有影响力的网站更是刻不容缓,本文将详细探讨大足区企业建站的成本构成及大致费用,帮助企业决策者更好地了解和规划建站预算。企业建站成本构成1、网站域名注册费用域名是企...

石柱企业建站费用详解,了解建站成本,预算更合理

随着互联网的发展,企业建站已成为企业宣传、营销的重要手段,石柱企业建站需要考虑的一个重要问题就是建站费用,本文将详细解析石柱企业建站的费用构成,帮助企业在预算建站成本时更加合理。石柱企业建站费用构成1、域名注册费用域名是企业网站的地址,是网站的重要组成部分,域名的注册费用因域名后缀不同而有所差异,常...

彭水企业建站需要多少钱?全面解析建站成本与因素

随着互联网技术的不断发展,越来越多的企业开始重视网站建设,希望通过互联网拓展业务、提升品牌影响力,彭水地区的企业也不例外,对于想要建站的企业来说,了解建站成本是非常重要的一环,本文将详细解析彭水企业建站所需的费用,帮助企业在预算和决策过程中做出明智的选择。企业建站成本构成1、域名注册费用域名是企业网...

AI绘画,艺术与科技的完美融合

随着科技的飞速发展,人工智能(AI)已经逐渐渗透到我们生活的方方面面,其中就包括艺术领域,AI绘画作为人工智能的一个重要分支,正在以其独特的魅力改变着绘画领域,让艺术创作变得更加便捷、高效和多元化,本文将深入探讨AI绘画的发展历程、技术原理、应用领域,以及它给艺术家和观众带来的变革。AI绘画的发展历...

云南服务器工作站,科技力量与数字化发展的交汇点

随着信息技术的飞速发展,服务器作为数字化时代的重要基础设施,发挥着越来越重要的作用,云南服务器工作站作为这一领域的重要组成部分,不仅推动了地方信息技术的进步,更成为了科技力量与数字化发展的交汇点。云南服务器工作站概述云南服务器工作站是云南省信息技术领域的重要基础设施之一,主要提供高性能的服务器托管服...