「AI科普」小白也能看懂GPT和人工智能,NLP、预训练、机器学习、深度学习、神经网络……这都是啥?_学习_GPT

  • 「AI科普」小白也能看懂GPT和人工智能,NLP、预训练、机器学习、深度学习、神经网络……这都是啥?_学习_GPT已关闭评论
  • A+
所属分类:生财干货

领500g书库,关注公众号:程叫兽的宝藏 (长按可复制!)

关注我

热门下载区==>点此链接进入<<<

扫上面二维码获取原文

「AI科普」小白也能看懂GPT和人工智能,NLP、预训练、机器学习、深度学习、神经网络……这都是啥?

作为一个产品经理、非技术人士,想对GPT和涉及到的AI知识有一个整体的认知和理解,但是市面上的内容要么太专业、要么过于浅显,同时没有对常见的自然语言处理、深度学习等名词作解释,于是把自己学到的内容沉淀下来,分享给同样有需要的人。

本文主要分为4个部分,第一部分是用大白话理解GPT,第二部分补充一些基础的AI知识、名词解释、关系;因为我是借助GPT理解并学习的,所以第三部分分享下「我是怎么用GPT学习GPT的」,第四部分是比较详细的技术知识、优缺点等,辅助进一步理解,或者也可以作为存档,随时回来搜索。

大家有问题可以在评论区说,我尽量解答,以及补充完善。

一、GPT介绍

1、基础介绍

定义

说人话/极速版理解:

GPT厉害的点在于通过「

预训练」有了上下文理解

、「

自回归方式」生成流畅长文本

,因为是预训练,

在前期

大量

的数据学习,所以可以处理

多领域

的语言问题,具有

少量样本学习能力,

反应也比较迅速。

(这里提到的技术,后面都会一一讲到)

GPT

没有理解功能,只是一个模型。 实质功能/

底层原理就是「单字接龙」

,是对于下一个字的预测。

生成句子的话,就用到了「自回归生成」,gpt自己套娃预测。

比如,给gpt“我”,预测出了“想”,然后再基于“想”预测,可能是“吃”可能是“睡”。

那怎么生成长文呢?Transformer架构里有一个

注意力机制,

擅长

「捕捉长距离依赖关系」,

不拘泥于上下文。

模型训练的

目的

是学习

「提问和回答的通用规律」

。它只学习提问和回答的

模式

,并不记忆数据库,

基于数据和学到的规律生成全新的回答

,所以有时候会

胡说八道

。这和搜索引擎不同,搜索引擎只能回答它记得的数据库里的信息。

因为

训练的数据足够多

,就成了

大模型

,本来是只能「单字接龙」,

但是训练着能够

理解“指令”、学习范文

、还可以「步步

连续推理

,从而提升正确率」(思维链),这一现象也叫

涌现

。(现在似乎不清楚为啥出现)

所以在回答问题时,它更像是个人一样。它用学到的大量数据来模拟各种情景、角色和语气,同时可以生成有逻辑关系的长文。

GPT(Generative Pre-trained Transformer)是一种基于变换器(Transformer)架构的预训练语言(Pre-trained)模型,是大语言模型。

2、训练过程

说人话/极速版理解:先是海量数据尽情学,然后模版规范纠正,最后是激励引导输出有创意的内容。

3个学习环节用到了不同的学习算法。

1、尽情学:无监督学习

能力:单词搭配、语法规则,同一个意思的多种表达,编程语言,多个语种等等

问题:回答形式和内容不受约束

2、模版规范:监督学习

用优质对话模版进行训练,并知道什么有害,什么是正确的。

比如问怎么撬锁,要回答撬锁是不对的。

在训练过程中,

采用先海量数据投喂、然后再模版规范纠正的流程,主要

考虑海量数据的内容涉猎广泛而且优质的模版、数据对标注有一定要求,成本较高

模版规范后有了理解指令和例子的能力

1)语境内学习的能力

多个范文投喂后,chatgpt 可以根据例子生成新内容

2)分治能力/

思维链/分步学习的能力:

可以步步连续推理,从而提升正确率

。模仿人类面对复杂问题时的分步思考。

3、创意引导(强化学习)

跳出内容的模版化,通过正负反馈激励 ChatGPT 生成复合模版形式的创意回答。

3、GPT 缺点

因为只是学习「一种模式」,可以理解为函数,所以内容

无法被直接增删改查

,信息和规律以模型呈现。

1、较难全面评估,比如不知道模型具体的学到了什么规律(可以对比 Excel 中内容可以直观看到),只能通过提问评估和猜测,在应用中会有一定的安全风险。

2、更新效率低,想要纠正某个问题,对比 Excel 直接删改,模型只能通过再次训练进行调整。

3、

高度依赖数据,数据足够多才能学到通用规律,

否则会出现以偏概全的情况,同时避免胡编和混淆。

二、涉及的常见技术名词和关系

常见名词间的关系:

自然语言处理(NLP)是一个处理文本数据的任务,目前大语言模型(LLM)(熟知的是GPT)处理的效果显著。GPT是基

于Transformer架构

预训练语言模型

机器学习>>深度学习>>神经网络>>大语言模型(如GPT)

深度学习是机器学习的一部分,神经网络是深度学习的核心,大语言模型是神经网络的一个子类型。GPT是常见的大语言模型。

「AI科普」小白也能看懂GPT和人工智能,NLP、预训练、机器学习、深度学习、神经网络……这都是啥?_学习_GPT

可以 训练
语言 学习
可以 理解
学习 数据
学习 理解