(一文读懂)大模型到底是怎么生成文字的?

前言

在人工智能的领域,大模型在去年已经成为了一个热门的话题。

各大厂商如谷歌、微软、OpenAI等,都在积极研发和应用大模型技术。

这些模型在语言理解、图像识别、推荐系统等方面都表现出了惊人的能力,甚至在某些任务上,已经超越了人类的表现。

或许你用过,惊叹于它的神奇,或许你没有用过,听着它的传奇。无论如何,都懂那么一点点,但很难讲的清,它到底是怎么生成的?

我们接下来就讲透它生成的原理,并了解四种构建AI应用的大模型技术架构。

01

大模型的生成原理

首先,我们要了解的是,GPT大模型是一种基于深度学习的自然语言处理模型,也就是LLM。

(敲黑板,LLM是一种生成文字的模型,文生图比如DALL·E,它和LLM都是多模态语言模型的分支)

它的工作原理可以简单地理解为**“学习语言的规律”,它的生成方式只是根据上文,猜下一个词的概率。**

**
**

图片

那它为什么会掌握这么多的知识?

那是因为在模型训练过程中,GPT模型会阅读大量的文本数据,然后学习这些文本中的语言规律。

这个过程可以类比为人类学习语言的方式。当我们是婴儿时,我们会通过听父母和周围的人说话,学习语言的规律。

比如,我们会学习到“我”通常后面会跟“是”,“你”通常后面会跟“好”等等。这就是一种语言规律。GPT模型就是通过类似的方式,学习语言的规律。

但是,GPT模型的学习能力远超人类。

它可以阅读数以亿计的文本,学习到非常复杂的语言规律。这就是为什么GPT模型可以生成非常自然、连贯的文本。

02

GPT模型如何学习语言的规律

说到这里,需要我们了解一下GPT模型的内部结构。

GPT模型是由多层神经网络组成的。每一层神经网络都可以抽取文本的某种特征。比如:

第一层神经网络可能会抽取出单词的拼写规律;

第二层神经网络可能会抽取出词性的规律;

第三层神经网络可能会抽取出句子的语法规律等等。

通过这种层层抽取,GPT模型可以学习到非常深层次的语言规律。

当GPT模型生成文本时,它会根据已有的文本,预测下一个单词,整体就是通过这种方式,生成连贯的文本。

当然,这只是一个非常简化的版本。实际上,GPT模型的工作原理还涉及到很多复杂的数学和计算机科学知识。

03

大模型的四种应用技术架构

大模型的厉害之处,其实不止在于它很像我们人学习语言,而更大的作用在于它未来会改变我们的生活和职场。

从整体现有最新的架构来看,其实有四种大模型的应用架构,从上往下,依次从简单到复杂。

第一种:Prompt(指令工程)

指令工程听着好像很遥远,其实就是通过下面这个输入框触发的:

图片

看上去简单,但这个很考验一个人写prompt的“功力”。

prompt的作用就是通过引导模型生成特定类型的文本。一个好的prompt可以引导模型以期望的方式生成文本。

例如,如果我们想让模型写一篇关于全球变暖的文章,我们可以给模型一个prompt,如"全球变暖是一个严重的问题,因为…"。模型会根据这个prompt生成一篇文章。

这种方法的优点是简单直观,但缺点是可能需要大量的尝试才能找到一个好的prompt。

第二种:Function calling(函数调用)

Function calling是一种更深入的应用架构,它通过调用模型的内部函数,直接获取模型的某些特性。

例如,我们可以调用模型的词向量函数,获取单词的词向量。

这种方法的优点是可以直接获取模型的内部信息,但缺点是需要深入理解模型的内部结构。

第三种:RAG(Retrieval-Augmented Generation)

RAG是一种结合检索和生成的应用架构。

在这种方法中,模型首先会检索相关的文本,然后用这些文本作为输入,让模型生成答案。

例如,如果我们想让模型回答一个关于全球变暖的问题,模型可以先检索到一些关于全球变暖的文章,然后根据这些文章生成答案。

这种方法的优点是可以利用大量的外部信息,提高模型的生成质量。但缺点是需要大量的计算资源,因为需要对大量的文本进行检索。

第四种:Fine-tuning(微调)

Fine-tuning是一种在特定任务上进一步训练模型的应用架构。(如计算钢材的消耗量等等。)

在这种方法中,模型首先会在大量的文本上进行预训练,学习语言的基本规律。然后,模型会在特定任务的数据上进行fine-tuning,学习任务的特定规律。

例如,我们可以在情感分析任务上fine-tuning模型,让模型更好地理解情感。

这种方法的优点是可以提高模型在特定任务上的表现,但缺点是需要大量的标注数据。

最后的话

总的来说,GPT大模型生成结果的原理,就是通过学习语言的规律,然后根据已有的语境,预测下一个单词,从而生成连贯的文本。

这就像我们人类说话或写文章一样,根据已有的语境,预测下一个单词或短语。

只不过,GPT模型的学习能力和生成能力,远超我们人类。

我们可以看到,AI在学习我们人类,它们不知疲倦,孜孜以求,我们人类也应该向它们学习,不带批判和有色眼镜的看待身边人的观点,用仅剩的群体智慧来继续引领我们走向下一个新世界。

如何学习大模型 AI ?

由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范

第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署

第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建

第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型
  • 带你了解全球大模型
  • 使用国产大模型服务
  • 搭建 OpenAI 代理
  • 热身:基于阿里云 PAI 部署 Stable Diffusion
  • 在本地计算机运行大模型
  • 大模型的私有化部署
  • 基于 vLLM 部署大模型
  • 案例:如何优雅地在阿里云私有部署开源大模型
  • 部署一套开源 LLM 项目
  • 内容安全
  • 互联网信息服务算法备案

学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。

如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/bicheng/22843.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

【JS红宝书学习笔记】第6章 集合引用类型

第6章 集合引用类型 对象 数组与定型数组 Map、WeakMap、Set 以及 WeakSet 类型 1. object 很适合存储和在应用程序间交换数据。 显式创建object的两种方式: (1)new操作符 let person new Object(); person.name "Nicholas";…

MySQL是怎么保证持久性的(redo log日志相关)

Mysql中 事务的很多实现,都是因为有日志的支撑,比如binlog、undo log、redo log等 MySQL是怎么保证持久性的 持久性是指,事务一旦提交,它对数据库的改变就应该是永久性的,接下来的其他操作或故障不能对其有影响。In…

大数据数据治理

大数据数据治理介绍 大数据数据治理是一个复杂的过程,涉及到数据的标准化、融通、关联、解析、聚合等一系列活动。其核心目标是在确保数据安全的基础上,提高大数据资源和资产的可用性、易用性和可靠性,从而显著提升大数据资源和资产的价值7。…

Ktor库的高级用法:代理服务器与JSON处理

在现代网络编程中,Ktor是一个高性能且易于使用的框架,它提供了对异步编程、WebSockets、HTTP客户端和服务器等特性的原生支持。Ktor是使用Kotlin语言编写的,充分利用了Kotlin的协程特性来简化异步编程。本文将深入探讨Ktor库的高级用法&#…

AlDente Pro for Mac(电池最大充电限制工具)v1.24激活版

AlDente Pro for Mac是一款运行在MacOS平台上专业的电池最大充电限制工具。通过 AlDente Pro 您可以设置电池的最大充电百分比设置为 20% 至 100%,然后,它将保持在所需的电池百分比,然后再次使用电源适配器进行充电。 …

安徽某高校数据挖掘作业4-5 (与一些碎碎念)

1. 编写程序求函数、、的极限。 解答: import sympy as sp# 定义符号变量 x x sp.symbols(x)# 定义函数 f1 sp.sin(20 * x) / x f2 (1 4 * x)**(2 / x) f3 (1 4 / x)**(2 * x)# 计算极限 limit1 sp.limit(f1, x, 0) limit2 sp.limit(f2, x, 0) limit3 sp…

跨域请求解决方法----不允许有多个 ‘Access-Control-Allow-Origin‘ CORS 头

后端配置了代码: spring:application:name: spzx-server-gatewaycloud:nacos:discovery:server-addr: localhost:8848gateway:discovery:locator:enabled: trueglobalcors:cors-configurations:[/**]:allowedOriginPatterns: "*"# 允许请求中携带的头信息…

连锁门面预付费电表管理系统

1.什么叫连锁门面预付费电表管理系统? 连锁门面预付费电表管理系统是一种前沿的电力管理解决方案,尤其适用于拥有众多分店的服务提供商。该系统容许用户使用电力以前预先支付花费,有效解决传统式后付模式的收支明细纠纷案件和扣费难题。 2.系统的核心…

非递归实现快排排序及归并排序(尾篇)

1.快速排序(双指针实现) 2.非递归实现快排 3.递归实现归并排序 4.非递归实现归并排序 5.总代码 1.快速排序(双指针实现) 俩有个指针一前一后的排放着,cur先走并且去找比kye对应值小的数组值,一旦找到后…

x86国产化麒麟系统上安装docker及问题解决

以前感觉安装docker没有问题,所以没有记录怎么安装的,最近在国产化系统上安装docker总是失败,经过仔细研究完全解决了该问题,特此记录。 参考链接: 在 OpenKylin 上安装 Docker 按照上面的链接可以知道整个docker安装…

EMC整改学习-笔记

EMC整改学习-笔记 来自赛盛技术的笔记 如果我拿到一个产品超标的一个频谱图的话,首先我们可以对比做一个分析。来确定你干扰源的一个分类和定义是哪些。是你这个产品类型,什么样的电路对应什么样的一个。从我们的一个大量的一个测试数据的经验来看&…

超全面,编程语言汇总,看看哪些语言适合GIS开发?

最近总有很多人关心GIS开发语言的问题,这个确实很重要,毕竟学习一门编程语言需要花费不少时间和精力,找不到合适GIS的编程语言意味着浪费时间。 首先我们来简单看一下常见的编程语言有哪些,后续再给大家介绍哪些语言适合GIS开发&a…

如何获知SylixOS某API调用方法?

问题背景 SylixOS从2006年韩总在大学时开始开发,到今年2024年已走过18个年头,这18年一直在不断迭代更新,也经过无数实际项目的考验,SylixOS无论从功能还是性能上看,都毫无疑问是世界一流的大型实时操作系统。 但实时…

AI大模型还没有到卷长文的时候

AI风口上,国内大模型技术突飞猛进,很多人都沉浸在用AI来辅助办公,辅助学习等等工具化应用落地,但也有趁着风口想大赚一笔,为了估值什么都敢说的。 前几天,Kimi对外宣称自己的技术狂飙到能读200万字甚至100…

标准发布 | 高氨氮废水厌氧氨氧化处理应用技术规范

高氨氮废水厌氧氨氧化处理应用技术规范 Technical specification for anammox treatment of high strength ammonia nitrogen wastewater 一、编制单位 本文件由中华环保联合会水环境治理专业委员会提出。 本文件由中华环保联合会归口。 本文件主编单位:北京城市…

SSRF思路及步骤

什么是SSRF? SERVER SIDE REQUEST FORGERY的简写 因为服务器本身提供了资源获取相关的服务,在资源地址能够被用户控制时,将可能导致攻击者利用服务器身份获取预期外的资源的后果 危害? 条件满足的情况下:突破网络防…

佛教祭拜小程序-寺庙小程序-纪念馆小程序

大家好,我是程序员小孟。 现在有很多的产品或者工具都开始信息话了,寺庙或者佛教也需要小程序吗? 当然了! 前面我们还开发了很多寺庙相关的小程序,都有相关的介绍: 1,优质的寺庙小程序-H5寺庙网页 今天…

机器学习多场景实战

机器学习已不再局限于理论探讨,而是广泛渗透到我们生活的方方面面,成为解决复杂问题、优化决策过程的强有力工具。从智能推荐系统个性化推送你可能喜爱的电影和商品,到金融风控领域精准识别欺诈交易;每一个应用场景都是机器学习技…

(学习笔记)数仓建模

数仓建模 OLAP数仓分层数据模型数据模型建设方法模型建设具体流程模型数据域事实表设计事实表拉链表 数据模型规范表命名(采用阿里one-data设计)字段命名(采用阿里one-data设计)数据模型标注规范 数据模型发展周期 OLAP OLTP:概念全称OnLine Transaction Processin…

实验七、创建小型实验拓扑《计算机网络》

早检到底是谁发明出来的。 一、实验目的 完成本实验后,您将能够: • 设计逻辑网络。 • 配置物理实验拓扑。 • 配置 LAN 逻辑拓扑。 • 验证 LAN 连通性。 二、实验任务 在本实验中,将要求您连接网络设备并配置主机实现基本的网络…