拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

【白话大模型一】一次搞懂大模型和机器学习

【白话大模型一】一次搞懂大模型和机器学习

1大模型能用来做什么

①ai自然语言编程(Vibe Coding)
可以通过直接对ai输出自己的想法或灵感,实现低代码甚至零代码完成开发,真正的想法即代码。(这个后期我还会再讲,过程中涉及提示词还有skill一类的,非常有趣)
②ai对话图像处理
依旧一句话精简概括所想即所得,非常强大,很方便。几乎可以达到以假乱真。
③ai智能体操控腾讯会议
重新定义了人与机器的协作边界,直接让对话机器人具备自主感知,规划决策与工具调用能力的数字行动者。(可以通过微信对话预定腾讯会议)

2大模型是什么

本质:对人类智能的模拟

• 强⼈⼯智能:⽬标是制造出真正拥有⼼智、意识、能理解⾃⾝存在的机器。
• 弱⼈⼯智能:专注于在特定领域表现出智能⾏为,像⼈⼀样做得好,甚⾄更好。

3机器学习(Machine Learning)

机器学习(Machine Learning),英⽂缩写为ML,是⼈⼯智能的⼀个⼦领域,其核⼼不再是⼿动编写规则,⽽是通过数据训练算法,让计算机从历史样本中⾃动总结规律,⽤以预测或决策新问题。
⼈⼯智能和机器学习到底是什么关系呢?⼈⼯智能是⽬标,机器学习是实现该⽬标的主要⼿段。当代⼈⼯智能≈基于机器学习的⼈⼯智能。
本质:给定输⼊和输出 ,让机器⾃⼰找到那个函数 。

怎么理解这个本质呢?
⽐如我们打⻋,起步价10元(固定成本),每公⾥2元,求⼀下打⻋20公⾥多少钱?这个公式对我们来说⾮常简单就可以求解出来y=2x+10,这就是费⽤的计算规律。
那机器学习是什么呢?告诉你有下⾯的数据,然后需要计算⼀下X=20公⾥的时候,费⽤是多少?
设y=ax+b,然后代⼊2组数据,可以求出来a=2,b=10。然后我们
根据规律求出来20公⾥的时候费⽤是50块钱。
这个求出的a,b就是机器学习中的参数;(⼈类)输⼊给机器的原始素材x就是特征;机器学习对⽐我们⼈⼯求出来的这个过程是⾃动化求解,不需要我们⼈⼯代⼊数据去求解,这个⾃动化找参数的过程就叫模型训练(training)或者学习(learning);⽽且机器的x和y在现实世界中不全是数字,可以是复杂的问题,图⽚,语⾳等。y=2x+10就是我们训练好的数学模型。有了模型以后,我们根据X=20公⾥,计算费⽤总的费⽤为50,这个过程就叫做推理(inference)/预测(Prediction)。
实际⼯作中我们真正的模型往往很难如此简单,举个例⼦,我们要实现⼀个简单的图像分类,⽐如区分下图⽚⾥⾯是⻋还是⼈?我们要学习的函数变成了下⾯的形式,⻋和⼈我们很难⽤简单的⼏个参数来表⽰,就需要⽤机器学习来完成,学习到的参数往往也是⼏万⼏⼗万的参数,很难通过简单的⽅式
来进⾏解释。
我们参与训练的图⽚和标签往往叫做样本,其中图⽚称为特征,Y称为标签,特征和标签组成了样本整体称为训练数据.

4机器学习分类

4.1 按照反馈信号分类:

监督学习
无监督学习
半监督学习(医疗影像)
自监督学习(大模型核心预训练范式)
强化学习

4.1.1监督学习

监督学习是机器学习和⼈⼯智能中的⼀种算法学习训练⽅式。模型通过标记好的训练数据进⾏学习,⽬标是建⽴输⼊与输出之间的映射关系。监督学习靠“外部标准答案”(⼈⼯标签)反馈。有对错,直接纠正。

4.1.2无监督学习

⽆监督学习的核⼼定义可以概括为:在完全没有“标签”(即标准答案)的情况下,让算法⾃⾏从输⼊数据中发现隐藏的结构、规律或模式,靠“数据内在结构”反馈。没有对错,只找规律。

4.1.3半监督学习

半监督学习利⽤少量“有标签”的数据(带标准答案)和⼤量“⽆标签”的数据(⽆答案)共同进⾏训练,以此来提升模型的预测精度。介于两者之间,在我们拥有相对较少的标记数据和⼤量未标记数据的情况下,半监督学习结合了监督学习和⽆监督学习的优势,于是在此时可以发挥很好的作⽤。在
海量数据⾯前,⼿动标记数据的成本过于⾼昂且繁琐,⽽未标记的数据很多、易于获取,且每⽇都会产⽣⼤量的数据。因此,我们可以只标记数据集中的⼀部分,⽽不是标记整个数据集,然后⽤半监督学习⽅式来学习。
半监督做法:
1.⽤500张医⽣标注好的⽚⼦训练⼀个初始模型。
2.让该模型去预测10,000张未标注的⽚⼦。
3.挑选模型预测结果中置信度极⾼(⽐如99%确定是肺炎)的图⽚,给它们打上“伪标签”(Pseudo-label)。
4.将这些带有伪标签的数据加⼊训练集,重新训练模型。

4.1.4自监督学习

⾃监督学习利⽤数据本⾝的结构来“⾃动⽣成”监督信号(即伪标签)。⾃监督学习⽬前是AI界的宠⼉,它是⽆监督学习的⼀种特殊形式,但其“学习过程”却极像监督学习。既然⼈⼯标注(Labeling)太贵,那就让数据“⾃⼰标注⾃⼰”。模型通过隐藏数据的⼀部分,然后尝试预测这部
分内容。它与半监督学习的核⼼区别在于:半监督学习仍依赖少量真实标签,⽽⾃监督学习完全不⽤标签。
⾃监督学习(Self-Supervised Learning,SSL)是⼀种让机器学习模型“⾃学成才”的范式。它最⼤的特点是,不需要昂贵的⼈⼯标注数据,⽽是从海量的⽆标签原始数据中,⾃动“创造”出训练所需的“标签”或“监督信号”
** 扩散模型(DiffusionModel)**的⼯作过程就是⼀个⾃监督学习的过程,它通过⼀套⾃给⾃⾜的逻辑来摸索世界的规律。
第⼀步:⾃导⾃演的“恶作剧”(加噪-Forward Process)
想象你⼿⾥有⼀张清晰的《蒙娜丽莎》拼图。

  1. 操作:你往拼图上撒了⼀把沙⼦(噪声),遮住了⼀点细节。
  2. 继续:你⼜撒了⼀把沙⼦,画⾯变得模糊了。
  3. 终点:最后你撒了⽆数把沙⼦,原来的画完全看不⻅了,只剩下⼀堆灰⾊的沙⼦。
    为什么是⾃监督?因为在这个过程中,“沙⼦”是你亲⼿撒的。你知道每⼀时刻加了多少沙⼦,也知道原图⻓什么样。这种“答案就在⾃⼰⼿⾥”的过程,就是⾃监督。
    第⼆步:苦练“还原术”(去噪-Reverse Process)
    现在,你把这堆“沙⼦”交给模型,对它说:“我刚才往画上撒了沙⼦,请你把刚才那⼀层沙⼦从画上‘吹’⾛,还原回前⼀秒的样⼦。”
    • 前置任务:模型的⽬标不是直接变出⼀张画,⽽是预测并减去那层沙⼦。
    • 反复横跳:模型会不停地对⽐:
    ◦ 它以为的沙⼦vs实际上你撒的沙⼦。
    ◦ 它还原出的画vs你⼿⾥的原图。
    学到了什么?为了把沙⼦吹⼲净,模型必须理解画作的内在规律。它得知道:
    • “这⾥有⼀条弧线,沙⼦下⾯可能是⼀个嘴⻆。”
    • “这⾥的颜⾊很暗,沙⼦下⾯应该是头发。”
    • “如果我胡乱吹,画出来的东西就不像‘画’,⽽像碎纸屑。”
    第三步:⽆中⽣有的“超能⼒”(采样-Sampling)
    当模型练成了“顶级还原术”后,神奇的事情发⽣了。
    即使你给它⼀堆全新的、完全随机的沙⼦(纯随机噪声),并对它说:“去吧,把这堆沙⼦⾥多余的东西吹掉。”
    模型会凭借它在训练中学到的“经验”(即图像的概率分布),在虚⽆中⼀点点勾勒出线条、⾊彩和结构。它以为⾃⼰在“还原”⼀张不存在的画,结果却创造出了⼀张全新的、写实的图像。
    这就像⼀个学画画的⼈,每天的任务不是临摹名画,⽽是把名画打碎成粉末,再尝试把粉末粘回去。久⽽久之,即便不看原图,他也能⽤粉末堆出⼀幅⼤师级的作品。

4.1.5强化学习

如果说监督学习是“照答案做题”(有标准答案),⽆监督学习是“⾃⼰找规律”(没有答案),那么强化学习就是“在试错中积累经验,追求⻓期收益最⼤化”。
强化学习通过与环境交互来学习。它没有直接的标签,⽽是通过“奖励”或“惩罚”来优化⾏为策略,⽬标是获得最⼤的⻓期累积奖励。它的核⼼逻辑和我们训练宠物狗⼀模⼀样:做对了,给块⾁⼲(奖励);做错了,轻轻呵斥(惩罚)。久⽽久之,它就知道在什么情况下该做什么事,以获得最多的⾁⼲。

4.2以AlphaGo为例

第⼀阶段:通过“打谱”进⾏监督学习
这是AlphaGo的启蒙阶段。研究⼈员会输⼊海量⼈类⾼段位棋⼿的历史对局棋谱,让模型像⼈类初学者⼀样“打谱”学习。
• 学习⽅式:监督学习。
• 具体做法:模型学习“在某个棋局下,⼈类⾼⼿通常会下在哪⾥”。它的⽬标不是赢棋,⽽是尽可能准确地模仿⼈类的落⼦选择。
• 成果:经过这个阶段,AlphaGo已经拥有了超越绝⼤多数⼈类棋⼿的棋感,学会了合理的下法。
第⼆阶段:通过“左右互搏”进⾏强化学习
这是AlphaGo超越⼈类、实现进化的核⼼阶段。它的学习⽅式从“模仿⼈类”转变为“⾃我探索”。
• 学习⽅式:强化学习。
• 具体做法:
a. ⾃我对弈:让第⼀阶段训练出的多个不同版本的策略⽹络相互对弈数⼗万甚⾄数百万局。
b. 获得奖励:对弈的最终结果(赢或输)就是唯⼀的“奖励信号”。赢了,说明这局棋的策略是好的;输了,则说明需要改进。
c. 优化策略:模型的⽬标是最⼤化赢棋的概率。它会不断调整⾃⼰的下棋策略,淘汰那些导致失败的策略,强化那些能带来胜利的策略。
• 成果:通过这种“左右互搏”,AlphaGo不再局限于⼈类棋谱,⽽是⾃⼰创造出了许多⼈类从未⻅过的、极具创造⼒的新下法,⽐如那招让所有棋⼿震惊的“第37⼿”。这标志它真正超越⼈类知识的边界。
第三阶段:AlphaGo Zero摆脱⼈类偏⻅
值得⼀提的是,DeepMind后来发布的 AlphaGo Zero 版本,进⼀步印证了强化学习的强⼤。
• 彻底摆脱⼈类:AlphaGo Zero完全摒弃了第⼀阶段的监督学习,它不再需要任何⼈类棋谱。
• 真正的“从零开始”:它只被告诉围棋的基本规则,然后就开始和“⾃⼰”下棋,通过纯粹的强化学习,在短短40天内就成为了史上最强的围棋AI,并以100:0的战绩完胜击败李世⽯的旧版AlphaGo
各个类别的反馈信号
• 监督学习:信号来⾃⼈⼯标注
• ⽆监督学习:信号来⾃数据本⾝的内在结构
• ⾃监督学习:信号由数据⾃动构造
• 强化学习:信号来⾃环境给出的奖励(延迟、数值型)

4.3按照机器学习的任务分类:

分类
回归
聚类
序列预测
深度学习

4.3.1分类

分类是⼀种监督学习任务,旨在根据输⼊数据的特征,将其划分到预先定义好的、离散的类别标签中。机器学习可以通过对已知类别的数据进⾏学习,从⽽对未知类别的数据进⾏分类。⽐如在垃圾邮件识别中,机器学习算法可以通过学习已知的垃圾邮件和⾮垃圾邮件,来判断⼀封新收到的邮件是否
是垃圾邮件。分类问题的常⻅算法有K近邻算法、逻辑回归、朴素⻉叶斯、决策树、随机森林、⽀持向量机(SVM算法)等。(高级的算法可以先不用具体了解,理解大体意思即可)

举个例⼦
假设你刚⼊职⼀家公司,领导给你⼀个任务:把邮件分类成“正常邮件”和“垃圾邮件”。
领导扔给你5000封已经分好类的历史邮件(训练数据),让你⾃⼰看,⾃⼰总结规律。你开始认真翻
看:
垃圾邮件的常⻅套路:
• 标题含“免费”、“中奖”、“⽴即领取”?
• 正⽂频繁出现“点击链接”、“转账”、“账户异常”
• 发件⼈是⼀串乱码邮箱,⽐如 sdf23@xx.com
正常邮件的常⻅特征:
• 发件⼈是熟悉的同事、客户
• 内容涉及⼯作安排、项⽬进度
• 没有诱导点击的夸张话术
你看完5000封邮件后,脑⼦⾥已经形成了⼀套判断规则(模型)。
第⼆步:分类(推理阶段)
第⼆天早上,你打开收件箱,看到⼀封从来没有⻅过的新邮件:
发件⼈: service@unknown.com
标题:【紧急】您的账⼾存在异常,请⽴即点击链接验证
你⼤脑迅速扫描:
• ✅发件⼈陌⽣
• ✅标题含“紧急”、“⽴即”
• ✅诱导点击链接
你果断判断:这是垃圾邮件!然后⼀键拖进垃圾箱。
恭喜你,成功完成了⼀次分类推理。

4.3.2回归

回归是⼀种监督学习任务,旨在建⽴⼀个数学模型,来拟合输⼊特征与连续数值型输出之间的映射关系。机器学习可以通过对已知的数据进⾏学习,从⽽对新的数据进⾏预测。⽐如在股票市场中,机器学习算法可以通过学习历史股票价格数据,来预测未来的股票价格。回归问题的常⻅算法有线性回归
等。

4.3.3聚类

聚类是⼀种⽆监督学习任务,旨在在没有预先给定类别标签的情况下,根据数据样本之间的内在相似性,⾃动将其划分为若⼲个不相交的(Group)。机器学习可以将数据按照⼀定的特征进⾏聚类,
从⽽将相似的数据归为⼀类。⽐如在客⼾分析中,机器学习算法可以通过学习客⼾的购买⾏为和喜好,将相似的客⼾归为⼀类,从⽽对不同的客⼾群体进⾏针对性的营销。聚类算法属于⽆监督学习,常⻅的算法有K均值算法(K-means)、层次聚类、DBSCAN、⾼斯混合模型(GMM)等。(高级的算法可以先不用具体了解,理解大体意思即可)
⽐如我们常⽤的⾳乐APP
第⼀步:机器看什么数据(特征)
App后台有成千上万⾸歌,每⾸歌都被提取成⼀组数字特征:
• 节拍速度(快/慢)
• 乐器种类(有没有吉他、钢琴、电⼦合成器)
• ⼈声特点(男声/⼥声/纯⾳乐)
• 能量值(激昂/舒缓)
• 情绪值(欢快/悲伤)
于是每⾸歌都变成了⼀个“坐标点”,⽐如:
• 歌曲A:(速度120,能量0.8,⼈声男,情绪欢快)
• 歌曲B:(速度60,能量0.2,纯⾳乐,情绪悲伤)
• 歌曲C:(速度130,能量0.9,⼈声⼥,情绪欢快)
第⼆步:机器⾃动“抱团”(聚类)
机器把所有歌曲按照这些特征“距离远近”⾃动分成若⼲堆,⽐如分成了4堆:

机器内部标签⼈类后来赋予的名字歌曲特征
第1堆“燃爆运动”速度快、能量⾼、⿎点重
第2堆“深夜emo”速度慢、钢琴为主、歌词伤感
第3堆“学习专注”纯⾳乐、⽆歌词、节奏平稳
第4堆“轻松愉快”速度快、吉他为主、⼈声轻快

第三步:把你“塞”进某⼀堆
机器再看你过去⼀周的听歌记录:你单曲循环了20遍《起⻛了》,还听了5⾸类似的歌。
机器发现:这些歌全部属于“深夜emo”那⼀堆。
于是它得出结论:“这个⽤⼾⼤概率属于‘深夜emo’群体。”
第四步:给你推荐
机器从“深夜emo”那⼀堆⾥,挑出你还没听过的其他歌曲,塞进你明天的“每⽇推荐”⾥。
你第⼆天打开App,发现推荐的歌⾸⾸都像量⾝定做——这就是聚类的魔⼒。

4.3.4关联规则

关联规则是⼀种⽆监督学习任务,旨在从⼤规模数据集中,发现变量(或项)之间有趣的隐含依赖关系或共⽣模式,通常表⽰为“X→Y”的蕴含式。机器学习可以从⼤规模数据中发现变量之间的有趣关联或频繁模式。
例如在超市购物篮分析中,通过分析顾客购买记录,可以找出“购买尿不湿的顾客往往也会购买啤酒”这样的关联规则,从⽽优化商品陈列和促销策略。常⻅的算法有Apriori算法、FP-Growth算法等。
啤酒尿布是数据挖掘与商业分析领域最著名的经典案例之⼀,讲述了超市通过数据分析发现啤酒与尿布存在关联销售机会的故事。尽管其真实性存在争议,被视为“商业寓⾔”,但其背后的关联规则挖掘理论对零售业营销产⽣了深远影响。

4.3.5序列预测

序列预测,简单来说,就是利⽤过去⼀串有顺序的数据,来推断未来接下来会发⽣什么。它的核⼼在于数据点之间存在顺序依赖性(⾮独⽴同分布)。机器学习可以利⽤历史序列数据来预测未来的元素或趋势。⽐如在⾃然语⾔处理中,模型可以根据已⽣成的⽂字预测下⼀个单词,从⽽实现⽂本⾃动补
全或机器翻译。序列预测的常⻅算法有循环神经⽹络(RNN)、⻓短期记忆⽹络(LSTM)、⻔控循环单元(GRU)、Transformer等。
以中英⽂翻译为例,核⼼的⽣成过程,本质上是由⼀系列连续的序列预测构成。
• 输⼊序列(源语⾔): “我 爱 学习”
• ⽬标序列(⽬标语⾔): “I love learning”
在翻译时,模型并不是瞬间变出整句英⽂,⽽是⼀个词⼀个词地“预测”出来的。

返回列表