拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Agent 技术摘要 03 —— 基座模型、推理模型、Flash、联邦学习、分布式机器学习

Agent 技术摘要 03 —— 基座模型、推理模型、Flash、联邦学习、分布式机器学习

系列为笔者在实习过程中的所见所闻记录,内容为技术摘要,旨在提供关于Agent领域相关技术名词的通俗和简要介绍,详细内容暂不展开,供同在该领域进修的童鞋们参考。

01 基座模型 VS 推理模型

基座模型是“脱口而出”的快思考,推理模型是“打草稿再回答”的慢思考。

维度基座模型推理模型
训练目标预测下一个词学会推理步骤,通过强化学习奖励正确答案
回答方式直接输出最终答案先输出一长串思维链,再输出答案
计算资源分配训练时烧钱,推理时便宜训练烧钱,推理时也极其烧钱
自我纠错能力几乎没有强
类型代表模型擅长场景
基座/通用对话模型GPT-4o, DeepSeek-V3, Qwen-Max, Claude 3.5 Sonnet日常聊天、写邮件、翻译、写普通代码、总结文章
推理模型OpenAI o1 / o3, DeepSeek-R1, Claude 3.5数学竞赛题、复杂逻辑推导、底层代码架构设计、科研论文分析

大家发现,单纯把基座模型做得更大,喂更多的数据,它的逻辑推理能力并没有成正比提升,它依然会在简单的脑筋急转弯或者复杂的数学题上翻车。

于是,行业找到了新方向,Test-Time Compute(推理时计算),既然模型脱口而出容易错,那我就逼它在回答前多花点时间思考,多生成一些中间 token,实验证明,只要给模型足够的时间打草稿,它的智商会产生涌现式的飞跃,能解出以前绝对解不出的奥数题和编程难题。

这就是为什么 DeepSeek-R1 和 OpenAI o1 震动了整个硅谷——它们证明了让 AI 学会思考比让 AI 死记硬背更有前途。

02 Flash

Flash就是模型家族里的极速、便宜、性价比款,主打一个天下武功,唯快不破。

  • 参数变少了:旗舰模型可能有 1000 亿个参数,而 Flash 模型可能只有 70 亿或 140 亿个,参数少,计算量就小,速度自然就快,占用的显卡显存也少。
  • MoE 架构:想象一个有 100 个医生的大医院,普通模型,你去看个感冒,100 个医生全跑出来给你会诊,MoE 模型,门口有个导诊台,一看你是感冒,只叫醒 2 个内科医生来给你看病,其他 98 个医生在睡觉,虽然医院很大,但每次看病的计算量极小,速度飞快!
  • 量化技术:把模型里高精度的数字(比如 3.1415926)压缩成低精度的(比如 3.14),虽然损失了一丁点智商,但体积和计算量直接减半。

03 联邦学习

联邦学习(Federated Learning,FL)是一种协作训练范式,即多个参与方把原始训练数据保留在本地,通过交换模型更新等信息,共同训练模型。

以经典 FedAvg 为例,假设三家公司想共同训练客服模型,但各自的对话数据不能集中存储。它们可以运行以下循环:

  • 下发模型:协调服务器把同一个全局模型参数发给本轮参与方
  • 本地训练:每家公司用自己的数据执行若干步梯度下降,得到本地参数
  • 上传更新:参与方上传模型参数或参数增量,原始训练样本保留在本地
  • 聚合更新:服务器按规则合并,得到下一轮全局模型,再重复上述过程

FedAvg 的典型聚合公式是:
θt+1=∑k∈Stnk∑j∈Stnjθt+1(k) \theta_{t+1} = \sum_{k\in S_t} \frac{n_k}{\sum_{j\in S_t} n_j} \theta_{t+1}^{(k)}θt+1​=k∈St​∑​∑j∈St​​nj​nk​​θt+1(k)​
其中,S_t是本轮参与方集合,n_k 是参与方 k 的本地样本数,直观上,就是对从同一个全局模型出发,分别经过本地训练的模型参数,按数据量做加权平均,共同的初始化、参数结构和训练协议很重要。

一个难点是 Non-IID(非独立同分布),例如,一家公司主要处理金融客服,另一家主要处理电商客服,各自的本地更新可能朝不同方向优化。另一个难点是安全和隐私,模型更新仍然携带训练数据的信息,在特定条件下,攻击者可以利用共享梯度重建部分训练样本。因此,隐私要求较高的联邦系统通常还需要结合:

  • 安全聚合(Secure Aggregation):让服务器获得多个参与方更新的聚合结果,同时隐藏单个参与方的更新
  • 差分隐私(Differential Privacy):通过裁剪、加噪和隐私预算管理,限制单条记录或单个用户对可观察结果的影响

04 分布式机器学习

分布式机器学习(Distributed Machine Learning)指把机器学习的计算和存储分配到多个计算节点上,通过通信与协调共同完成任务。

在训练语境中,通常就是让多张 GPU、多台服务器协同训练模型。

① 数据并行

以 4 张 GPU 训练同一个模型为例,在各卡样本数相同、损失取样本平均的简单情形下:
g=14∑k=14gk,θt+1=θt−ηg g=\frac{1}{4}\sum_{k=1}^{4}g_k, \qquad \theta_{t+1}=\theta_t-\eta gg=41​k=1∑4​gk​,θt+1​=θt​−ηg
其中 g_k是第 k 张卡计算的梯度,eta 是学习率。

② 模型并行

大模型训练中,显存不仅用于存储参数,还要存储梯度、优化器状态和中间激活。

Ⅰ张量并行:TP,拆分同一层内部的张量及计算,比如一个大型矩阵乘法由多张 GPU 共同完成。

Ⅱ 流水线并行:PP,将不同层分配到不同设备,比如GPU 0 计算前几层,再把激活传给 GPU 1。

Ⅲ 状态分片:FSDP,分片存储参数、梯度和优化器状态,比如每张卡只常驻部分状态,计算时按需通信获取参数。

返回列表