拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

大模型驱动营销广告:货拉拉四个落地场景与踩坑复盘

大模型驱动营销广告:货拉拉四个落地场景与踩坑复盘 本来货拉拉的营销广告在我印象里还是补贴短信固定素材那一套老打法。直到去年下半年我们开始系统性引入大模型情况才彻底变了。这篇想完整复盘一下我们在货拉拉营销广告这条业务线上怎么把大模型从一句口号变成真正每天扛流量的生产工具。内容会覆盖四个落地场景、模型选型和微调路线、效果评估方法还有一堆只有实际跑过才会踩到的坑。适合正在做大模型落地、或者打算在广告投放和内容营销方向引入AI的算法同学参考。1. 为什么营销团队最终被逼着用大模型1.1 旧模式的痛点已经顶到天花板货拉拉的广告场景和其他电商不太一样。我们不光有C端用户拉新还有司机端招募、搬家用户、企业货运客户甚至还要配合各地分公司做区域性的促销活动。过去一套广告物料流程下来文案要外包团队反复改稿图片设计要等排期落地页结构多年不动投放时要靠优化师凭经验调出价。遇到大促节点这种模式完全来不及。最典型的一次是搬家季活动运营周二下午提出需求希望周五前产出58套不同城市、不同搬家人群的落地页文案和15条短视频脚本。外包文案团队拼了两天交上来的东西还是套模板把城市名换掉就完事整体转化率比日常还低。那个节点我们就在想如果能有一个自动生成、又懂业务、还能控制调性的系统该多好。1.2 大模型恰好补齐了内容生产的三个缺口后来我们拆解下来传统广告生产的瓶颈集中在三块第一是生产速度。人工写文案一天最多几篇但大模型按分钟算就能批量产出几十条不同风格的草稿。第二是个性化粒度。传统上做人群细分最多到城市、年龄、是否搬家用户但大模型可以理解更复杂的上下文比如用户搜索小货车拉一车书它就能推断出这是读书搬家场景自动调整广告侧重点。第三是迭代闭环。过去素材上线后要等一周才知道效果好坏现在我们可以让大模型在投放数据回流后自动生成新版本形成生成-投放-回收-再生成的循环。这三点准确戳中了营销广告的命门效率、精准、持续优化。所以我们在内部定了个原则不是所有广告流程都要换而是选择那些人力明显跟不上、规则明显不够用的环节优先让大模型顶上。2. 四个真正跑起来的广告应用场景从立项到现在我们先后试过十几个大模型应用想法最终稳定跑在生产环境的其实只有四个。我一个个拆开说。2.1 广告文案与落地页的批量生成这是最早上线的场景。我们要解决的核心问题是让大模型生成的不只是看起来能用的文案而是真正贴合不同广告位的文案。货拉拉的广告位很杂信息流图文、搜索页标题、短信通知、朋友圈卡片、评论区置顶。同一个用户在不同位置看到的文案角色完全不同。比如搜索场景强调的是马上接单解决需求短信场景强调的是优惠力度和限时性朋友圈卡片则需要一点社交传播感。我们设计了一个结构化的Prompt模板把广告位、目标用户、城市、业务线、促销力度、品牌调性全部作为参数传入。下面是一个浓缩后的示例请你作为货拉拉资深广告文案生成一条[信息流]广告文案。 目标用户同城搬家用户近期搜索过“跨城搬家”和“纸箱收纳”。 城市深圳。 业务线货运搬家。 促销信息新用户立减30元可叠加优惠券。 要求 1. 突出“快”和“省”但不要出现“最便宜”等绝对化用语。 2. 开头前10个字必须让人想点击。 3. 提供3个不同侧重点的版本每个版本不超过50字。这样做的好处是可控。我们把广告规范直接塞进Prompt里把广告法禁用词表放在后置校验环节两层保险。落地页生成比文案复杂一些。我们不是让大模型直接写HTML而是让大模型生成落地页的结构化内容标题、卖点、主视觉建议、转化按钮文案再交给前端模板渲染。这样既保留了统一设计风格又实现了千人千面式的模块调整。目前这个系统每天可以生成上千套个性化落地页人工设计师只需要审核头图和关键卖点是否准确。2.2 基于用户意图的广告投放策略广告物料有了发给谁看也不能靠拍脑袋。过去我们靠兴趣标签和用户分群准确率有限。大模型进来之后我们把重点放在意图理解上。具体做法是用大模型对用户的免费搜索词、历史点击行为、订单记录做深度语义分析。比如一个用户搜4米2货车带司机传统规则可能给它打上货车用户标签但大模型能看出这个搜索词里包含带司机4米2这两个关键约束推测用户很可能是小B企业用户需要长期运输而非一次性搬家。基于这个推断广告投放策略就会从C端搬家广告切换成企业货运广告落地页也会突出可开票长期合作折扣。这个场景没有让大模型直接决定出价而是派生出三层输入给投放系统人群扩展基于语义相似度找到和种子用户向量距离近的潜在用户。创选匹配同一广告位下根据用户意图自动选择最佳文案和落地页组合。预算调整对高意图用户群体提高出价系数低意图则降低频次。这样做之后广告点击率提升了大概15%但更关键的是转化成本下降了近两成。大模型的价值不是替代原有投放系统而是让投放系统拥有更好的眼睛。2.3 创意素材的自动优选与二次创作广告圈有个常见痛点素材生命周期太短。一个创意上线一两周用户看腻了点击率就会掉。过去只能靠设计师不断手动出图现在我们用大模型做素材的二手加工。具体思路是这样的把跑得好的历史的素材拆成元素包括文案结构、视觉风格、促销点组合、场景氛围。然后让大模型分析为什么这个素材跑得好生成多个同风格但不重复的变体。视觉素材用文生图模型出草稿设计师再精修。文案部分则完全交给大模型。这里有一条经验很重要大模型产出的素材不能直接全量上线必须走小流量择优。我们内部做了一个自动化创意优选实验平台每个新素材先在5%的流量里跑两天根据点击率、转化率、退出率打分只有得分超过老素材的才放量。大模型负责生产平台负责淘汰这相当于给素材生产装上了自动进化的机制。实测下来头部素材的整体生命周期从原先的一周拉长到三周左右因为持续可以有新变体补充进入测试池。2.4 会话式线索承接与转化跟进广告投出去总会有用户留下线索以前这些线索要人工销售一个个打电话跟进效率低而且夜间咨询经常错过。我们做了一个基于大模型的会话机器人专门负责承接广告落地页里的在线咨询和线索洗筛。这个机器人不是简单问答核心能力有两块第一根据用户当前的咨询上下文和广告来源自动判断用户处在哪个决策阶段。比如用户问你们能搬钢琴吗它会理解为高意向用车用户立即推送已为你预留车辆现在下单立减20元的话术同时把线索标记为A级推送给人工销售优先跟进。第二把用户闲聊里出现的需求结构化生成标准化的订单线索。比如用户说我周五上午从朝阳搬家到通州有两张床和一个冰箱大模型直接抽取出时间、起终点、物品清单填入CRM系统销售接通电话时已经不需要重复询问基础信息。这个场景对大模型的推理能力要求比较高因为真实会话里用户用语非常绕。我们后期专门用近三个月的客服会话记录微调了一个意图识别模型准确率从初版的78%提升到了91%。会话机器人上线后夜间线索的响应速度从平均两小时缩短到几秒线索到订单的转化率提升了近三成。3. 模型选型和落地架构别一上来就当炼丹师3.1 API优先还是开源模型优先这是所有团队都会纠结的问题。我们最终定下来的原则是能用API的就用API必须私有化才走开源。广告投放文案和会话生成这两个场景我们一开始想全链路私有化但认真算了算成本和工期放弃了。原因很简单大模型迭代太快我们如果自训一个中文文案模型花大量算力做预训练效果大概率不如最新的商业模型而且维护成本极高。所以我们初期选择调用商用大模型API优先保证业务跑通。开源模型真正派上用场的是两个地方一是用户意图解析服务因为要接收搜索词等业务数据出于数据安全考虑不能出内网二是会话机器人里的结构化信息抽取这部分完全业务相关开源模型微调后效果更好而且推理成本可控。所以整体架构可以理解成两条腿走路对外交互场景用商业大模型API对内数据加工场景用私有化开源模型。目前内部部署的关键模型是基于Qwen2.5-7B微调出来的一个意图分析模型和一个会话信息抽取模型分别部署在两张推理卡上就能满足日常流量延迟基本控制在300毫秒以内。3.2 用RAG和提示词工程兜住业务知识大模型有个特点通用能力很强但不懂货拉拉的内部业务。比如及时单多货主拼车这些词通用大模型很难理解准确含义。我们不可能把所有业务解释都塞进Prompt里所以采用了RAG方案。我们把货拉拉的运营规则、调度逻辑、计价方式、客服话术、历史优质广告文案全部清洗后向量化放进一个知识库里。大模型在生成文案、回答问题之前先从知识库检索出相关的业务片段再拼接到Prompt上下文里。这里有个非常容易踩的坑RAG检索回来的内容如果太杂反而会拉低生成效果。我们做过对比实验同样一个Prompt不接RAG时文案虽然泛泛但通顺接了RAG但检索结果混乱时文案会变得前言不搭后语。解决方案是给知识库分段打标签检索时过滤出广告文案案例“计价规则”活动规则这些具体类型只让大模型参考同场景的片段。同时设置相关性阈值低于阈值的检索结果宁可不用也不能硬塞给模型。提示词工程上我们总结出一套自己的结构分成五个部分角色定义、任务约束、业务上下文来自RAG、目标用户信息、输出格式要求。每个部分之间用清晰的标记分隔模型理解起来更稳定。另外我们要求模型描述为什么不这么写不定时抽检这个技巧对约束模型行为非常有效。3.3 微调一个真正懂货拉拉的文案模型RAG解决知识问题但解决不了风格问题。通用模型写出来的文案总是带着一股标准AI味哪怕Prompt写得很激进它还是习惯用高效便捷专业可靠这类词。所以我们后来用积累的优质广告数据微调了一个专有文案模型。数据是最大门槛。我们找运营要了近三年在投和跑量的广告文案一共几万条按业务线分类。清洗过程很痛苦很多历史文案本身就是外包凑数的质量不行。我们的做法是自己做了个打分模型结合点击率、转化率等效果指标筛选同时人工抽检。只保留头部的几千条做微调。微调用的是LoRA方案基座是商业开源文案模型训练数据控制在5000条左右训练了三个epoch。这一步性价比极高微调后生成的文案在风格自然度上的主观评分提升了明显而且绝对化广告词这类违规输出大幅减少。关键经验是微调不是越多越好数据量超过一定阈值后质量反而会下降因为历史素材之间互相矛盾。宁愿精筛两千条高质量数据也不要糊一万条低质数据进去。3.4 部署和推理性能的实战调优私有化部署这个环节我们把最核心的推理链路做成了独立服务主要有三个优化点。第一是动态批处理。意图解析这类场景有很强的波峰波谷白天咨询多夜间几乎没有流量。我们设置了一个动态等待窗口攒够一定请求数或者达到最大等待时长就触发一次推理吞吐量提升了近三倍。第二是量化精度。我们尝试过把模型从FP16量化到INT8和INT4最终稳定选用INT8。INT4虽然省一半显存但意图识别的F1值掉了快两个点考虑到这个场景的容错性不高还是放弃。第三是缓存策略。搜索意图和广告文案请求中有大量查询是很相似的。我们对用户意图解析结果做了短暂缓存对完全重复的请求直接命中不需要重新跑模型大概省了20%的算力消耗。4. 效果评估和数据闭环没有AB实验谁说了都不算4.1 营销场景的AB实验设计要落在业务指标上做技术的人容易一上来就比模型的准确率、生成文本的BLEU分数但在广告场景里这些都不是终局指标。老板关心的是获客成本降没降转化率升没升GMV有没有变化。我们在设计AB实验时同时看了两层指标过程指标点击率、素材消耗速度、创意数量、线索响应时长。成果指标获客成本、下单转化率、首单GMV、用户次日留存。大模型版本和旧版本会同时跑在互斥流量上流量按广告位、城市、人群分层。每个实验至少跑满7天覆盖一个完整的自然流量周期避免周末和工作日差异影响判断。有一个细节很重要广告效果有延迟归因问题。用户看到广告后可能过两三天才下单所以只看当天的转化会严重低估效果。我们把归因窗口扩展到72小时并且用增量学习的模型去分析实验组和对照组之间的差异。这样做之后很多曾被判断为无显著差异的实验其实在72小时窗口下有明显的正向收益。4.2 机器审核加人工审核的双层质检机制大模型生成内容上线前必须过审这是底线。我们搭建了一套双层质检机制。机器层主要做四件事广告法违规词检测比如最便宜绝对第一名、品牌词冲突检测禁止出现竞品或无关品牌、敏感情感判断、以及格式完整度检查。这层能挡掉大部分问题。人工层我们采用抽检加重点抽双重策略。常规内容抽检比例是5%但涉及活动金额、时效承诺的全部走人工确认。前期为了训练模型的合规性我们还专门标注了一批违规样本喂给模型后来发现这在源头减少违规输出比审核更有效。4.3 每次投放的数据都在变成下一次生成的知识如果大模型生成广告素材是一次性的那价值会缩水一半。我们把投放结果和生成内容打平成一张宽表记录每条文案在哪个广告位、哪个用户群、什么样的出价条件下产生了怎样的点击率、转化率、成本。这些数据再回流到两个地方一个是RAG知识库让新生成的素材优先引用当前跑量好的文案风格另一个是微调数据的标注池当某个创意在AB测试里胜出会被自动标记为优质样本积累一段时间后进入下一轮微调训练。这个闭环跑起来之后系统不再只是生成得好看而是生成得有效。我们内部统计过连续三个月的优质素材命中率从初期的15%提升到了近40%也就是说大模型生成的素材里有接近一半能通过AB实验并最终跑量这个比例已经超过了不少资深优化师的选品能力。5. 踩过的坑和复盘后的完整解决方案5.1 幻觉导致广告法合规问题频发上线头两周我们收到过几次运营投诉说大模型文案里出现了全城最低价保证再无更便宜这类绝对化表述。虽然我们自己有违规词表但架不住模型换个说法比如价格低到你不信这种擦边球硬规则根本拦不住。解决思路分三层第一把广告法相关条文和合规案例做进RAG知识库让模型在生成前就参考合规标准第二用微调数据里的违规样本做负面标注告诉模型哪些说法绝对不能用第三后端再加一层语义违规检测通过一个分类模型判断文案是否包含诱导性绝对化承诺。三层下来合规事故率基本归零后面再没被运营找过麻烦。5.2 内容同质化会让素材衰减得更快大模型有一个让人头疼的特点同样一个Prompt跑十次可能有八次结果相近。如果批量生成五十条素材实际上可能只有五六个不同类型其余全是微调版本。这样的素材池上线后用户会很快疲劳。我们后来在Prompt里强制注入差异化因子每次生成时随机指定不同的表达角度比如从省钱角度从速度快角度从服务好角度从深夜搬家场景角度等并要求每条文案至少包含一个不同的记忆点。同时用embedding模型计算生成文案之间的相似度相似度超过阈值就自动丢弃。这个方法让素材池的多样性明显提升测试命中率也稳住了。5.3 API成本和性能的天平怎么平衡用商业API上量之后成本问题立刻暴露出来。我们曾有一个月广告文案生成调用量超过千万次账单出来的时候运营同学眼神都不对了。成本优化的核心是不在一个模型上吊死。我们对请求类型做了分流高价值场景例如面向高意向用户的落地页文案生成继续使用效果最好的旗舰级商业模型海量低价值的草稿生成任务则切换到中小模型或者候选方案直接复用历史优质素材改改写不需要全新生成。另一个有效做法是减少无意义的重新生成给Prompt增加输出稳定性和复用机制相同参数的请求直接走缓存。总之成本控制要先看需求分层而不是一味追求模型能力。5.4 离线效果和线上表现为什么老对不上我们遇到过很诡异的情况离线评测时大模型生成的文案专家评分挺高一到线上切换到50%流量的时候点击率反而下降了。前后排查了很久最后定位到问题出在上下文不一致上。离线评测时我们是拿着完美整理过的用户信息去生成文案但线上真实请求里用户意图解析有概率出错比如把货运公司识别成搬家个人生成出来的文案自然就不对味。所以后期我们把用户意图解析和大模型生成当成一个整体来测试而不是各测各的。线上做灰度时也留出足够长的观察期因为新素材上线后前两天的数据波动很大经常会被流量巧合误导至少要跑满一周同时观察细分人群的表现再下结论。写在最后回头看这段实践最深的感受是大模型在营销广告里不是靠某一个杀手级功能取胜而是靠一整套生成-评估-归因-进化的机制慢慢把成本磨下来的。如果一开始就想让模型完美解决所有问题大概率会卡在某个地方出不来。我个人的建议是不管你现在是做广告文案、投放策略还是用户运营都可以先挑一个重复劳动最多、判断规则最明确的环节切入。不用一步到位先跑通一个小闭环把数据积累起来后续的模型调优才有依据。货拉拉现在的这套体系也不是一步建成的中间迭代了快半年踩坑不少但收益是实打实的。希望这篇分享能给你们团队提供一些可复用的思路。
返回列表