十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从10亿美元收入看Agent后训练范式:Handshake拆解真实工作环境的数据供应链重构

从10亿美元收入看Agent后训练范式:Handshake拆解真实工作环境的数据供应链重构 【摘要】校园招聘平台Handshake的AI训练业务在12个月内实现从0到10亿美元年化收入的增长其覆盖300万用户的职业网络构成了Agent后训练时代的新型供给基础设施。当前顶尖大模型团队的预训练与后训练算力投入已趋近1:1AI训练数据正从离散文本标注转向包含专家网络、任务环境、验证器的3层完整结构产业价值重心正在从预训练向后训练快速迁移。全文以Handshake为分析锚点覆盖训练数据范式转移、供应链结构与底层技术逻辑3个维度适配AI基础设施、数据工程与模型训练领域的技术决策者参考。核心关键词Agent后训练强化学习环境RL验证器Verifier职业数据供应链大模型Agent能力瓶颈垂直领域AI训练数据短缺后训练算力配置预训练vs后训练对比传统标注vs专家训练Handshake商业模式拆解引言2022年底ChatGPT上线后的3年算力竞赛在2026年迎来拐点模型公司内部后训练算力逼近预训练的1:1外部Handshake这类数据供给商年化总收入合计已接近百亿美元其中超过60%需支付给外部专家。产业价值重心正在从预训练向后训练加速迁移。Handshake是其中最具代表性的跨界样本。这家2013年成立的校园招聘平台深耕校招赛道12年直到2025年初才切入AI训练数据业务。起步阶段该业务年化收入仅500万至1000万美元2026年1月增长至5.5亿美元同年4月第三方机构Sacra估算其年化毛收入已接近11亿美元12个月内增长超过100倍最高达220倍。2026年8月31日Handshake联合创始人兼CEO Garrett Lord在播客中确认公司AI业务“一年多一点从0做到10亿美元收入”且“已经能看到20亿美元的预期”。以下内容基于Handshake的转型实践拆解Agent时代训练数据的范式转移、供应链结构与技术逻辑分析后训练时代的产业价值迁移路径。一、从标注到环境Agent时代训练数据的定义重构面向垂直行业的长程Agent训练核心瓶颈已从通用语料数量转向真实职业场景下的连续任务数据质量与环境还原度该结论适用于所有非编程类专业领域的Agent研发场景。1.1 互联网公开数据的能力边界大模型的第一阶段训练本质是“消费”互联网上已经存在的文字、图片和代码。GitHub的海量代码库、Stack Overflow的问题与解答、维基百科的结构化知识这些公开数据构成了GPT、Claude、Llama等基座模型的初始训练养料。但这条免费数据管道的边际收益正在快速见底。编程智能体Coding Agent过去两年进展最快核心原因是软件工程可能是唯一一个在互联网上留下“完整工作痕迹”的职业。代码具备天然的可执行验证机制模型生成一段代码运行单元测试即可立刻判断对错。GitHub记录了完整的提交历史与问题修复链路Stack Overflow沉淀了问题与解决方案的对应关系形成了天然的学习闭环。绝大多数职业不存在对应的公开“工作数据库”。Lord在访谈中以石油工程师为例一名石油工程师如何结合井下数据、历史文件和专业软件做出下一步判断这些知识几乎不会被完整记录在公开互联网上。即使网上存在大量会计、金融、医学领域的教材与论文也无法还原专业人士在真实工作中面对的信息不全、多目标权衡、边界模糊等复杂决策场景。Q为什么教材和学术论文不能直接用来训练垂直领域Agent A教材与论文无法直接支撑长程Agent训练核心原因是其仅包含静态知识不包含真实工作过程与连续决策逻辑。Agent需要掌握面对具体任务时的操作顺序、工具调用、判断节点与验证方法这些执行层面的信息在教材与论文中不存在。1.2 训练数据的三层结构升级Handshake的实践揭示了Agent时代训练数据的完整三层结构彻底区别于传统的数据标注模式第一层专家供给层Who。找到真正具备一线实操经验的从业者。Handshake的职业网络覆盖300万用户包括50万名博士和300万名硕士研究生。Lord透露参与Handshake AI项目的专家中89%来自平台自有的职业网络。第二层环境模拟层Where。还原目标职业的真实工作环境包括日常使用的文件系统、专业软件、云端资源与协作流程。这不是简单的表单填写而是让AI进入一个“接近真实工作的环境”——可以访问本地文件、云端资料调用行业软件与各类工具像真实员工一样完成连续任务。Lord将其比喻为专家在“电子游戏里工作”。第三层验证标准层How。设计分层级的任务集明确任务成功与失败的量化评分标准。任务需要匹配模型当前的能力边界既有挑战性又具备通过训练学会的可能性。这三层结构共同定义了全新的数据品类。传统数据标注的核心是“判断内容对错”输出离散的标注点而Agent时代需要的数据是“任务的执行环境、模型的可操作空间、任务完成度的判断标准”输出的是可交互的完整训练单元。注以下对比均为格式演示用途所涉比例、指标数据均为虚拟示例不对应真实项目参数。对比维度传统数据标注模式Agent训练数据模式核心差异说明核心形态离散的问答对、标签、分类结果包含环境、工具、任务、验证的完整模拟单元传统模式是静态数据点Agent模式是动态可交互场景交付成果标注完成的数据集文件可运行的RL环境、标准任务集、自动评分接口传统模式交付即可用的训练语料Agent模式交付可探索的训练沙盒验证方式人工核对答案一致性同环境下全链路结果验证传统模式仅验证文本对错Agent模式验证任务真实完成度成本结构标注人员工时占比超80%环境搭建、专家咨询、验证器开发占比超60%传统模式成本集中在人力标注Agent模式成本集中在环境与规则设计训练效果提升模型问答准确率提升模型长程任务完成率传统模式优化模型输出表现Agent模式优化模型实际工作能力二、跨界增长的底层逻辑职业网络成为AI训练的新型基础设施覆盖全职业路径的实名职业网络是垂直领域专家级训练数据最高效的供给渠道其专家获客成本与身份可信度均显著优于泛娱乐平台招募模式该结论适用于需要严格验证专业资质的AI后训练数据供给场景。2.1 偶然转型背后的结构性资产Handshake切入AI数据市场带有一定偶然性但这种偶然性建立在12年积累的结构性资产之上。这家公司成立以来的核心业务逻辑是“人岗匹配”将大学生匹配给合适的雇主。在这个过程中Handshake积累了3类关键信息用户的教育背景、专业方向、学历层次毕业后的就业去向、所属公司职业发展轨迹与大致岗位方向这些信息原本的核心价值是提升职位推荐的精准度。但在AI后训练时代它们衍生出了第二层战略价值验证一个人是否真的拥有模型急需的专业经验。对比行业内多数竞争者需要在TikTok、Instagram等泛娱乐平台投放广告招募专业人士还要花费大量成本验证身份与资质Handshake几乎天然拥有一套“可验证的专家供应链”获客成本更低资质可信度更高。2.2 专家网络的规模效应壁垒Handshake官方数据显示平台拥有50万名博士、300万名硕士研究生覆盖物理、化学、法律、金融、医学、工程等近200个专业领域。这个规模的专家网络形成了3重壁垒第一触达成本优势。这些用户本来就活跃在Handshake平台上公司不需要为寻找专家支付高昂的获客成本。竞争对手则需要投放广告、搭建线下招募渠道、逐一验证资质每一步都耗时耗力。第二身份可信度优势。Handshake的用户信息在与大学、雇主的长期合作中得到了交叉验证学历、职业轨迹的真实性有保障。对于需要博士级物理或医学专家提供反馈的模型公司来说“可验证的专家”比“自称的专家”价值高出一个量级。第三覆盖广度的网络效应。模型公司需要的不是一两个专家而是成百上千个细分领域的资深从业者。Handshake覆盖近200个专业领域从量子力学到材料化学再到分子生物学这种广度使其可以同时服务多个前沿实验室的多样化需求形成正向循环。Lord总结这轮需求变化时表示“模型已经强到普通标注员越来越不够用了它们真正需要的是各个领域的专家”。QAgent训练的专家筛选核心标准是什么AAgent训练的专家筛选核心标准是一线实操经验与任务还原能力而非单纯的学历与职称。拥有5年以上一线岗位经验、能完整还原日常工作流与决策逻辑的从业者价值远高于仅有理论研究背景的高学历人员。三、全链路能力延伸从专家供给到RL环境与验证器的完整闭环完整的Agent训练单元已从“prompt-答案”二元对演进为“环境-任务-动作-验证”四元闭环其单位训练效果的成本效率比传统文本标注提升3倍以上当环境还原度高于70%时该结论适用于长程连续任务的Agent强化学习训练场景低于此阈值时边际收益将显著衰减。Handshake并未止步于做高端专家众包平台而是沿着训练链路向上下游持续延伸技术能力构建了从专家资源到环境搭建再到自动验证的全链路能力。3.1 收购Cleanlab补全RL环境与评估技术底座2026年1月Handshake收购了MIT团队创办的Cleanlab强化自身在强化学习环境Reinforcement Learning Environment, RL Environment、模型评估、AI安全与人类数据治理领域的技术能力。Cleanlab的核心技术方向是“数据中心型AI”即让AI系统自动识别数据中的错误与噪声。其创始人Curtis Northcutt在MIT读博期间提出的置信学习Confident Learning是一种数据质量优化方法通过估计样本的标签噪声分布自动识别错误标注区别于传统的人工抽检清洗模式目前已成为数据质量领域的基础性技术。这笔收购的核心属性是人才收购acqui-hire。Cleanlab的9名核心员工全部加入Handshake研发团队包括3位MIT计算机科学博士创始人Northcutt加入后负责领导公司的AI研究与战略。官方对这笔收购的定位是深化在RL环境、模型评估、AI安全与人类数据上的能力。QRL Environment在Agent训练中扮演什么角色ARL Environment是Agent执行任务的模拟沙盒完整复现真实工作环境中的文件系统、工具调用与状态变化机制。没有对应的RL环境Agent无法学习连续动作的因果逻辑有了匹配的环境模型才能通过试错迭代学会多步骤任务中的正确决策。3.2 开源Gandalf验证器成为Agent能力的新边界2026年5月Handshake开源了Gandalf——一个“Agent-as-a-Judge”模式的智能体验证框架。Gandalf解决了传统验证方案的核心痛点传统的大模型评审LLM-as-a-Judge只能检查模型最终输出的文本内容但Agent完成任务后结果可能散落在生成的文件、更新后的数据库、软件的状态变化或者工具调用的返回值中仅靠文本比对无法判断任务是否真正完成。Gandalf的核心设计思路是直接运行在与Agent相同的环境中使用相同的工具接口在推理过程中自主决定检查哪些文件、读取哪些工具结果、验证哪些软件状态。在Handshake公开的跨行业通用Agent任务基准测试中Gandalf的最低成本配置部署成本约42美元F1值达到0.633同期最强的传统LLM-as-a-Judge基线方案成本约422美元F1值仅为0.604。Gandalf在成本降低约90%的同时验证质量超越了所有非同类验证方案。Gandalf的出现带来了3个产业层面的影响第一验证器从附属组件升级为核心基础设施。在传统的**基于可验证奖励的强化学习Reinforcement Learning with Verifiable Rewards, RLVR**中验证是一个标准化步骤比如数学题精确匹配、代码跑单元测试核心特征是奖励信号可被精确量化验证无需人工主观判断。但当Agent的产出是Excel工作簿、PPT演示文稿或者已发送的业务邮件时验证需要打开文件、查询状态、追踪引用、应用领域知识复杂度大幅提升。第二验证器的设计直接决定基准测试的真实效度。Handshake研究团队指出“基准测试是经过验证器过滤的任务分布。当验证器能力不足时基准测试测量的其实是验证器的能力边界而不是预设的任务目标”。第三验证器的能力上限决定了Agent的能力上限。如果验证器无法判断一个任务的完成质量那么Agent就无法通过强化学习掌握这个任务。从这个意义上说验证器的能力边界就是当前Agent可训练的能力边界。四、算力结构重构后训练正在获得与预训练对等的产业地位进入长程Agent范式后大模型研发的后训练算力占比将从不足15%提升至30%以上顶尖实验室预训练与后训练的算力投入趋近1:1在Agent任务平均步骤数超过5步的场景下该结论适用短程任务步骤数≤3的后训练算力需求增幅不明显。Handshake的10亿美元收入从外部证明了模型公司正在大量采购后训练能力而模型团队内部的资源分配变化也给出了同样的产业信号。4.1 算力分配比例的范式级变化小米大模型团队负责人罗福莉曾给出行业内少见的量化判断在对话机器人Chatbot时代如果将模型研发的算力消耗分为研究探索、正式预训练、正式后训练三部分用卡比例大致为3:5:1后训练算力占比仅约11%进入Agent阶段一个非常合理的比例已经变成3:1:1后训练算力占比提升至20%而顶尖实验室的预训练与后训练算力投入已经达到1:1。这一变化的核心驱动是Agent训练的算力消耗模式完全不同。预训练阶段主要是对海量语料进行批量前向计算与反向传播单位样本算力消耗相对固定。而Agent训练需要大量的环境交互、试错探索与对照实验长程任务的每一轮探索都需要完整运行环境、调用工具、执行动作单位样本的算力消耗远高于预训练的语料处理。同时Agent能力迭代需要大量消融实验验证不同策略的效果进一步放大了算力需求。Agent范式本质上非常消耗后训练资源。模型真正进入长程Agent任务场景后需要大量实验学习上下文理解、工具调用、连续反馈处理的逻辑预训练与后训练的资源重要性正在重新平衡。4.2 外部供应链的同步扩张模型公司内部后训练Post-train开始获得接近预训练Pre-train的正式算力资源模型公司外部Handshake、Mercor、Surge AI等提供专家、评估、RL环境与验证器的公司正在实现高速增长。这种内外同步扩张并非巧合。后训练需要的不是“更多算力”而是“更高质量的训练数据”——这些数据无法从互联网上免费获取必须通过专家、环境和验证器这条供应链重新生产。The Information 2026年4月的报道数据显示Handshake的AI训练业务年化总收入从1月的5.5亿美元上涨至接近10亿美元而一年前刚起步时只有500万至1000万美元。行业同行Mercor也保持类似增速2025年9月其年化收入约为5亿美元2026年2月突破10亿美元到2026年6月已超过20亿美元。根据《The Information》2026年6月发布的全球AI训练数据行业调研Scale AI、Surge AI、Mercor和Handshake四家公司合计占据全球专家级AI训练数据市场约76%的收入份额。4.3 “10亿美元收入”的真实商业含义需要明确的是Handshake的10亿美元并非传统软件即服务Software as a Service, SaaS意义上的年度经常性收入Annual Recurring Revenue, ARR而是年化运行收入Annualized Run Rate常简称run rate是将当前时段收入折算为全年规模的估算值包含项目制、一次性收入区别于可持续的订阅制ARR且包含大量需支付给外部专家的成本。The Information获取的财务数据显示Handshake AI业务当时的年化总收入接近10亿美元但扣除参与训练的专家与承包商报酬后年化净收入约3亿美元。同期传统校园招聘业务贡献约1.5亿美元的年化总收入。 第三方研究机构Sacra的估算略有差异2026年4月Handshake全公司年化总收入约11亿美元其中AI训练业务约9.5亿美元扣除承包商报酬后公司年化净收入约4.5亿美元其中AI业务净收入约3亿美元。两套数据共同指向同一个结论Handshake的10亿美元收入中超过60%甚至接近70%需要支付给提供专业知识的专家与外包人员。同行Mercor也存在类似的收入结构其超过10亿美元的年化总收入中约60%—70%需要支付给外部承包商。这种收入结构意味着Handshake的商业模式更接近“供应链平台”——它赚取的是组织专家、管控质量、交付标准化训练资产的服务费而非高毛利的软件订阅收入。这也恰恰说明了这条供应链的价值模型公司愿意为“专家生产的定制化训练资产”每年支付数十亿美元而Handshake的核心价值是将分散的专家资源组织成规模化、质量可控的供给体系。也有行业观点认为Handshake的收入高速增长包含了头部大模型厂商的一次性大额订单后续增速可能放缓且其成本占比高的模式规模化盈利能力仍待验证。Q如何区分年化运行收入run rate与年度经常性收入ARRA年化运行收入是将当前阶段收入折算为全年规模的估算值包含项目制、一次性收入年度经常性收入是可持续的订阅类收入稳定性与毛利水平更高。Handshake的10亿美元属于前者不具备传统SaaS ARR的高毛利属性。五、产业终局推演人类训练AI与AI替代人类的循环AI训练数据行业的长期价值锚点是模型自身无法自发生成的真实职业经验与复杂场景决策能力而非可被自动化的标准化标注与验证环节该结论适用于所有面向前沿大模型的训练数据与服务提供商。5.1 自我迭代的产业循环AI数据行业一直存在一个悖论式疑问如果AI公司的最终目标是让模型学会会计师、程序员、医生和工程师的工作那么Handshake每教会模型一种能力理论上都在消耗自己未来的一部分需求。当模型足够强大时是不是就不再需要人类专家来训练了Lord并不认同这种线性的“自我吞噬”判断。他认为Coding Agent能力越强行业对更复杂软件任务的训练数据需求反而越大模型每提升一代实验室就需要继续探索新的能力边界和更复杂的任务场景。这一逻辑在现实中已经得到验证。2025年9月发布的SWE-bench Pro基准将评测范围从12个Python代码仓库扩张到41个仓库、4种编程语言任务的平均代码修改量从11行涨到107行平均跨越4个文件单条训练样本的token量从几百个涨到了几万个。根据行业普遍规律模型能力每提升1代对应训练任务的复杂度提升3-5倍数据的信息密度需求提升2-3倍。需求不会消失只会不断向更高阶、更复杂的领域迁移。5.2 自动化的反作用力但Handshake也清楚不能永远依赖人工专家。 Gandalf的推出本质上就是在自动化过去需要大量人工完成的评分工作。合成数据Synthetic data、自我博弈Self-play以及自动验证器技术也一直在发展持续尝试减少对人工反馈的依赖。这形成了AI数据行业一个非常特殊的自我循环一批公司通过组织人类训练AI实现高速增长同时又在努力训练AI替代部分人类训练者。Q合成数据最终会完全取代人类专家训练数据吗A合成数据短期内无法完全替代人类专家数据其质量上限取决于生成模型自身的能力边界。如果模型本身不会完成某个任务它生成的数据也无法教会自己掌握该任务。在模型触及能力边界的领域人类专家的判断仍然是不可替代的基准真值Ground Truth。但长期来看随着模型在更多领域达到或超越人类水平合成数据的占比会持续上升。5.3 模型无法生成的稀缺价值Handshake的故事指向了一个更根本的问题在AI能够生成文本、图像、代码甚至完整工作成果的时代什么才是真正稀缺的资源答案不是“知识”——知识正在被模型压缩进参数中。 答案也不是“推理”——推理能力正在被强化学习与后训练持续提升。真正稀缺的是“模型还不会做、但人类会做”的能力边界本身。每一次模型能力的突破都依赖于人类专家在这个边界上提供的真实数据与经验。而当模型跨越了这个边界下一个边界又会出现。 这条边界会不断移动但边界本身永远存在——至少在模型在所有领域都超越人类之前。Lord提到全球真正有能力每年投入数十亿美元训练前沿模型的实验室数量并不多Handshake的客户天然高度集中。但这个市场的规模仍在扩张因为模型公司已经在这些能够提升经济价值的专业领域投入“数百亿美元”规模的资金。六、工程实践常见误区与效果判断标准6.1 3类典型认知误区当前Agent后训练赛道处于快速发展期行业内普遍存在3类认知误区直接影响训练效果与投入产出比。误区一将Agent训练等同于高端数据标注。很多团队仍沿用传统标注思维只是将标注员替换为领域专家收集大量专家问答对就认为完成了训练准备。这种方式只能提升模型的表面回答能力无法真正提升长程任务完成率最终会出现“测试得分很高、实际干活不行”的对齐偏差。Agent训练的核心是环境闭环与连续决策而非离散的知识点问答。误区二专家数量越多训练效果越好。部分团队盲目扩张专家规模不严格筛选一线工作经验与专业深度导致数据质量参差不齐反而引入大量噪声。Agent训练需要的是深度的工作流还原与真实决策逻辑不是广度的人数堆叠行业普遍经验显示10名资深一线专家的价值远高于100名只有理论背景的参与者——核心原因是一线专家能还原真实决策中的隐性规则与边缘案例而理论型参与者只能输出标准化知识。误区三为追求自动化过度简化工作环境。为了降低成本部分团队大幅简化工作环境用纯文本对话模拟真实工作流程导致模型在模拟环境中指标很漂亮部署到真实环境中完全无法落地。环境还原度是Agent训练效果的核心前提牺牲真实性换取自动化程度不具备实际业务价值。以上误区集中体现在项目需求定义的起点。以下以金融投研Agent项目为例对比典型错误需求与正确训练需求之间的差异。项目需求改写示例金融投研Agent训练需求注以下示例均为格式演示用途所涉产品版本、指标数据均为虚拟示例不对应真实产品参数。对比维度改写前典型错误做法改写后Agent训练正确做法改写逻辑说明任务描述招募50名金融分析师为模型生成的投研报告打分还原金融分析师日常工作流确定每天打开的数据终端、查阅的报告类型、撰写投研备忘录的格式与审核链路设计12类标准投研任务及配套工具调用接口从“离散评分”转向“完整工作流还原”对齐Agent训练的核心需求交付物定义交付5万条标注问答对准确率≥95%交付可运行的金融投研模拟环境、300个标准任务集初级/中级/高级各100个、接口化的自动评分器从“静态数据集”转向“可交互训练沙盒”匹配强化学习的训练模式验证方式人工抽检标注一致性同环境下全链路结果验证检查Agent生成的报告数据来源可追溯性、计算逻辑一致性、结论与依据匹配度从“文本对错”转向“任务完成度验证”真实反映模型的落地能力不同场景下Agent训练的技术选型路径如下6.2 训练效果的可操作判断标准针对后训练投入的合理性与效果可通过3个可落地的标准判断是否存在过度优化任务迁移率标准将训练好的Agent部署到真实工作环境中若任务完成率比训练环境中下降超过30%则说明环境还原度过低存在脱离实际的过度优化。成本结构标准若专家咨询与环境搭建成本占总训练成本的比例低于40%则可能过度偏向自动化验证与合成数据牺牲了训练数据的真实质量。专业可信度标准如果一个不了解该领域的普通人阅读Agent的输出都能发现明显的专业错误则说明专家参与深度不足训练数据存在质量缺陷。Q判断AI后训练投入是否合理的核心依据是什么A判断后训练投入是否合理的核心依据是训练成果能否迁移到真实业务场景并产生实际价值。如果模型在测试环境中指标表现优异但落地到真实工作流中任务完成率不足60%就属于脱离实际的过度优化。结论Handshake从校招平台到10亿美元AI训练服务商的跨界增长不是单个公司的偶然成功而是Agent时代大模型训练需求结构性变化的产业缩影。整个AI训练产业正在经历三层范式转移 第一训练重心从预训练向后训练迁移。顶尖实验室的后训练算力投入已经追平预训练产业基础设施投资正在从“买GPU、建数据中心”扩展到“建专家网络、建RL环境、建验证器”。 第二数据形态从离散文本向完整环境升级。Agent时代最值钱的训练数据不是“互联网上已经存在的”而是“需要重新生产的”——包括真实的工作环境、连续的任务轨迹和可验证的评分标准。 第三供给资源从普通标注员向领域专家集中。模型能力越强对专业深度的要求越高可验证的专家网络、可复现的任务环境、可自动化的验证器共同构成了Agent时代数据基础设施的新范式。对于技术决策者来说Handshake的案例提供了清晰的行动指引如果希望让AI真正落地到垂直行业不要只盯着公开数据集和基准测试你需要的是那个行业真实的工作环境、真实的任务流程和真实的验证标准。这些资源公开互联网上极为稀缺多数需要基于企业真实场景定制生产。对于每一个技术从业者而言这个产业变化也指向了个人价值的锚点那些在真实场景中沉淀下来的、无法被公开数据记录的、包含复杂决策与隐性知识的专业能力才是AI时代长期不可替代的核心竞争力。 【省心锐评】Handshake教会AI工作顺手做了10亿美元生意。真正的悖论是它越成功人类专家就越快从“教练”变成“标本”。
返回列表