十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Phi-3-mini:轻量化AI模型如何重塑边缘计算与本地化部署

Phi-3-mini:轻量化AI模型如何重塑边缘计算与本地化部署 1. 项目概述当“小”成为新的竞争力最近微软在AI圈子里扔下了一颗不大不小的“震撼弹”——Phi-3-mini。这个名字听起来就很有意思“Phi”系列一直走的是“小而精”的路线这次的“mini”更是把“小”做到了极致。官方说它是迄今为止最小的AI语言模型之一但能力却不容小觑号称在多项基准测试中能和一些体量大它好几倍的模型掰掰手腕。这让我这个老码农一下子来了兴趣因为过去几年我们似乎已经习惯了“大就是好好就是大”的叙事动辄千亿、万亿参数的模型发布会总让人感觉AI的门槛越来越高离我们这些普通开发者和中小团队越来越远。Phi-3-mini的出现像是一股清流。它不是一个追求在榜单上刷分的“巨无霸”而更像是一个精心打磨的“瑞士军刀”。它的核心目标非常明确在资源受限的环境下——比如你的笔记本电脑、手机甚至是边缘计算设备上——提供足够可靠、高效的文本理解和生成能力。想想看以前想本地跑个像样的对话模型没个专业显卡、几十G内存根本玩不转。现在一个几B十亿参数级别的模型可能只需要几GB内存就能流畅运行这背后的意义远不止是技术参数的对比。它关乎AI的民主化关乎更多创意和想法能否以更低的成本、更快的速度被验证和实现。所以这篇内容我想和你深入聊聊这个Phi-3-mini。我们不止要看看它的纸面数据更要把它放到真实的应用场景里和那些我们耳熟能详的“大模型”们做个实实在在的对比。我会结合我过去折腾各种模型部署、优化的经验拆解Phi-3-mini的设计思路、它的能耐和局限以及最重要的——它到底适合谁来用怎么用才能发挥最大价值。如果你正在为项目选型纠结或者单纯对“小模型”的潜力感到好奇那么接下来的内容应该能给你一些不一样的视角。2. 核心思路拆解Phi-3-mini为何而“小”要理解Phi-3-mini我们不能只看它“小”的结果更要看它“为何小”以及“如何小得聪明”。这背后是一套完全不同于训练千亿参数模型的设计哲学。2.1 目标场景与核心需求微软推出Phi-3-mini绝不是为了在“最大规模模型”的竞赛中参赛。它的诞生精准地瞄准了几个被“大模型”时代暂时忽略但实际需求极其旺盛的痛点场景边缘与端侧部署这是最核心的应用场景。智能设备、物联网终端、车载系统、甚至你的手机和笔记本电脑。这些设备的共同特点是算力有限、内存紧张、功耗敏感并且对响应延迟要求极高。你不可能在每台智能音箱里塞一块A100显卡也不可能让手机上的翻译App每次调用都联网请求云端大模型那延迟和隐私都是问题。Phi-3-mini的目标就是成为这些设备的“本地大脑”。成本敏感型业务对于很多初创公司、中小团队或个人开发者来说持续调用GPT-4、Claude等大型API是一笔不小的开销。即使是使用开源大模型部署所需的硬件成本和技术门槛也让人望而却步。一个能在消费级GPU甚至CPU上高效运行的优质小模型能极大降低产品原型验证和早期用户服务的成本。特定垂直领域任务很多时候我们并不需要一个“通才”。一个客服机器人只需要精通产品知识和对话流程一个代码辅助工具只需要深刻理解编程语言和常见库。用一个庞大的通用模型来处理这些专门任务就像用高射炮打蚊子不仅浪费还可能因为模型过于“通识”而引入无关的干扰信息。一个在高质量、高相关性数据上精炼出的小模型往往在特定任务上表现更专注、更稳定。研究与快速迭代对于AI研究者或算法工程师动辄需要数百GB显存来加载和微调一个大模型严重拖慢了实验周期。一个小巧但能力不俗的模型可以作为理想的“实验平台”快速验证新的训练方法、架构改进或数据策略。Phi-3-mini的设计正是围绕这些需求展开的。它不是大模型的“缩水版”而是针对“高效、专注、可及”这些目标从数据、架构到训练策略进行的一次全新设计。2.2 关键技术路径“质”大于“量”的数据策略模型变小最直接的风险是能力退化。Phi-3-mini避免退化的核心秘诀我认为很大程度上在于其数据策略。根据微软Phi系列一贯的思路从Phi-1 Phi-1.5到Phi-2Phi-3-mini很可能延续并升级了“教科书级”数据筛选方法。高质量数据过滤与其用互联网上海量、嘈杂、重复的数据进行预训练不如精心筛选一小部分极高品质的数据。这些数据可能包括高质量的教科书、学术论文、精选的代码库如GitHub上星标很高的项目、经过严格审核的百科和知识库内容。数据的“洁净度”和“信息密度”远比“数据量”重要。这就像用顶级食材做一道小菜远比用普通食材做一锅乱炖要美味。合成数据与课程学习这是Phi系列之前的亮点。通过让更大的模型如GPT-4生成大量符合逻辑、结构清晰的数学题、代码题、推理链条然后用这些“合成数据”来训练小模型。这种方法相当于为小模型请了一位“顶级私教”让它直接学习“优等生”的思维模式和解题步骤。Phi-3-mini很可能大量采用了这种技术从而在逻辑推理、代码生成等需要多步思考的任务上获得了超越其参数规模的性能。严格的内容安全与对齐在数据源头就进行严格的安全和伦理过滤比训练完一个大模型再去“对齐”要容易得多效果也更好。小模型因为容量有限更容易被高质量、无害的数据“塑造”出稳定的行为模式。注意这种数据策略对计算资源的要求从“训练算力”部分转移到了“数据清洗与合成算力”上。它需要强大的基础设施来生成和筛选高质量数据但这是一次性的前期投入。相比之下训练一个万亿参数模型所需的持续巨量算力是绝大多数机构无法承担的。2.3 架构与工程优化在模型架构层面Phi-3-mini虽然基于经典的Transformer解码器架构但必然做了大量面向效率的剪枝和优化精简的注意力机制可能会采用更高效的注意力变体如滑动窗口注意力来减少长序列带来的计算平方级增长。激活函数与归一化层优化选择计算更高效的激活函数如Swish GLU的变体和归一化层如RMSNorm这些细节的累积能显著提升推理速度。量化与压缩就绪的设计模型结构在设计时就会考虑后续的量化如INT4, INT8和压缩确保在降低精度后性能损失最小。这为端侧部署打开了大门。总而言之Phi-3-mini的“小”是一种主动选择的结果是围绕特定目标场景通过“数据质量碾压数据数量”、“架构精简配合算法优化”这一套组合拳实现的。它的出现标志着AI模型发展路径的一个重要分叉从一味追求规模的“极限竞赛”转向追求效率、可用性和商业化的“实用主义”道路。3. 与大型模型的深度对比不只是参数的游戏把Phi-3-mini和GPT-4、Claude-3 Opus、Llama 3 70B这样的“庞然大物”放在一起比看似不公平但恰恰能凸显出各自赛道的价值。我们不能只看学术榜单的分数而要从一个项目负责人的角度看看在实际引入时它们分别意味着什么。3.1 能力范围与性能表现首先必须承认在“通用能力”的广度上小模型无法与大模型抗衡。知识广度与深度大模型在预训练时吞下了整个互联网的文本其知识库的覆盖面和时效性是任何小模型难以比拟的。当你问一个非常冷门的历史事件细节或者需要整合多领域知识进行复杂创作时大模型的表现通常更可靠。复杂推理与思维链对于需要数十步逻辑推理、多模态信息融合虽然Phi-3-mini是纯文本模型或高度创造性的任务如写一部小说的第一章大模型因其庞大的参数所承载的复杂模式识别能力依然优势明显。指令遵循与上下文学习大模型通常在海量指令微调数据上训练对于复杂、多轮或模糊的用户指令理解得更细腻泛化能力更强。然而Phi-3-mini在它的“射程范围”内表现可能令人惊喜常识推理与基础编程在MMLU大规模多任务语言理解、GSM8K小学数学等基准测试上根据微软发布的数据Phi-3-mini38亿参数的成绩已经接近甚至超越了早期更大的模型如Llama 2的70亿参数版本。这意味着在日常对话、基础逻辑判断、编写简单脚本和函数方面它完全堪用。特定任务精调后的潜力这是小模型的杀手锏。如果你有一个法律文书分类的任务收集几万条高质量的法律条文和案例对Phi-3-mini进行精调它在这个垂直任务上的准确率和速度很可能远超“泛泛而谈”的通用大模型。因为小模型参数少更容易被专项数据“塑造”和“记住”特定模式。响应速度与确定性参数少计算量就小。在同等硬件上Phi-3-mini的生成速度吞吐量和响应延迟时延会远优于大模型。这对于需要实时交互的应用如聊天、游戏NPC至关重要。同时小模型因为“记忆容量”有限产生“幻觉”即胡编乱造的概率和程度有时反而比“想象力过于丰富”的大模型要低一些输出更稳定。3.2 部署与成本考量这是对比最悬殊也是Phi-3-mini最具颠覆性的地方。对比维度Phi-3-mini (示例: 3.8B参数)大型模型 (示例: Llama 3 70B)分析与影响内存占用 (推理)~8 GB (FP16)~140 GB (FP16)Phi-3-mini可放入消费级显卡如RTX 4070 12GB或通过量化放入手机内存。大模型需要多张专业卡或云上高端实例。推理速度极快较慢在相同硬件上Phi-3-mini的Token生成速度可能是大模型的数十倍用户体验是“瞬间响应”与“等待数秒”的差别。硬件门槛低高端笔记本、单张消费级GPU、甚至高性能CPU。极高需要多张A100/H100或等效云服务。Phi-3-mini让本地化、私有化部署成为每个开发者触手可及的事彻底摆脱对云API的依赖。运行成本极低电费可忽略不计无API调用费用。高昂云实例费用每小时数十美元或高昂的电费与硬件折旧。对于需要7x24小时运行的服务成本差异可能是“每月几百元”与“每月数十万元”的天壤之别。隐私与安全完全可控数据不出本地满足最严格的合规要求。依赖供应商使用云API需信任供应商的数据政策有泄露风险。金融、医疗、政务等敏感行业Phi-3-mini这类模型是唯一可行的技术路径。3.3 开发与运维体验对于开发团队来说选择不同规模的模型意味着完全不同的工作流。精调Fine-tuning成本精调一个70B参数的模型需要协调庞大的计算集群一次实验的成本和时间代价巨大。而精调一个3.8B的模型一张显卡可能几小时就能完成。这意味着你可以快速进行A/B测试迭代不同的数据策略和超参数试错成本极低。调试与可解释性模型越小其内部行为在理论上相对更容易分析和调试。虽然Transformer仍然是黑盒但更少的参数意味着更简单的激活模式在出现问题时定位根源的可能性稍大一些。供应链风险依赖某个云服务商的大模型API存在服务涨价、条款变更、甚至服务中断的风险。将核心能力构建在一个可以完全自主掌控的小模型上技术栈的自主性和稳定性更高。实操心得在我参与过的一个内部知识库问答项目中我们最初尝试用大型API。虽然效果尚可但延迟高2秒且涉及内部技术细节时经常“幻觉”频出。后来我们改用了一个类似Phi-3-mini规模的开源模型用几千条内部问答数据精调后准确率从75%提升到92%响应时间降到200毫秒以内并且可以部署在公司的内部服务器上彻底解决了数据安全顾虑。这个案例让我深刻体会到“最适合的才是最好的”在很多场景下“够用且高效”远比“强大但笨重”更有价值。4. 实战如何获取、运行并评估Phi-3-mini理论说了这么多是骡子是马还得拉出来溜溜。下面我就以一个实践者的角度带你走一遍本地部署和简单测试Phi-3-mini的流程。这里我会以Hugging Face作为模型来源使用Ollama作为本地运行引擎因为它对新手最为友好。4.1 环境准备与工具选型首先你需要一个能跑起来的环境。Phi-3-mini对硬件要求很亲民但为了最佳体验我建议硬件最低配置一台拥有8GB以上系统内存的现代电脑过去5年内的CPU。纯CPU推理可以运行但速度较慢。推荐配置拥有一张显存不小于8GB的NVIDIA显卡如RTX 3060 12G, RTX 4060 Ti 16G。这将允许你使用GPU进行加速获得流畅的交互体验。内存16GB或以上系统内存会更从容。软件Ollama这是目前最简单易用的本地大模型运行框架。它帮你处理了模型下载、加载、上下文管理等一系列麻烦事提供一个类似OpenAI API的简单接口。去其官网下载对应操作系统的安装包即可。可选代码IDE或终端用于编写调用脚本。4.2 使用Ollama一键部署Ollama的使用简单到令人发指。假设你已经安装好了Ollama安装后命令行输入ollama应有输出。拉取模型打开你的终端Windows用PowerShell或CMDMac/Linux用系统终端输入以下命令ollama pull phi3:mini这个命令会从Ollama的模型库中下载Phi-3-mini的最新版本。模型大小大约在2-3GB左右经过量化下载速度取决于你的网络。运行与交互下载完成后直接运行ollama run phi3:mini你会立刻进入一个交互式聊天界面。你可以直接输入问题比如“用Python写一个快速排序函数”或者“解释一下量子计算的基本原理”。模型会开始生成回答。按CtrlD可以退出交互模式。作为服务调用更实用的方式 交互式聊天适合体验真正开发时需要API。启动Ollama服务后它默认会在http://localhost:11434提供一个兼容OpenAI API格式的接口。启动服务如果未自动运行通常Ollama安装后会自动在后台运行服务。你可以用任何HTTP客户端如curl、Postman或编程语言来调用。例如一个简单的Python调用脚本import requests import json def ask_phi3(prompt): url http://localhost:11434/api/generate data { model: phi3:mini, prompt: prompt, stream: False # 设为True可以流式接收体验更好 } response requests.post(url, jsondata) return response.json()[response] if __name__ __main__: question 为什么天空是蓝色的 answer ask_phi3(question) print(f问{question}) print(f答{answer}) # 你也可以尝试更复杂的任务比如 # print(ask_phi3(将以下文字翻译成英文今天天气真好适合去公园散步。)) # print(ask_phi3(总结下面这段话的核心观点[输入一段长文本]))4.3 基础能力评估与测试部署好后不要只看它能不能聊天。我建议你设计几个小测试来切身感受它的能力边界逻辑与数学测试提问“如果三只猫三天能抓三只老鼠那么九只猫九天能抓几只老鼠”经典的比例推理题观察点看它是机械地做乘法3-9, 3-9, 33327错误还是能理解“猫数×天数”与“老鼠数”的正比关系得出27只的正确结论。这考验其基础推理能力。代码生成与理解任务“写一个Python函数接收一个列表返回这个列表的所有子集。”观察点生成的代码是否简洁、正确是否考虑了空集是否使用了itertools.combinations等标准库你可以直接复制代码到Python环境里运行测试。指令遵循与格式控制任务“请以JSON格式输出三位中国古代著名诗人的信息包含字段name姓名 dynasty朝代 representative_work代表作。”观察点输出是否严格符合JSON格式字段是否齐全内容是否准确这考验模型对复杂指令的解析和执行能力。知识广度与时效性提问“介绍一下微软最近发布的Phi-3-mini模型的特点。”用模型来评价自己观察点它的回答是否准确能否提到“小参数”、“高性能”、“适合端侧部署”等关键点这能反映其训练数据的新旧程度和知识覆盖范围。注意事项在测试时你可能会发现Phi-3-mini对于一些非常近期2024年第一季度以后的事件或者极度冷门的知识点一无所知或回答错误。这是所有基于固定时间点数据训练的模型的通病并非它的缺陷。它的优势不在于此。4.4 进阶尝试精调Fine-tuning如果你有一个特定的任务比如客服话术生成、专业领域术语解释想让Phi-3-mini变得更专业精调是下一步。虽然Ollama本身不直接提供精调功能但你可以利用Hugging Face的transformers和peft库在本地进行。精调一个3.8B模型相比大模型要轻松很多数据准备准备几百到几千条高质量的(指令, 输出)配对数据。环境一张显存足够的显卡如24GB的RTX 4090可以轻松应对。方法采用参数高效微调技术如LoRA。这种方法只训练模型新增的一小部分参数通常不到原模型的1%速度快效果好且能保留模型的通用能力。工具使用trlTransformer Reinforcement Learning库可以很方便地实现基于SFT监督微调的精调流程。这个过程涉及更多代码和机器学习知识但社区有大量现成的脚本和教程。关键在于你的任务数据是否高质量、有代表性。一旦精调成功你就能获得一个为你量身定做的、在特定任务上表现卓越的专属模型这才是小模型价值的最大化。5. 典型应用场景与选型指南了解了Phi-3-mini的能力和部署方式我们最终要回到现实问题我到底该不该用它它适合我的项目吗下面我结合常见场景给你一些具体的选型建议。5.1 Phi-3-mini的“高光”场景以下这些情况选择Phi-3-mini或类似的小型优质模型往往是更优解智能终端设备助手智能音箱、车载语音助手、智能家居中控。需要低延迟、离线可用、保护用户隐私。Phi-3-mini完全可以处理天气查询、设备控制、简单百科问答、讲故事等任务。企业内部效率工具代码助手集成在IDE中提供单文件、单函数的代码补全、注释生成和解释。对代码上下文的理解要求适中但响应必须极快。文档智能助手基于企业内部知识库Wiki、Confluence、项目文档构建的问答机器人。通过检索增强生成技术让Phi-3-mini根据检索到的相关文档来回答可以极大提升准确率完美满足信息安全要求。会议纪要生成与摘要在本地处理音频转文本后的内容生成要点摘要和待办事项数据完全不出内网。教育类应用个性化辅导为学生提供解题思路、作文润色、语言练习伙伴。模型可以部署在学校服务器或教育平板上成本可控。互动电子书让故事书中的角色能与孩子进行简单的、安全的对话。游戏与互动娱乐NPC对话生成为游戏中的非玩家角色赋予动态的、符合角色设定的对话能力。每个NPC可以搭载一个独立的微调后的小模型实现大规模、低成本的智能化。原型验证与MVP开发创业团队在产品早期需要快速验证“AI功能”是否能带来用户价值。使用Phi-3-mini本地部署可以零成本、快速搭建出可演示、可体验的原型收集反馈而无需在初期就承担高昂的API费用。5.2 何时仍需选择大型模型当然大型模型不可替代的价值依然存在在以下场景你仍应优先考虑它们需要广博知识和深度分析的复杂研究例如撰写一篇涉及多学科交叉的综合性研究报告或分析一个涉及政治、经济、文化等多方面因素的复杂社会事件。高度创造性和开放性的内容生成创作长篇小说、诗歌、剧本或进行天马行空的艺术构思。大模型的“想象力”和“知识缝合能力”目前仍远超小模型。处理极其复杂、模糊或多轮的用户指令当用户的请求非常不清晰需要模型进行大量上下文推断和意图揣摩时大模型的理解能力更强。作为“裁判”或“评估者”例如用于评估其他AI模型生成内容的质量、安全性或创造性。这需要模型自身具备极高的综合能力。5.3 选型决策流程图与检查清单为了帮你更直观地做决定我画一个简单的决策思路首先问你的应用是否必须离线/私有化部署或对延迟、成本极度敏感是-强烈倾向选择Phi-3-mini等小模型。这是它的主场。否- 进入下一步。其次问你的核心任务是否是高度垂直、领域特定的如法律条文查询、医疗报告摘要、特定风格文案生成是-优先考虑用小模型如Phi-3-mini进行精调。用高质量领域数据精调后的小模型在专精任务上的性价比和性能通常优于直接调用通用大模型。否- 进入下一步。再问你的任务是否需要极其广博的实时知识、复杂的多步推理或高度的创造性是-需要依赖大型模型。可以评估使用云端API如GPT-4、Claude-3或部署开源大模型如Llama 3 70B如果硬件允许。否-可以尝试Phi-3-mini。用它进行原型开发和初步测试如果效果满意就足以支撑产品需求。最后无论选哪个都请进行概念验证用大约50-100个真实场景的测试用例分别用Phi-3-mini可精调和候选大模型跑一遍从准确性、速度、成本、稳定性四个维度打分。让数据说话而不是盲目追随技术潮流。6. 常见问题与避坑指南在实际折腾Phi-3-mini这类小模型的过程中你肯定会遇到各种各样的问题。我把我踩过的一些坑和解决方案总结在这里希望能帮你节省时间。6.1 部署与运行问题问题Ollama拉取模型速度慢或失败。原因网络连接问题或Ollama默认镜像源在国内访问不畅。解决检查网络确保能正常访问外网。使用镜像源对国内用户尤其重要Ollama允许配置镜像。可以尝试寻找可靠的国内镜像源或者使用代理工具改善网络环境。具体配置方法需参考Ollama官方文档或社区分享。手动下载如果实在无法通过Ollama下载可以尝试从Hugging Face模型库手动下载Phi-3的模型文件需注意格式转换然后通过Ollama的ollama create命令从本地文件创建模型。问题模型运行时报“CUDA out of memory”或速度非常慢。原因显存不足模型被迫在CPU上运行或使用了内存交换。解决检查可用显存使用nvidia-smi命令查看。Phi-3-mini的FP16版本需要约8GBINT4量化版本仅需约2-3GB。使用量化版本Ollama拉取的phi3:mini默认可能是4-bit或8-bit量化版占用显存较小。如果你是自己从Hugging Face加载确保加载的是phi-3-mini-4k-instruct这类指令调优版并使用bitsandbytes库进行4/8比特量化加载。限制上下文长度模型上下文越长占用显存越多。通过API调用时可以设置num_ctx参数如设为2048来限制最大上下文长度。关闭无关程序释放被其他程序占用的显存。问题生成的回答看起来“很傻”或答非所问。原因提示词Prompt不够清晰或者模型本身在某个领域知识不足。解决优化提示词小模型对提示词更敏感。尝试使用更明确、结构化的指令。例如不要问“写一篇关于春天的文章”而是问“请以散文的格式写一篇约200字、描绘春天公园景象的文章要求语言优美包含视觉和嗅觉的描写”。提供上下文在提问前先给模型提供必要的背景信息。例如“你是一位经验丰富的Python程序员。请优化以下代码的循环效率[你的代码]”。使用检索增强对于知识性问题不要依赖模型的内部记忆。先从你的知识库中检索出相关文档然后将“文档问题”一起交给模型让它基于文档回答。这能极大提升准确率。6.2 性能与效果调优问题如何提高推理速度确保使用GPU这是最大的提速因素。使用量化INT4量化通常对精度影响很小但能显著提升推理速度和减少内存占用。调整生成参数降低max_tokens生成的最大长度使用贪婪解码greedy而非采样都能加快速度但可能会影响文本多样性。使用更快的推理库除了Ollama可以尝试vLLM或TGI这类为生产环境优化的高性能推理服务器它们对批处理和持续吞吐做了大量优化。问题精调时遇到过拟合怎么办现象模型在训练数据上表现完美但在新数据上表现很差。解决增加数据量这是最根本的。小模型也需要足够的数据来泛化。使用更强的正则化增加Dropout率或使用权重衰减。早停密切监控在验证集上的表现一旦性能不再提升甚至下降立即停止训练。使用LoRA时降低秩LoRA的r参数控制新增参数的量降低r可以减少模型容量有助于防止过拟合。混合原始预训练数据在精调数据中混入少量原始的、通用的预训练数据可以帮助模型保持一定的通用能力。6.3 安全与内容过滤即使Phi-3-mini在训练时经过了严格的安全对齐任何语言模型在部署时都应考虑内容安全。部署后过滤在模型输出到用户之前一定要添加一层后处理过滤层。可以使用关键词过滤列表或者使用一个专门的小型分类模型来检测输出中是否包含有害、偏见或不合规的内容。系统提示词约束在每次对话开始时通过系统提示词System Prompt明确约束模型的行为。例如“你是一个有帮助且无害的助手。你不得生成暴力、仇恨、自残或色情内容。如果用户请求此类内容你应礼貌地拒绝并引导对话至积极方向。”监控与日志记录模型的输入和输出定期审查以便发现潜在的问题模式并及时调整。最后一点体会从“追逐最大模型”到“审视最小可行模型”这种思维的转变对于工程师和产品经理来说都至关重要。Phi-3-mini的出现不是一个技术奇点而是一个强烈的信号AI正在从实验室的尖端科技变成工程师工具箱里一件趁手的、可量产的“普通”工具。它的价值不在于取代谁而在于开启无数个以前因为成本、延迟或隐私问题而无法被AI赋能的新场景。下一次当你为项目技术选型时不妨先问一句“我真的需要一个千亿参数的模型吗还是一个几B参数的‘小钢炮’就足够了” 很多时候答案会是后者。
返回列表