十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

数据科学生命周期实战指南:从数据捕获、分析到沟通的完整旅程(Data-Science-For-Beginners)

数据科学生命周期实战指南:从数据捕获、分析到沟通的完整旅程(Data-Science-For-Beginners) 数据科学生命周期实战指南从数据捕获、分析到沟通的完整旅程Data-Science-For-Beginners【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本指南以微软开源课程 Data-Science-For-Beginners 的第 4 部分「数据科学生命周期」为核心系统梳理数据科学项目的五大阶段并重点深入生命周期中的捕获Capturing、处理Processing、维护Maintaining、分析Analyzing与沟通Communication五个环节。读完本文你将掌握用 Pandas 执行探索性数据分析EDA的完整套路、用讲故事的方式传递数据洞察的方法论并能复现仓库中基于纽约出租车数据的真实作业流程。数据科学生命周期为什么数据科学是一个过程经过前面课程的学习你应该已经意识到数据科学不是一次性的写代码动作而是一个过程。在 生命周期介绍 中这一过程被拆解为 5 个阶段捕获Capturing获取数据并定义要解决的问题处理Processing从数据中发现模式并建模分析Analysis验证数据能否回答提出的问题沟通Communication向受众传递数据背后的故事维护Maintenance贯穿项目始终的数据管理、存储与安全。其中本课程的介绍部分重点聚焦捕获、处理和维护三个阶段分析15-analyzing与沟通16-communication则各有独立课程深入展开。下图给出了该生命周期的整体示意图片来源Berkeley School of Information。捕获Capturing定义问题与获取数据捕获是生命周期中最关键的阶段因为后续所有阶段都依赖它。它实际上是两个阶段的合并获取数据定义需要解决的目的与问题。定义项目目标定义项目目标需要深入到问题或疑问的上下文中识别并找到需要被解决问题的人如业务干系人、项目赞助方由他们帮助明确谁会从这个项目中受益、他们需要什么、以及为什么需要一个定义良好的目标应当是可测量、可量化的从而界定出可接受的结果。数据科学家在此阶段常问自己以下问题这个问题之前是否有人尝试过发现了什么目的和目标是否被所有参与者理解是否存在歧义如何减少歧义有哪些约束条件最终结果可能长什么样有多少可用资源时间、人员、计算能力获取并评估数据其次是识别、收集并最终探索达成目标所需的数据。在获取这一步数据科学家还必须评估数据的数量与质量这需要一定的数据探索来确认所获数据能支撑期望的结果。关于数据数据科学家常问的问题我已经有哪些数据谁拥有这些数据有哪些隐私顾虑数据量是否足够解决这个问题数据质量对此问题是否可接受如果通过数据发现了额外信息是否应该考虑调整或重新定义目标处理Processing发现模式与建模处理阶段聚焦于发现数据中的模式以及建模。该阶段使用的一些技术需要统计方法去揭示模式。对于大型数据集人工完成这类工作是繁琐的通常依赖计算机承担繁重工作来加速进程。处理阶段也正是数据科学与机器学习交汇的地方机器学习是构建模型以理解数据的过程而模型是数据中变量之间关系的表示用于预测结果。该阶段常用技术包括分类Classification将数据组织到类别中以便更高效地使用聚类Clustering将数据分组为相似群组回归Regression确定变量之间的关系以预测或预报数值。这些机器学习技术的系统讲解在本仓库之外的 ML for Beginners 课程中本课程在此仅作为生命周期环节提及。维护Maintaining贯穿全程的数据管理在生命周期图中你可能注意到维护位于捕获与处理之间。维护是一个持续的过程负责在项目全过程中管理、存储和保护数据并且应在整个项目中持续考量。存储数据位置与成本权衡数据存储的位置与方式会影响存储成本以及数据访问的速度。这类决策通常不完全由数据科学家单独做出但他们往往需要根据数据存储方式来决定如何与数据打交道。现代数据存储系统中有几个关键维度本地部署 vs 外部托管 vs 公有/私有云本地部署On premise在自有设备上托管数据例如自购带硬盘的服务器外部托管Off premise依赖不属于自己的设备例如数据中心公有云Public cloud存储数据的流行选择无需了解数据具体如何存储或存在哪里底层基础设施由所有云用户共享私有云Private cloud一些组织有严格的安全策略要求对托管数据的设备拥有完全访问权限因此使用提供自有云服务的私有云。关于云端数据的更多内容参见本仓库的 云端数据科学章节。冷数据 vs 热数据训练模型时可能需要更多训练数据即使模型已令人满意也会有新数据持续到来。无论如何随着数据积累存储与访问成本都会上升。将很少使用的冷数据cold data与频繁访问的热数据hot data分离可以通过硬件或软件服务降低存储成本。冷数据在需要访问时取回耗时通常比热数据更长。管理数据持续清洗保证质量与数据打交道时你会发现部分数据需要用 数据准备课程 中介绍的技术进行清洗才能构建准确的模型。当新数据到来时也需要应用同样的方法以保持质量一致。某些项目会使用自动化工具在数据移动到最终位置之前执行清洗、聚合与压缩例如 Azure Data Factory 就是这类工具之一。保护数据安全与伦理保护数据的主要目标之一是确保相关人员能够掌控收集了什么数据、在什么情境下被使用。保持数据安全包括只向需要的人开放访问权限、遵守当地法律法规、以及维持伦理标准——这与 伦理课程 中的内容一脉相承。团队出于安全考虑通常会做的事确认所有数据均已加密向客户说明其数据如何使用移除已离开项目人员的数据访问权限只允许特定项目成员修改数据。分析Analyzing用 Pandas 做探索性数据分析生命周期中的分析环节用于确认数据能够回答所提出的问题或解决特定问题也可以用于确认模型是否正确处理了这些问题。本课程聚焦探索性数据分析EDA——一组定义数据内特征与关系、并为建模准备数据的技术。课程使用一个来自 Kaggle 的邮件垃圾邮件分类数据集每封邮件中常见单词的计数来源匿名结合 Python 与 Pandas 库演示。你可以跟随 分析 Notebook 实际操作数据文件为仓库中的 data/emails.csv。数据画像Data Profiling与描述性统计如何评估是否有足够数据解决问题数据画像通过描述性统计技术对数据集进行汇总帮助我们了解有什么可用而描述性统计帮助我们了解有多少可用。Pandas 的describe()函数可给出数值数据的 count、max/min、均值、标准差与分位数。仓库 Notebook 中的用法import pandas as pd # 加载数据集 path ../../data/emails.csv email_df pd.read_csv(path) # 在邮件数据集上使用 describe print(email_df.describe())输出示例节选the to ect and for of count 406.000000 406.000000 406.000000 406.000000 406.000000 406.000000 mean 7.022167 6.519704 4.948276 3.059113 3.502463 2.662562 std 10.945522 9.801907 9.293820 6.267806 4.901372 5.443939 min 0.000000 0.000000 1.000000 0.000000 0.000000 0.000000 25% 1.000000 1.000000 1.000000 0.000000 1.000000 0.000000 50% 3.000000 3.000000 2.000000 1.000000 2.000000 1.000000 75% 9.000000 7.750000 4.000000 3.000000 4.750000 3.000000 max 99.000000 88.000000 79.000000 69.000000 39.000000 57.000000使用describe()这类描述性统计可以帮助你评估当前拥有多少数据、以及是否还需要更多。采样Sampling与查询Querying在大数据集上探索一切非常耗时通常交给计算机处理。采样是理解数据的得力工具通过样本你可以应用概率与统计得出关于数据的一般性结论。虽然采样多少没有硬性规定但采样越多泛化越精确。Pandas 的sample()函数可以传入随机采样的条数# 采样 10 封邮件 print(email_df.sample(10))而查询与采样互补查询让你聚焦于你好奇的数据的特定部分通过query()选择列并通过返回的行获得关于数据的简单答案。仓库 Notebook 中演示了返回 to 出现次数多于 the 的行# 返回 to 出现次数多于 the 的行 print(email_df.query(the to))输出节选共 169 行 × 17 列Email No. the to ect and for of a you in on is this i 1 Email 2 8 13 24 6 6 2 102 1 18 21 13 0 61 3 Email 4 0 5 22 0 5 1 51 2 1 5 9 2 16 ... [169 rows x 17 columns]探索性可视化你不必等到数据彻底清洗、分析完毕才开始创建可视化。事实上在探索过程中就拥有视觉表示能帮助你识别数据中的模式、关系与问题。此外可视化提供了一种与不参与数据管理的人沟通的途径可以分享并澄清捕获阶段未解决的问题。关于常见的可视化探索方式可参考本仓库的 可视化章节。识别不一致与缺失值本课的所有技术都有助于识别缺失或不一致的值但 Pandas 还提供了专门函数isna()或isnull()可检查缺失值。探索这些值时一个重要的点是探究它们为什么会变成这样——这能帮助你决定采取什么 行动来解决它们。沟通Communication用讲故事的方式传递数据沟通是数据科学生命周期中最容易被低估、却至关重要的阶段。沟通就是传达或交换信息——信息可以是想法、思想、感受、消息甚至数据。发送信息的一方称为沟通者communicator接收方称为受众audience。沟通数据的核心原则是不要简单地把数字甩给受众而要讲一个由数据支撑的故事。人们更容易记住你讲的故事而不是你给的一个数字。两种沟通类型单向沟通One-way communication发送方发出信息后不期待反馈。例如群发邮件、新闻播报、电视广告——发送方只是传达信息不寻求交换。双向沟通Two-way communication所有参与者既是发送者又是接收者接收方会提供反馈或回应。例如面对面交谈、电话、社交媒体、短信。沟通数据时两者都会用到在会议上向一大群人演讲之后无法直接提问属于单向沟通用数据说服几位干系人达成共识、说服队友投入时间建设新事物则属于双向沟通。有效沟通的五大策略1. 理解你的受众、渠道与沟通方式你与家人沟通的方式和与朋友沟通的不同数据沟通也应如此。根据Harvard Business Review文章《How to Tell a Story with Data》受众大致可分为五类新手Novice第一次接触该主题但不希望被过度简化通才Generalist了解该话题但寻求概览性理解与主要主题管理层Managerial需要关于细节与相互关系的深入、可操作的理解并能接触细节专家Expert需要更多探索与发现而非简化叙事高管Executive只有时间捕捉加权概率的意义与结论。此外还要考虑沟通渠道备忘录/邮件 vs 会议/演讲以及使用单向还是双向沟通。例如面对多数是新手受众且为单向沟通时必须先教育受众、给出上下文再呈现数据并解释其含义与重要性此时要极致聚焦清晰度因为受众无法直接提问。2. 以终为始Begin with the End in Mind在开始沟通前先明确你希望受众带走什么。动笔前写下你的关键结论然后在准备故事的每一步问自己这如何融入我要讲的故事但要注意摘樱桃Cherry-Picking不能只沟通支持你结论的数据而忽略其他数据。如果某些数据不支持你的结论、甚至支持相反论点你也应当如实呈现若仍然坚持自己的故事要向受众坦白并解释原因。3. 像讲故事一样组织Approach it Like an Actual Story传统故事有五个阶段Exposition铺陈、Rising Action上升、Climax高潮、Falling Action下落、Denouement收尾——或者更易记的Context背景、Conflict冲突、Climax高潮、Closure收束、Conclusion结论背景设定舞台让受众在同一页面上冲突为什么要收集这些数据要解决什么问题高潮数据是什么数据意味着什么数据告诉我们需要什么解决方案收束重申问题与提议的解决方案结论总结关键结论与建议团队采取的下一步。4. 使用有意义的词句模糊的表达会让不同听众得出不同结论。例如用户需要很长时间才能完成平台注册——一小时还是一周如果改为用户平均只需 3 分钟即可完成注册和上手信息就清晰得多。类似地我们度过了令人印象深刻的一年2% 还是 50% 的增长、用户成功率大幅提升、这项工作需要巨大努力都是模糊表达。模糊语言可以作为引出更多数据的前奏或讲完故事的总结但请确保呈现的每个部分都对受众清晰。5. 运用情感Use Emotion情感是讲故事的关键数据故事尤甚。唤起情感能帮助受众共情、更可能采取行动也更容易记住你的信息。具体做法使用证言与个人故事收集数据时同时收集定量与定性数据若数据主要是定量的就向个体寻找他们的经历故事使用意象Imagery图片帮助受众把自己代入情境推动受众产生你认为他们应持有的情绪使用色彩Color不同颜色唤起不同情绪——蓝色通常唤起平静与信任绿色常与自然和环境相关红色通常是激情与兴奋黄色通常是乐观与幸福。注意颜色在不同文化中可能有不同含义。沟通案例研究Emerson 的 30 分钟会议Emerson 是一款移动应用的产品经理他发现客户在周末提交的投诉和 bug 报告多 42%投诉在 48 小时内未获回应的客户给应用打出 1 或 2 星评级的可能性高 32%。Emerson 的研究给出了两个解决方案方案 1雇佣客服代表周末上班方案 2购买新的客服工单系统让客服能轻松识别排队最久的投诉。在首次会议上Emerson 的 30 分钟是这样分配的5 分钟解释低评分为何糟糕10 分钟解释研究过程10 分钟逐条过近期客户投诉最后 5 分钟草草带过两个解决方案。结果三位公司负责人的记忆点各不相同一位只记得那 10 分钟投诉一位只关注研究过程第三位记住了方案却不知道如何落地——Emerson 想让负责人带走的和他们实际带走的出现了巨大差距。改进后的方案遵循背景、冲突、高潮、收束、结论结构背景前 5 分钟说明应用商店评分目前是 2.5而评分对应用商店优化ASO至关重要直接影响搜索曝光与潜在用户观感进而直接关联收入冲突5 分钟用户周末提交的投诉多 42%48 小时未回应的客户给高于 2 星评级的可能性低 32%。把评分提升到 4 分可使曝光度提升 20%-30%预计收入增加 10%。并准备好论证这些数字高潮5 分钟介绍两个解决方案、如何解决所述问题、如何融入现有工作流、成本与 ROI甚至展示截图或线框图还可引用等待超 48 小时用户的证言与内部客服对现行工单系统的评价收束5 分钟重述公司面临的问题、回顾方案、论证为何这些方案是正确的结论10 分钟因为这是与少数干系人开会的双向沟通场景留出 10 分钟答疑确保会议结束前澄清所有困惑。这样组织后负责人们更可能带走 Emerson 真正想传达的信息投诉与 bug 的处理方式可以改进并且有两个方案可以落地。这正是有效的数据沟通与故事叙述的力量所在。配套实战三份可运行的作业与数据生命周期的知识最终要落到动手。本章节仓库提供了三份层层递进的作业全部围绕同一个业务问题展开纽约市黄色出租车乘客在冬季还是夏季给司机的小费更多作业一评估数据集捕获阶段在 评估数据集作业 中你处于生命周期捕获阶段负责处理数据集。仓库提供了 评估 Notebook 与 出租车数据200 条 2019 年 1 月和 7 月的出行记录18 列来自纽约出租车与轿车委员会。Notebook 中加载数据的核心代码import pandas as pd path ../../data/taxi.csv df pd.read_csv(path) print(df)数据列包括VendorID、tpep_pickup_datetime、tpep_dropoff_datetime、passenger_count、trip_distance、RatecodeID、PULocationID、DOLocationID、payment_type、fare_amount、extra、mta_tax、tip_amount、tolls_amount、improvement_surcharge、total_amount、congestion_surcharge等。任务要求评估该数据集能否帮助回答客户的问题在 NYC Open Data 目录中找出一个可能有助于回答该问题的补充数据集写下 3 个你希望向客户澄清、以便更好理解问题的提问。作业二探索答案分析阶段探索答案作业 是作业一的延续此时团队进入生命周期分析阶段负责对数据集做 EDA。使用本课技巧在 Notebook 中回答数据中还有哪些因素会影响小费金额哪些列最可能不需要用来回答客户问题基于目前提供的数据数据是否显示了季节性小费行为的证据作业三讲一个故事沟通阶段讲故事作业 则把重心转向沟通数据科学就是讲故事。选择一个数据集写一篇短文讲述你能从中讲出的故事——你希望数据集揭示什么如果揭示的结果有问题你会怎么做如果数据不能轻易解锁其秘密呢把数据集可能呈现的场景写下来。挑战比较 TDSP 与 CRISP-DM 生命周期数据科学生命周期有很多版本每一步可能有不同名称和阶段数量但都包含本课提到的相同过程。一个值得完成的挑战是探索Team Data Science ProcessTDSP生命周期与跨行业数据挖掘标准流程CRISP-DM并说出两者之间的 3 个相似点和 3 个差异点。仓库中 生命周期介绍章节 提供了两者的示意图images/tdsp-lifecycle2.png与images/CRISP-DM.png。TDSP 还提供了关于项目中各类角色与任务的资源可帮助你理解不同角色如何聚焦于各阶段的特定部分。小结数据科学是一个包含捕获、处理、分析、沟通、维护五阶段的过程捕获阶段要定义可量化目标并评估数据的数量与质量处理阶段用统计方法与机器学习模型揭示模式维护是贯穿全程的工作涵盖存储位置选择本地/云、冷/热数据、数据管理与安全伦理分析阶段用describe()、sample()、query()、isna()等 Pandas 工具做 EDA回答数据够不够、质量行不行、目标要不要调整沟通阶段要区分单向与双向沟通掌握理解受众、以终为始、像故事一样组织、使用有意义的词句、运用情感五大策略并警惕摘樱桃式选择性呈现。你可以打开仓库中的三份 Notebook评估、分析、沟通作业与 出租车数据 亲自走完整个生命周期将方法论转化为可复用的实战能力。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表