ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

Data-Science-For-Beginners 数据集评估实战:基于纽约出租车数据的冬季与夏季小费分析

Data-Science-For-Beginners 数据集评估实战:基于纽约出租车数据的冬季与夏季小费分析 Data-Science-For-Beginners 数据集评估实战基于纽约出租车数据的冬季与夏季小费分析【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本指南以 Data-Science-For-Beginners 课程第 14 课数据科学生命周期导论的课后作业为骨架完整呈现数据科学生命周期 Capturing采集阶段的数据集评估流程。读者将掌握如何判断一份原始数据能否回答业务问题、如何通过探索性分析发现数据缺口、如何补充关联数据源以及如何用澄清性问题消除需求歧义。文中所有结论均基于仓库中的 notebook.ipynb 与 taxi.csv 的真实数据验证。任务背景一个关于季节与小费的业务问题课程 14-Introduction/README.md 将数据科学生命周期拆解为 5 个阶段Capturing采集、Processing处理、Analysis分析、Communication沟通、Maintenance维护。本次作业明确将团队定位在Capturing 阶段——这是整个生命周期中最关键的一环因为后续所有阶段都依赖它。作业场景对应 assignment.md 的英文原版与 translations/fa/4-Data-Science-Lifecycle/14-Introduction/assignment.md 波斯语版一位客户向你的团队求助希望调查纽约市出租车顾客的季节性消费习惯。他们想知道纽约市黄色出租车乘客在冬季给司机的小费更多还是在夏季作为 Capturing 阶段的数据负责人你的核心职责不是立刻建模而是评估这份已提供的数据集能否支撑回答这个问题并识别缺失的信息。数据集初探从 notebook 到真实文件仓库为本次任务提供了两份关键资产资产路径作用分析笔记本notebook.ipynb用 Python/pandas 加载出租车数据数据文件data/taxi.csv200 行 × 18 列的纽约黄色出租车行程记录notebook.ipynb 的加载逻辑如下代码来自 notebook 首个代码单元import pandas as pd path ../../data/taxi.csv # 将 CSV 文件加载为 dataframe df pd.read_csv(path) # 打印 dataframe print(df)notebook 元数据还揭示了运行环境Python 3.9.7数据源为纽约市出租车与轿车委员会NYC Taxi Limousine Commission的黄色出租车行程数据。也可以直接用文本编辑器或 Excel 打开 taxi.csv 查看——这正是作业建议的备选方式。对真实数据的独立验证在仓库中执行上述加载逻辑后taxi.csv 的实际形态可以精确描述如下规模200 行、18 列约 36 KB 内存占用是一份典型的小型教学样本数据时间覆盖tpep_pickup_datetime字段只包含2019-01冬季100 行与 2019-07夏季100 行两个月份冬夏各占一半完整性18 个字段均无缺失值18 个字段VendorID、tpep_pickup_datetime、tpep_dropoff_datetime、passenger_count、trip_distance、RatecodeID、store_and_fwd_flag、PULocationID、DOLocationID、payment_type、fare_amount、extra、mta_tax、tip_amount、tolls_amount、improvement_surcharge、total_amount、congestion_surcharge。与小费问题直接相关的字段是tip_amount小费金额与payment_type支付方式。实际统计结果基于仓库数据显示分组行数tip_amount 均值tip_amount 中位数2019-01冬季1001.94941.482019-07夏季1002.07842.00全样本tip_amount均值为 2.0139标准差 2.2921中位数 1.65最大 14.64payment_type中 1.0信用卡143 笔、2.0现金57 笔。这些数字本身并不能直接得出结论但足以支撑后续的质量评估。评估一这份数据能回答冬夏小费对比吗作业的第一条指令是评估数据集是否有助于回答客户的问题。从数据结构与实际取值看这份数据既具备回答能力也存在明显局限可以回答的部分tpep_pickup_datetime提供了精确到秒的乘车时间足以区分冬季1 月与夏季7 月tip_amount记录了每次行程的小费金额配合payment_type信用卡 vs 现金可以区分可观测小费与可能被低估的小费trip_distance、fare_amount、total_amount等字段支持在比较小费时控制里程与车费差异避免长途行程天然小费更多的混淆因素。无法回答的部分关键缺口只有 2019 年一个冬季月和一个夏季月单年样本无法排除异常年份如天气极端、节假日效应、费率调整的干扰无法形成季节性的稳健结论缺失天气数据冬季小费变化可能受降雪、气温、交通拥堵影响而数据集中没有任何天气字段缺失区域/街区上下文PULocationID/DOLocationID是位置 ID但未附带区域名称、商圈密度、机场标记等语义信息缺失司机与乘客侧信息如司机的服务评价、乘客是否本地通勤这些都可能影响小费行为。因此评估结论应为该数据集可作为回答问题的起点但不足以独立支撑可靠结论需要补充外部数据源——这正是作业第二条指令的意义所在。评估二从 NYC Open Data 目录中补充数据源作业建议浏览 NYC Open Data 目录识别一个可能有助于回答客户问题的额外数据集。基于上面识别出的缺口以下候选方向与仓库数据结构契合度最高NYC 天气历史数据如 NOAA/NWS 气象观测记录将温度、降水量、降雪量与tpep_pickup_datetime按日期关联可以直接检验冬季恶劣天气是否推高小费这一假说。这也是仓库 notebook 元数据中04-nyc-taxi-join-weather-in-pandas在 pandas 中关联天气数据命名的直接印证——课程设计者原本就设想将出租车数据与天气数据做 join。出租车区域Taxi Zone地理数据包含PULocationID/DOLocationID对应的区域名称与边界可以把小费差异细化到曼哈顿、机场、皇后区等粒度。节假日日历数据识别感恩节、新年等旺季避免把节假日效应误判为季节效应。补充数据源时应围绕tpep_pickup_datetime与PULocationID这两个键做关联这与生命周期 Capturing 阶段识别、采集、探索达成目标所需数据的流程完全一致。评估三向客户提出的 3 个澄清问题作业第三条指令是写出 3 个用于向客户澄清的问题。这些问题服务于 README 中提到的目标一个定义良好的目标应当是可测量、可量化的以界定可接受的结果。结合本数据集特点可提出季节的定义边界是什么冬季与夏季是按自然月如 1 月 vs 7 月、气象学定义12–2 月 vs 6–8 月还是按节假日/旅游旺季划分不同的定义会显著改变样本切分方式。小费更多的度量标准是什么是比较小费绝对金额、小费占车费的百分比还是按行程距离/时长的标准化小费率此外是否只统计信用卡支付现金小费在数据中通常记录为 0可接受结果的判定门槛是什么冬夏小费差异达到多少如均值差 5%、10%才算是有意义的季节性差异是否需要考虑行程距离、区域、天气等协变量的影响这类问题正是 README 中 Capturing 阶段列举的是否存在歧义以及如何减少歧义的落地实践能帮助团队在进入 Processing 阶段前锁定目标。评估四数据质量与维护视角作业隐含的第四层评估是数据质量README 明确指出数据科学家必须评估数据的数量和质量。基于仓库数据的可验证事实缺失值18 列全部为 0 缺失结构完整数量每季仅 100 条记录属于抽样样本而非全量数据统计功效有限字段语义tip_amount在payment_type2.0现金时大量为 0说明小费字段对现金支付不完整——这是一个典型的数据采集偏差必须在分析时处理例如仅以信用卡行程为分析对象数据字典参考作业建议查阅官方数据字典data dictionary与用户指南user guide来理解字段含义如RatecodeID费率代码、store_and_fwd_flag是否存储转发等字段的取值语义。从生命周期 Maintenance维护视角看README 还提醒数据存储方式会影响成本与访问性能冷热数据分离、数据加密、访问权限控制都应纳入考虑。对于本任务至少应确认数据的许可与隐私边界行程数据含上下车位置与时间戳属于敏感信息。扩展Capturing 阶段的完整方法论结合 14-Introduction/README.md本次作业实际演练了 Capturing 阶段的两层提问框架关于项目目标的问题该问题之前是否被研究过发现了什么所有参与者是否理解目的与目标存在哪些歧义如何减少约束条件是什么最终结果可能是什么样有多少资源时间、人力、算力可用关于数据的问题我目前有哪些可用数据谁拥有这些数据隐私顾虑是什么我掌握的数据是否足以解决问题该数据对问题的质量是否可接受如果从数据中发现额外信息是否应考虑调整或重新定义目标作业中的3 个澄清问题正是第一组框架的浓缩演练而对数据缺口的识别则是第二组框架的实践。README 还建议将本作业的流程与 Team Data Science ProcessTDSP生命周期、CRISP-DM 方法论图见 tdsp-lifecycle2.png 与 CRISP-DM.png进行对比找出二者的 3 处相似点与 3 处差异以加深对生命周期各阶段命名与边界的理解。实操清单与交付物完成本作业的可执行步骤在 notebook.ipynb 中运行 pandas 加载代码或直接用 Excel/文本编辑器打开 data/taxi.csv检查行数、列数、缺失值、时间范围应观察到 2019-01 与 2019-07 各 100 行按月份分组统计tip_amount的均值与中位数形成初步对比如文中验证结果到 NYC Open Data 目录中定位 1 个补充数据集推荐天气数据并说明它与现有数据按何字段关联写下 3 个面向客户的澄清问题明确季节定义、小费度量口径与结论判定标准。最终交付物是一份数据可用性评估报告回答这份数据能否回答问题、缺什么、需要向客户确认什么为团队进入 Processing处理阶段提供依据。整个过程严格遵循数据科学生命周期 Capturing 阶段先定义目标、再评估数据、后决定是否调整目标的顺序——这正是 Data-Science-For-Beginners 课程希望学习者内化的核心能力。免责声明作业的波斯语版本文档translations/fa/4-Data-Science-Lifecycle/14-Introduction/assignment.md由 Co-op Translator 自动翻译生成可能存在偏差英文原版 assignment.md 应视为权威来源。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表