拓冰建站拓冰建站
首页 / 资讯中心 / 正文

数据科学场景推演实战:从 Data-Science-For-Beginners 第一课作业掌握数据科学流程设计

数据科学场景推演实战从 Data-Science-For-Beginners 第一课作业掌握数据科学流程设计【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本篇技术指南以开源课程 Data-Science-For-Beginners 第一课《定义数据科学》的配套作业场景作业参考答案为核心完整拆解如何为一个真实业务问题设计数据科学方案的四步方法论收集什么数据、如何收集、如何存储、能得出什么洞察与决策。读完本文你将掌握跨领域教育、公共卫生、个人生产力的数据方案设计套路并理解它如何与课程第一课讲授的数据旅程数据获取、存储、处理、可视化、建模一一对应。作业背景用数据科学思维改造真实流程本作业出现在课程第一课《定义数据科学》见 1-Introduction/01-defining-data-science/README.md末尾属于课程开篇的第一项实战任务Task 2。它的目标不是写代码而是训练学习者像数据科学家一样思考面对任意一个业务领域中的真实流程或问题能否提出一套可落地的数据改进方案。作业要求围绕任意 3 个不同的领域逐一回答以下 4 个核心问题收集什么数据Which data can you collect——该问题有哪些可观测、可量化的信号如何收集How would you collect it——通过传感器、摄像头、日志、问卷还是既有系统数据库如何存储体量有多大How would you store the data? How large the data is likely to be——结构化还是非结构化需要关系型数据库、NoSQL 还是数据湖能获得什么洞察、做出什么决策Which insights / decisions——数据能验证什么假设、支撑什么业务动作作业还给出三个可直接入手的建议领域如何用数据改进学校中面向儿童的教育流程如何用数据在大流行期间管控疫苗接种流程如何用数据确保自己在工作中的产出效率。参考答案拆解教育场景的完整推演作业提供了一行教育Education领域的完整参考答案作为理解预期产出的示范。将其关键信息还原如下领域问题可收集的数据数据如何存储可获得的洞察 / 决策教育大学课堂出勤率通常偏低假设经常出勤的学生考试表现更好。目标激励出勤并验证该假设。通过教室内监控摄像头拍摄的照片追踪出勤或通过追踪学生在教室内的手机蓝牙/Wi-Fi 地址考试成绩数据已存在于学校数据库中。若采用监控摄像头照片方案——每节课只需存储少量5–10 张照片非结构化数据随后用 AI 进行人脸识别将数据转化为结构化形式。计算每名学生的平均出勤数据检验其与考试成绩之间是否存在相关性相关性将在课程概率与统计一节深入讨论为激励出勤可在学校门户发布每周出勤排名并在出勤率最高的学生中抽奖。这一行示例看似简单实则暗含了完整的数据科学流程设计值得逐项拆解数据收集层面它给出了两条可选的采集路径被动视觉采集监控摄像头照片与主动无线信号采集蓝牙/Wi-Fi 地址并指出考试成绩这类关键数据已存在于既有数据库中——这对应课程第一课数据旅程的第一步数据获取Data Acquisition见 1-Introduction/01-defining-data-science/README.md即数据可能来自传感器、既有系统也可能来自日志、调查问卷等渠道。数据存储层面它清晰地区分了非结构化与结构化数据摄像头照片属于非结构化数据对应课程中非结构化数据的概念需要先借助 AI人脸识别转换为结构化形式后才能进入表格化的分析流程。这与课程第一课强调的数据科学需要同时处理结构化与非结构化数据完全一致——课程后续的关系数据库、非关系型数据库等章节正是围绕存储问题展开。洞察与决策层面它示范了两类典型产出一是验证性分析——计算平均出勤率并与考试成绩求相关性相关性分析是后续课程 04 统计与概率 的核心主题之一二是业务动作——通过发布每周出勤排名、对高出勤学生抽奖来激励行为改变这正是课程所强调的可执行的洞察actionable insights。方法论底座数据旅程与数据类型这个参考答案不是凭空设计的它的每一步都能在课程第一课的方法论中找到对应数据旅程五步见 1-Introduction/01-defining-data-science/README.md数据获取Data Acquisition直接从应用数据库取数最简单IoT 传感器数据量大时宜用 IoT Hub 等缓冲端点先行汇聚。数据存储Data Storage按未来查询方式决定——关系型数据库用 SQL 查询、以 schema 组织NoSQL如 CosmosDB不强加 schema、可存层级化 JSON 文档或图结构但查询能力和引用完整性较弱数据湖Data Lake用于原始非结构化大数据集群常搭配 Parquet 格式。数据处理Data Processing把原始形式转换为可用于可视化/模型训练的形式非结构化文本、图像常需 AI 提取特征feature。可视化与人工洞察Visualization / Human Insights多角度可视化数据、寻找关系并用统计手段检验假设或证明相关性。训练预测模型Training a Predictive Model用机器学习技术构建预测模型应用于新的同构数据。三类数据类型见 1-Introduction/01-defining-data-science/README.md结构化Structured以表格形式组织如带电话号码的联系人列表过去 20 年每分钟各房间温度进入大楼人员的年龄与性别数据半结构化Semi-structured有一定结构但差异大如带链接的维基百科页面、JSON 格式的论文集合、网页非结构化Unstructured文件集合如百科全书的正文文本、企业共享文件、监控摄像头的原始视频流。教育场景参考答案中监控照片非结构化→ AI 人脸识别 → 结构化表格的转化路径正是这三类数据之间流转的典型范例。从示例到实战补全你自己的三个场景作业要求学习者自行填充下方表格可替换建议领域至少覆盖 3 个领域领域问题可收集的数据如何存储可获得的洞察 / 决策教育示例已给出疫苗接种生产力若想高质量完成可以套用第一课 README 中归纳的数据来源清单来打开思路见 1-Introduction/01-defining-data-science/README.md结构化来源IoT 传感器温度、压力等可用于自动控制楼宇供暖照明以降低成本购买后/访问网站后的调查问卷用户行为分析如用户深入站点的程度、离开站点的典型原因。非结构化来源文本可提取情感得分sentiment与关键词图像/视频如监控视频估算道路车流、预警拥堵Web 服务器日志可分析哪些页面最常被访问及停留时长。半结构化来源社交网络图谱可用于刻画用户性格与信息传播效力聚会照片集可构建谁与谁合影的关系图提取群体动力学Group Dynamics信息。以作业给出的另外两个领域为例可以这样沿四步框架推演以下为结合课程数据来源清单的引导性思路非作业原文结论疫苗接种Vaccination可考虑收集接种登记记录、疫苗库存与冷链温度传感器数据、预约与到场数据等存储上可用关系型数据库管理预约与接种记录用半结构化/时序存储承载传感器流洞察层面可分析不同人群、地区的接种率与流失环节从而指导疫苗调配、开放临时接种点或定向通知提醒。生产力Productivity可考虑收集时间追踪工具日志、任务完成记录、专注时段数据等结合服务器日志、行为分析类数据源洞察层面可找出低效时段或干扰源支撑作息调整、任务重排等决策。评分时参考答案只要求方案合理即可重点是每个领域都要覆盖数据源、存储方式与决策/洞察三要素。评分标准解读作业官方评分表Rubric如下优秀Exemplary合格Adequate待改进Needs Improvement能为所有问题领域识别出合理的数据源、数据存储方式以及可能的决策/洞察方案的部分方面不够详细未讨论数据存储且至少描述了 2 个问题领域只描述了数据方案的一部分且只考虑了 1 个问题领域对照可见最容易被忽略的是**数据存储这一列**——作业明确指出未讨论存储方式即最多只能算合格。因此在填表时务必为每个场景明确数据形态结构化/非结构化与存储选型关系型、NoSQL、数据湖或纯文件并估计数据体量。延伸配套文本挖掘挑战中的同款流程作业之外第一课还提供了一项可选的 Challenge见 notebook.ipynb用一段真实代码完整演示了上述数据旅程可作为设计作业方案时的参照数据获取用requests.get携带自定义User-Agent下载维基百科 Data Science 页面 HTML数据处理用 BeautifulSoup 解析 HTML并借助一组选择器.mw-jump-link、.navbox、.reflist、sup.reference、.mw-editsection、.hatnote、.metadata、.infobox、#toc、.sidebar等剥离导航、参考列表等噪音元素仅保留正文文本洞察提取用nlp_rake.Rake(max_words2, min_freq3, min_chars5)做关键词抽取——最短关键词 5 个字符、文档内最少出现 3 次、关键词最多 2 个词并用matplotlib绘制关键词重要度柱状图可视化用WordCloud(background_colorwhite, width800, height600)分别以generate_from_frequencies基于 RAKE 结果和generate基于原始文本生成词云输出为1-Introduction/01-defining-data-science/images/ds_wordcloud.png。notebook 最后还指出一个关键观察直接用原始文本生成词云会混入大量噪音如 Retrieved on 这类无意义词而 RAKE 抽取的关键词质量明显更高——这直观印证了数据预处理与清洗的重要性也正是作业表格中如何存储/如何处理一列要回答的问题。挑战还预留了延伸任务将同样的代码应用到Big Data与Machine Learning两个领域的维基百科词条上对比相关概念词云。小结本作业是 Data-Science-For-Beginners 课程给学习者的第一块思维磨刀石不写代码却要求你完整走一遍定义问题 → 设计数据采集 → 规划存储 → 预判洞察与决策的数据科学方案设计闭环。掌握这四步框架后无论面对教育、公共卫生还是个人效率问题你都能快速产出一份结构完整、可评估、可讨论的数据方案——这正是后续所有数据获取、存储、可视化与建模课程的地基。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门