拓冰建站拓冰建站
首页 / 资讯中心 / 正文

2011大学生SNS问卷数据:统计教学中的真实数据训练场

简介本资源是一份面向高校统计学课程实践与社会调查类作业的实证调研报告适用于大学生开展SNS使用行为研究、社会调查方法实训及数据分析入门学习。报告以2011年针对47名在校大学生的问卷调查为基础系统呈现了社交网站如人人网、QQ、微博在大学生群体中的使用类型、核心功能日志浏览、状态发布、资源共享、使用目的娱乐消遣、打发时间、日均耗时及对现实人际交往的影响等关键发现并通过10项Likert量表题深入分析了线上社交认同感、现实社交倾向、好友重合度与依赖程度等心理维度。资源为单个PDF文件大小479KB结构完整含调查方案、数据统计分析、调研结论与附录问卷表共四章逻辑清晰、模块分明便于教学引用或课程设计参考。目前已有91人学习下载是理解早期中国大学生社交媒体使用生态与统计调查全流程的典型范例材料。1. 这不是一份普通课程作业一份2011年真实大学生SNS行为快照藏着统计学教学中最易被忽略的「数据真实性训练场」你手头这份《统计学调研报告.pdf》表面看是某高校学生贾璐完成的课程实践作业——但拆开它会发现它远不止“交差材料”那么简单。它记录的是中国社交网络爆发初期2011年人人网、QQ空间、微博刚成为大学生数字生活基础设施时的真实行为切片47份有效问卷、13个李克特五级量表题项、覆盖使用频率、心理依赖、现实社交替代效应等维度。这不是模拟数据而是未经清洗的原始田野记录——问卷中“我会因为不能上SNS而焦躁不安”一题40.43%选“完全不符合”21.28%选“不太符合”但仍有6.38%选“完全符合”这种分布本身就构成一个典型偏态样本。对统计学初学者它提供从问卷设计→数据录入→频数/交叉分析→信效度初判的完整闭环对有经验者它是检验SPSS/Python数据清洗能力的试金石比如第10题“您上社交网站的目的”允许多选但原始PDF未说明编码规则需自行推断多选题拆分逻辑又如“好友重合度”与“现实朋友数量”存在潜在共线性却未做相关性检验。适合三类人深度复用统计学教师用作课堂案例附带真实问卷结构与缺陷数据分析新人练手从PDF表格OCR到建模全流程社会学研究者回溯早期SNS用户心理图谱。2. 从PDF到可计算数据集结构化提取与变量重建的技术路径2.1 PDF文本解析的陷阱识别与人工校验策略原始PDF虽为扫描件从页眉“专业班级学号姓名”及手写体编号可判断但全文含大量结构化表格如第8页的李克特量表统计表。直接使用pdfplumber或tabula提取易出错问题1跨页表格断裂——第8页“题目完全不符合…完全符合”表格实际横跨两栏自动解析常将“我 在 现实 生 活中 是 一个 内 向的人”拆成多行问题2百分比与频数混排——如“1327.66%”需分离为count13, pct27.66问题3题干与选项错位——第14页问卷第10题“您认为社交网站对您有何影响”后接多选选项但PDF中选项A-F与题干间存在空行OCR易误判为新题。提示必须采用“半自动人工锚点校验”流程。先用pdfplumber按页提取文本定位关键词“题目完全不符合”作为量表起始锚点再用正则r(\d)\s\((\d\.\d)%\)匹配频数与百分比最后人工核对每题13行是否完整因量表题共13题每题5列应得65个数值。2.2 多选题编码规则逆向工程与数据宽表构建问卷中第3、9、10、15题为多选题如第3题“经常使用的社交网站有哪些”含8个选项但PDF未提供编码说明。根据统计惯例及上下文推断选项赋值逻辑A1, B2, C3...H8非二进制编码因第14页问卷显示选项为字母序缺失值处理未勾选视为0但需区分“拒答”与“无此项”——第4题“如何接触SNS”含4个选项若全未选则标记为NaN宽表转换关键将单选题如性别直接映射为列多选题需拆分为布尔列。例如第3题生成8列use_weibo,use_renren,use_qqspace...值为1/0。import pandas as pd import re # 假设已提取原始文本块text_block def parse_multiselect(text_block, question_num, options_count): 解析多选题文本返回字典格式 # 提取选项行如A 微博、博客 pattern r([A-Z])\s(.?)(?\n[A-Z]\s|\n\n|$) matches re.findall(pattern, text_block, re.DOTALL) if len(matches) ! options_count: raise ValueError(fQuestion {question_num}: expected {options_count} options, got {len(matches)}) # 构建选项映射 option_map {opt[0]: opt[1].strip() for opt in matches} return option_map # 示例解析第3题8个选项 option_3 parse_multiselect(pdf_text_page14, 3, 8) print(option_3) # {A: 微博、博客, B: 人人网校内网, C: QQ 空间、腾讯朋友, ...}参数说明parse_multiselect函数通过正则捕获选项字母与内容避免手动录入错误options_count8确保完整性校验。若实际提取选项数不符立即中断并人工检查PDF——这是防止后续分析污染的关键闸口。2.3 李克特量表数据清洗从原始频数到个体响应矩阵第8页量表题给出的是汇总频数如“我 在 现实 生 活中 是 一个 内 向的人”题下5列数值但统计教学需还原至个体层面。标准做法是步骤1确认量表方向——所有题项均按“完全不符合→完全符合”正向计分A1, B2, C3, D4, E5步骤2生成虚拟个体数据——对每题按频数重复生成对应数量的个体响应。例如第1题“完全不符合”13人则生成13个值为1的记录步骤3合并题项——将13题响应拼接为47×13矩阵因总有效人数47且∑各题频数47。import numpy as np # 假设已提取第1题频数[13, 25, 4, 5, 0] freq_q1 [13, 25, 4, 5, 0] # A-E频数 # 生成该题个体响应向量 responses_q1 np.repeat([1,2,3,4,5], freq_q1) # 对13题循环执行最终得到(47,13)数组 all_responses np.column_stack([ np.repeat([1,2,3,4,5], [13,25,4,5,0]), # Q1 np.repeat([1,2,3,4,5], [2,8,7,19,11]), # Q2 # ... 其他11题频数 ]) # 转为DataFrame列名为Q1-Q13 df_likert pd.DataFrame(all_responses, columns[fQ{i} for i in range(1,14)])逻辑说明np.repeat按频数复制计分值确保总行数恒为47np.column_stack横向拼接保证个体响应一致性。若某题∑频数≠47如第8页Q10频数和为47但Q11为47需逐题验证则表明原始数据存在录入错误必须标注并讨论其对信度分析的影响。3. 统计分析复现用现代工具验证2011年结论的稳健性3.1 描述性统计的现代实现与经典结论对照原始报告结论P11称“大学生主要使用的社交网站为QQ、人人网、微博”“使用目的主要是娱乐消遣也有近50%用来打发时间”。我们用pandas复现# 假设已构建多选题宽表df_multiselect列use_weibo, use_renren, use_qqspace... usage_counts df_multiselect[[use_weibo,use_renren,use_qqspace,use_douban]].sum().sort_values(ascendingFalse) print(使用频率TOP3) print(usage_counts.head(3)) # 输出示例 # use_qqspace 38 # use_renren 35 # use_weibo 29 # 目的分析第10题多选 purpose_cols [purpose_entertainment, purpose_resource, purpose_follow, purpose_selfshow, purpose_killtime] purpose_sum df_multiselect[purpose_cols].sum() purpose_pct (purpose_sum / len(df_multiselect) * 100).round(2) print(使用目的占比) print(purpose_pct.sort_values(ascendingFalse)) # 输出示例 # purpose_killtime 48.94 # 接近原文近50% # purpose_entertainment 42.55参数说明sum()直接统计多选题勾选项数/len(df_multiselect)得占比round(2)保留两位小数便于与原文“近50%”对照。注意若purpose_killtime占比48.94%则原文“近50%”属合理概括但若为32.15%则需质疑结论偏差。3.2 关键假设检验SNS使用强度与现实社交能力的关联性验证报告P12提出“在维持了一段时间社交网站后我和现实朋友的交流少了”Q13并暗示其与“我在现实中是一个内向的人”Q1存在关联。我们用卡方检验验证from scipy.stats import chi2_contingency # 构建列联表Q1内向程度vs Q13现实交流减少 # 将Q1、Q13从5级量表压缩为二分类Q14为自评内向Q134为承认现实交流减少 df_cross df_likert.copy() df_cross[shy] (df_cross[Q1] 4).astype(int) # 1内向0不内向 df_cross[less_real_talk] (df_cross[Q13] 4).astype(int) # 1减少0未减少 # 生成2x2列联表 contingency pd.crosstab(df_cross[shy], df_cross[less_real_talk]) chi2, p, dof, expected chi2_contingency(contingency) print(卡方检验结果) print(f卡方值{chi2:.3f}, p值{p:.3f}) print(列联表) print(contingency)逻辑说明将李克特量表压缩为二分类是常见简化但需注明损失信息chi2_contingency返回p值判断独立性。若p0.05支持“内向者更可能因SNS减少现实交流”的假设若p0.05则原文结论缺乏统计依据。此步骤直击报告核心论点暴露其未做假设检验的局限性。3.3 信度分析补全Cronbachs α检验量表内部一致性原始报告未评估量表信度但13题李克特量表Q1-Q13涉及“SNS依赖”“现实社交替代”等构念需检验α系数。使用pingouin库import pingouin as pg # 选取理论相关题项如Q3/Q4/Q10/Q11/Q12/Q13测依赖程度 dependency_items [Q3,Q4,Q10,Q11,Q12,Q13] alpha_result pg.cronbach_alpha(datadf_likert, itemsdependency_items) print(fCronbachs α {alpha_result[0]:.3f}) print(f95% CI [{alpha_result[1][0]:.3f}, {alpha_result[1][1]:.3f}]) # 若α0.72说明该子量表信度良好0.7参数说明cronbach_alpha自动计算条目间相关性items参数指定待检验题项需基于理论框架选择非随意组合。若α0.6表明量表设计存在缺陷原文结论可靠性存疑。4. 教学级复用技巧将静态PDF转化为动态统计教学沙盒4.1 Jupyter Notebook交互式教学模板设计将清洗后的数据封装为SNS_2011_Dataset类内置方法支持一键调用class SNS_2011_Dataset: def __init__(self, data_path): self.df pd.read_csv(data_path) self.likert_cols [fQ{i} for i in range(1,14)] def plot_usage_pie(self, top_n5): 绘制TOP N社交网站使用占比饼图 usage self.df[[use_weibo,use_renren,use_qqspace]].sum() usage.nlargest(top_n).plot.pie(autopct%1.1f%%) plt.title(大学生常用社交网站占比) def test_dependency_hypothesis(self, item1Q1, item2Q13): 检验两题项关联性卡方/相关系数 if self.df[item1].nunique() 5 and self.df[item2].nunique() 5: # 分类变量用卡方 contingency pd.crosstab(self.df[item1], self.df[item2]) chi2, p, _, _ chi2_contingency(contingency) return f卡方检验p{p:.3f} else: # 连续变量用皮尔逊 r, p pearsonr(self.df[item1], self.df[item2]) return f相关系数r{r:.3f}, p{p:.3f} # 教师在Notebook中只需 data SNS_2011_Dataset(sns_2011_clean.csv) data.plot_usage_pie() # 自动生成图表 print(data.test_dependency_hypothesis(Q1,Q13)) # 一键检验技巧价值封装后教师无需重复写数据加载代码学生可专注统计逻辑plot_usage_pie自动适配不同TOP-N需求避免硬编码test_dependency_hypothesis智能选择检验方法降低初学者误用风险。4.2 问卷设计缺陷的批判性教学模块原始问卷存在三处典型缺陷可设计为课堂讨论题缺陷类型具体表现教学引导问题多选题编码缺失第3题未说明多选题如何录入是求和还是最大值“若将8个选项编码为1-8求和后最大值为36这能否反映‘使用广度’为什么”量表题方向不一致Q8“比起发表日志我更愿浏览转载”为反向题但未在分析中反转计分“若直接计算Q8均值会高估还是低估用户表达意愿如何修正”关键变量缺失未测量每日具体使用时长仅分段少于1小时/1-3小时无法做回归分析“若要建立‘SNS使用时长→现实社交减少’模型你需要补充哪些变量”实操建议在Jupyter中嵌入ipywidgets滑块让学生拖动调整Q8计分方向实时观察均值变化直观理解反向题处理必要性。4.3 历史数据对比实验2011 vs 2023 SNS行为变迁量化将本报告数据与2023年同类研究如《Z世代社交媒体使用白皮书》对比需统一指标使用强度将2011年“每天花费时间”分段A-D映射为中位数A0.5h, B2h, C4h, D6h平台迁移2011年TOP3为QQ/人人/微博2023年TOP3为微信/抖音/小红书计算平台重合度0%心理依赖Q11“因不能上SNS而焦躁”2011年6.38%选E完全符合若2023年该题比例升至22.3%则支持“数字依赖加剧”假说。# 定义2011年时间映射 time_map_2011 {A:0.5, B:2.0, C:4.0, D:6.0} df_2011[time_hours] df_2011[time_spent].map(time_map_2011) # 计算2011年焦躁比例 anxiety_2011 (df_2011[Q11] 5).mean() # Q115即“完全符合” print(f2011年SNS焦躁比例: {anxiety_2011:.1%}) # 输出2011年SNS焦躁比例: 6.4%关键洞察单纯比较百分比易失真必须结合技术语境——2011年SNS需主动打开网页2023年推送通知即时触达焦躁感本质是“连接中断焦虑”而非平台本身。此对比迫使学生思考统计数字背后的媒介技术逻辑。本文还有配套的精品资源点击获取
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门