Skip to content

数据生成使用指南

本模块专用于具有复杂统计分析需求的问卷,主要用于用户通过可视化界面设置量表水平、样本量、维度关系等参数,自动生成符合研究设计的模拟数据,并支持数据下载与智能解读功能。建议先阅读SEM入门,了解基本概念后再上手本模块。 对于Kano模型,请查看Kano模型使用指南

模块与模块之间(如速填与SEM)是相互独立的页面,参数不互相影响。SEM本身并不直接解析问卷链接和同步数据,但支持的结论更多,可满足主流复杂统计需求。

SEM的大体流程和效果为:

  1. 根据问卷和研究模型,手动配置维度项与维度间影响关系;
  2. 系统生成符合研究设计的EXCEL数据,并立即显示本次模拟数据的各项统计指标(如信效度,描述性,差异,中介,调节等);
  3. 用户手动核查本次数据指标是否满足自身需求,若满足,即可下载数据文件;
  4. (可选)用户可手动用SPSS分析数据文件,结果会与本网页显示的各项统计指标一致。下载的 CSV 文件可直接导入 SPSS、Excel 等工具进行进一步分析。

核心参数说明

  • 量表水平:设置量表的评分等级(4-8 级),默认值为 5 级(如常见的 "非常不同意" 到 "非常同意" 5 级评分)
  • 样本量:设置需要生成的样本数量(建议 200-2000 之间)
  • 随机种子:相同种子 + 相同配置 = 完全相同的数据。用于复现结果。如果对当前数据不满意,可以更换种子重新生成,直到满意为止,无需额外费用。
  • 元信息配置:用于模拟数据收集场景的信息,如提交答卷时间、所用时间、来源、IP等信息

元信息配置

1. 核心维度设置

维度配置用于定义研究中的核心变量(维度),是数据生成的基础。

维度配置界面截图

  • 维度标识:变量简称,随便取个名字(如 "A"、"B"、"IV"、"DV"等)
  • 变量类型:在整体研究中该变量的定位,支持自变量/中介/调节/因变量
  • 小题数:该维度包含的题目数量(3-10 题)
  • 均值:该维度的平均得分(需在 1 - 量表水平之间)。均值控制该维度得分的中心位置。例如 5 级量表下,均值=3 表示大部分回答集中在"一般"附近;均值=4 表示集中在"同意"附近。

2. 维度关系配置

用于定义变量之间的影响关系,系统会根据此配置生成具有预期相关性的数据。

维度关系配置界面截图

  • 源变量:影响的发出者(如 自变量)
  • 目标变量:被影响的变量(如 因变量或中介变量)
  • 影响方向正向负向,决定源变量与目标变量之间的相关性正负。

中介变量的配置规则

中介变量(M)在模型中扮演"桥梁"角色:既要被其他变量影响,也要影响其他变量

一个有效的中介路径需要同时配置两条关系:

  1. X → M:自变量影响中介变量(M 必须被影响)
  2. M → Y:中介变量影响因变量(M 必须影响其他变量)

暂不支持多重中介

3. 人口统计学变量设置

用于添加性别、年龄、学历等人口统计学变量。这些变量可以用于后续的差异性检验。

人口统计学变量配置界面截图

支持两种类型:

  • 单选题:按设置的比例生成选项。

    • 设置各选项的比例(如 男:女 = 50:50),系统会按比例随机生成答案
    • 比例会自动归一化,填 50:50 或 1:1 效果相同
    • 生成结果为单个数字:1=第1个选项,2=第2个选项...
  • 多选题:按设置的比例生成各选项的选中概率。

    • 每个选项单独设置选中概率(百分比),如 选项A=80%,选项B=60%
    • 生成结果为 0/1 组合:1=选中,0=未选中
    • 系统确保每份问卷至少选中一个选项
    • 在数据文件中,多选题会展开为多列(如"爱好_1"、"爱好_2"...)

4. 差异与调节

差异效应

用于设置不同人口学分组在特定维度上的差异,以模拟统计学中的显著差异(ANOVA或T检验)。

差异效应配置界面截图

需要将同组别的选项拖入到同一个分组框中。

差异效应配置动态操作图

分组顺序决定了得分的排列:排在前面的组在目标维度上得分更高。 例如:当一个题目为:"你的月收入为?",选项分别为:3000-, 3000+, 5000+, 7000+, 9000+;

可以如下设置:

差异效应配置动态操作图差异效应配置动态操作图

上图中,3000- > 3000+ > 5000+ 3000- 收入群体在目标维度上得分最高,5000+ 得分最低。

系统通过在不同分组的维度得分上叠加偏移量来模拟差异:

  • 第1组(排最前):得分最高
  • 每往后一组,得分降低约 0.4 个标准差
  • 这样在方差分析中就能得到显著的组间差异

调节效应

用于设置一个变量如何改变另外两个变量之间的关系强度。

  • 自变量:影响者(如 X)
  • 调节变量:改变关系强弱的变量(如 A)
  • 因变量:被影响者(如 Y)
  • 强度:正数=增强关系,负数=减弱关系

例如:设置 X 为自变量,A 为调节变量,Y 为因变量,强度为 -0.3,表示 A 越强时,X 对 Y 的影响越弱(负向调节)。

5. 填空题设置

支持在量表中插入填空题,生成的数据会自动填充合理的答案。

支持的类型:

类型说明示例
数字指定范围内的随机数字年龄:18~60
姓名随机中文姓名系统自动生成
手机号随机手机号系统自动生成
日期指定范围内的随机日期1990-01-01 ~ 2005-12-31
自定义从给定选项中随机选择,以 ### 分割选项1###选项2###选项3

填空题输出格式

类型输出示例
数字25
姓名张三
手机号13812345678
日期1995-06-15
自定义选项2

6. 数据生成与分析

配置完成后,就可以点击 "生成数据" 开始生成了。

生成完毕后系统会返回数据的分析结果,包括:

  • 信度 Cronbach's alpha 系数
  • 效度 KMO 值和 Bartlett 球形检验显著性
  • 相关性 系数及其 p 值
  • 方差分析 显著性、回归分析中介分析描述统计

数据合格标准

指标合格标准说明
信度 α> 0.7量表测量的一致性
KMO> 0.7结构效度
相关/回归 p 值< 0.05关系显著
中介效应p < 0.05中介作用显著
调节效应p < 0.05调节作用显著

如果你觉得数据可以接受(如 信度 > 0.7,关系显著),那就可以点击下载文件直接下载了;如果你觉得数据欠佳,可以尝试更换随机种子并重新生成,直到满意为止。更换种子无需额外费用。

7. 下载数据

下载的 CSV 文件可直接导入 SPSS、Excel 等工具进行进一步分析,结果与网页显示的各项统计指标一致。

数据文件结构

说明
序号样本编号(从1开始)
提交答卷时间模拟的提交时间(需开启元信息)
所用时间模拟的作答时长(需开启元信息)
来源模拟的来源渠道(微信/手机/链接)
来自IP模拟的IP地址和地区
总分所有维度题项的总分
人口学变量性别、收入等
X1, X2, ...各维度下的题目得分
X_mean各维度的均值
填空题年龄、姓名等

8. 完整案例

以 "短视频平台算法推荐对用户信息茧房程度的影响机制" 为例,一共 2 个人口统计学题目,5 个维度。

8.1 问卷结构

  • 第1题:性别
  • 第2题:收入
  • 量表共5个变量:X、M1、M2、Y、A,均为5分量表
  • X,M1,M2,Y,A 的题目数分别为4题,4题,5题,5题,3题

问卷图

8.2 研究假设

假设模型如下,X 为自变量,Y 为因变量,M1/M2 为中介变量,A 为调节变量:

模型图

以下是期望数据可以满足的结论:

  1. 相关性分析:M1与X、Y显著正相关,M2与X、Y显著正相关
  2. 中介效应:X→M1→Y、X→M2→Y,期望M1在X与Y间起正向中介作用,M2在X与Y间起正向中介作用
  3. 调节效应:A 在 M1 与 Y 的关系中起负向调节作用,A 在 M2 与 Y 的关系中起负向调节作用
  4. ANOVA方差分析: 以第2题(收入)为分组变量,在因变量Y上检验差异;期望高收入群体(收入5000+)在Y维度得分 < 低收入群体(收入5000-)

8.3 配置方案

那么配置如下: 短视频平台案例 - 数据生成配置截图短视频平台案例 - 数据生成配置截图

8.4 结果验证

生成之后,系统会输出数据各项结果,包括描述性统计分析、信度、效度、方差等,用于验证生成的数据是否符合研究假设。

生成数据后的 SPSS 分析结果报告截图 结果与SPSS的分析结果保持一致。 生成数据后的 SPSS 分析结果报告截图 中介效应: 生成数据后的 SPSS 分析结果报告截图 调节效应: 生成数据后的 SPSS 分析结果报告截图 ANOVA方差分析: 生成数据后的 SPSS 分析结果报告截图 数据的所有指标均可在spss中复现。祝顺利。