Appearance
数据生成使用指南
本模块专用于具有复杂统计分析需求的问卷,主要用于用户通过可视化界面设置量表水平、样本量、维度关系等参数,自动生成符合研究设计的模拟数据,并支持数据下载与智能解读功能。建议先阅读SEM入门,了解基本概念后再上手本模块。 对于Kano模型,请查看Kano模型使用指南。
模块与模块之间(如速填与SEM)是相互独立的页面,参数不互相影响。SEM本身并不直接解析问卷链接和同步数据,但支持的结论更多,可满足主流复杂统计需求。
SEM的大体流程和效果为:
- 根据问卷和研究模型,手动配置维度项与维度间影响关系;
- 系统生成符合研究设计的EXCEL数据,并立即显示本次模拟数据的各项统计指标(如信效度,描述性,差异,中介,调节等);
- 用户手动核查本次数据指标是否满足自身需求,若满足,即可下载数据文件;
- (可选)用户可手动用SPSS分析数据文件,结果会与本网页显示的各项统计指标一致。下载的 CSV 文件可直接导入 SPSS、Excel 等工具进行进一步分析。
核心参数说明
- 量表水平:设置量表的评分等级(4-8 级),默认值为 5 级(如常见的 "非常不同意" 到 "非常同意" 5 级评分)
- 样本量:设置需要生成的样本数量(建议 200-2000 之间)
- 随机种子:相同种子 + 相同配置 = 完全相同的数据。用于复现结果。如果对当前数据不满意,可以更换种子重新生成,直到满意为止,无需额外费用。
- 元信息配置:用于模拟数据收集场景的信息,如提交答卷时间、所用时间、来源、IP等信息

1. 核心维度设置
维度配置用于定义研究中的核心变量(维度),是数据生成的基础。

- 维度标识:变量简称,随便取个名字(如 "A"、"B"、"IV"、"DV"等)
- 变量类型:在整体研究中该变量的定位,支持自变量/中介/调节/因变量
- 小题数:该维度包含的题目数量(3-10 题)
- 均值:该维度的平均得分(需在 1 - 量表水平之间)。均值控制该维度得分的中心位置。例如 5 级量表下,均值=3 表示大部分回答集中在"一般"附近;均值=4 表示集中在"同意"附近。
2. 维度关系配置
用于定义变量之间的影响关系,系统会根据此配置生成具有预期相关性的数据。

- 源变量:影响的发出者(如 自变量)
- 目标变量:被影响的变量(如 因变量或中介变量)
- 影响方向:正向 或 负向,决定源变量与目标变量之间的相关性正负。
中介变量的配置规则
中介变量(M)在模型中扮演"桥梁"角色:既要被其他变量影响,也要影响其他变量。
一个有效的中介路径需要同时配置两条关系:
- X → M:自变量影响中介变量(M 必须被影响)
- M → Y:中介变量影响因变量(M 必须影响其他变量)
暂不支持多重中介
3. 人口统计学变量设置
用于添加性别、年龄、学历等人口统计学变量。这些变量可以用于后续的差异性检验。

支持两种类型:
单选题:按设置的比例生成选项。
- 设置各选项的比例(如 男:女 = 50:50),系统会按比例随机生成答案
- 比例会自动归一化,填 50:50 或 1:1 效果相同
- 生成结果为单个数字:1=第1个选项,2=第2个选项...
多选题:按设置的比例生成各选项的选中概率。
- 每个选项单独设置选中概率(百分比),如 选项A=80%,选项B=60%
- 生成结果为 0/1 组合:1=选中,0=未选中
- 系统确保每份问卷至少选中一个选项
- 在数据文件中,多选题会展开为多列(如"爱好_1"、"爱好_2"...)
4. 差异与调节
差异效应
用于设置不同人口学分组在特定维度上的差异,以模拟统计学中的显著差异(ANOVA或T检验)。

需要将同组别的选项拖入到同一个分组框中。

分组顺序决定了得分的排列:排在前面的组在目标维度上得分更高。 例如:当一个题目为:"你的月收入为?",选项分别为:3000-, 3000+, 5000+, 7000+, 9000+;
可以如下设置:


上图中,3000- > 3000+ > 5000+ 3000- 收入群体在目标维度上得分最高,5000+ 得分最低。
系统通过在不同分组的维度得分上叠加偏移量来模拟差异:
- 第1组(排最前):得分最高
- 每往后一组,得分降低约 0.4 个标准差
- 这样在方差分析中就能得到显著的组间差异
调节效应
用于设置一个变量如何改变另外两个变量之间的关系强度。
- 自变量:影响者(如 X)
- 调节变量:改变关系强弱的变量(如 A)
- 因变量:被影响者(如 Y)
- 强度:正数=增强关系,负数=减弱关系
例如:设置 X 为自变量,A 为调节变量,Y 为因变量,强度为 -0.3,表示 A 越强时,X 对 Y 的影响越弱(负向调节)。
5. 填空题设置
支持在量表中插入填空题,生成的数据会自动填充合理的答案。
支持的类型:
| 类型 | 说明 | 示例 |
|---|---|---|
| 数字 | 指定范围内的随机数字 | 年龄:18~60 |
| 姓名 | 随机中文姓名 | 系统自动生成 |
| 手机号 | 随机手机号 | 系统自动生成 |
| 日期 | 指定范围内的随机日期 | 1990-01-01 ~ 2005-12-31 |
| 自定义 | 从给定选项中随机选择,以 ### 分割 | 选项1###选项2###选项3 |
填空题输出格式
| 类型 | 输出示例 |
|---|---|
| 数字 | 25 |
| 姓名 | 张三 |
| 手机号 | 13812345678 |
| 日期 | 1995-06-15 |
| 自定义 | 选项2 |
6. 数据生成与分析
配置完成后,就可以点击 "生成数据" 开始生成了。
生成完毕后系统会返回数据的分析结果,包括:
- 信度 Cronbach's alpha 系数
- 效度 KMO 值和 Bartlett 球形检验显著性
- 相关性 系数及其 p 值
- 方差分析 显著性、回归分析、中介分析、描述统计
数据合格标准
| 指标 | 合格标准 | 说明 |
|---|---|---|
| 信度 α | > 0.7 | 量表测量的一致性 |
| KMO | > 0.7 | 结构效度 |
| 相关/回归 p 值 | < 0.05 | 关系显著 |
| 中介效应 | p < 0.05 | 中介作用显著 |
| 调节效应 | p < 0.05 | 调节作用显著 |
如果你觉得数据可以接受(如 信度 > 0.7,关系显著),那就可以点击下载文件直接下载了;如果你觉得数据欠佳,可以尝试更换随机种子并重新生成,直到满意为止。更换种子无需额外费用。
7. 下载数据
下载的 CSV 文件可直接导入 SPSS、Excel 等工具进行进一步分析,结果与网页显示的各项统计指标一致。
数据文件结构
| 列 | 说明 |
|---|---|
| 序号 | 样本编号(从1开始) |
| 提交答卷时间 | 模拟的提交时间(需开启元信息) |
| 所用时间 | 模拟的作答时长(需开启元信息) |
| 来源 | 模拟的来源渠道(微信/手机/链接) |
| 来自IP | 模拟的IP地址和地区 |
| 总分 | 所有维度题项的总分 |
| 人口学变量 | 性别、收入等 |
| X1, X2, ... | 各维度下的题目得分 |
| X_mean | 各维度的均值 |
| 填空题 | 年龄、姓名等 |
8. 完整案例
以 "短视频平台算法推荐对用户信息茧房程度的影响机制" 为例,一共 2 个人口统计学题目,5 个维度。
8.1 问卷结构
- 第1题:性别
- 第2题:收入
- 量表共5个变量:X、M1、M2、Y、A,均为5分量表
- X,M1,M2,Y,A 的题目数分别为4题,4题,5题,5题,3题

8.2 研究假设
假设模型如下,X 为自变量,Y 为因变量,M1/M2 为中介变量,A 为调节变量:

以下是期望数据可以满足的结论:
- 相关性分析:M1与X、Y显著正相关,M2与X、Y显著正相关
- 中介效应:X→M1→Y、X→M2→Y,期望M1在X与Y间起正向中介作用,M2在X与Y间起正向中介作用
- 调节效应:A 在 M1 与 Y 的关系中起负向调节作用,A 在 M2 与 Y 的关系中起负向调节作用
- ANOVA方差分析: 以第2题(收入)为分组变量,在因变量Y上检验差异;期望高收入群体(收入5000+)在Y维度得分 < 低收入群体(收入5000-)
8.3 配置方案
那么配置如下: 

8.4 结果验证
生成之后,系统会输出数据各项结果,包括描述性统计分析、信度、效度、方差等,用于验证生成的数据是否符合研究假设。
结果与SPSS的分析结果保持一致。
中介效应:
调节效应:
ANOVA方差分析:
数据的所有指标均可在spss中复现。祝顺利。
