硅基样本数据
硅基样本数据
硅基样本数据指由 AI、LLM 或 agent 模型生成的“类受访者”数据。它可以模拟回答、偏好、态度或行为轨迹,但它不是从真人样本直接观测到的社会事实。
观察
- AI 可以帮助线上调查做问卷设计、质量控制、异常识别、开放题编码和趋势监测;但同一能力也降低了伪造调查回答和批量生成受访者数据的成本。
- 硅基样本的核心问题不是“像不像真人”,而是它是否具有独立于训练语料和 prompt 的外部效度。一个模型能复现常识性回答,不等于它代表某个人群。
- 对 可执行社会科学 来说,硅基样本更适合用于机制推演、问卷预实验、敏感问题压力测试和研究设计辅助;它不能未经校准地替代抽样调查、实验或田野数据。
- 对 社会世界模型 来说,硅基样本是社会模拟中的 participant layer,但必须明确区分模型内行为、真实人群行为和研究者推论。
- 社交媒体注意力资本 使用 agent-based simulation 解释共情唤起机制,提示硅基/agent 样本适合做机制推演,但仍需要真实平台数据校准。
风险
- 如果平台无法区分真人回答和 AI 生成回答,线上调查的数据质量会被系统性污染。
- 如果研究者把硅基样本当作真实样本,会把模型偏差误认成人群分布。
- 如果 AI 生成数据参与训练下游模型,可能形成“模型用模型生成的社会”这一闭环,削弱经验世界的校准作用。