中国街区级犯罪时空数据集
中国街区级犯罪时空数据集
中国街区级犯罪时空数据集是一个用大语言模型和自然语言处理从公开裁判文书中抽取犯罪事件时空信息的数据资源。它把犯罪记录转化为带时间、经纬度和空间粒度的研究数据,用于观察中国城市街道和社区层面的犯罪时空分布。
观察
- Scientific Data 原文将该数据集描述为开放的街道和社区犯罪时空 repository,规模约百万级记录,覆盖中国多个地区,并为每起事件提供空间和时间信息。
- LLM 在这里不是生成现实犯罪,而是参与从非结构化法律文本中抽取、标准化和地理定位事件。数据质量因此依赖裁判文书公开程度、抽取规则、地理编码和隐私处理。
- 这与 城市环境犯罪因果效应 相邻:后者关注建成环境对犯罪的因果机制,这个数据集提供更大规模的时空事件底座。
- 对 社会世界模型 和 可执行社会科学 来说,这类数据集说明 LLM 可以进入社会科学数据生产环节,但必须保留来源、抽取误差、偏差和可复核链路。
- 对 智能社会治理 来说,街区级犯罪数据能支持热点识别和资源配置讨论,但也必须避免把不完整公开文书误读为真实犯罪全量分布。
边界
- 裁判文书数据不是犯罪全量数据。报案、侦查、起诉、审判、公开和文本可解析性都会造成选择偏差。
- 任何治理应用都需要隐私保护、误差评估和制度审查,不能把模型抽取结果直接转成执法行动。