实证研究智能体工作流
实证研究智能体工作流
实证研究智能体工作流把论文生产从“和聊天机器人问答”改造成一个可复现、可审计、可停止的项目文件夹。它关注的对象不是单次 prompt,而是研究目标、数据、代码、权限、验证和 provenance 共同构成的制度层。
观察
- 研究智能体的最小单元不是模型,而是本地项目文件夹:
README/目标、数据目录、脚本、输出、skills、permissions、provenance 和 memory 共同定义任务边界。 README或项目说明负责把研究任务写成可验收目标;skills 负责沉淀可复用 SOP;MCP/tools 负责访问真实数据和执行代码;verification 负责阻止“看起来完成”的静默降级。- provenance 和 memory 必须分开。provenance 面向研究者、审稿人和合作者,记录数据来源、下载时间、API 参数和处理链;memory 面向 agent,帮助它减少重复检索和保持上下文。
- 权限设计是科研质量的一部分:raw data 应该只读,processed data 可以生成,安装包、联网、写入敏感目录等动作要有明确 allow/ask/deny 边界。
- 停止规则把完成定义权留在人手里。连续同错、超预算、未满足 README 验收条款、脏数据进入回归等情况都应触发停止或报错,而不是让 agent 自行美化结果。
- OpenClaw 的课堂部署把这一工作流教学化:研究路径要求用 agent 完成完整社科研究任务,技术路径要求自主构建 agent 工具,从而把“会用”推进到“能造”。
- AI4SS 技术入门 把这套工程语言带到公开教学场景:社科研究者需要理解 agent 如何进入文献综述、研究设计和基础设施搭建,而不只是调用聊天机器人。
- Christopher Blattman 的 Prompt、Plan、Review、Revise 页面提供了面向非技术专业人士的低摩擦入口:先把问题、背景和约束装入项目,再显式计划、独立审查、修订并沉淀下一次可复用的说明。对实证研究而言,这个入口仍须继续细化为 estimand、识别假设、数据边界和验收测试。
- Emergence World 提供长程多智能体数据生成环境,但其跨模型示范运行首先是平台观察。若要形成实证研究,需要固定角色与工具、记录版本和随机种子、进行独立重复,并把模型比较与现实人群推论分开。
和可执行社会科学的关系
可执行社会科学 关注社会科学问题如何转成可运行实验结构;实证研究智能体工作流则提供项目工程层:目录、脚本、验证、来源追踪和权限边界。前者回答“研究机制如何执行”,后者回答“执行过程如何可复现和可审计”。
边界
- Agent 能提高执行密度,不替代研究问题、识别策略、变量含义和理论判断。
- 自动下载和分析公开数据不自动满足伦理要求;隐私、涉密和受限数据仍需要独立合规流程。
- 同一 agent 不应既产出结果又做最终审稿;高风险项目需要新会话、不同模型或人工复核。
- 单次模拟中的跨模型差异不能代替因果设计;即使平台宣称“只改变基础模型”,缺少重复运行和独立核验时仍不能估计稳定模型效应。
相关页面
证据
- AI辅助实证论文全流程操作指南
- 可执行社会科学
- Agentic 软件开发工作流
- OpenClaw
- AI4SS 技术入门
- Christopher Blattman
- Emergence World
- 原始资料快照(本地归档)
- 原始资料快照(本地归档)