示例案例¶
五个做完的案例,每一个都以 studies/ 下的一个 study 目录交付——产物、
grounding 台账,以及(在存在运行的情况下)轨迹与报告。它们的选取标准是覆盖
一个 study 可能有的不同形态,而不只是不同题材:包装既有模拟器、外部预测
管线、从零移植的混合人群、外部 MARL 训练任务、以及一个基准壳。
| 案例 | 走的路径 | 示范了什么 | 有结果吗? |
|---|---|---|---|
| Chicago Schelling | C —— 包装遗留 | 由普查数据锚定的 P、一次定时干预加分受众广播,以及一个被如实记录的证伪假设 | 有 —— 4 行指标、570 个家庭 |
| 消费者信心 | C —— 包装遗留 | 由信息累积(as_of 截止日)构成的纵向轴,以及 LLM 核心 + 贝叶斯扩展覆盖其余人群 |
有 —— 3 个预测步、12 个 persona |
| HiSim ROE | B —— 从零构建 | 一个混合人群:8 个 LLM agent 与 12 个规则 agent 共处同一面板、同一环境、同一套指标 | 有 —— 5 行指标、20 个 agent |
| 药品集采 | 外部 MARL 管线 | run_note 机制——一个在这里完整物化、却在别处训练再导回来的 study |
无 —— setup-only 报告,0 个训练 episode |
| ABM Sugarscape | 套在同级基准上的 umbrella 壳 | LLM 的 f 能否复现规则的 f,以对照原实现的精确 parity 作为检验 |
无 —— 纯结构;需自行重跑 |
那两个「无」不是需要道歉的缺口。药品集采正是「运行属于重型外部任务」这一 模式的样板,它如实携带了那份产物:一份写着 0 episode 的 setup 报告。 Sugarscape 则是一个基准壳,全部内容就是委托 + 一个 parity 测试。
每个案例页都有什么¶
这些页面共享同一形态,所以案例集同时也是一份模式库:
- 研究问题,以及这个案例是什么模式的样板;
- P / E / B —— 人群、带 modality / scope / dynamics 的环境层、以及行为 函数实际产出什么;
- 一步是什么与跑多久 —— 这一点各案例差异极大(一轮迁居、一个信息截止日、 平台上的一个回合、一个训练 episode);
- 结果 —— 真实的轨迹表加解读,或者一句明确的「本研究以纯结构交付」;
- grounding —— 具体到条目的
sourced/proxy/assumed切分; - 可以 fork 什么 —— 该 study 的
adjustable_params,每条都按 「改这个,是为了问那个问题」来写。
catalog 才是真正的索引¶
拿到仓库之后,可用研究的最新列表就是 catalog 本身——每个
studies/*/study.yaml 连同它的发现字段(domain、tags、demonstrates、
adjustable_params、reference,以及每个参考研究的 teaches 一行,写明它
示范的模式)。sv-init 会自动按这些字段路由新问题:匹配上就 fork
(Path A)而不是重建;reference: true 的研究是模板,永不原地修改。
catalog 里的研究比这里的页面多——光是那十一个 abm_* 基准壳就是一例,
Sugarscape 是其中做完的样本。随仓库提供的从零构建模板
(studies/opinion_diffusion/)同样完全可用,其文档见
从零构建 Study。
要读懂上述任何一个目录,从一个 Study 的解剖 开始;要把你自己的问题路由进去,见快速开始。