跳转至

示例案例

五个做完的案例,每一个都以 studies/ 下的一个 study 目录交付——产物、 grounding 台账,以及(在存在运行的情况下)轨迹与报告。它们的选取标准是覆盖 一个 study 可能有的不同形态,而不只是不同题材:包装既有模拟器、外部预测 管线、从零移植的混合人群、外部 MARL 训练任务、以及一个基准壳。

案例 走的路径 示范了什么 有结果吗?
Chicago Schelling C —— 包装遗留 由普查数据锚定的 P、一次定时干预加分受众广播,以及一个被如实记录的证伪假设 —— 4 行指标、570 个家庭
消费者信心 C —— 包装遗留 信息累积as_of 截止日)构成的纵向轴,以及 LLM 核心 + 贝叶斯扩展覆盖其余人群 —— 3 个预测步、12 个 persona
HiSim ROE B —— 从零构建 一个混合人群:8 个 LLM agent 与 12 个规则 agent 共处同一面板、同一环境、同一套指标 —— 5 行指标、20 个 agent
药品集采 外部 MARL 管线 run_note 机制——一个在这里完整物化、却在别处训练再导回来的 study —— setup-only 报告,0 个训练 episode
ABM Sugarscape 套在同级基准上的 umbrella 壳 LLM 的 f 能否复现规则的 f,以对照原实现的精确 parity 作为检验 —— 纯结构;需自行重跑

那两个「无」不是需要道歉的缺口。药品集采正是「运行属于重型外部任务」这一 模式的样板,它如实携带了那份产物:一份写着 0 episode 的 setup 报告。 Sugarscape 则是一个基准壳,全部内容就是委托 + 一个 parity 测试。

每个案例页都有什么

这些页面共享同一形态,所以案例集同时也是一份模式库:

  • 研究问题,以及这个案例是什么模式的样板;
  • P / E / B —— 人群、带 modality / scope / dynamics 的环境层、以及行为 函数实际产出什么;
  • 一步是什么与跑多久 —— 这一点各案例差异极大(一轮迁居、一个信息截止日、 平台上的一个回合、一个训练 episode);
  • 结果 —— 真实的轨迹表加解读,或者一句明确的「本研究以纯结构交付」;
  • grounding —— 具体到条目的 sourced / proxy / assumed 切分;
  • 可以 fork 什么 —— 该 study 的 adjustable_params,每条都按 「改这个,是为了问那个问题」来写。

catalog 才是真正的索引

拿到仓库之后,可用研究的最新列表就是 catalog 本身——每个 studies/*/study.yaml 连同它的发现字段(domaintagsdemonstratesadjustable_paramsreference,以及每个参考研究的 teaches 一行,写明它 示范的模式)。sv-init 会自动按这些字段路由新问题:匹配上就 fork (Path A)而不是重建;reference: true 的研究是模板,永不原地修改。

catalog 里的研究比这里的页面多——光是那十一个 abm_* 基准壳就是一例, Sugarscape 是其中做完的样本。随仓库提供的从零构建模板 (studies/opinion_diffusion/)同样完全可用,其文档见 从零构建 Study

要读懂上述任何一个目录,从一个 Study 的解剖 开始;要把你自己的问题路由进去,见快速开始