{
  "timestamp": "2026-06-26T06:40:15.308Z",
  "model": "deepseek/deepseek-v4-pro",
  "scenarios": [
    {
      "scenario": "scenario-A-noisy-folder",
      "model": "deepseek/deepseek-v4-pro",
      "mode": "cloud",
      "timestamp": "2026-06-26T04:54:11.082Z",
      "results": {
        "deepseek": {
          "no-memory": {
            "tokens": {
              "input": 81,
              "output": 3303
            },
            "time_ms": 62596,
            "runs": 3,
            "total": 3,
            "passes": 0,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0,
            "no_completion_rate": 0,
            "success": false,
            "consistency": 0,
            "judge_pass_rate": 0,
            "median_tokens": 3384,
            "token_samples": [
              2825,
              3384,
              3652
            ],
            "tokens_per_success": null,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 0
              },
              {
                "n": 2,
                "pass_rate": 0
              },
              {
                "n": 3,
                "pass_rate": 0
              },
              {
                "n": 4,
                "pass_rate": 0.333
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 0.667
              }
            ]
          },
          "oracle-ceiling": {
            "tokens": {
              "input": 44,
              "output": 3304
            },
            "time_ms": 57858,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 3348,
            "token_samples": [
              3207,
              3348,
              4161
            ],
            "tokens_per_success": 3572,
            "retrieval": {
              "recall": {
                "1": 0.333,
                "3": 1,
                "5": 1,
                "10": 1
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          },
          "keyword": {
            "tokens": {
              "input": 61,
              "output": 3810
            },
            "time_ms": 49843,
            "runs": 3,
            "total": 3,
            "passes": 0,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0,
            "no_completion_rate": 0,
            "success": false,
            "consistency": 0,
            "judge_pass_rate": 0,
            "median_tokens": 3871,
            "token_samples": [
              3374,
              4373,
              3871
            ],
            "tokens_per_success": null,
            "retrieval": {
              "recall": {
                "1": 0.333,
                "3": 0.333,
                "5": 0.333,
                "10": 0.333
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 0
              },
              {
                "n": 2,
                "pass_rate": 0
              },
              {
                "n": 3,
                "pass_rate": 0
              },
              {
                "n": 4,
                "pass_rate": 0.333
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          },
          "vector-baseline": {
            "tokens": {
              "input": 118,
              "output": 2268
            },
            "time_ms": 32499,
            "runs": 3,
            "total": 3,
            "passes": 0,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0,
            "no_completion_rate": 0,
            "success": false,
            "consistency": 0,
            "judge_pass_rate": 0,
            "median_tokens": 2405,
            "token_samples": [
              2405,
              2924,
              2386
            ],
            "tokens_per_success": null,
            "retrieval": {
              "recall": {
                "1": 0,
                "3": 0,
                "5": 0,
                "10": 0
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 0
              },
              {
                "n": 2,
                "pass_rate": 0
              },
              {
                "n": 3,
                "pass_rate": 0
              },
              {
                "n": 4,
                "pass_rate": 0
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 0.333
              }
            ]
          },
          "context-dump-bounded": {
            "tokens": {
              "input": 61,
              "output": 3548
            },
            "time_ms": 44621,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 3609,
            "token_samples": [
              10894,
              3609,
              3064
            ],
            "tokens_per_success": 5856,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          },
          "context-dump-large": {
            "tokens": {
              "input": 25,
              "output": 3308
            },
            "time_ms": 40420,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 3390,
            "token_samples": [
              55941,
              2737,
              3390
            ],
            "tokens_per_success": 20689,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          },
          "brain-full": {
            "tokens": {
              "input": 81,
              "output": 3191
            },
            "time_ms": 39004,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 3272,
            "token_samples": [
              3764,
              3272,
              2561
            ],
            "tokens_per_success": 3199,
            "retrieval": {
              "recall": {
                "1": 0.333,
                "3": 0.667,
                "5": 0.667,
                "10": 0.667
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          },
          "brain-no-recall": {
            "tokens": {
              "input": 108,
              "output": 3134
            },
            "time_ms": 34961,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 3242,
            "token_samples": [
              5041,
              2645,
              3242
            ],
            "tokens_per_success": 3643,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 0.667
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          },
          "brain-no-pin": {
            "tokens": {
              "input": 106,
              "output": 3565
            },
            "time_ms": 44606,
            "runs": 3,
            "total": 3,
            "passes": 2,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0.667,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 0.667,
            "judge_pass_rate": 0.667,
            "median_tokens": 3985,
            "token_samples": [
              4055,
              2229,
              3985
            ],
            "tokens_per_success": 5135,
            "retrieval": {
              "recall": {
                "1": 0.333,
                "3": 0.333,
                "5": 0.333,
                "10": 0.333
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 0
              },
              {
                "n": 2,
                "pass_rate": 0
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 0.667
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          }
        }
      },
      "summary": null
    },
    {
      "scenario": "scenario-B-three-sessions",
      "model": "deepseek/deepseek-v4-pro",
      "mode": "cloud",
      "timestamp": "2026-06-26T05:32:23.906Z",
      "results": {
        "deepseek": {
          "fixture-only": {
            "tokens": {
              "input": 60,
              "output": 1749
            },
            "time_ms": 19702,
            "runs": 3,
            "total": 3,
            "passes": 2,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0.667,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 0.667,
            "judge_pass_rate": 0.667,
            "median_tokens": 1809,
            "token_samples": [
              927,
              2356,
              1809
            ],
            "tokens_per_success": 2546,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 0.667
              },
              {
                "n": 2,
                "pass_rate": 0.667
              },
              {
                "n": 3,
                "pass_rate": 0.667
              },
              {
                "n": 4,
                "pass_rate": 0.667
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 0.667
              },
              {
                "n": 7,
                "pass_rate": 0
              }
            ]
          },
          "oracle-ceiling": {
            "tokens": {
              "input": 99,
              "output": 1621
            },
            "time_ms": 19907,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 1720,
            "token_samples": [
              2167,
              1315,
              1720
            ],
            "tokens_per_success": 1734,
            "retrieval": {
              "recall": {
                "1": 1,
                "3": 1,
                "5": 1,
                "10": 1
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          },
          "keyword": {
            "tokens": {
              "input": 20,
              "output": 2684
            },
            "time_ms": 34355,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 2704,
            "token_samples": [
              2599,
              2704,
              2860
            ],
            "tokens_per_success": 2721,
            "retrieval": {
              "recall": {
                "1": 0,
                "3": 1,
                "5": 1,
                "10": 1
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 0.667
              }
            ]
          },
          "brain-real": {
            "tokens": {
              "input": 16,
              "output": 1719
            },
            "time_ms": 20887,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 1848,
            "token_samples": [
              2247,
              1848,
              1518
            ],
            "tokens_per_success": 1871,
            "retrieval": {
              "recall": {
                "1": 1,
                "3": 1,
                "5": 1,
                "10": 1
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          },
          "brain-no-pin": {
            "tokens": {
              "input": 10,
              "output": 1961
            },
            "time_ms": 23737,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 1971,
            "token_samples": [
              2510,
              1735,
              1971
            ],
            "tokens_per_success": 2072,
            "retrieval": {
              "recall": {
                "1": 1,
                "3": 1,
                "5": 1,
                "10": 1
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          },
          "brain-no-recall": {
            "tokens": {
              "input": 78,
              "output": 1689
            },
            "time_ms": 22690,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 1767,
            "token_samples": [
              2899,
              1451,
              1767
            ],
            "tokens_per_success": 2039,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              }
            ]
          }
        }
      },
      "summary": null
    },
    {
      "scenario": "scenario-C-contradiction",
      "model": "deepseek/deepseek-v4-pro",
      "mode": "cloud",
      "timestamp": "2026-06-26T05:55:51.703Z",
      "results": {
        "deepseek": {
          "fixture-only": {
            "tokens": {
              "input": 72,
              "output": 739
            },
            "time_ms": 9443,
            "runs": 3,
            "total": 3,
            "passes": 2,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0.667,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 0.667,
            "judge_pass_rate": 0.667,
            "median_tokens": 811,
            "token_samples": [
              811,
              679,
              945
            ],
            "tokens_per_success": 1218,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 0
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 0.667
              }
            ]
          },
          "oracle-ceiling": {
            "tokens": {
              "input": 63,
              "output": 568
            },
            "time_ms": 7802,
            "runs": 3,
            "total": 3,
            "passes": 2,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0.667,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 0.667,
            "judge_pass_rate": 0.667,
            "median_tokens": 631,
            "token_samples": [
              557,
              642,
              631
            ],
            "tokens_per_success": 915,
            "retrieval": {
              "recall": {
                "1": 1,
                "3": 1,
                "5": 1,
                "10": 1
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 0.333
              },
              {
                "n": 3,
                "pass_rate": 0.667
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              }
            ]
          },
          "keyword": {
            "tokens": {
              "input": 5,
              "output": 475
            },
            "time_ms": 7465,
            "runs": 3,
            "total": 3,
            "passes": 1,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0.333,
            "no_completion_rate": 0,
            "success": false,
            "consistency": 0.333,
            "judge_pass_rate": 0.333,
            "median_tokens": 686,
            "token_samples": [
              736,
              686,
              353
            ],
            "tokens_per_success": 1775,
            "retrieval": {
              "recall": {
                "1": 0,
                "3": 1,
                "5": 1,
                "10": 1
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 0
              },
              {
                "n": 3,
                "pass_rate": 0.333
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              }
            ]
          },
          "brain-real": {
            "tokens": {
              "input": 33,
              "output": 682
            },
            "time_ms": 9631,
            "runs": 3,
            "total": 3,
            "passes": 2,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0.667,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 0.667,
            "judge_pass_rate": 0.667,
            "median_tokens": 1064,
            "token_samples": [
              1064,
              1364,
              715
            ],
            "tokens_per_success": 1572,
            "retrieval": {
              "recall": {
                "1": 1,
                "3": 1,
                "5": 1,
                "10": 1
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 0.667
              },
              {
                "n": 3,
                "pass_rate": 0.333
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              }
            ]
          },
          "brain-no-pin": {
            "tokens": {
              "input": 28,
              "output": 496
            },
            "time_ms": 7642,
            "runs": 3,
            "total": 3,
            "passes": 2,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0.667,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 0.667,
            "judge_pass_rate": 0.667,
            "median_tokens": 524,
            "token_samples": [
              1098,
              494,
              524
            ],
            "tokens_per_success": 1058,
            "retrieval": {
              "recall": {
                "1": 1,
                "3": 1,
                "5": 1,
                "10": 1
              }
            },
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 0.333
              },
              {
                "n": 3,
                "pass_rate": 0.667
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              }
            ]
          },
          "dump-all-chrono": {
            "tokens": {
              "input": 5,
              "output": 384
            },
            "time_ms": 5943,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 416,
            "token_samples": [
              602,
              416,
              389
            ],
            "tokens_per_success": 469,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 0.667
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              }
            ]
          }
        }
      },
      "summary": null
    },
    {
      "scenario": "scenario-D-skills",
      "model": "deepseek/deepseek-v4-pro",
      "mode": "cloud",
      "timestamp": "2026-06-26T06:21:55.738Z",
      "results": {
        "deepseek": {
          "fixture-only": {
            "tokens": {
              "input": 61,
              "output": 2007
            },
            "time_ms": 29116,
            "runs": 3,
            "total": 3,
            "passes": 0,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0,
            "no_completion_rate": 0,
            "success": false,
            "consistency": 0,
            "judge_pass_rate": 0,
            "median_tokens": 2068,
            "token_samples": [
              921,
              2249,
              2068
            ],
            "tokens_per_success": null,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 0.333
              },
              {
                "n": 2,
                "pass_rate": 0
              },
              {
                "n": 3,
                "pass_rate": 0.333
              },
              {
                "n": 4,
                "pass_rate": 0.667
              },
              {
                "n": 5,
                "pass_rate": 0
              },
              {
                "n": 6,
                "pass_rate": 0
              },
              {
                "n": 7,
                "pass_rate": 0.667
              },
              {
                "n": 8,
                "pass_rate": 0.667
              }
            ]
          },
          "brain-skills-L0": {
            "tokens": {
              "input": 61,
              "output": 1789
            },
            "time_ms": 26565,
            "runs": 3,
            "total": 3,
            "passes": 0,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0,
            "no_completion_rate": 0,
            "success": false,
            "consistency": 0,
            "judge_pass_rate": 0,
            "median_tokens": 1850,
            "token_samples": [
              2388,
              1850,
              1759
            ],
            "tokens_per_success": null,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 0.333
              },
              {
                "n": 2,
                "pass_rate": 0.667
              },
              {
                "n": 3,
                "pass_rate": 0
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 0
              },
              {
                "n": 6,
                "pass_rate": 0
              },
              {
                "n": 7,
                "pass_rate": 1
              },
              {
                "n": 8,
                "pass_rate": 1
              }
            ]
          },
          "brain-skills-loaded": {
            "tokens": {
              "input": 102,
              "output": 1381
            },
            "time_ms": 20033,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 1483,
            "token_samples": [
              1808,
              1448,
              1483
            ],
            "tokens_per_success": 1580,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              },
              {
                "n": 8,
                "pass_rate": 1
              }
            ]
          },
          "brain-skills-all-loaded": {
            "tokens": {
              "input": 4,
              "output": 2165
            },
            "time_ms": 32431,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 2302,
            "token_samples": [
              2425,
              2302,
              2141
            ],
            "tokens_per_success": 2289,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              },
              {
                "n": 7,
                "pass_rate": 1
              },
              {
                "n": 8,
                "pass_rate": 1
              }
            ]
          }
        }
      },
      "summary": null
    },
    {
      "scenario": "scenario-F-abstention",
      "model": "deepseek/deepseek-v4-pro",
      "mode": "cloud",
      "timestamp": "2026-06-26T06:40:15.297Z",
      "results": {
        "deepseek": {
          "fixture-only": {
            "tokens": {
              "input": 90,
              "output": 689
            },
            "time_ms": 13265,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 779,
            "token_samples": [
              752,
              793,
              779
            ],
            "tokens_per_success": 775,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              }
            ]
          },
          "oracle-ceiling": {
            "tokens": {
              "input": 117,
              "output": 635
            },
            "time_ms": 14019,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 844,
            "token_samples": [
              844,
              1074,
              752
            ],
            "tokens_per_success": 890,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              }
            ]
          },
          "keyword": {
            "tokens": {
              "input": 123,
              "output": 741
            },
            "time_ms": 15749,
            "runs": 3,
            "total": 3,
            "passes": 2,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 0.667,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 0.667,
            "judge_pass_rate": 0.667,
            "median_tokens": 992,
            "token_samples": [
              992,
              1241,
              243
            ],
            "tokens_per_success": 1238,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 0.667
              },
              {
                "n": 2,
                "pass_rate": 0.667
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              }
            ]
          },
          "brain-real": {
            "tokens": {
              "input": 70,
              "output": 743
            },
            "time_ms": 15861,
            "runs": 3,
            "total": 3,
            "passes": 3,
            "completed": 3,
            "no_completion": 0,
            "completion_rate": 1,
            "success_rate": 1,
            "no_completion_rate": 0,
            "success": true,
            "consistency": 1,
            "judge_pass_rate": 1,
            "median_tokens": 849,
            "token_samples": [
              1097,
              849,
              813
            ],
            "tokens_per_success": 920,
            "retrieval": null,
            "criteria_pass_rate": [
              {
                "n": 1,
                "pass_rate": 1
              },
              {
                "n": 2,
                "pass_rate": 1
              },
              {
                "n": 3,
                "pass_rate": 1
              },
              {
                "n": 4,
                "pass_rate": 1
              },
              {
                "n": 5,
                "pass_rate": 1
              },
              {
                "n": 6,
                "pass_rate": 1
              }
            ]
          }
        }
      },
      "summary": null
    }
  ]
}
