{
  "version": "2.3.0-multi-surface-baselines",
  "policy": "Local deterministic surfaces are labeled as tools, not external human adoption or model-provider evidence.",
  "surfaces": {
    "codex-cli-default": {
      "kind": "codex",
      "label": "Codex CLI default model",
      "provenance": "project-owned",
      "execution": "local read-only CLI",
      "evidence_class": "project_owned_model_run"
    },
    "local-deterministic-grader": {
      "kind": "local-tool",
      "label": "Fixture-local deterministic execution and marker grader",
      "provenance": "project-owned",
      "limitation": "This is a repository-owned tool surface, not an independent model surface."
    },
    "claude-code-safe": {
      "kind": "claude-code",
      "label": "Claude Code CLI with tools disabled",
      "provenance": "project-owned",
      "execution": "local CLI, print mode, tools disabled",
      "evidence_class": "project_owned_model_run"
    }
  },
  "field_spell_matrix": {
    "safe-refactoring": {
      "title": "Refactor Without Breaking Behavior",
      "surfaces": {
        "claude-code-safe": {
          "delta": "repaired prompts satisfied 0.5 more outcome checks on average",
          "reviewability_delta": "repaired prompts scored 4.0 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 4,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "claude-code-safe",
              "tier": "clean",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 8.0,
              "repaired_reviewability_avg": 10.0,
              "reviewability_delta": 2.0,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 2.0,
              "outcome_delta": -1.0
            },
            {
              "surface": "claude-code-safe",
              "tier": "trap",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 5.0,
              "repaired_reviewability_avg": 11.0,
              "reviewability_delta": 6.0,
              "weak_outcome_avg": 1.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 2.0
            }
          ]
        },
        "codex-cli-default": {
          "delta": "repaired prompts satisfied 0.7 more outcome checks on average",
          "reviewability_delta": "repaired prompts scored 3.2 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 12,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "codex-cli-default",
              "tier": "clean",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 7.666666666666667,
              "repaired_reviewability_avg": 10.0,
              "reviewability_delta": 2.333333333333333,
              "weak_outcome_avg": 2.6666666666666665,
              "repaired_outcome_avg": 2.6666666666666665,
              "outcome_delta": 0.0
            },
            {
              "surface": "codex-cli-default",
              "tier": "trap",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 6.333333333333333,
              "repaired_reviewability_avg": 10.333333333333334,
              "reviewability_delta": 4.000000000000001,
              "weak_outcome_avg": 1.3333333333333333,
              "repaired_outcome_avg": 2.6666666666666665,
              "outcome_delta": 1.3333333333333333
            }
          ]
        },
        "local-deterministic-grader": {
          "delta": "repaired artifact passes where weak artifact fails",
          "reviewability_delta": "not applicable",
          "evidence": "fixture-local artifact execution where grader exists",
          "limitation": "repository-owned deterministic tool surface, not independent model evidence",
          "cells": []
        }
      }
    },
    "bug-diagnosis-from-logs": {
      "title": "Incident Diagnosis Without Fake Certainty",
      "surfaces": {
        "claude-code-safe": {
          "delta": "weak and repaired prompts tied on outcome checks",
          "reviewability_delta": "repaired prompts scored 2.0 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 4,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "claude-code-safe",
              "tier": "clean",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 8.0,
              "repaired_reviewability_avg": 9.0,
              "reviewability_delta": 1.0,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            },
            {
              "surface": "claude-code-safe",
              "tier": "trap",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 5.0,
              "repaired_reviewability_avg": 8.0,
              "reviewability_delta": 3.0,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            }
          ]
        },
        "codex-cli-default": {
          "delta": "repaired prompts satisfied 0.5 more outcome checks on average",
          "reviewability_delta": "repaired prompts scored 3.3 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 12,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "codex-cli-default",
              "tier": "clean",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 6.333333333333333,
              "repaired_reviewability_avg": 7.333333333333333,
              "reviewability_delta": 1.0,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            },
            {
              "surface": "codex-cli-default",
              "tier": "trap",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 1.3333333333333333,
              "repaired_reviewability_avg": 7.0,
              "reviewability_delta": 5.666666666666667,
              "weak_outcome_avg": 2.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 1.0
            }
          ]
        },
        "local-deterministic-grader": {
          "delta": "execution delta pending",
          "reviewability_delta": "not applicable",
          "evidence": "fixture-local artifact execution where grader exists",
          "limitation": "repository-owned deterministic tool surface, not independent model evidence",
          "cells": []
        }
      }
    },
    "api-design": {
      "title": "API Design Without Hidden Compatibility Traps",
      "surfaces": {
        "claude-code-safe": {
          "delta": "weak and repaired prompts tied on outcome checks",
          "reviewability_delta": "repaired prompts scored 2.5 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 4,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "claude-code-safe",
              "tier": "clean",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 7.0,
              "repaired_reviewability_avg": 9.0,
              "reviewability_delta": 2.0,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            },
            {
              "surface": "claude-code-safe",
              "tier": "trap",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 5.0,
              "repaired_reviewability_avg": 8.0,
              "reviewability_delta": 3.0,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            }
          ]
        },
        "codex-cli-default": {
          "delta": "weak and repaired prompts tied on outcome checks",
          "reviewability_delta": "repaired prompts scored 3.0 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 12,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "codex-cli-default",
              "tier": "clean",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 7.0,
              "repaired_reviewability_avg": 10.333333333333334,
              "reviewability_delta": 3.333333333333334,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            },
            {
              "surface": "codex-cli-default",
              "tier": "trap",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 7.0,
              "repaired_reviewability_avg": 9.666666666666666,
              "reviewability_delta": 2.666666666666666,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            }
          ]
        },
        "local-deterministic-grader": {
          "delta": "execution delta pending",
          "reviewability_delta": "not applicable",
          "evidence": "fixture-local artifact execution where grader exists",
          "limitation": "repository-owned deterministic tool surface, not independent model evidence",
          "cells": []
        }
      }
    },
    "migration-without-data-loss": {
      "title": "Online Migration Without Data Loss",
      "surfaces": {
        "claude-code-safe": {
          "delta": "repaired prompts satisfied 0.5 more outcome checks on average",
          "reviewability_delta": "repaired prompts scored 0.5 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 4,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "claude-code-safe",
              "tier": "clean",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 9.0,
              "repaired_reviewability_avg": 9.0,
              "reviewability_delta": 0.0,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            },
            {
              "surface": "claude-code-safe",
              "tier": "trap",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 7.0,
              "repaired_reviewability_avg": 8.0,
              "reviewability_delta": 1.0,
              "weak_outcome_avg": 2.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 1.0
            }
          ]
        },
        "codex-cli-default": {
          "delta": "weak and repaired prompts tied on outcome checks",
          "reviewability_delta": "repaired prompts scored 0.7 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 12,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "codex-cli-default",
              "tier": "clean",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 8.666666666666666,
              "repaired_reviewability_avg": 9.333333333333334,
              "reviewability_delta": 0.6666666666666679,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            },
            {
              "surface": "codex-cli-default",
              "tier": "trap",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 8.333333333333334,
              "repaired_reviewability_avg": 9.0,
              "reviewability_delta": 0.6666666666666661,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            }
          ]
        },
        "local-deterministic-grader": {
          "delta": "execution delta pending",
          "reviewability_delta": "not applicable",
          "evidence": "fixture-local artifact execution where grader exists",
          "limitation": "repository-owned deterministic tool surface, not independent model evidence",
          "cells": []
        }
      }
    },
    "test-generation": {
      "title": "Test Generation Without Overfitting To Implementation",
      "surfaces": {
        "claude-code-safe": {
          "delta": "repaired prompts satisfied 1.0 more outcome checks on average",
          "reviewability_delta": "repaired prompts scored 1.5 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 4,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "claude-code-safe",
              "tier": "clean",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 8.0,
              "repaired_reviewability_avg": 6.0,
              "reviewability_delta": -2.0,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            },
            {
              "surface": "claude-code-safe",
              "tier": "trap",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 4.0,
              "repaired_reviewability_avg": 9.0,
              "reviewability_delta": 5.0,
              "weak_outcome_avg": 1.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 2.0
            }
          ]
        },
        "codex-cli-default": {
          "delta": "repaired prompts satisfied 0.2 more outcome checks on average",
          "reviewability_delta": "repaired prompts scored 2.7 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 12,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "codex-cli-default",
              "tier": "clean",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 5.0,
              "repaired_reviewability_avg": 7.333333333333333,
              "reviewability_delta": 2.333333333333333,
              "weak_outcome_avg": 2.6666666666666665,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.3333333333333335
            },
            {
              "surface": "codex-cli-default",
              "tier": "trap",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 6.0,
              "repaired_reviewability_avg": 9.0,
              "reviewability_delta": 3.0,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            }
          ]
        },
        "local-deterministic-grader": {
          "delta": "execution delta pending",
          "reviewability_delta": "not applicable",
          "evidence": "fixture-local artifact execution where grader exists",
          "limitation": "repository-owned deterministic tool surface, not independent model evidence",
          "cells": []
        }
      }
    },
    "performance-tuning": {
      "title": "Performance Tuning Without Micro-Optimization Drift",
      "surfaces": {
        "claude-code-safe": {
          "delta": "repaired prompts satisfied 1.5 more outcome checks on average",
          "reviewability_delta": "repaired prompts scored 4.0 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 4,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "claude-code-safe",
              "tier": "clean",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 10.0,
              "repaired_reviewability_avg": 8.0,
              "reviewability_delta": -2.0,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            },
            {
              "surface": "claude-code-safe",
              "tier": "trap",
              "weak_runs": 1,
              "repaired_runs": 1,
              "weak_reviewability_avg": 1.0,
              "repaired_reviewability_avg": 11.0,
              "reviewability_delta": 10.0,
              "weak_outcome_avg": 0.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 3.0
            }
          ]
        },
        "codex-cli-default": {
          "delta": "repaired prompts satisfied 0.2 more outcome checks on average",
          "reviewability_delta": "repaired prompts scored 3.7 reviewability points higher on average",
          "evidence": "recorded transcripts and marker outcome scoring",
          "limitation": "model-surface evidence for the named local CLI/tool configuration; reviewability scoring remains secondary",
          "run_count": 12,
          "tiers": [
            "clean",
            "trap"
          ],
          "cells": [
            {
              "surface": "codex-cli-default",
              "tier": "clean",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 8.666666666666666,
              "repaired_reviewability_avg": 11.0,
              "reviewability_delta": 2.333333333333334,
              "weak_outcome_avg": 3.0,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.0
            },
            {
              "surface": "codex-cli-default",
              "tier": "trap",
              "weak_runs": 3,
              "repaired_runs": 3,
              "weak_reviewability_avg": 6.0,
              "repaired_reviewability_avg": 11.0,
              "reviewability_delta": 5.0,
              "weak_outcome_avg": 2.6666666666666665,
              "repaired_outcome_avg": 3.0,
              "outcome_delta": 0.3333333333333335
            }
          ]
        },
        "local-deterministic-grader": {
          "delta": "execution delta pending",
          "reviewability_delta": "not applicable",
          "evidence": "fixture-local artifact execution where grader exists",
          "limitation": "repository-owned deterministic tool surface, not independent model evidence",
          "cells": []
        }
      }
    }
  }
}
