67 Evidence Browser
68 Evidence Browser
The evidence browser is the project ledger. It separates calibration materials from evidence-bearing artifacts, then records the class and claim scope for each artifact.
68.1 Summary
- Available artifacts:
18/18 - Project-owned model surfaces:
claude-code-safe, claude-code-safe:baseline, claude-code-safe:warded, codex-cli-default, codex-cli-default:baseline, codex-cli-default:warded - Recorded model runs:
266 - Deterministic execution runs:
80 - External adoption reports:
0 - Human canon signoff:
pending-human-maintainer-signoff
68.2 Artifacts
| Artifact | Class | Runs | Surfaces | Status | Path |
|---|---|---|---|---|---|
| Field Spell Model Runs | project_owned_model_run | 96 | claude-code-safe, codex-cli-default | present | examples/evaluations/results.json |
| Fixture-Local Execution Results | local_deterministic_execution | 24 | codex-cli-default, local-deterministic-grader | present | examples/evaluations/execution-results.json |
| Model-Produced Artifact Execution | local_deterministic_execution | 6 | claude-code-safe | present | examples/evaluations/model-execution-results.json |
| Bench v4 Hardness Ladder Seed | local_deterministic_execution | 50 | local-deterministic-grader | present | examples/evaluations/hardness-v4/results.json |
| Bench v4 Model-Surface Hardness Runs | project_owned_model_run | 50 | codex-cli-default | present | examples/evaluations/hardness-v4/model-surface-results.json |
| Bench v4 Hardness Intake Decision Template | reviewer_supplied_model_run | 2 | - | present | examples/evaluations/hardness-v4/hardness-intake-decision-template.json |
| Jailbreak-Resilience Model Runs | project_owned_model_run | 24 | codex-cli-default | present | examples/jailbreak-resilience/results.json |
| Local Warded Baseline Matrix | local_deterministic_control | 16 | local-unwarded-control, local-warded-reviewer | present | examples/jailbreak-resilience/baseline-results.json |
| Ward Science Seed | local_deterministic_control | 6 | local-ward-limb-control | present | examples/jailbreak-resilience/ward-science-results.json |
| Real Surface Warded A/B Runs | project_owned_model_run | 96 | claude-code-safe:baseline, claude-code-safe:warded, codex-cli-default:baseline, codex-cli-default:warded | present | examples/jailbreak-resilience/ab-results.json |
| Adoption Intake Decision Template | adoption_report | 2 | - | present | examples/adoption/adoption-intake-decision-template.json |
| Canon Review Queue | human_audit_pending | 19 | - | present | data/canon_review_queue.json |
| Canon Audit Decision Template | human_audit_pending | 3 | - | present | examples/canon/canon-audit-decision-template.json |
| Logical Conclusion Status | roadmap_acceptance_status | 90 | - | present | data/logical_conclusion_status.json |
| Public Package Build and Install Check | packaging_or_release_check | 15 | - | present | examples/adoption/package-check.json |
| Package-Index Release Plan | packaging_or_release_check | 11 | - | present | examples/adoption/package-index-release-plan.json |
| Package-Index Smoke Template | packaging_or_release_check | 1 | - | present | examples/adoption/package-index-smoke-template.json |
| Public Site Smoke Check | packaging_or_release_check | 28 | - | present | examples/release-gate/public-smoke-check.json |
68.3 Evidence Classes
| Evidence Class | Claim Power | Examples |
|---|---|---|
| calibration_fixture | teaches the method and exposes expected failure modes; does not prove model performance | weak-vs-repaired cases; trap-tier fixture contexts |
| project_owned_model_run | evidence about the named local model/tool surface under the recorded prompt, fixture, and date | Codex CLI transcripts; Claude Code safe-mode transcripts |
| reviewer_supplied_model_run | external or reviewer evidence only after provenance, redaction, and transcript paths are supplied | manual import template records |
| local_deterministic_execution | evidence that a saved artifact satisfies a fixture-local executable check | safe-refactoring pytest fixture; model-produced artifact pytest runs |
| local_deterministic_control | project-owned control evidence for baseline/ward comparisons, not independent model evidence | defanged local warded baseline matrix |
| packaging_or_release_check | evidence that public artifacts can be rendered, installed, or fetched through declared release surfaces | wheel install checks; Quarto render checks; GitHub Pages smoke checks |
| human_audit_pending | records what still requires a named human maintainer before canonical status can be claimed | canon audit queue; reviewed-to-canonical blockers |
| roadmap_acceptance_status | maps roadmap acceptance criteria to current evidence and explicit blockers; does not prove claims beyond linked artifacts | logical-conclusion status ledger; external-reality gate blockers |
| adoption_report | evidence that a practitioner used the grimoire and reported success, friction, or failure | project-owned dogfood; reviewer-supplied reports; external-user reports |
Raw data: evidence_index.json and evidence_taxonomy.json