Files
codex-game-studio/eval-framework/catalog.json
T

573 lines
17 KiB
JSON
Raw Normal View History

2026-07-01 23:07:48 +00:00
{
"version": 1,
"manualOnly": true,
"lastReviewed": "2026-07-01",
"targets": [
{
"id": "workflow.vertical-slice",
"kind": "workflow",
"priority": "critical",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/vertical-slice.md",
".agents/skills/cgs-vertical-slice/SKILL.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-vertical-slice/behavior/scenario.json"
]
},
{
"id": "workflow.bugfix",
"kind": "workflow",
"priority": "critical",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/bugfix.md",
".agents/skills/cgs-bugfix/SKILL.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-bugfix/behavior/scenario.json"
]
},
{
"id": "workflow.playtest",
"kind": "workflow",
"priority": "critical",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/playtest.md",
".agents/skills/cgs-playtest-report/SKILL.md",
"templates/playtest_report_template.md",
"templates/test_evidence_template.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-playtest/behavior/scenario.json"
]
},
{
"id": "workflow.market-analysis",
"kind": "workflow",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/market-analysis.md",
".agents/skills/cgs-content-audit/SKILL.md",
"templates/market_analysis_template.md",
"templates/pitch_document_template.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-market-analysis/behavior/scenario.json"
]
},
{
"id": "workflow.release-checklist",
"kind": "workflow",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/release-checklist.md",
".agents/skills/cgs-release-checklist/SKILL.md",
"templates/release_notes_template.md",
"templates/risk_register_template.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-release-checklist/behavior/scenario.json"
]
},
{
"id": "workflow.ship-check",
"kind": "workflow",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/ship-check.md",
"templates/ship_check_template.md",
"templates/risk_register_template.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-ship-check/behavior/scenario.json"
]
},
{
"id": "workflow.prototype",
"kind": "workflow",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/prototype.md",
".agents/skills/cgs-prototype/SKILL.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-prototype/behavior/scenario.json"
]
},
{
"id": "workflow.design-spec",
"kind": "workflow",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/design-spec.md",
".agents/skills/cgs-design-system/SKILL.md",
"templates/gdd_template.md",
"templates/feature_spec_template.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-design-spec/behavior/scenario.json"
]
},
{
"id": "workflow.game-feel-tuning",
"kind": "workflow",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/game-feel-tuning.md",
".agents/skills/cgs-balance-check/SKILL.md",
"templates/game_feel_tuning_template.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-game-feel-tuning/behavior/scenario.json"
]
},
{
"id": "workflow.ui-ux-review",
"kind": "workflow",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/ui-ux-review.md",
".agents/skills/cgs-ui-ux-review/SKILL.md",
"templates/ui_ux_review_template.md",
"templates/accessibility_requirements_template.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-ui-ux-review/behavior/scenario.json"
]
},
{
"id": "workflow.architecture-review",
"kind": "workflow",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/architecture-review.md",
".agents/skills/cgs-architecture-review/SKILL.md",
"templates/technical_design_template.md",
"templates/architecture_traceability_template.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-architecture-review/behavior/scenario.json"
]
},
{
"id": "workflow.sprint-plan",
"kind": "workflow",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/workflows/sprint-plan.md",
".agents/skills/cgs-sprint-plan/SKILL.md",
"templates/sprint_plan_template.md"
],
"rubric": "eval-framework/rubrics/prompt-workflow-behavior.json",
"scenarios": [
"eval-framework/scenarios/workflow-sprint-plan/behavior/scenario.json"
]
},
{
"id": "cgs-skill-test",
"kind": "skill",
"priority": "critical",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-skill-test/SKILL.md",
"eval-framework/rubrics/skill-behavior.json"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-skill-test/behavioral-spec/scenario.json"
]
},
{
"id": "cgs-skill-improve",
"kind": "skill",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-skill-improve/SKILL.md",
"eval-framework/failure-taxonomy.md",
"eval-framework/improvement-loop.md"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-skill-improve/failure-loop/scenario.json"
]
},
{
"id": "cgs-gate-check",
"kind": "skill",
"priority": "critical",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-gate-check/SKILL.md",
"eval-framework/rubrics/skill-behavior.json"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-gate-check/mode-boundary/scenario.json"
]
},
{
"id": "cgs-design-review",
"kind": "skill",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-design-review/SKILL.md",
"eval-framework/rubrics/skill-behavior.json"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-design-review/read-only-verdict/scenario.json"
]
},
{
"id": "cgs-architecture-review",
"kind": "skill",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-architecture-review/SKILL.md",
"eval-framework/rubrics/skill-behavior.json"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-architecture-review/risk-verdict/scenario.json"
]
},
{
"id": "cgs-story-readiness",
"kind": "skill",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-story-readiness/SKILL.md",
"eval-framework/rubrics/skill-behavior.json"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-story-readiness/readiness-verdict/scenario.json"
]
},
{
"id": "cgs-story-done",
"kind": "skill",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-story-done/SKILL.md",
"eval-framework/rubrics/skill-behavior.json"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-story-done/done-verdict/scenario.json"
]
},
{
"id": "cgs-qa-plan",
"kind": "skill",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-qa-plan/SKILL.md",
"templates/test_plan_template.md"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-qa-plan/coverage-plan/scenario.json"
]
},
{
"id": "cgs-regression-suite",
"kind": "skill",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-regression-suite/SKILL.md",
"templates/test_evidence_template.md"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-regression-suite/repeatability/scenario.json"
]
},
{
"id": "cgs-test-evidence-review",
"kind": "skill",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-test-evidence-review/SKILL.md",
"templates/test_evidence_template.md"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-test-evidence-review/evidence-review/scenario.json"
]
},
{
"id": "cgs-test-flakiness",
"kind": "skill",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-test-flakiness/SKILL.md",
"eval-framework/rubrics/skill-behavior.json"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-test-flakiness/flakiness-diagnosis/scenario.json"
]
},
{
"id": "cgs-code-review",
"kind": "skill",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".agents/skills/cgs-code-review/SKILL.md",
"eval-framework/rubrics/skill-behavior.json"
],
"rubric": "eval-framework/rubrics/skill-behavior.json",
"scenarios": [
"eval-framework/scenarios/cgs-code-review/review-findings/scenario.json"
]
},
{
"id": "role.producer",
"kind": "role",
"priority": "critical",
"manualOnly": true,
"surfacePaths": [
".codex/agents/producer.toml"
],
"rubric": "eval-framework/rubrics/role-behavior.json",
"scenarios": [
"eval-framework/scenarios/role-producer/domain-boundary/scenario.json"
]
},
{
"id": "role.qa-playtester",
"kind": "role",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/agents/qa-playtester.toml"
],
"rubric": "eval-framework/rubrics/role-behavior.json",
"scenarios": [
"eval-framework/scenarios/role-qa-playtester/domain-boundary/scenario.json"
]
},
{
"id": "role.gameplay-programmer",
"kind": "role",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/agents/gameplay-programmer.toml"
],
"rubric": "eval-framework/rubrics/role-behavior.json",
"scenarios": [
"eval-framework/scenarios/role-gameplay-programmer/domain-boundary/scenario.json"
]
},
{
"id": "role.game-designer",
"kind": "role",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/agents/game-designer.toml"
],
"rubric": "eval-framework/rubrics/role-behavior.json",
"scenarios": [
"eval-framework/scenarios/role-game-designer/domain-boundary/scenario.json"
]
},
{
"id": "role.market-analyst",
"kind": "role",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/agents/market-analyst.toml"
],
"rubric": "eval-framework/rubrics/role-behavior.json",
"scenarios": [
"eval-framework/scenarios/role-market-analyst/domain-boundary/scenario.json"
]
},
{
"id": "role.technical-artist",
"kind": "role",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/agents/technical-artist.toml"
],
"rubric": "eval-framework/rubrics/role-behavior.json",
"scenarios": [
"eval-framework/scenarios/role-technical-artist/domain-boundary/scenario.json"
]
},
{
"id": "role.release-manager",
"kind": "role",
"priority": "high",
"manualOnly": true,
"surfacePaths": [
".codex/agents/release-manager.toml"
],
"rubric": "eval-framework/rubrics/role-behavior.json",
"scenarios": [
"eval-framework/scenarios/role-release-manager/domain-boundary/scenario.json"
]
}
],
"runners": {
"harnessHosts": [
"fake"
],
"manualAgentHosts": [
"codex"
],
"runOutputPolicy": {
"repositoryTracked": true,
"root": "eval-framework/runs",
"perRunDirectory": "<timestamp>-<stage-or-scenario>",
"requiredFiles": [
"summary.md",
"audit.json"
],
"summaryContract": [
"run id and evaluation stage",
"selected model and token usage summary",
"scenario verdict table",
"deterministic failures and semantic findings",
"changed files and verification evidence",
"recommended follow-up fixes"
],
"auditContract": [
"machine-readable scenario results",
"raw token usage fields",
"model used per scenario",
"trace evidence references",
"failure taxonomy labels"
],
"notes": "Evaluation results are repository artifacts. Commit intentionally selected run summaries and compact audit files when preserving an eval result; do not rely on chat transcript as the record."
}
},
"modelPolicy": {
"defaultEvaluationModel": "gpt-5.3-codex-spark",
"allowedEvaluationModels": [
"gpt-5.3-codex-spark",
"gpt-5.5",
"gpt-5.4",
"gpt-5.4-mini"
],
"overrideMechanism": "Manual runners may pass an explicit Codex --model value per scenario or batch; record the selected model in the run report and audit JSON.",
"tokenEstimation": {
"required": true,
"fields": [
"inputTokens",
"cachedInputTokens",
"outputTokens",
"reasoningOutputTokens",
"totalTokens"
],
"notes": "Estimate token usage as part of each staged evaluation run using the selected model, scenario count, expected context, and expected output size; record actual token usage when the host exposes it."
}
},
"evaluationPlan": [
{
"stage": "smoke-critical",
"purpose": "Run the smallest critical token-estimation set first before touching broad coverage.",
"targetPriorities": [
"critical"
],
"scenarioKinds": [
"workflow",
"skill",
"role"
],
"recommendedMaxScenarios": 5
},
{
"stage": "workflow-high-risk",
"purpose": "Evaluate high-priority workflow prompts that drive real game-production behavior.",
"targetPriorities": [
"critical",
"high"
],
"scenarioKinds": [
"workflow"
],
"recommendedMaxScenarios": 12
},
{
"stage": "skill-maintenance",
"purpose": "Evaluate skill-maintenance, gate, QA, review, and evidence skills after workflow smoke passes.",
"targetPriorities": [
"critical",
"high"
],
"scenarioKinds": [
"skill"
],
"recommendedMaxScenarios": 12
},
{
"stage": "role-boundary",
"purpose": "Evaluate role prompts for ownership boundaries and handoff quality.",
"targetPriorities": [
"critical",
"high"
],
"scenarioKinds": [
"role"
],
"recommendedMaxScenarios": 7
},
{
"stage": "full-regression",
"purpose": "Run all scenarios only before large prompt-surface releases or after broad refactors.",
"targetPriorities": [
"critical",
"high",
"medium",
"low"
],
"scenarioKinds": [
"workflow",
"skill",
"role",
"prompt"
],
"recommendedMaxScenarios": 31
}
]
}