# Benchmark Gate Matrix

Generated: 2026-03-04T10:50:31Z
CYCLE_DECISION_FILE: `/mnt/c/_organized_non_vital/.ci_cycle_decision.json`

| # | Benchmark Entrypoint | Command | Exit Code | Status | Output (truncated) |
|---|---|---|---:|---|---|
| 1 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/artifact_contract.sh` | `bash /mnt/c/_organized_non_vital/ai_research/benchmarks/artifact_contract.sh` | 0 | PASS |  |
| 2 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/check_cycle_decision.py` | `python3 /mnt/c/_organized_non_vital/ai_research/benchmarks/check_cycle_decision.py` | 2 | FAIL | usage: check_cycle_decision.py [-h] --cycle-decision-file CYCLE_DECISION_FILE                                --baseline-run BASELINE_RUN --target-run                                TARGET_RUN check_cycle_decision.py: error: the following arguments are required: --cycle-decision-file, --baseline-run, --target-run  |
| 3 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/coverage_gap_audit.py` | `python3 /mnt/c/_organized_non_vital/ai_research/benchmarks/coverage_gap_audit.py` | 0 | PASS | {   "class_summary": [     {       "class_id": 1,       "class_name": "Perception & Grounding",       "coverage_status": "uncovered",       "mapped_benchmark_ids": []     },     {       "class_id": 2,       "class_name": "Reasoning & Inference",       "coverage_status": "uncovered",       "mapped_benchmark_ids": []     },     {       "class_id": 3,       "class_name": "Planning & Control",       "coverage_status": "uncovered",       "mapped_benchmark_ids": []     },     {       "class_id": 4,       "class_name": "Memory & State Tracking",       "coverage_status": "uncovered",       "mapped_benchmark_ids": []     },     {       "class_id": 5,       "class_name": "Tool Use & Environment Interaction",       "coverage_status": "uncovered",       "mapped_benchmark_ids": []     },     {       "class_id": 6,       "class_name": "Reliability, Safety & Maintainability",       "coverage_status": " |
| 4 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/entrypoint_contract.sh` | `bash /mnt/c/_organized_non_vital/ai_research/benchmarks/entrypoint_contract.sh` | TIMEOUT | TIMEOUT | command timed out (10s limit) |
| 5 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/entrypoint_contract_check.sh` | `bash /mnt/c/_organized_non_vital/ai_research/benchmarks/entrypoint_contract_check.sh` | TIMEOUT | TIMEOUT | command timed out (10s limit) |
| 6 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/generate_benchmark_delta.py` | `python3 /mnt/c/_organized_non_vital/ai_research/benchmarks/generate_benchmark_delta.py` | 2 | FAIL | usage: generate_benchmark_delta.py [-h] --baseline-run BASELINE_RUN                                    --target-run TARGET_RUN                                    [--runs-dir RUNS_DIR]                                    [--output-dir OUTPUT_DIR] generate_benchmark_delta.py: error: the following arguments are required: --baseline-run, --target-run  |
| 7 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/generate_benchmark_delta.sh` | `bash /mnt/c/_organized_non_vital/ai_research/benchmarks/generate_benchmark_delta.sh` | 2 | FAIL | usage: generate_benchmark_delta.py [-h] --baseline-run BASELINE_RUN                                    --target-run TARGET_RUN                                    [--runs-dir RUNS_DIR]                                    [--output-dir OUTPUT_DIR] generate_benchmark_delta.py: error: the following arguments are required: --baseline-run, --target-run  |
| 8 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/generate_class_trends.py` | `python3 /mnt/c/_organized_non_vital/ai_research/benchmarks/generate_class_trends.py` | 0 | PASS | /mnt/c/_organized_non_vital/ai_research/benchmarks/generate_class_trends.py:278: DeprecationWarning: datetime.datetime.utcnow() is deprecated and scheduled for removal in a future version. Use timezone-aware objects to represent datetimes in UTC: datetime.datetime.now(datetime.UTC).   "generated_at": datetime.utcnow().isoformat() + "Z",  |
| 9 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/normalize_benchmark_summary.py` | `python3 /mnt/c/_organized_non_vital/ai_research/benchmarks/normalize_benchmark_summary.py` | 2 | FAIL | usage: normalize_benchmark_summary.py [-h] [--inplace] [--output OUTPUT]                                       summary_path normalize_benchmark_summary.py: error: the following arguments are required: summary_path  |
| 10 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/smoke_delta_e2e.sh` | `bash /mnt/c/_organized_non_vital/ai_research/benchmarks/smoke_delta_e2e.sh` | 1 | FAIL | 2026-03-04T10:50:27Z [stage] Starting argument parsing 2026-03-04T10:50:27Z [stage] Arguments parsed Both --baseline-run and --target-run are required Usage: smoke_delta_e2e.sh --baseline-run ID --target-run ID [--runs-dir DIR]  Runs baseline->target delta generation smoke check.  Options:   --baseline-run ID   Baseline run id (required)   --target-run ID     Target run id (required)   --cycle-decision-file PATH  Optional specific cycle decision markdown   --runs-dir DIR      Directory containing run folders (default: /mnt/c/_organized_non_vital/ai_research/benchmarks/runs)   -h, --help         Show this help and exit  |
| 11 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/tests/test_normalize_benchmark_summary.py` | `python3 /mnt/c/_organized_non_vital/ai_research/benchmarks/tests/test_normalize_benchmark_summary.py` | 1 | FAIL | Traceback (most recent call last):   File "/mnt/c/_organized_non_vital/ai_research/benchmarks/tests/test_normalize_benchmark_summary.py", line 8, in <module>     from ai_research.benchmarks.normalize_benchmark_summary import ( ModuleNotFoundError: No module named 'ai_research'  |
| 12 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/verify_benchmark_artifacts.sh` | `bash /mnt/c/_organized_non_vital/ai_research/benchmarks/verify_benchmark_artifacts.sh` | 2 | FAIL | Missing RUN_ID; expected to be provided (e.g., RUN_ID=2026-03-04).  |
| 13 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/verify_benchmark_artifacts_wrapper.sh` | `bash /mnt/c/_organized_non_vital/ai_research/benchmarks/verify_benchmark_artifacts_wrapper.sh` | 2 | FAIL | Missing RUN_ID; expected to be provided (e.g., RUN_ID=2026-03-04).  |
| 14 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/verify_benchmark_parity.py` | `python3 /mnt/c/_organized_non_vital/ai_research/benchmarks/verify_benchmark_parity.py` | 0 | PASS |  |
| 15 | `/mnt/c/_organized_non_vital/ai_research/benchmarks/verify_coverage_gap_map.sh` | `bash /mnt/c/_organized_non_vital/ai_research/benchmarks/verify_coverage_gap_map.sh` | 1 | FAIL | [ERROR] missing proposal for class 1  |
| 16 | `/mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/ai-tutorial.ts` | `node /mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/ai-tutorial.ts` | 0 | PASS |  |
| 17 | `/mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/api-docs.ts` | `node /mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/api-docs.ts` | 0 | PASS |  |
| 18 | `/mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/blog-post.ts` | `node /mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/blog-post.ts` | 0 | PASS |  |
| 19 | `/mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/data-analysis.ts` | `node /mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/data-analysis.ts` | 0 | PASS |  |
| 20 | `/mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/empty.ts` | `node /mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/empty.ts` | 0 | PASS |  |
| 21 | `/mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/math-formulas.ts` | `node /mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/math-formulas.ts` | 0 | PASS |  |
| 22 | `/mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/readme.ts` | `node /mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/readme.ts` | 0 | PASS |  |
| 23 | `/mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/storybook-mocks.ts` | `node /mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/storybook-mocks.ts` | 1 | FAIL | node:internal/modules/package_json_reader:314   throw new ERR_MODULE_NOT_FOUND(packageName, fileURLToPath(base), null);         ^  Error [ERR_MODULE_NOT_FOUND]: Cannot find package '$lib' imported from /mnt/c/_organized_non_vital/ai_research/custollama/llama.cpp/tools/server/webui/tests/stories/fixtures/storybook-mocks.ts     at Object.getPackageJSONURL (node:internal/modules/package_json_reader:314:9)     at packageResolve (node:internal/modules/esm/resolve:767:81)     at moduleResolve (node:internal/modules/esm/resolve:853:18)     at defaultResolve (node:internal/modules/esm/resolve:983:11)     at #cachedDefaultResolve (node:internal/modules/esm/loader:731:20)     at ModuleLoader.resolve (node:internal/modules/esm/loader:708:38)     at ModuleLoader.getModuleJobForImport (node:internal/modules/esm/loader:310:38)     at ModuleJob._link (node:internal/modules/esm/module_job:182:49) {   co |
| 24 | `/mnt/c/_organized_non_vital/ai_research/MK2/evaluation/benchmarks.py` | `python3 /mnt/c/_organized_non_vital/ai_research/MK2/evaluation/benchmarks.py` | 1 | FAIL | Traceback (most recent call last):   File "/mnt/c/_organized_non_vital/ai_research/MK2/evaluation/benchmarks.py", line 5, in <module>     import torch ModuleNotFoundError: No module named 'torch'  |
| 25 | `/mnt/c/_organized_non_vital/ai_research/MK2/scripts/run_benchmarks.py` | `python3 /mnt/c/_organized_non_vital/ai_research/MK2/scripts/run_benchmarks.py` | 1 | FAIL | Traceback (most recent call last):   File "/mnt/c/_organized_non_vital/ai_research/MK2/scripts/run_benchmarks.py", line 5, in <module>     import torch ModuleNotFoundError: No module named 'torch'  |
| 26 | `/mnt/c/_organized_non_vital/ai_research/MK2/training/train_benchmark_final.py` | `python3 /mnt/c/_organized_non_vital/ai_research/MK2/training/train_benchmark_final.py` | 1 | FAIL | Traceback (most recent call last):   File "/mnt/c/_organized_non_vital/ai_research/MK2/training/train_benchmark_final.py", line 6, in <module>     import torch ModuleNotFoundError: No module named 'torch'  |
| 27 | `/mnt/c/_organized_non_vital/ai_research/MK4/MK2/MK2/evaluation/benchmarks.py` | `python3 /mnt/c/_organized_non_vital/ai_research/MK4/MK2/MK2/evaluation/benchmarks.py` | 1 | FAIL | Traceback (most recent call last):   File "/mnt/c/_organized_non_vital/ai_research/MK4/MK2/MK2/evaluation/benchmarks.py", line 5, in <module>     import torch ModuleNotFoundError: No module named 'torch'  |
| 28 | `/mnt/c/_organized_non_vital/ai_research/MK4/MK2/MK2/scripts/run_benchmarks.py` | `python3 /mnt/c/_organized_non_vital/ai_research/MK4/MK2/MK2/scripts/run_benchmarks.py` | 1 | FAIL | Traceback (most recent call last):   File "/mnt/c/_organized_non_vital/ai_research/MK4/MK2/MK2/scripts/run_benchmarks.py", line 5, in <module>     import torch ModuleNotFoundError: No module named 'torch'  |
| 29 | `/mnt/c/_organized_non_vital/ai_research/MK4/MK2/MK2/training/train_benchmark_final.py` | `python3 /mnt/c/_organized_non_vital/ai_research/MK4/MK2/MK2/training/train_benchmark_final.py` | 1 | FAIL | Traceback (most recent call last):   File "/mnt/c/_organized_non_vital/ai_research/MK4/MK2/MK2/training/train_benchmark_final.py", line 6, in <module>     import torch ModuleNotFoundError: No module named 'torch'  |
| 30 | `/mnt/c/_organized_non_vital/ai_research/run_benchmarks.sh` | `bash /mnt/c/_organized_non_vital/ai_research/run_benchmarks.sh` | 0 | PASS | Wrote /mnt/c/_organized_non_vital/ai_research/benchmarks/runs/2026-03-04/summary.json Benchmark summary: /mnt/c/_organized_non_vital/ai_research/benchmarks/runs/2026-03-04/summary.json Latest run: /mnt/c/_organized_non_vital/ai_research/benchmarks/runs/latest  |
| 31 | `/mnt/c/_organized_non_vital/ai_research/verify_benchmark_artifacts.sh` | `bash /mnt/c/_organized_non_vital/ai_research/verify_benchmark_artifacts.sh` | 2 | FAIL | Missing RUN_ID; expected to be provided (e.g., RUN_ID=2026-03-04).  |

> Evidence generated from executed benchmark/fixture entrypoint commands with CYCLE_DECISION_FILE.
