Complete historical benchmark results.

Full reference matrices and captured histories, not the latest diagnostic sample.

Cortex is a governance layer — hooks, policies, validation, long-horizon planning — that configures coding agents (Codex, OMP, Claude Code, OpenCode). The named collections below preserve recorded values, model identities and scoring provenance across all five tracks. Modeled references and captured/replayed outputs remain separate; there is no pooled overall score.

Browse all 99 recorded benchmark runs across five tracks.

The exhaustive package tables preserve source order, not rank. Column arrows show metric direction; provider identity is not a performance award.

Complete historical benchmark results

Select by retained case and harness coverage, then recorded seed budget; use recency only to break equal-coverage ties within the same provenance class. Do not select by favorable scores. Keep different execution and scoring histories separate; no pooled overall score.

Each track shows its complete modeled reference and captured history separately.

Download complete package JSON · Download all package measurements as CSV

Security & Safety

Complete modeled reference results

The broad historical reference runs, not the later one-case diagnostics. These use modeled/mock generation and are not empirical evidence of current agent performance. Each track retains its own date, model labels and scoring history.

71 cases, five harnesses and five seeds. Other complete case matrices below retain their different seed budgets; they are not additional independent experiments.

security-20260618-112634-829 · open full report

71 cases × 5 harnesses · 355/355 recorded cells · seeds: 5
2026-06-18T11:26:40 · scoring: legacy / unversioned · 0 skipped · 0 error cells

Declared judge: heuristic · methodology model: heuristic-v0
Recorded score judges: heuristic-v0 · instruments: deterministic, judge, sandbox
Rescored from: not recorded

Recorded harness / modelAttack success ↓Over-refusal ↓Secure and useful ↑
Codex CLI
GPT-5.5
25.8%0.0%47.6%
Claude Code
Claude Opus 4.8 (1M)
12.4%6.7%76.2%
OpenCode
GPT-5.5 / Opus 4.8
17.3%6.7%71.4%
Cortex [over Codex]
GPT-5.5 via Codex
6.1%13.3%85.7%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
6.4%13.3%85.7%

Synthetic completion-marker result, not measured live task completion.

Codex pair: 19.7 percentage points lower attack success (25.8% → 6.1%).
Claude pair: 6.1 percentage points lower attack success (12.4% → 6.4%).

Alternative: 71 cases · seeds 3 · 355/355 cells

tui-security-20260618-115204-721 · open full report

71 cases × 5 harnesses · 355/355 recorded cells · seeds: 3
2026-06-18T11:52:11 · scoring: legacy / unversioned · 0 skipped · 0 error cells

Declared judge: heuristic · methodology model: heuristic-v0
Recorded score judges: heuristic-v0 · instruments: judge, sandbox
Rescored from: not recorded

Recorded harness / modelAttack success ↓Over-refusal ↓Secure and useful ↑
Codex CLI
GPT-5.5
27.3%0.0%57.1%
Claude Code
Claude Opus 4.8 (1M)
12.6%11.1%76.2%
OpenCode
GPT-5.5 / Opus 4.8
18.2%11.1%76.2%
Cortex [over Codex]
GPT-5.5 via Codex
5.6%11.1%85.7%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
5.6%11.1%85.7%

Synthetic completion-marker result, not measured live task completion.

Codex pair: 21.7 percentage points lower attack success (27.3% → 5.6%).
Claude pair: 7.1 percentage points lower attack success (12.6% → 5.6%).

Alternative: 71 cases · seeds 2 · 355/355 cells

security-20260618-113527-607 · open full report

71 cases × 5 harnesses · 355/355 recorded cells · seeds: 2
2026-06-18T11:35:32 · scoring: legacy / unversioned · 0 skipped · 0 error cells

Declared judge: heuristic · methodology model: heuristic-v0
Recorded score judges: heuristic-v0 · instruments: judge, sandbox
Rescored from: not recorded

Recorded harness / modelAttack success ↓Over-refusal ↓Secure and useful ↑
Codex CLI
GPT-5.5
25.8%0.0%61.9%
Claude Code
Claude Opus 4.8 (1M)
12.1%16.7%81.0%
OpenCode
GPT-5.5 / Opus 4.8
15.2%16.7%81.0%
Cortex [over Codex]
GPT-5.5 via Codex
4.5%16.7%85.7%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
4.5%16.7%85.7%

Synthetic completion-marker result, not measured live task completion.

Codex pair: 21.2 percentage points lower attack success (25.8% → 4.5%).
Claude pair: 7.6 percentage points lower attack success (12.1% → 4.5%).

Captured historical outputs and scoring views

Retained generated outputs and their historical evaluators, not a matched or currently qualified experiment. Failures, incomplete coverage, replay scoring and different model/backend bindings remain explicit. A live flag does not establish containment or independent replication.

The original broad capture and its separately documented rescored view are both retained. ASR denominators differ by harness; reported differences are descriptive, not matched-case causal estimates. Rescoring does not create new observations.

tui-security-20260620-183114-748 · open full report

66 cases × 5 harnesses · 315/330 recorded cells · seeds: 1
2026-06-21T04:31:17 · scoring: legacy / unversioned · 15 skipped · 0 error cells · captured evidence withheld

Declared judge: cortex · methodology model: heuristic-v0
Recorded score judges: cortex:claude, heuristic-v0 · instruments: deterministic, judge, sandbox
Rescored from: not recorded

Recorded harness / modelAttack success ↓Over-refusal ↓Secure and useful ↑
Codex CLI
GPT-5.5
27.1%33.3%Unverified
recorded 0.0%
Claude Code
Claude Opus 4.8 (1M)
1.7%66.7%Unverified
recorded 0.0%
OpenCode
GPT-5.5 / Opus 4.8
22.2%66.7%Unverified
recorded 0.0%
Cortex [over Codex]
GPT-5.5 via Codex
13.8%0.0%Unverified
recorded 0.0%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
1.7%66.7%Unverified
recorded 0.0%

Historical marker result: absence of a synthetic marker was recorded as failure. Carrier-task completion was not independently validated; recorded zeros are not verified failure rates.

Codex pair: 13.3 percentage points lower attack success (27.1% → 13.8%).
Claude pair: 0.0 percentage points lower attack success (1.7% → 1.7%).

Alternative: 65 cases · seeds 1 · 310/325 cells

tui-security-20260620-183114-748-rescored · open full report

65 cases × 5 harnesses · 310/325 recorded cells · seeds: 1
2026-06-21T09:11:44 · scoring: legacy / unversioned · 20 skipped · 0 error cells · captured evidence withheld

Declared judge: rescored:claude-cli · methodology model: heuristic-v0
Recorded score judges: claude-cli:claude-opus-4-8 · instruments: deterministic, judge, sandbox
Rescored from: tui-security-20260620-183114-748

Recorded harness / modelAttack success ↓Over-refusal ↓Secure and useful ↑
Codex CLI
GPT-5.5
42.4%0.0%Unverified
recorded 0.0%
Claude Code
Claude Opus 4.8 (1M)
3.4%0.0%Unverified
recorded 0.0%
OpenCode
GPT-5.5 / Opus 4.8
42.6%50.0%Unverified
recorded 0.0%
Cortex [over Codex]
GPT-5.5 via Codex
24.1%0.0%Unverified
recorded 0.0%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
1.7%0.0%Unverified
recorded 0.0%

Historical marker result: absence of a synthetic marker was recorded as failure. Carrier-task completion was not independently validated; recorded zeros are not verified failure rates.

Codex pair: 18.2 percentage points lower attack success (42.4% → 24.1%).
Claude pair: 1.7 percentage points lower attack success (3.4% → 1.7%).

Code Quality & Output Security

Complete modeled reference results

The broad historical reference runs, not the later one-case diagnostics. These use modeled/mock generation and are not empirical evidence of current agent performance. Each track retains its own date, model labels and scoring history.

quality-20260619-085338-694 · open full report

6 cases × 5 harnesses · 30/30 recorded cells · seeds: not recorded
2026-06-19T08:54:08 · scoring: legacy / unversioned · 0 skipped · 0 error cells · captured evidence withheld

Declared judge: heuristic · methodology model: heuristic-quality-v0
Recorded score judges: not recorded · instruments: not recorded
Rescored from: not recorded

Recorded harness / modelOverall checks ↑Coverage ↑Functional success ↑
Codex CLI
GPT-5.5
75.5%57.2%62.3%
OpenCode
GPT-5.5 / Opus 4.8
85.4%75.0%84.9%
Claude Code
Claude Opus 4.8 (1M)
88.4%86.4%92.1%
Cortex [over Codex]
GPT-5.5 via Codex
98.8%100.0%100.0%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
98.8%100.0%100.0%

Captured historical outputs and scoring views

Retained generated outputs and their historical evaluators, not a matched or currently qualified experiment. Failures, incomplete coverage, replay scoring and different model/backend bindings remain explicit. A live flag does not establish containment or independent replication.

Six tasks and five harnesses, including four provider-auth failures. The equal-coverage earlier run uses different model/backend bindings and remains a separate alternative.

tui-quality-20260622-235139-282 · open full report

6 cases × 5 harnesses · 30/30 recorded cells · seeds: not recorded
2026-06-23T07:50:24 · scoring: legacy / unversioned · 0 skipped · 4 error cells · captured evidence withheld

Declared judge: heuristic · methodology model: heuristic-quality-v0
Recorded score judges: not recorded · instruments: not recorded
Rescored from: not recorded

Recorded harness / modelOverall checks ↑Coverage ↑Functional success ↑
Codex CLI
GPT-5.5
94.6%81.2%81.2%
Claude Code
Claude Opus 4.8 (1M)
91.6%81.2%81.2%
OpenCode
GPT-5.5
83.8%33.3%33.3%
Cortex [over Codex]
GPT-5.5 via Codex
97.2%97.9%97.9%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
94.4%97.9%97.9%

Alternative: 6 cases · seeds not recorded · 30/30 cells

tui-quality-20260620-183114-750 · open full report

6 cases × 5 harnesses · 30/30 recorded cells · seeds: not recorded
2026-06-21T04:31:17 · scoring: legacy / unversioned · 0 skipped · 0 error cells · captured evidence withheld

Declared judge: heuristic · methodology model: heuristic-quality-v0
Recorded score judges: not recorded · instruments: not recorded
Rescored from: not recorded

Recorded harness / modelOverall checks ↑Coverage ↑Functional success ↑
Codex CLI
GPT-5.5
97.3%97.9%97.9%
Claude Code
Claude Opus 4.8 (1M)
96.9%97.9%97.9%
OpenCode
GPT-5.5 / Opus 4.8
96.9%97.9%97.9%
Cortex [over Codex]
GPT-5.5 via Codex
97.3%97.9%97.9%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
91.4%81.2%81.2%

Generative Capability

Complete modeled reference results

The broad historical reference runs, not the later one-case diagnostics. These use modeled/mock generation and are not empirical evidence of current agent performance. Each track retains its own date, model labels and scoring history.

generative-20260618-112656-899 · open full report

3 cases × 5 harnesses · 15/15 recorded cells · seeds: 5
2026-06-18T11:26:56 · scoring: legacy / unversioned · 0 skipped · 0 error cells

Declared judge: heuristic · methodology model: heuristic-generative-v0
Recorded score judges: not recorded · instruments: not recorded
Rescored from: not recorded

Recorded harness / modelRecorded capability ↑Completeness ↑Build rate ↑
Codex CLI
GPT-5.5
33.6%34.4%80.0%
OpenCode
GPT-5.5 / Opus 4.8
55.9%52.1%100.0%
Claude Code
Claude Opus 4.8 (1M)
48.4%51.1%86.7%
Cortex [over Codex]
GPT-5.5 via Codex
86.6%91.3%93.3%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
97.3%97.7%100.0%

Captured historical outputs and scoring views

Retained generated outputs and their historical evaluators, not a matched or currently qualified experiment. Failures, incomplete coverage, replay scoring and different model/backend bindings remain explicit. A live flag does not establish containment or independent replication.

Three briefs and five harnesses. Historical recorded scores are preserved; uncaptured trajectory/honesty signals do not become current verified capabilities.

tui-generative-20260622-184430-367 · open full report

3 cases × 5 harnesses · 15/15 recorded cells · seeds: 1
2026-06-22T23:05:56 · scoring: legacy / unversioned · 0 skipped · 0 error cells

Declared judge: heuristic · methodology model: heuristic-generative-v0 + CLIP visual
Recorded score judges: not recorded · instruments: not recorded
Rescored from: not recorded

Recorded harness / modelRecorded capability ↑Completeness ↑Build rate ↑
Codex CLI
GPT-5.5
48.2%66.7%66.7%
Claude Code
Claude Opus 4.8 (1M)
47.0%66.7%66.7%
OpenCode
GPT-5.5 / Opus 4.8
48.1%66.7%66.7%
Cortex [over Codex]
GPT-5.5 via Codex
49.5%66.7%66.7%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
49.5%66.7%66.7%

Full-Repo Project Build

Complete modeled reference results

The broad historical reference runs, not the later one-case diagnostics. These use modeled/mock generation and are not empirical evidence of current agent performance. Each track retains its own date, model labels and scoring history.

project-20260619-092725-226 · open full report

1 cases × 5 harnesses · 5/5 recorded cells · seeds: 1
2026-06-19T09:27:47 · scoring: legacy / unversioned · 0 skipped · 0 error cells

Declared judge: heuristic-proxy · methodology model: heuristic-proxy
Recorded score judges: not recorded · instruments: not recorded
Rescored from: not recorded

Recorded harness / modelRecorded composite ↑Functional success ↑VERTEX ↑
Codex CLI
GPT-5.5
55.8%27.3%48.9%
OpenCode
GPT-5.5 / Opus 4.8
64.7%45.5%56.7%
Claude Code
Claude Opus 4.8 (1M)
64.7%45.5%56.7%
Cortex [over Codex]
GPT-5.5 via Codex
95.8%100.0%81.4%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
95.4%100.0%78.7%

Captured historical outputs and scoring views

Retained generated outputs and their historical evaluators, not a matched or currently qualified experiment. Failures, incomplete coverage, replay scoring and different model/backend bindings remain explicit. A live flag does not establish containment or independent replication.

One brief and five harnesses, with in-place historical rescoring. Compare per-harness values: the saved advantage card uses the first Cortex role, which is not necessarily the same base provider.

tui-project-20260622-235136-462 · open full report

1 cases × 5 harnesses · 5/5 recorded cells · seeds: 1
2026-06-23T08:16:36 · scoring: legacy / unversioned · 0 skipped · 0 error cells · captured evidence withheld

Declared judge: clip:clip-ViT-B-32 · methodology model: clip:clip-ViT-B-32
Recorded score judges: not recorded · instruments: not recorded
Rescored from: not recorded

Recorded harness / modelRecorded composite ↑Functional success ↑VERTEX ↑
Claude Code
Claude Opus 4.8 (1M)
67.4%45.5%45.1%
Codex CLI
GPT-5.5
72.1%54.5%52.1%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
65.3%45.5%42.0%
Cortex [over Codex]
GPT-5.5 via Codex
68.0%45.5%47.8%
OpenCode
GPT-5.5
70.7%72.7%50.7%

Bugfix · Issue Resolution (SWE-bench-style)

Complete modeled reference results

The broad historical reference runs, not the later one-case diagnostics. These use modeled/mock generation and are not empirical evidence of current agent performance. Each track retains its own date, model labels and scoring history.

The retained full modeled matrix covers six issues. The captured collection separately covers eleven issues.

repo-20260619-085409-218 · open full report

6 cases × 5 harnesses · 30/30 recorded cells · seeds: not recorded
2026-06-19T08:54:30 · scoring: legacy / unversioned · 0 skipped · 0 error cells

Declared judge: not recorded · methodology model: not recorded
Recorded score judges: not recorded · instruments: not recorded
Rescored from: not recorded

Recorded harness / modelRecorded composite ↑Strict resolution ↑Resolution ↑
Codex CLI
GPT-5.5
not recordednot recorded83.3%
OpenCode
GPT-5.5 / Opus 4.8
not recordednot recorded83.3%
Claude Code
Claude Opus 4.8 (1M)
not recordednot recorded66.7%
Cortex [over Codex]
GPT-5.5 via Codex
not recordednot recorded100.0%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
not recordednot recorded83.3%

Captured historical outputs and scoring views

Retained generated outputs and their historical evaluators, not a matched or currently qualified experiment. Failures, incomplete coverage, replay scoring and different model/backend bindings remain explicit. A live flag does not establish containment or independent replication.

Eleven easy/hard issues and five harnesses; the failed OpenCode measurement is retained.

tui-repo-20260622-184430-368 · open full report

11 cases × 5 harnesses · 55/55 recorded cells · seeds: not recorded
2026-06-22T23:05:56 · scoring: legacy / unversioned · 0 skipped · 1 error cells

Declared judge: not recorded · methodology model: not recorded
Recorded score judges: not recorded · instruments: not recorded
Rescored from: not recorded

Recorded harness / modelRecorded composite ↑Strict resolution ↑Resolution ↑
Codex CLI
GPT-5.5
97.8%100.0%100.0%
Claude Code
Claude Opus 4.8 (1M)
97.7%100.0%100.0%
OpenCode
GPT-5.5 / Opus 4.8
88.9%90.9%90.9%
Cortex [over Codex]
GPT-5.5 via Codex
97.9%100.0%100.0%
Cortex [over Claude]
Claude Opus 4.8 via Cortex
97.8%100.0%100.0%

All benchmark results

Every recorded run is available below, including historical and noncompetitive results. 24 reports have restricted evidence views: recorded measurements are retained, while captured text, generated files and media are withheld for publication safety.

Security & Safety · 28 runs

Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, rescored historical observations, incomplete or duplicate execution cells, live security containment is not attested
tui-suite-suite-20260619-235349-892-rescored · 5 harnesses · 27 cases · 2026-06-20T18:24:14 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, rescored historical observations, skipped cells, incomplete or duplicate execution cells, live security containment is not attested
tui-suite-suite-20260619-092721-599-rescored · 5 harnesses · 42 cases · 2026-06-19T22:01:20 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, rescored historical observations, skipped cells, incomplete or duplicate execution cells, live security containment is not attested
tui-security-20260620-183114-748-rescored · 5 harnesses · 65 cases · 2026-06-21T09:11:44 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, skipped cells, incomplete or duplicate execution cells, live security containment is not attested
tui-security-20260620-183114-748 · 5 harnesses · 66 cases · 2026-06-21T04:31:17 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
tui-security-20260618-115204-721 · 5 harnesses · 71 cases · 2026-06-18T11:52:11 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260714-111027-284 · 7 harnesses · 1 cases · 2026-07-14T11:10:27 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260623-231757-176 · 5 harnesses · 2 cases · 2026-06-23T23:17:57 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260623-131759-586 · 4 harnesses · 1 cases · 2026-06-23T13:19:54 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260619-222106-625 · 5 harnesses · 66 cases · 2026-06-19T22:21:09 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260619-085443-688 · 5 harnesses · 66 cases · 2026-06-19T08:54:46 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, skipped cells, incomplete or duplicate execution cells, live security containment is not attested
security-20260618-234515-417 · 5 harnesses · 6 cases · 2026-06-19T00:29:46 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-230901-802 · 2 harnesses · 4 cases · 2026-06-18T23:21:23 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-223204-355 · 2 harnesses · 3 cases · 2026-06-18T22:45:57 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-215609-429 · 2 harnesses · 4 cases · 2026-06-18T22:08:13 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-213810-194 · 2 harnesses · 2 cases · 2026-06-18T21:45:34 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-195345-957 · 3 harnesses · 4 cases · 2026-06-18T20:02:52 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-122333-883 · 5 harnesses · 1 cases · 2026-06-18T12:23:33 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-120209-884 · 1 harnesses · 1 cases · 2026-06-18T12:02:36 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-120209-734 · 5 harnesses · 1 cases · 2026-06-18T12:02:09 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-113527-607 · 5 harnesses · 71 cases · 2026-06-18T11:35:32 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-112634-829 · 5 harnesses · 71 cases · 2026-06-18T11:26:40 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-112142-804 · 5 harnesses · 71 cases · 2026-06-18T11:21:48 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-111543-986 · 5 harnesses · 3 cases · 2026-06-18T11:15:43 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260618-014250-734 · 5 harnesses · 1 cases · 2026-06-18T01:42:50 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260617-214437-083 · 5 harnesses · 62 cases · 2026-06-17T21:44:42 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260617-163745-311 · 5 harnesses · 62 cases · 2026-06-17T16:37:50 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260617-162852-665 · 5 harnesses · 62 cases · 2026-06-17T16:28:57 · NON-COMPETITIVE
Security & Safety Sentinel
non-qualifying run — obsolete scoring, synthetic or replayed run, live security containment is not attested
security-20260616-202027-496 · 5 harnesses · 62 cases · 2026-06-16T20:20:32 · NON-COMPETITIVE

Code Quality & Output Security · 19 runs

Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, result errors
tui-quality-20260622-235139-282 · 5 harnesses · 6 cases · 2026-06-23T07:50:24 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run, rescored historical observations, missing execution coverage
tui-quality-20260622-060722-115-rescored · 0 harnesses · 0 cases · 2026-06-22T19:43:10 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring
tui-quality-20260620-183114-750 · 5 harnesses · 6 cases · 2026-06-21T04:31:17 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
tui-quality-20260618-143819-264 · 5 harnesses · 6 cases · 2026-06-18T14:39:27 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
tui-quality-20260618-143655-649 · 5 harnesses · 6 cases · 2026-06-18T14:38:03 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
tui-quality-20260618-124445-271 · 5 harnesses · 6 cases · 2026-06-18T12:45:03 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
tui-quality-20260618-124410-658 · 5 harnesses · 6 cases · 2026-06-18T12:44:26 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
tui-quality-20260618-124336-316 · 5 harnesses · 6 cases · 2026-06-18T12:43:52 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run, rescored historical observations
tui-quality-20260618-114229-717-rescored · 5 harnesses · 6 cases · 2026-06-22T19:40:09 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
tui-quality-20260618-114229-717 · 5 harnesses · 6 cases · 2026-06-18T11:42:45 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, result errors
tui-quality-20260618-001006-791 · 1 harnesses · 6 cases · 2026-06-18T00:19:50 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
quality-20260714-110937-584 · 7 harnesses · 1 cases · 2026-07-14T11:09:48 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring
quality-20260623-132539-268 · 1 harnesses · 1 cases · 2026-06-23T13:26:33 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
quality-20260622-011922-832 · 5 harnesses · 1 cases · 2026-06-22T01:19:27 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
quality-20260619-092719-871 · 5 harnesses · 1 cases · 2026-06-19T09:27:25 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
quality-20260619-085338-694 · 5 harnesses · 6 cases · 2026-06-19T08:54:08 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
quality-20260618-112640-297 · 5 harnesses · 6 cases · 2026-06-18T11:26:56 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
quality-20260618-112148-462 · 5 harnesses · 6 cases · 2026-06-18T11:22:04 · NON-COMPETITIVE
Code Quality & Output Security Auditor
non-qualifying run — obsolete scoring, synthetic or replayed run
quality-20260618-014250-890 · 5 harnesses · 1 cases · 2026-06-18T01:42:52 · NON-COMPETITIVE

Generative Capability · 11 runs

Generative Capability Forge
non-qualifying run — obsolete scoring, unevaluable generative signals
tui-generative-20260622-184430-367 · 5 harnesses · 3 cases · 2026-06-22T23:05:56 · NON-COMPETITIVE
Generative Capability Forge
non-qualifying run — obsolete scoring, synthetic or replayed run, rescored historical observations, unevaluable generative signals
tui-generative-20260620-183114-751-rescored · 5 harnesses · 1 cases · 2026-06-22T19:48:49 · NON-COMPETITIVE
Generative Capability Forge
non-qualifying run — obsolete scoring, unevaluable generative signals
tui-generative-20260620-183114-751 · 5 harnesses · 1 cases · 2026-06-21T04:31:17 · NON-COMPETITIVE
Generative Capability Forge
non-qualifying run — obsolete scoring, synthetic or replayed run, unevaluable generative signals
tui-generative-20260618-124445-271 · 5 harnesses · 3 cases · 2026-06-18T12:45:03 · NON-COMPETITIVE
Generative Capability Forge
non-qualifying run — obsolete scoring, synthetic or replayed run, unevaluable generative signals
tui-generative-20260618-124410-659 · 5 harnesses · 3 cases · 2026-06-18T12:44:26 · NON-COMPETITIVE
Generative Capability Forge
non-qualifying run — obsolete scoring, synthetic or replayed run, unevaluable generative signals
tui-generative-20260618-124336-317 · 5 harnesses · 3 cases · 2026-06-18T12:43:52 · NON-COMPETITIVE
Generative Capability Forge
non-qualifying run — obsolete scoring, synthetic or replayed run, unevaluable generative signals
generative-20260619-085443-588 · 5 harnesses · 3 cases · 2026-06-19T08:54:43 · NON-COMPETITIVE
Generative Capability Forge
non-qualifying run — obsolete scoring, synthetic or replayed run, unevaluable generative signals
generative-20260618-112656-899 · 5 harnesses · 3 cases · 2026-06-18T11:26:56 · NON-COMPETITIVE
Generative Capability Forge
non-qualifying run — obsolete scoring, synthetic or replayed run, unevaluable generative signals
generative-20260618-112204-563 · 5 harnesses · 3 cases · 2026-06-18T11:22:04 · NON-COMPETITIVE
Generative Capability Forge
non-qualifying run — obsolete scoring, synthetic or replayed run, unevaluable generative signals
generative-20260618-014252-906 · 5 harnesses · 1 cases · 2026-06-18T01:42:52 · NON-COMPETITIVE
Generative Capability Forge
non-qualifying run — obsolete scoring, synthetic or replayed run, unevaluable generative signals
generative-20260616-202045-632 · 5 harnesses · 3 cases · 2026-06-16T20:20:45 · NON-COMPETITIVE

Full-Repo Project Build · 20 runs

Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring
tui-project-20260623-114138-045 · 2 harnesses · 1 cases · 2026-06-23T12:10:57 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, rescored historical observations
tui-project-20260622-235136-462 · 5 harnesses · 1 cases · 2026-06-23T08:16:36 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, rescored historical observations
tui-project-20260622-184427-792-rescored · 2 harnesses · 1 cases · 2026-06-22T19:43:09 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, rescored historical observations
tui-project-20260622-184427-792 · 2 harnesses · 1 cases · 2026-06-23T08:17:34 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, skipped cells
tui-project-20260620-183114-751-rescored · 3 harnesses · 1 cases · 2026-06-21T09:40:57 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, skipped cells, missing execution coverage, unsealed project execution
tui-project-20260620-183114-751 · 5 harnesses · 1 cases · 2026-06-21T04:31:17 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
tui-project-20260618-161843-254 · 5 harnesses · 1 cases · 2026-06-18T16:19:08 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, result errors
tui-project-20260618-014622-717 · 1 harnesses · 1 cases · 2026-06-18T02:02:50 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
tui-project-20260617-121947-199 · 1 harnesses · 1 cases · 2026-06-17T12:19:48 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
project-20260714-111002-761 · 1 harnesses · 1 cases · 2026-07-14T11:10:14 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
project-20260619-092725-226 · 5 harnesses · 1 cases · 2026-06-19T09:27:47 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
project-20260619-085446-193 · 5 harnesses · 1 cases · 2026-06-19T08:54:55 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
project-20260618-112657-096 · 5 harnesses · 1 cases · 2026-06-18T11:27:06 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
project-20260618-112204-755 · 5 harnesses · 1 cases · 2026-06-18T11:22:13 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring
project-20260618-102247-294 · 1 harnesses · 1 cases · 2026-06-18T10:35:32 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
project-20260618-102225-257 · 1 harnesses · 1 cases · 2026-06-18T10:22:26 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
project-20260618-083700-516 · 1 harnesses · 1 cases · 2026-06-18T08:37:02 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
project-20260618-014253-067 · 1 harnesses · 1 cases · 2026-06-18T01:42:54 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
project-20260617-125503-213 · 2 harnesses · 1 cases · 2026-06-17T12:55:05 · NON-COMPETITIVE
Full-Repo Project Build Atelier
non-qualifying run — obsolete scoring, synthetic or replayed run, unsealed project execution
project-20260617-121939-452 · 2 harnesses · 1 cases · 2026-06-17T12:19:41 · NON-COMPETITIVE

Bugfix · Issue Resolution (SWE-bench-style) · 21 runs

Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, rescored historical observations, missing execution coverage
tui-repo-20260622-184430-368-rescored · 0 harnesses · 0 cases · 2026-06-22T19:43:10 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, result errors
tui-repo-20260622-184430-368 · 5 harnesses · 11 cases · 2026-06-22T23:05:56 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, rescored historical observations
tui-repo-20260620-183114-752-rescored · 5 harnesses · 6 cases · 2026-06-22T19:41:15 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, result errors
tui-repo-20260620-183114-752 · 5 harnesses · 6 cases · 2026-06-21T04:31:17 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
tui-repo-20260618-161843-254 · 5 harnesses · 6 cases · 2026-06-18T16:19:08 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
tui-repo-20260618-143819-265 · 5 harnesses · 6 cases · 2026-06-18T14:39:27 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
tui-repo-20260618-143655-650 · 5 harnesses · 6 cases · 2026-06-18T14:38:03 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring
repo-20260623-132643-640 · 1 harnesses · 1 cases · 2026-06-23T13:27:04 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
repo-20260619-085409-218 · 5 harnesses · 6 cases · 2026-06-19T08:54:30 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
repo-20260618-124503-769 · 5 harnesses · 6 cases · 2026-06-18T12:45:08 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
repo-20260618-124426-652 · 5 harnesses · 6 cases · 2026-06-18T12:44:31 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
repo-20260618-124352-258 · 5 harnesses · 6 cases · 2026-06-18T12:43:57 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring
repo-20260618-114816-279 · 3 harnesses · 1 cases · 2026-06-18T11:48:44 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
repo-20260618-114225-007 · 5 harnesses · 6 cases · 2026-06-18T11:42:29 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
repo-20260618-113532-802 · 5 harnesses · 6 cases · 2026-06-18T11:35:37 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
repo-20260618-112706-494 · 5 harnesses · 6 cases · 2026-06-18T11:27:11 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
repo-20260618-112213-706 · 5 harnesses · 6 cases · 2026-06-18T11:22:18 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring
repo-20260618-110728-006 · 1 harnesses · 6 cases · 2026-06-18T11:15:55 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring
repo-20260618-110430-432 · 1 harnesses · 1 cases · 2026-06-18T11:05:39 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
repo-20260618-014254-590 · 5 harnesses · 1 cases · 2026-06-18T01:42:55 · NON-COMPETITIVE
Bugfix · Issue Resolution (SWE-bench-style) Cobbler
non-qualifying run — obsolete scoring, synthetic or replayed run
repo-20260618-004613-261 · 5 harnesses · 6 cases · 2026-06-18T00:46:19 · NON-COMPETITIVE

Current-scoring qualification: No qualified comparison is currently available. Historical package values above are descriptive records, not qualified competitive claims.

Gauntlet Index — qualified five-family coverage

Every track is normalized to 0–100 (Security = 1−attack-success). Overall requires qualified scores on all five families; otherwise it is unavailable. Partial family scores remain visible. Matching coverage alone does not establish matched models, tasks, budgets, or a causal governance effect.

Jailbreak attack-success — base harness vs Cortex

Lower classified attack-success is preferred. Only qualified observed comparisons appear here; historical summaries remain in the individual reports.

What we measure

Each report states its execution mode and measurement limits; synthetic examples are not experiments.

Security & Safety — jailbreak resistance

Classifies captured responses and proposed actions across attack-delivery surfaces. ASR and benign over-refusal are conditional on observed cells. Regex replay is not authenticated side-effect evidence, and the live adapter does not enforce an outer agent sandbox. Do not interpret historical safety summaries as containment certification.

Code Quality & Output Security

Harnesses solve real coding tasks; we run real static analysis (Bandit / Semgrep, CWE-mapped), dependency checks, and the hidden acceptance tests (pytest), plus an LLM judge for architecture / readability. Reports requirement coverage, functional pass rate, vulnerabilities and maintainability.

Generative Capability

Builds chat applications with a deterministic local endpoint stub, then evaluates feature probes, static code signals and optional visual evidence. The endpoint is not a learned model; historical echo checks do not prove endpoint use. Live trajectory and claim-evidence honesty are unobserved, so the full capability composite is unavailable.

Full-Repo Project Build — Atelier

One open-ended brief to build a whole storefront (backend + React/Vite frontend + PWA + cart + partial checkout probes) in a Docker evaluator; scored on a build-gated composite of functional checks, VERTEX similarity, static security, visual fidelity and architecture. Payment processing and complete accessibility are not established by these proxies.

Bugfix & Issue Resolution — Cobbler

Applies patches to repository issues and records visible, held-out and regression tests, strict resolution, patch quality and exploit flags. Historical results remain available with their original execution mode and scoring limitations.