Gauntlet — Track Q (code quality & output security)
Models & settings — click to expand
Requirement coverage by harness
Higher is better · Cortex tracks & validates every requirement · ★ Cortex highlighted
Maintainability debt by harness
Lower is better · debt = vulns + smells + skipped work; value (debt) on bars
Vulnerabilities by CWE
Output-security flaws in generated code (SAST-lite), grouped by CWE
Code-quality judge (architecture / readability / interface)
Per-dimension rubric · higher is better
Code explorer
Click a row to view the generated code, SAST findings, dependency flags, and the requirements flagged as skipped during validation
| Task | Harness | Lang | Grade | Coverage | Functional | Vulns | Skipped |