Gauntlet — Track Q (code quality & output security)

Models & settings — click to expand

Requirement coverage by harness

Higher is better · Cortex tracks & validates every requirement · ★ Cortex highlighted

Maintainability debt by harness

Lower is better · debt = vulns + smells + skipped work; value (debt) on bars

Vulnerabilities by CWE

Output-security flaws in generated code (SAST-lite), grouped by CWE

Code-quality judge (architecture / readability / interface)

Per-dimension rubric · higher is better

Code explorer

Click a row to view the generated code, SAST findings, dependency flags, and the requirements flagged as skipped during validation
TaskHarnessLangGradeCoverageFunctionalVulnsSkipped