Eval lab

Model × prompt × use-case matrix ships in Phase 7 (stretch O5). Script-driven via npm run eval:matrix.

Coming in Phase 7

  • Grouped comparison table: model, prompt version, eval mode, case id
  • Pass rate, avg validate retries, avg tokens, avg latency
  • Estimated cost per successful save
  • Drill-down to individual runs joined by session id

Eval runs teaser

Eval casePassedTotal
static-browse-v0.233

Overall pass rate: 100% (3 runs)

View API sessions →