Improve
Evaluations
Reproducible eval suites with deterministic, LLM-as-judge, and code-based scorers.
Loading evaluation suites…
Model comparison · support_qa.v4
18s agoPrompt
Model
Accuracy
Cost / run
Latency
Cite
Loading comparison…
Reproducible eval suites with deterministic, LLM-as-judge, and code-based scorers.