AI Interfaces
Eval Failure Clusters
A root-cause explorer that groups failed evaluation cases by pattern, volume, and impact.
Installation
Copy and paste the code into your project.
Accessibility notes
Clusters use an ordered priority list with exact case counts and textual impact levels.
Failure clusters
Eval root causes
- 1High
Missing citation
18 related cases
- 2Medium
Stale context
11 related cases
- 3Low
Format mismatch
7 related cases
Preview accent
const clusters = [{ cause: "Missing citation", cases: 18 }, { cause: "Stale context", cases: 11 }]; export function EvalFailureClusters() { return <ol>{clusters.map((cluster) => <li key={cluster.cause}>{cluster.cause}: {cluster.cases} cases</li>)}</ol>; }<EvalFailureClusters />Related components
Confidence
readyAI Interfaces
Confidence Meter
A multi-signal confidence card for grounded AI answers, eval reviews, and release checks.
Dataset slices
Eval performance
- 96%
English · Enterprise
184 cases
- 82%
Spanish · SMB
91 cases
- 74%
Complex queries
63 cases
Largest gap: complex queries trail the average by 14 points.
AI Interfaces
Dataset Slice Explorer
A slice-level evaluation view revealing performance gaps across language, customer tier, and query complexity.
Evaluation run
Support answer quality
Fast
v2-mini
86%
quality score
- Latency
- 420ms
- Cost / 1k
- $0.18
Balanced
v3
94%
quality score
- Latency
- 880ms
- Cost / 1k
- $0.42
Balanced improves groundedness by 9 points with a 460ms latency tradeoff.
AI Interfaces
Model Eval Comparison
A side-by-side model decision card balancing quality, latency, cost, and groundedness.