Escalation Accuracy

Benchmarking a symptom-checker chatbot's emergency vs. non-emergency call against ground truth

Current Stage
—
—
Sensitivity
—
Specificity
—
False negatives
—
False positives
—
Escalation ThresholdBalanced
Emergency PrevalenceUncommon
True positive — correctly escalated
False positive — unnecessary escalation
False negative — missed emergency
True negative — correctly reassured
Decision boundary
Scroll for details