Probability Calibration
Aligning raw model prediction scores with true empirical probabilities for downstream decision making and ad auctions.
What is Probability Calibration?
A model can achieve high classification accuracy while outputting completely uncalibrated probability numbers.
For example, a model predicts $0.95$ probability for 100 items. But when we observe ground truth labels, only $60$ of those items are actually positive ($60%$ empirical frequency). The model is severely over-confident!
A model is well-calibrated if its predicted probabilities match true empirical outcomes:
$$\text{If model predicts } \hat{p} = 0.80 \implies \text{Exactly } 80% \text{ of those cases must be Positive!}$$
Uncalibrated Model: Predicts 0.95 ──► True Frequency is 0.60 (Over-confident!)
Calibrated Model: Predicts 0.60 ──► True Frequency is 0.60 (Aligned!)
Why Calibration Matters in Production
- Digital Ad Auctions: Ad networks rank ads by Expected Revenue ($\text{pCTR} \times \text{Bid}$). Uncalibrated probabilities overcharge advertisers and distort auction rankings.
- Medical Diagnosis & Risk: A physician needs true risk percentages to evaluate surgical risk. Over-confident predictions cause unsafe decisions.
- Thresholding: Cost sensitive thresholding assumes probabilities represent true empirical risk.
Assessing Calibration: Reliability Diagrams
To check calibration visually, divide predictions into 10 probability buckets ($[0.0, 0.1], (0.1, 0.2], \dots$). Plot Predicted Confidence against Empirical Accuracy:
RELIABILITY DIAGRAM (CALIBRATION CURVE)
Empirical Frequency
1.0 ┤ / ◄── Perfect Calibration (Diagonal Line!)
│ /
0.5 ┤ * * * / ◄── Uncalibrated Over-confident Model!
│ * *
0.0 ┴───────┴───────────┴──────────► Predicted Probability
0.5 1.0
Calibration Techniques
┌──────────────────────────┬──────────────────────────┐
│ 1. PLATT SCALING │ 2. ISOTONIC REGRESSION │
├──────────────────────────┼──────────────────────────┤
│ Fits a 1D Logistic │ Fits a non-parametric │
│ Regression model over │ monotonic step-function │
│ raw validation logits: │ mapping raw probabilities│
│ p_cal = σ(a * logit + b).│ to empirical rates. │
│ Fast, works on small data│ Requires more data! │
└──────────────────────────┴──────────────────────────┘
Say this out loud
Probability calibration aligns raw prediction scores with true empirical frequencies. Uncalibrated models produce over-confident or under-confident probabilities that distort decision thresholds and ad auction pricing. Evaluated using Reliability Diagrams and Expected Calibration Error, raw probabilities are post-processed using Platt Scaling or Isotonic Regression.
Followups to expect
- Which algorithms produce well-calibrated probabilities natively? Logistic Regression produces well-calibrated probabilities natively due to log loss optimization. Naive Bayes, Boosted Trees, and Neural Networks produce uncalibrated probabilities natively.
- What is Temperature Scaling in deep learning calibration? Dividing output logits by a single scalar parameter (temperature $T > 1$) before the softmax layer to soften over-confident probability outputs.
Check yourself
What defines a perfectly calibrated binary classification probability model?