Metrics & Evaluation

Probability Calibration

Aligning raw model prediction scores with true empirical probabilities for downstream decision making and ad auctions.

🔴 advanced5 min readmetrics
Probability Calibration ensures predicted probability scores match true observed empirical frequencies. Uncalibrated models output over-confident or under-confident probabilities that distort ad auction pricing, risk scoring, and threshold decisions. Techniques like Platt Scaling and Isotonic Regression post-process raw model outputs to align predictions with true real-world frequencies.

What is Probability Calibration?

A model can achieve high classification accuracy while outputting completely uncalibrated probability numbers.

For example, a model predicts $0.95$ probability for 100 items. But when we observe ground truth labels, only $60$ of those items are actually positive ($60%$ empirical frequency). The model is severely over-confident!

A model is well-calibrated if its predicted probabilities match true empirical outcomes:

$$\text{If model predicts } \hat{p} = 0.80 \implies \text{Exactly } 80% \text{ of those cases must be Positive!}$$

Uncalibrated Model: Predicts 0.95 ──► True Frequency is 0.60 (Over-confident!)
Calibrated Model:   Predicts 0.60 ──► True Frequency is 0.60 (Aligned!)

Why Calibration Matters in Production

  1. Digital Ad Auctions: Ad networks rank ads by Expected Revenue ($\text{pCTR} \times \text{Bid}$). Uncalibrated probabilities overcharge advertisers and distort auction rankings.
  2. Medical Diagnosis & Risk: A physician needs true risk percentages to evaluate surgical risk. Over-confident predictions cause unsafe decisions.
  3. Thresholding: Cost sensitive thresholding assumes probabilities represent true empirical risk.

Assessing Calibration: Reliability Diagrams

To check calibration visually, divide predictions into 10 probability buckets ($[0.0, 0.1], (0.1, 0.2], \dots$). Plot Predicted Confidence against Empirical Accuracy:

RELIABILITY DIAGRAM (CALIBRATION CURVE)
Empirical Frequency
1.0 ┤                      / ◄── Perfect Calibration (Diagonal Line!)
    │                     /
0.5 ┤            *  *  * / ◄── Uncalibrated Over-confident Model!
    │       *  *
0.0 ┴───────┴───────────┴──────────► Predicted Probability
           0.5         1.0

Calibration Techniques

┌──────────────────────────┬──────────────────────────┐
│ 1. PLATT SCALING         │ 2. ISOTONIC REGRESSION   │
├──────────────────────────┼──────────────────────────┤
│ Fits a 1D Logistic       │ Fits a non-parametric    │
│ Regression model over    │ monotonic step-function  │
│ raw validation logits:   │ mapping raw probabilities│
│ p_cal = σ(a * logit + b).│ to empirical rates.      │
│ Fast, works on small data│ Requires more data!      │
└──────────────────────────┴──────────────────────────┘

Say this out loud

Probability calibration aligns raw prediction scores with true empirical frequencies. Uncalibrated models produce over-confident or under-confident probabilities that distort decision thresholds and ad auction pricing. Evaluated using Reliability Diagrams and Expected Calibration Error, raw probabilities are post-processed using Platt Scaling or Isotonic Regression.

Followups to expect

  1. Which algorithms produce well-calibrated probabilities natively? Logistic Regression produces well-calibrated probabilities natively due to log loss optimization. Naive Bayes, Boosted Trees, and Neural Networks produce uncalibrated probabilities natively.
  2. What is Temperature Scaling in deep learning calibration? Dividing output logits by a single scalar parameter (temperature $T > 1$) before the softmax layer to soften over-confident probability outputs.

Check yourself

Question 1 of 3

What defines a perfectly calibrated binary classification probability model?

More in Metrics & Evaluation

See all →
Precision, Recall & F14 minWhy Accuracy Lies4 minROC-AUC vs PR-AUC4 min