Un modelo puede ordenar bien los casos y, al mismo tiempo, expresar mal su incertidumbre. Si cien operaciones reciben una probabilidad cercana al 0,8, una predicción calibrada implica que aproximadamente ochenta deberían pertenecer a la clase positiva. No significa que cada caso tenga un resultado seguro ni que el 0,8 deba convertirse automáticamente en una decisión.

La calibración importa cuando la probabilidad alimenta precios, prioridades, reservas, revisión humana o umbrales de riesgo. Para una clasificación meramente ordinal puede bastar con el ranking; para estimar consecuencias hace falta comprobar la correspondencia entre puntuación y frecuencia.

Separa discriminación y calibración

Una métrica como ROC AUC evalúa la capacidad de ordenar positivos por encima de negativos. No indica si 0,7 representa realmente un 70 %. Dos modelos pueden tener un ranking similar y probabilidades muy distintas.

Scikit-learn describe las curvas de calibración, también llamadas diagramas de fiabilidad: se agrupan predicciones en intervalos y se compara la probabilidad media con la fracción observada de positivos. La diagonal representa correspondencia perfecta.

Intervalo previsto Probabilidad media Frecuencia observada Lectura
0,10–0,20 0,15 0,13 ligera sobreestimación
0,40–0,50 0,45 0,29 sobreestimación relevante
0,80–0,90 0,84 0,81 buena correspondencia

No interpretes intervalos con pocos casos como evidencia firme. Muestra volumen y, cuando sea necesario, intervalos de incertidumbre.

Evalúa con datos separados

Ajustar un calibrador y evaluarlo con los mismos ejemplos produce una lectura optimista. Reserva datos independientes o integra la calibración dentro de una validación cruzada adecuada. Si los datos tienen orden temporal, respeta la validación temporal.

Los métodos habituales incluyen regresión logística o isotónica. La segunda es flexible, pero puede sobreajustar con muestras pequeñas. La elección debe validarse, no decidirse porque una curva de entrenamiento parece más recta.

El Brier score resume el error cuadrático entre probabilidad y resultado binario. Es útil, aunque combina componentes de calibración y resolución. Acompáñalo con curva, volumen y métricas de discriminación.

Comprueba segmentos y uso operativo

Una media global puede ocultar descalibración por canal, país, tipo de producto o cohorte temporal. Revisa segmentos con suficiente muestra y aquellos donde el coste de equivocarse sea distinto.

Después simula la decisión. Si se revisan manualmente casos por encima de 0,65, calcula:

  • volumen diario enviado a revisión;
  • positivos encontrados;
  • falsos positivos y negativos;
  • capacidad disponible;
  • coste o utilidad esperada.

Un modelo puede estar calibrado y aun así usar un umbral inadecuado. También puede mantener el ranking mientras el drift deteriora las probabilidades.

Criterio de aceptación

Documenta referencia, ventana evaluada, método, segmentos, curva, Brier score y efecto sobre la decisión. Recalibra solo con etiquetas fiables y conserva comparación con el modelo vigente. La pregunta útil no es si la gráfica se ve perfecta, sino si las probabilidades permiten tomar una decisión con un error conocido y una capacidad operativa real.