Qué es la distancia de Cook: cálculo y detección de outliers influyentes

| Última modificación: 20 de agosto de 2026 | Tiempo de Lectura: 5 minutos
Premios Blog KeepCoding 2025

Especialista en tecnología y formación digital, con foco en el desarrollo de talento y el análisis del sector tecnológico. Mi trabajo se centra en entender cómo evolucionan las tecnologías, qué competencias demanda el mercado y cómo se produce la transición real hacia el entorno tech.

En el entrenamiento de modelos de regresión dentro de la analítica de datos y el aprendizaje automático, la calidad de los datos de entrada determina el rendimiento final del sistema.

Un conjunto de datos puede contener observaciones atípicas que alteran de forma desproporcionada las estimaciones de los parámetros y la capacidad de predicción del modelo.

Para evaluar el impacto de cada registro individual y detectar puntos anómalos, la distancia de Cook es una de las métricas de diagnóstico más potentes de la estadística.


Qué es la distancia de Cook y para qué sirve

La distancia de Cook es una medida diagnóstica diseñada para calcular la influencia que ejerce una observación específica sobre el ajuste global de un modelo de regresion.

En el análisis de regresion lineal múltiple, existen valores cuyo impacto es tan elevado que pueden modificar drásticamente los coeficientes y las estimaciones del sistema.

Identificar un posible outlier mediante simples residuos no siempre es suficiente, ya que una observación puede tener un residuo moderado pero un apalancamiento (leverage) extremo.

La distancia de Cook combina la magnitud del residual con el apalancamiento del punto para determinar en qué medida cambiarían las predicciones si esa observación se eliminara del conjunto de datos.

Cómo se calcula la distancia de Cook

distancia de Cook

Para comprender la matemática detrás de la métrica, se analiza la diferencia entre el modelo completo entrenado con todas las muestras y una serie de modelos generados excluyendo una muestra a la vez.

La fórmula formal para calcular la distancia de Cook ($D_i$) para la observación $i$ se expresa como:

$$D_i = \frac{\sum_{j=1}^n (\hat{Y}_j – \hat{Y}_{j(i)})^2}{p \cdot MSE}$$

Donde $\hat{Y}_j$ representa la predicción para la observación $j$ usando todas las observaciones, $\hat{Y}_{j(i)}$ es la predicción calculada tras omitir la observación $i$, $p$ es el número de parámetros del modelo y $MSE$ es el error cuadrático medio.

En entornos prácticos de programación estadística como R, no es necesario calcular esta sumatoria

manualmente, ya que se utiliza la función incorporada cooks.distance():

Esta prueba extrae un punto a la vez del dataset de entrenamiento (train), construye un nuevo ajuste y mide el desplazamiento global resultante. Si la inserción o eliminación de un registro modifica sustancialmente la recta de ajuste, esa muestra califica como una observacion influyente.

Diagnóstico de observaciones: Outlier vs Apalancamiento vs Distancia de Cook
Métrica de diagnóstico Qué mide exactamente Criterio o umbral de alerta
Residual estudientizado Desviación entre el valor real y la predicción dividida por su error estándar. Valores absolutos superiores a $|2|$ o $|3|$.
Apalancamiento (Leverage / $h_{ii}$) Distancia entre los valores de las variables independientes de un punto y la media. Valores mayores a $2(p+1)/n$.
Distancia de Cook ($D_i$) Efecto combinado del residuo y del apalancamiento sobre las predicciones. Valores mayores a $1$ o umbrales relativos como $4/n$.

Ejemplo práctico: Detección y filtrado de outliers influyentes en R

A continuación, analizamos un caso de estudio donde se aplica la distancia de Cook para limpiar un dataset de generación de energía (powerplant) y ajustar un modelo limpio con la función lm():

El resumen estadístico del modelo resultante muestra coeficientes significativos y errores estándar reducidos:

Posteriormente, evaluamos el rendimiento sobre el conjunto de test (test) calculando la raíz del error cuadrático medio (RMSE) y el coeficiente de determinación ($R^2$):

Al comparar los resultados entre el modelo inicial y el modelo ajustado, el valor de $R^2$ se mantiene elevado en $0.9278$, mientras que la distribución de los residuos se vuelve más homogénea.

Analizar la dispersión de los residuos permite verificar si el filtrado mediante la distancia de Cook eliminó ruido sin eliminar patrones reales del fenómeno.

Interpretación de umbrales y criterios de corte

En la literatura estadística existen diversos criterios para determinar cuándo un valor de distancia de Cook justifica inspeccionar una muestra:

  • Criterio estricto ($D_i > 1$): Cualquier punto con una distancia superior a 1 se considera una observacion influyente crítica que altera significativamente el modelo.
  • Criterio moderado ($D_i > 0.5$): Puntos que superan el valor de 0.5 deben ser examinados para comprobar si corresponden a errores de medición.
  • Criterio relativo ($D_i > 4/n$): En conjuntos de datos grandes, se utiliza como umbral relativo $4/n$ (donde $n$ es el número de observaciones en la muestra).

Evaluar estos valores atípicos es un paso crucial dentro de cualquier tubería de limpieza de datos antes de entrenar algoritmos en producción.

Cómo conectar la analítica estadística con tu carrera en Data Science

Dominar el diagnóstico de modelos lineales y la detección de puntos influyentes es una competencia esencial dentro del área de Big Data y Machine Learning.

Para comprender la distribución de roles dentro del ecosistema informático, te sugerimos revisar nuestra guía sobre la diferencia entre frontend, backend y full stack.

Durante la construcción de tus scripts de procesamiento en R o Python, administrarás tus proyectos de forma profesional sabiendo qué es Git y por qué es tan importante para trabajar en equipo.

A nivel de almacenamiento de información, garantizar consultas consistentes exige verificar qué es ACID en bases de datos frente a sistemas transaccionales.

En proyectos avanzados de ciencia de datos, la automatización del ciclo de vida de los modelos se conecta directamente con comprender qué es MLOps y por qué es clave en ingeniería de software.

Si estás iniciando tu carrera y buscas trazar tu hoja de ruta de aprendizaje desde cero, te invitamos a consultar nuestro artículo sobre qué aprender primero en programación.

Asimismo, para consultar documentación académica y guías oficiales sobre funciones de diagnóstico estadístico, puedes revisar la documentación de R sobre la función cooks.distance.


Conclusión

La distancia de Cook es un recurso fundamental dentro del análisis regresional para identificar observaciones que ejercen una influencia desproporcionada sobre el modelo.

Su capacidad para combinar la magnitud del residuo con el apalancamiento del dato permite limpiar los datos de entrenamiento con rigor técnico.

Aplicar estas herramientas de diagnóstico estadístico te garantizará la creación de modelos predictivos más precisos, robustos y confiables en proyectos de Big Data.

Bootcamp Full Stack Big Data y Machine Learning de KeepCoding

Si quieres dominar el análisis estadístico, el procesamiento masivo con R y Python, la detección de anomalías y el desarrollo de algoritmos de Machine Learning con proyectos reales respaldado por expertos en activo, descubre el Bootcamp Full Stack Big Data & Machine Learning de KeepCoding y transforma tu perfil profesional hoy mismo.

Noticias recientes del mundo tech

¡CONVOCATORIA ABIERTA!

Big Data & Data Science

Full Stack Bootcamp

Clases en Directo | Acceso a +600 empresas | 98% de empleabilidad

Descárgate también el informe de tendencias en el mercado laboral 2026.

Fórmate con planes adaptados a tus objetivos y logra resultados en tiempo récord.
KeepCoding Bootcamps
Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.