Estadística
Regresión: OLS, Deming, Passing-Bablok y WLS
Cuatro formas de ajustar una recta — y por qué la que aprendiste en la escuela (OLS) casi nunca es la correcta para una comparación de métodos ni para un estudio de linealidad.
¿Por qué no basta la regresión lineal clásica (OLS)?
La regresión de mínimos cuadrados ordinarios (OLS) — la "y = mx + b" de cualquier curso introductorio de estadística — asume que X no tiene error de medición: todo el ruido de los datos vive en Y, y X es un valor de referencia conocido con exactitud.
En una comparación de métodos de laboratorio clínico, esa suposición es falsa por diseño: ambos métodos (el de referencia y el nuevo) son mediciones, y ambos tienen su propio error. Cuando X también tiene error, OLS produce un sesgo conocido y predecible llamado atenuación: la pendiente estimada se "aplana" hacia cero, subestimando sistemáticamente la relación real entre los dos métodos — entre más ruidoso sea X, peor la atenuación.
Deming: cuando conoces la razón de varianzas (λ)
La regresión de Deming corrige la atenuación de OLS incorporando explícitamente el error de ambos ejes. Para hacerlo, necesita un dato adicional: λ, la razón entre la varianza del error de medición en X y la varianza del error de medición en Y (λ = σ²ₓ / σ²ᵧ). Normalmente λ se estima a partir de estudios de precisión previos de cada método (réplicas, control de calidad interno).
Los dos extremos de λ son ilustrativos: cuando λ = 0 (todo el error está en Y, X es esencialmente exacto), Deming coincide exactamente con OLS. Cuando λ es muy grande (todo el error está en X), Deming se acerca a la inversa de la regresión de Y sobre X. Cuando λ = 1 (ambos métodos igual de ruidosos), Deming es equivalente a la regresión ortogonal clásica.
Cuando ambos métodos tienen un historial de control de calidad interno robusto que permite estimar su desviación estándar de repetibilidad de forma independiente y confiable — no una suposición, un número medido.
Passing-Bablok: el caso general (λ desconocido)
La mayoría de las veces, nadie tiene un número confiable para λ — sencillamente no hay suficiente historial de precisión de ambos métodos para estimar esa razón con confianza. Para ese caso general, CLSI EP09-A3 recomienda Passing-Bablok, un método no paramétrico que no necesita conocer λ ni asumir que los errores siguen una distribución normal.
Passing-Bablok calcula la pendiente entre cada par de puntos del conjunto de datos, y toma la mediana de todas esas pendientes (con un ajuste que corrige el sesgo de pares con pendiente negativa). Al ser una mediana, es robusto frente a valores atípicos — unos cuantos puntos raros no distorsionan el resultado como podrían hacerlo en una regresión basada en sumas de cuadrados.
Mismo conjunto de datos fijo (con error realista en ambos ejes) — activa o desactiva cada recta para comparar.
WLS: cuando la varianza no es constante
OLS, Deming y Passing-Bablok abordan un mismo problema — error de medición en X — pero comparten otro supuesto que rara vez se cuestiona: que la varianza del error es constante en todo el rango (homocedasticidad). En laboratorio clínico eso también suele ser falso: muchos métodos son proporcionalmente menos precisos en concentraciones altas que en bajas — su desviación estándar entre réplicas crece con la concentración (heterocedasticidad), en vez de mantenerse igual.
Cuando eso ocurre, OLS sigue dando una pendiente centrada en el valor correcto en promedio, pero deja de ser el ajuste más preciso posible: trata a un punto muy ruidoso exactamente igual que a uno muy preciso, dejando que el ruidoso lo desvíe más de lo que su información real justifica. WLS (mínimos cuadrados ponderados) corrige esto asignando a cada punto un peso 1/σᵢ² — la precisión conocida o estimada de ese nivel — para que los puntos más consistentes entre réplicas pesen más en el ajuste que los más dispersos.
Una pregunta diferente
No todos los puntos merecen el mismo peso
Lo anterior resuelve una pregunta: ¿los dos métodos que comparas tienen error de medición? Esta es una pregunta distinta: dentro de un solo estudio de linealidad, ¿tus mediciones se dispersan más en niveles de concentración altos que en los bajos? Si es así, no todos los puntos merecen el mismo peso en la línea que ajustas — y ahí es donde OLS y WLS se diferencian.
El principio: mismo peso vs. peso por precisión
OLS trata todos tus puntos exactamente igual: cada observación aporta la misma influencia a la recta final, sin importar si viene de un nivel de concentración donde tus réplicas caen casi en el mismo valor una y otra vez, o de un nivel donde saltan varios puntos entre sí. Para OLS, un punto ruidoso pesa lo mismo que uno consistente — y eso puede parecer razonable hasta que uno de esos niveles ruidosos empieza a jalar la pendiente hacia sí mismo, simplemente porque su dispersión vertical es mayor, no porque refleje mejor la relación real.
WLS le da menos peso a los puntos que sabes que son menos confiables, y más peso a los que sabes que son más consistentes. Si un nivel de concentración tiene una desviación estándar entre réplicas mucho mayor que otro, WLS lo reconoce explícitamente: en vez de dejar que ese ruido extra distorsione la pendiente, lo descuenta en la proporción exacta que le corresponde. El resultado es una recta que refleja mejor dónde está la señal real, y no solo dónde cayeron los puntos más dispersos.
Simulador — OLS vs WLS con el mismo dataset
¿Cuándo importa la diferencia?
Si tus datos muestran una dispersión claramente mayor en los niveles altos de concentración, WLS cambia de forma material la pendiente estimada: entre más marcada la heterocedasticidad, más se separan los ajustes de OLS y WLS, y OLS deja de ser el ajuste más preciso posible — sigue centrado en promedio, pero con más incertidumbre y más vulnerable a que un nivel ruidoso lo desvíe. Si la varianza es aproximadamente constante en todo el rango, OLS y WLS convergen a prácticamente la misma recta, y la elección entre ellos deja de importar en la práctica.
¿Cómo se calculan los pesos?
El peso de cada nivel se estima típicamente como el inverso de su varianza, wᵢ = 1/σᵢ², usando la desviación estándar observada entre réplicas en ese nivel. Cuando no hay un perfil de precisión completo de antemano, es común un ajuste iterativo: se corre primero una regresión sin ponderar, se examina la varianza residual por nivel, y se vuelve a ajustar con esos pesos estimados — el mismo enfoque que describe CLSI EP06 2nd Ed. para la evaluación de linealidad con mínimos cuadrados ponderados.¹ Ver BunnyStat Explains — Linealidad y WLS para el detalle de cómo Linealidad estima estos pesos a partir del perfil de precisión real.
¹ Clinical and Laboratory Standards Institute (CLSI). EP06, 2nd Edition: Evaluation of Linearity of Quantitative Measurement Procedures, §4.5 — regresión ponderada para varianza no constante.
La misma idea fuera del laboratorio
- Un GPS combina señales de varios satélites dando más peso a las de mejor calidad de señal — las más débiles contribuyen poco a la posición final.
- En un promedio de calificaciones ponderado, el examen final pesa más que una tarea — no todos los resultados cuentan igual.
- Los instrumentos que fusionan lecturas de varios sensores dan más peso a los más precisos y menos a los que varían mucho.
Por qué Linealidad usa WLS
El módulo de Linealidad evalúa una pregunta distinta a la comparación de métodos: no compara dos instrumentos midiendo la misma muestra, sino qué tan bien un único método responde a lo largo de un rango de concentraciones — típicamente un panel de diluciones o un set de materiales con valor nominal ya establecido. Ese valor nominal (el eje X) no es una medición con su propio error: es el valor objetivo del diseño experimental. El error que sí importa vive completo en el eje Y — la respuesta que da el método en cada nivel.
Eso elimina de raíz el problema que resuelven Deming y Passing-Bablok — error de medición simultáneo en ambos ejes — pero deja expuesto el otro problema: la heterocedasticidad. En la mayoría de los métodos clínicos, la variabilidad entre réplicas no es igual en todo el rango, y suele crecer en las concentraciones altas. Por eso CLSI EP06 2nd Ed. recomienda WLS específicamente para linealidad: pondera cada nivel según su propia variabilidad, en vez de dejar que los niveles más ruidosos —casi siempre los de concentración alta— dominen el ajuste solo por tener más dispersión absoluta.
Por qué Comparación de Métodos usa Passing-Bablok
El módulo de Comparación de Métodos enfrenta el problema inverso: aquí X no es un valor nominal fijo, es la medición de un segundo método — con su propio error, generalmente desconocido y no necesariamente menor que el del método que se evalúa. Ese es justamente el problema que WLS no resuelve: WLS asume que X está libre de error y solo ajusta la varianza no constante en Y. Si se usara WLS en una comparación de métodos, la atenuación de la pendiente por error en X seguiría intacta — WLS no la corrige, porque no fue diseñado para eso.
Passing-Bablok (y Deming, cuando λ es confiable) sí atacan ese problema: reconocen que ambos ejes tienen error propio, ya sea corrigiéndolo con una razón conocida (Deming) o sin necesitar conocerla, usando la mediana de pendientes entre pares de puntos (Passing-Bablok). Es una solución distinta a un problema distinto — no una versión "mejor" o "peor" que WLS, sino la herramienta correcta para cuando el ruido no vive solo en un eje.
Hay una segunda razón, independiente de la anterior. Passing-Bablok también es robusto frente a valores atípicos: al basarse en la mediana de las pendientes entre pares de puntos, unos cuantos resultados raros no distorsionan el ajuste. WLS no tiene esta propiedad — sigue centrado en promedios ponderados, así que un outlier puede desplazar la línea de la misma forma que en OLS.
¿Cuándo usar cada uno?
| Método | Cuándo usarlo | Supuesto sobre el error |
|---|---|---|
| OLS | Nunca, en una comparación de métodos IVD — solo cuando X es un valor de referencia certificado sin error de medición (ej. una concentración preparada gravimétricamente). | Todo el error está en Y; X es exacto. |
| Deming | Cuando λ (razón de varianzas de error) es conocida y confiable, típicamente a partir de estudios de precisión previos de ambos métodos. | Ambos ejes tienen error, en una proporción λ dada. |
| Passing-Bablok | Caso general — recomendado por CLSI EP09-A3 cuando λ es desconocido, que es la situación más común en la práctica. | Ambos ejes tienen error, sin necesidad de conocer su proporción ni su distribución. |
| WLS | Cuando la varianza no es constante en todo el rango (heterocedasticidad) — estándar en CLSI EP06 2nd Ed. para linealidad. No corrige error de medición en X, no es alternativa a Deming/Passing-Bablok. | X sin error de medición (como OLS); la varianza en Y puede crecer con X, ponderada por 1/σᵢ² conocido o estimado. |
Fuentes
- Passing, H., & Bablok, W. (1983). A new biometrical procedure for testing the equality of measurements from two different analytical methods. Journal of Clinical Chemistry and Clinical Biochemistry, 21(11), 709–720.
- Clinical and Laboratory Standards Institute (CLSI). (2018). EP09-A3: Measurement Procedure Comparison and Bias Estimation Using Patient Samples.
- Linnet, K. (1993). Evaluation of regression procedures for methods comparison studies. Clinical Chemistry, 39(3), 424–432.