Comparación de métodos

Pearson y significancia, explicados sin rodeos

Por qué un coeficiente de correlación alto no es suficiente para decir que dos métodos son intercambiables.

¿Por qué Pearson no es suficiente para comparar métodos?

El coeficiente de correlación de Pearson (r) mide qué tan bien se relacionan linealmente dos variables — pero no mide si son iguales, solo si se mueven juntas. Un r muy cercano a 1.0 es fácil de conseguir en comparación de métodos, precisamente porque ambos miden el mismo analito y suelen cubrir un rango amplio de valores.

El ejemplo clásico: puedes tener r = 0.99 y, al mismo tiempo, un sesgo sistemático enorme — por ejemplo, que el Método B siempre dé el doble que el Método A. La correlación sería casi perfecta (ambos suben y bajan juntos) pero los métodos serían completamente no intercambiables en la práctica clínica.

Por eso Pearson se reporta como estadístico de soporte, nunca como el criterio principal — Passing-Bablok y Bland-Altman son los que realmente evalúan concordancia.

Ejemplo interactivo — mismo r, distinta concordancia

Datos sintéticos — no un caso real. Ambos conjuntos tienen una correlación de Pearson alta, pero solo uno de ellos representa métodos realmente intercambiables.

Con sesgo sistemático
Sin sesgo sistemático

¿Qué es el test t-pareado vs. Wilcoxon?

Ambas son pruebas de significancia para las diferencias entre los dos métodos, pero parten de supuestos distintos. La t pareada asume que esas diferencias siguen una distribución aproximadamente normal. El test de Wilcoxon (rangos con signo) no necesita ese supuesto — evalúa las diferencias por su orden relativo, no por su valor exacto, y por eso es más robusto cuando los datos no son normales o hay valores atípicos.

¿Por qué BunnyStat elige uno u otro automáticamente?

Antes de aplicar cualquiera de las dos pruebas, BunnyStat® evalúa internamente la normalidad de las diferencias con la prueba de Shapiro-Wilk. Si las diferencias parecen seguir una distribución normal, usa la t pareada (más potente en ese caso). Si no, usa Wilcoxon automáticamente. Esta decisión ocurre detrás de escena — no necesitas ejecutar ni interpretar Shapiro-Wilk tú mismo, solo ver qué prueba se usó y su resultado.

¿Por qué p < 0.05 no significa que el método "falla"?

Un valor p pequeño solo indica que la diferencia media observada entre los métodos es poco probable si en realidad no hubiera ninguna diferencia real (la "hipótesis nula"). No te dice si esa diferencia es clínicamente relevante, ni qué tan grande es en términos prácticos — con un tamaño de muestra grande, hasta una diferencia mínima sin importancia clínica puede producir un p muy bajo.

Por eso el valor p se reporta junto al sesgo y su magnitud real (en las unidades del analito), nunca solo: la pregunta que importa es "¿esta diferencia es lo bastante grande como para afectar decisiones clínicas?", y esa pregunta la responde el analista, no un umbral estadístico aislado.

Fuentes