Unidad 4 Comparación de grupos y asociación

4.1 Análisis de datos categóricos (tablas de contingencia)

Esta sección no se enseñará este semestre.

4.1.1 Prueba de bondad y ajuste

Esta sección no se enseñará este semestre.

4.1.2 Prueba chi-cuadrado de homogeneidad

Esta sección no se enseñará este semestre.

4.1.3 Prueba chi-cuadrado de independencia

Esta sección no se enseñará este semestre.

4.2 ANOVA

El análisis de la varianza, o más brevemente, ANOVA, se refiere en general a un conjunto de situaciones experimentales y procedimientos estadísticos para el análisis de respuestas cuantitativas de unidades experimentales. El problema ANOVA más simple se conoce indistintamente como unifactorial, de clasificación única o ANOVA unidireccional e implica el análisis de datos muestreados de más de dos poblaciones (distribuciones) numéricas o de datos de experimentos en los cuales se utilizaron más de dos tratamientos. La característica que diferencia los tratamientos o poblaciones una de otra se llama factor en estudio y los distintos tratamientos o poblaciones se conocen como niveles del factor. Ejemplos de tales situaciones incluyen los siguientes:

  1. Un experimento para estudiar los efectos de cinco marcas diferentes de gasolina con respecto a la eficiencia de operación de un motor automotriz (mpg).
  2. Un experimento para estudiar los efectos de la presencia de cuatro soluciones azucaradas diferentes (glucosa, sucrosa, fructosa y una mezcla de las tres) en cuanto a crecimiento de bacterias.

4.2.1 ANOVA de un factor

El ANOVA unifactorial se enfoca en la comparación de más de dos medias de población o tratamiento. Sean

\[ J = \text{el número de poblaciones o tratamientos que se están comparando.} \]

\[\begin{equation} \notag \begin{matrix} \mu_1 = \text{la media de la población } 1.\\ \vdots \\ \mu_j = \text{la media de la población } j . \end{matrix} \end{equation}\]

Las hipótesis pertinentes son

\[\begin{equation} \notag \begin{split} H_0&: \mu_1 = \mu_2 = \cdots = \mu_j\\ H_1&: \text{por lo menos dos de las } \mu_j \text{ son diferentes.} \end{split} \end{equation}\]

Si los tratamientos (“poblaciones”) no tienen efecto, se espera que los promedios sean iguales (\(H_0\)). El análisis de los resultados consiste básicamente en la descomposición de las observaciones en contribuciones de diferentes fuentes, es decir, se puede desglosar de la siguiente forma:

\[ SCT = SCTr + SCE, \] donde, cada elemento se define de la siguiente manera:

  • SCT (suma de cuadrados totales): varianza total a explicar.
  • SCTr (suma de cuadrados de los tratamientos): suma de las varianzas de cada tratamiento (\(j\)) respecto al promedio general.
  • SCE (suma de cuadrados de los errores o residual): suma de las varianza de cada tratamiento.

La siguiente tabla resume la descomposición de la suma de cuadrados anterior:

Tabla 4.1: Tabla ANOVA para el diseño completamente aleatorizado
Fuente gl SC CM
Tratamientos \(k - 1\) \(\displaystyle\sum_{j=1}^k n_j (\bar{y}_{j} - \bar{y})^2\) \(CMTr = \displaystyle\frac{SCTr}{k-1}\)
Error \(n - k\) \(\displaystyle\sum_{j=1}^k \displaystyle\sum_{i=1}^{n_j} (y_{ij} - \bar{y}_{j})^2\) \(CME = \displaystyle\frac{SCE}{n-k}\)
Total \(n - 1\) \(\displaystyle\sum_{j=1}^k \displaystyle\sum_{i=1}^{n_j} (y_{ij} - \bar{y})^2\)

donde, \(j\) es el tratamiento e \(i\) la observación en cada tratamiento. Y, \(CM\) es cuadrado de la media de tratamiento (\(CMTr\)) y error respectivamente (\(CME\)).

El estadístico de prueba correspondiente es:

\[ F_0 = CMTr/CME, \]

y se rechaza la hipótesis nula cuando \(F_0 \geq F_{1-\alpha, k-1,n-k}\), donde \(n = \sum n_j\).

Ejemplo 4.1 En un intento por mejorar la calidad de las cintas de grabación, se les aplica diferentes tinturas a los tipos de dispositivos, 22. Se desea saber si los niveles de distorsión son diferentes o no según el color de la cinta.

Distorsión de sonido obtenido con 4 tipos de tinturas,

Tabla 4.2: Datos del experimento
Tratamientos
A B C D
10 14 17 12
15 18 16 15
8 21 14 17
12 15 15 15
15 17 16
15 15
18
\[\begin{equation} \notag \begin{split} H_0&: \mu_A = \mu_B = \mu_C = \mu_D\\ H_1&: \text{por lo menos de las } \mu_j \text{ son diferentes} \end{split} \end{equation}\]

Calculando la tabla ANOVA en R:

datos = data.frame(
  Tipo = rep(c("A","B","C","D"), c(5,4,7,6)),
  Fallos = c(10,15,8,12,15,14,18,21,15,17,16,14,15,17,15,18,12,15,17,15,16,15)
)

anova = aov(datos$Fallos ~ datos$Tipo)
summary(anova)
##             Df Sum Sq Mean Sq F value Pr(>F)  
## datos$Tipo   3     68  22.667    4.34 0.0181 *
## Residuals   18     94   5.222                 
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

El valor-p de 0.0181 es menor o igual a la significancia de 0.05, por lo cual, existe suficiente evidencia estadística para rechazarla hipótesis nula, es decir, se asume que existe efecto del tratamiento con una confianza del 95%.

Verificando el valor crítico,

qf(1-0.05, 3, 18)
## [1] 3.159908

se obtiene la misma conclusión antes dada.

Ejercicio 4.1 Se analizaron seis muestras de cada uno de cuatro tipos de crecimiento de granos de cereal en una región para determinar el contenido de tiamina y se obtuvieron los siguientes resultados (\(\mu g/g\)):

Tabla 4.3: Contenido de tiamina en granos de cereal
Grano 1 2 3 4 5 6
Trigo 5.2 4.5 6.0 6.1 6.7 5.8
Cebada 6.5 8.0 6.1 7.5 5.9 5.6
Maíz 5.8 4.7 6.4 4.9 6.0 5.2
Avena 8.3 6.1 7.8 7.0 5.5 7.2

¿Sugieren estos datos que por lo menos dos de los granos difieren con respecto al contenido de tiamina promedio verdadero? Use un nivel \(\alpha = 0.05\) con base en el método del valor-p y del valor crítico.

4.2.2 ANOVA de dos factores

Esta sección no se enseñará este semestre.

4.3 Métodos no parámetricos

Esta sección no se enseñará este semestre.

4.3.1 Prueba de Wilcoxon de rangos signados

Esta sección no se enseñará este semestre.

4.3.2 Prueba de Mann-Whitney

Esta sección no se enseñará este semestre.

4.3.3 Prueba de Kruskal-Wallis

Esta sección no se enseñará este semestre.