Saltar la navegación

8. Resumen

1. Estadística descriptiva bidimensional

SÍNTESIS.

1.- Estadística Bidimensional. 
La estadística bidimensional es la ciencia que se ocupa de determinar si existe relación o no entre dos variables.
Ejemplos:
- Horas de estudio y calificaciones negativas de los alumnos.
- Calificaciones en Matemáticas y Física.
- Dinero gastado en publicidad y dinero obtenido por ventas en una empresa.
Una variable estadística bidimensional es el conjunto de pares de valores de dos caracteres o variables estadísticas unidimensionales X e Y sobre una misma población. Se llama distribución bidimensional a la tabla estadística bidimensional formada por todas las frecuencias absolutas de todos los posibles valores de la variable estadística bidimensional. Es decir, para cada elemento de una población o muestra se consideran los valores correspondientes a dos caracteres cuantitativos distintos.

2.- Uso de tablas.

  • Tablas simples:
    Ejemplo 1: Tabla con dos variables que son la talla en cm y el peso en kg de una muestra de 9 alumnos de una clase:
Talla (cm): X 164  166  168  170  172  174  175  176  176 
Peso (kg): Y 68   72  75  68  75  76  73  72  80
  • Tablas de doble entrada:
    Los datos también pueden darse mediante una tabla de doble entrada de la cual es posible extraer una tabla bidimensional y los datos de cada variable por separado, que son las llamadas distribuciones marginales.
    Ejemplo 2: En 35 familias que habitan en un mismo bloque de pisos hemos hecho un estudio sobre el número de hijas e hijos que tienen cada una de ellas y hemos obtenido los resultados que figuran en la tabla adjunta. La variable X indica el número de hijos y la variable Y, el número de hijas de dichas familias. La tabla estadística bidimensional correspondiente sería esta:

X⇒
⇓Y

0 1 2 3 Total
0 0 2 3 1 6
1 3 6 4 1 14
2 4 2 3 0 9
3 3 1 1 1 6
Total 10 11 11 3 35

3.- Diagramas de Dispersión o Nube de puntos.
La representación gráfica más usual para una distribución bidimensional es el diagrama de dispersión o nube de puntos. Se fija un sistema de ejes cartesiano y se realiza fijando un carácter en cada uno de los ejes y representando los puntos correspondientes a cada par. Para la tabla del Ejemplo 1 se obtiene:

Diagrama de dispersión o Nube de puntos
Diagrama de dispersión o Nube de puntos.
Material de elaboración propia. (CC BY-NC-SA)

4.- Cálculo de parámetros: Covarianza.
Al considerar las distribuciones de cada variable por separado se obtienen dos distribuciones unidimensionales, llamadas marginales cuyos parámetros (media, varianza, desviación típica) ya sabemos hallar. El parámetro específico de una variable bidimensional es la covarianza. Se llama covarianza de una variable bidimensional, con valores $(x_i,y_i)$, a la media aritmética de los productos de las desviaciones de cada variable respecto a su media.
Se representa por $\sigma_{x,y}$ y su expresión es:

$\sigma _{x,y}={\large{\frac{\sum _{i=1}^n \left(x_i-\bar{x}\right)\left(y_i-\bar{y}\right)}{\sum _{i=1}^n n_i}}}={\large{\frac{\sum _{i=1}^n x_i·y_i}{n}}}-\bar{x}·\bar{y}$

La covarianza presenta el inconveniente de que su valor depende de las unidades de medida de las variables y, por tanto, no permite comparar la relación entre dos variables medidas en diferentes unidades.

5.- Correlación.
Se llama correlación a la teoría que intenta estudiar la relación o dependencia que existe entre las dos variables que intervienen en una distribución bidimensional.

  • La correlación es lineal o curvilínea cuando el diagrama de puntos se condensa en torno a una línea recta o a una curva.
  • La correlación es positiva o directa cuando a medida que crece una variable, la otra también crece.
  • La correlación es negativa o inversa cuando a medida que crece una variable, la otra decrece.
  • La correlación es nula cuando no existe ninguna relación entre ambas variables.
  • La correlación es de tipo funcional si existe una función que satisface todos los valores de la distribución.
  • La correlación será tanto más fuerte o más débil, dependiendo de la mayor o menor tendencia de los valores de la distribución a satisfacer una determinada función.

6.- Coeficiente de Correlación lineal, $r$ y coeficiente de Determinación. $R^2$.
El coeficiente de correlación lineal de Pearson se define mediante la siguiente expresión $r={\Large{\frac{\sigma_{x,y}}{\sigma_x·\sigma_y}}}$. El signo del coeficiente r viene dado por el signo de la covarianza, ya que las desviaciones típicas son siempre positivas. Es, por tanto, el signo de la covarianza el que decide el comportamiento de la correlación:

  • Si la covarianza es positiva, la correlación es directa.
  • Si la covarianza es negativa, la correlación es inversa.
  • Si la covarianza es nula, no existe correlación.

Se demuestra que el coeficiente de correlación lineal es un número comprendido entre –1 y 1. Según el valor de r la dependencia entre las variables x e y será del siguiente tipo:

  • Si r = -1 todos los valores de la variable bidimensional se encuentran situados sobre una recta; satisfacen la ecuación de la recta. Se dice que entre las variables x e y existe una dependencia funcional.
  • Si –1 < r < 0, la correlación es negativa y será tanto más fuerte a medida que r se acerque a –1, y tanto más débil a medida que se aproxima a 0. En este caso se dice que las variables x e y están en dependencia aleatoria.
  • Si r = 0, no existe ningún tipo de relación entre las dos variables. Se dice que son aleatoriamente independientes.
  • Si 0 < r < 1, la correlación es positiva y será tanto más fuerte a medida que r se acerque a 1, y tanto más débil a medida que se aproxima a 0. En este caso se dice que las variables x e y están en dependencia aleatoria.
  • Si r = 1, todos los valores de la variable bidimensional se encuentran situados sobre una recta; satisfacen la ecuación de la recta. Se dice que entre las variables x e y existe una dependencia funcional.

Se llama Coeficiente de Determinación y se nota como $R^2$ al cuadrado del coeficiente de correlación lineal, $R^2={\Large{\frac{\sigma_{x,y}^2}{\sigma^2_x·\sigma^2_y}}}$.

Diagrama de dispersión correlación negativa
Diagrama de dispersión correlación negativa.
Material de elaboración propia. (CC BY-NC-SA)
Diagrama de dispersión correlación positiva
Material de elaboración propia. (CC BY-NC-SA)

7.- Estudio analítico de la Regresión Lineal.
Sobre el diagrama de dispersión de la variable bidimensional (x, y) trazamos una recta llamada recta de regresión de y sobre x, que es la recta que más se ajusta a esa nube de puntos. El problema del mejor ajuste se resuelve obligando a que la suma de los cuadrados de las desviaciones sea lo menor posible. Por eso, a esta recta de regresión se le conoce también como la recta de los mínimos cuadrados, que sirve para minimizar los residuos o diferencias entre el valor de la variable dada y el predicho por esta ecuación para un valor de x dado. Así se determina la recta de regresión de Y sobre X:

$y={\large{\frac{\sigma_{x,y}}{\sigma_x^2}}}·(x-\bar{x})+\bar{y}$.

El error que se comete en este ajuste recibe el nombre de error cuadrático medio, (ECM) y se puede expresar así:

$ECM=VR=\sigma _y{}^2-{\large{\frac{\sigma _{x,y}{}^2}{\sigma _x{}^2}}}=\sigma _y{}^2·(1-{\large{\frac{\sigma _{x,y}{}^2}{\sigma_y{}^2·\sigma _x{}^2}}})=\sigma _y{}^2·(1-R^2)$

8.- Otros modelos de regresión.
Se pueden aplicar los resultados del modelo de regresión lineal a otros modelos como el logarítmico, exponencial, polinómico, etc. En general, si disponemos de unas observaciones $(xi, yi)$; i=1,...,n de dos características X e Y de una muestra de una población, y queremos ajustar un modelo de la forma $y=a+b·g(x)$ para estos datos, podemos definir una nueva variable estadística T=g(X) y hallar la recta de regresión de Y sobre T correspondiente a los datos $(ti,yi)=(g(xi),yi)$; i=1,...,n. Una vez obtenida la recta de regresión de Y sobre T, deshacemos el cambio y obtenemos el tipo de gráfico o curva solicitada.

9.- Valores predictivos. 
La relación entre las dos variables X e Y a través de un modelo formal supone contar con una expresión lógico-matemática que, aparte de resumir cómo es esa relación, va a permitir realizar predicciones de los valores que tomará una de las dos variables (la que se asuma como variable de respuesta, dependiente, criterio o Y) a partir de los valores de la otra (la que se asuma como variable explicativa, independiente, predictora o X).

10. Ejercicio tipo.
Una asociación dedicada a la protección de la infancia desea estudiar la relación entre la mortalidad infantil en cada país y el número de camas de hospital por cada mil habitantes. De forma que, X representa el número de camas por cada mil habitantes e Y el tanto por ciento de mortalidad infantil en un país correspondiente.

Para ello, poseemos los siguientes datos sobre 10 países concretos que pueden considerarse representativos del resto:

Número 
(camas/mil hab): X
50 100 70 60 120 180 200 150 30 90
Mortalidad
infantil (%) : Y
5 2 2,5 3,75 4 1 1,25 0,75 7 3

a) Calcula razonadamente la media y la desviación típica de X.
b) Calcula razonadamente la media y la desviación típica de Y.
c) ¿Qué distribución está más dispersa? Razona la respuesta.
d) Calcula el coeficiente de correlación lineal e interprétalo.
e) Encuentra la recta de regresión de y sobre x.
f) Estima la mortalidad infantil en el caso de existir 150 camas.

Creado con eXeLearning (Ventana nueva)