Mostrando entradas con la etiqueta estadísticas. Mostrar todas las entradas
Mostrando entradas con la etiqueta estadísticas. Mostrar todas las entradas

Calcular frecuencias acumuladas







Si en un estudio estadístico los datos son muy variados, podemos agruparlos en clases. De todas formas, tanto si los datos son discretos como si están agrupados en clases, ¿qué significa calcular las frecuencias acumuladas?

I. Cuando los datos son discretos
Hemos recogido y agrupado en esta tabla la edad de los asistentes a un campamento de verano:


Estamos interesados en la edad de cada individuo. El carácter de este estudio es, por lo tanto, la edad. La edad es un carácter cuantitativo.
La población que estamos estudiando está formada por 55 individuos:

7 + 10 + 15 + 13 + 10 = 55
10 participantes tienen 13 años. Podemos decir que la frecuencia de la modalidad “13” es 10.
1. Calcular frecuencias acumuladas crecientes
Podemos observar que hay 17 (7 + 10 = 17) personas que tienen 13 años o menos. Podemos decir entonces que el valor de la frecuencia acumulada para la modalidad “13”, es 17.
También podemos comprobar que 32 (7 + 10 + 15) personas tienen 14 años o menos. La frecuencia acumulada de la modalidad “14” es 32.
Por lo tanto, podemos calcular la frecuencia acumulada de cada una de las modalidades que presenta el carácter “edad”. En la tabla siguiente podemos observar todas las frecuencias acumuladas de forma ordenada:


Nota: la suma de las primeras cuatro frecuencias es igual a 45 (7 + 10 + 15 + 13). Pero también podemos obtener 45 sumando dos cantidades: la que está justo encima de 45 (es decir, 32) con la que hay a su izquierda (13): 45 = 32 + 13. Si usamos esta técnica, resulta muy sencillo completar todas las frecuencias acumuladas de la tabla. Observa:


Definición: para un carácter cuantitativo, la frecuencia acumulada de un valor o modalidad v es la suma de las frecuencias de cada una de las modalidades que tienen un valor menor o igual a v.
2. Calcular frecuencias acumuladas decrecientes
También podemos observar que hay 23 (13 + 10 = 23) personas que tienen 15 años o más. Esto nos permite definir y calcular las frecuencias acumuladas decrecientes mostradas en esta tabla:


Nota: la suma de las tres últimas frecuencias es 38 (15 + 13 + 10). La cantidad 38 también la podemos obtener sumando el número que se encuentra justo debajo del 38 (es decir, el 23) y el que se encuentra a su izquierda (el 15). Para completar la tabla cómodamente, empezamos por la última frecuencia (10) y vamos subiendo. Observa:


Definición: para un carácter cuantitativo, la frecuencia acumulada decreciente de una modalidadv es la suma de cada una de las frecuencias de aquellas modalidades que tienen un valor mayor o igual a v.
3. Representar frecuencias acumuladas en un diagrama o gráfico de barras
Podemos representar las frecuencias acumuladas de esta serie de datos mediante un diagrama de barras:


También podríamos representar de la misma forma las frecuencias acumuladas decrecientes.
II. Cuando los datos están agrupados en clases o intervalos
Entrevistamos a 120 personas acerca de la cantidad de tiempo que dedican al día a ver la televisión. Lo más probable es que obtengamos una gran variedad de respuestas diferentes (tales como 2 h, 2 h 30 min, etc.). Por este motivo vamos a agrupar las respuestas en intervalos de tiempo (llamados clases), de manera que aquellas personas que hayan visto la televisión 2 h o más de 2 h pero menos de 3 h las vamos a agrupar en la clase 2 ≤t < 3.
Aquí tenemos los resultados:


Ahora completamos la tabla incluyendo las frecuencias acumuladas y las frecuencias acumuladas decrecientes:


Podemos representar las frecuencias acumuladas o las frecuencias acumuladas decrecientes mediante un diagrama de barras, tal como lo hicimos con los datos discretos. En el diagrama, podríamos llamar a la última clase: 4 ≤ t < 5.

Frecuencia y muestreo







En cualquier periódico que leamos, nos encontramos algún escrutinio o recuento de datos, con porcentajes y comentarios. ¿Pero son fiables estos escrutinios? Vamos a ver las nociones en que se basan (frecuencia y simulación) y a especificar las limitaciones de sus resultados. 
I. Tener la distribución de frecuencias de una serie de datos

Comenzamos con una serie de datos, cuyos valores y frecuencias absolutasfi, aparecen recogidos en una tabla similar a la siguiente:


Para cada valor xi, calculamos su frecuencia relativa hi.
Se halla dividiendo la frecuencia absoluta fi de ese valor entre el número total de datos n de la población estudiada, es decir: .
Construimos una tabla con los valores de la serie de datos y sus frecuencias relativas, similar a la siguiente:

Lo que habitualmente manejamos es la frecuencia relativa acumulada, que para un determinado valor de X se obtiene sumando su frecuencia relativa con las frecuencias relativas de todos los valores anteriores a él. Dicha frecuencia relativa acumulada la expresamos en valor decimal o en tanto por ciento. La frecuencia relativa acumulada del último valor de la serie debe ser igual a 1, que equivale al 100%.

II. Fluctuación de las muestras
Cuando queremos conocer la proporción p de una característica en una población numerosa, supervisar uno a uno cada individuo de la población es un proceso largo y costoso, así que tomamos una muestra.
Tomar una muestra de tamaño de la población significa tomar n individuos, o repetir el experimento n veces bajo las mismas condiciones en las que medimos la característica que estamos estudiando.
La serie de datos formada por los n resultados obtenidos es una muestra de tamaño n.
Este método no puede proporcionar el valor exacto de p, ya que diferentes muestras pueden dar diferentes proporciones.
Si tenemos varias muestras, podemos observar estas diferencias en la distribución de frecuencias. Esto es lo que llamamos fluctuación y para observarla, basta con tomar dos muestras.
III. Interpretación de un escrutinio de datos
Como acabamos de ver, con una única muestra no podemos saber la proporción exacta p de una característica en una población completa.
No obstante, si respetamos ciertas condiciones, la proporción observada pe para esa muestra es un buen valor aproximado de la proporción p.
Estas condiciones son las siguientes:
—los individuos de la muestra deben ser elegidos aleatoriamente;
—los individuos se deben devolver a la población (o repetir el experimento en idénticas condiciones);
—el tamaño n de la muestra debe ser bastante grande; se tiene que cumplir que .
Cumpliéndose estas condiciones, podemos asegurar que en el 93% de los casos (de las muestras observadas) se cumple que:
, lo que significa que pe es un valor aproximado de p con una imprecisión o error absoluto de .
IV. Simulación de un experimento
Un experimento aleatorio es un experimento cuyo resultado es impredecible a priori, depende de la suerte.
Simular un experimento aleatorio significa sustituir el experimento real por otro también aleatorio que nos proporcione resultados similares a los del real.
Simulamos un experimento cuando el experimento original es difícil de reproducir, bien porque sea demasiado costoso, bien porque llevaría demasiado tiempo o bien porque sería muy difícil de observar.
Simulando varias veces un experimento (por ejemplo, tomando varias muestras), podremos sacar conclusiones de la distribución de frecuencias y de la fluctuación.
Para simular un experimento podemos usar la tecla de una calculadora o una hoja de cálculo (Excel, por ejemplo, tiene la función RAND).
En una calculadora, esta tecla o función proporciona un número aleatorio con unas 10 cifras decimales.
Ejemplo:
Hemos metido 35 prendas rojas y 65 verdes en una caja. El experimento consiste en extraer 10 prendas de la caja, reemplazando cada vez la prenda extraída. ¿Cómo podemos simular este experimento? Usando una calculadora, activamos 10 veces la función obteniendo 10 números decimales. Observamos las dos primeras cifras de la parte decimal de cada número. Si el número que forman esas dos cifras está comprendido entre 1 y 35, consideramos que hemos extraído una prenda roja, de lo contrario consideramos que la prenda extraída ha sido verde. De esta manera podemos simular nuestro experimento tantas veces como queramos.
Recuerda
—La frecuencia relativa hi de un valor perteneciente a una serie de datos viene dada por el cociente entre la frecuencia absoluta fi de dicho valor y el tamaño n de la población: .
—La proporción observada pe de una característica en una muestra de tamaño n es un valor aproximado de la proporción p de dicha característica en la población total, y cuya imprecisión es .
—Si nuestra calculadora tiene la tecla , pulsándola podemos simular experimentos aleatorios.


Calcular frecuencias relativas






Muchas veces no es posible interpretar directamente una tabla de datos estadísticos. Al representarlos en un gráfico, podemos distinguir visualmente la distribución de los datos. El cálculo de las frecuencias relativas nos muestra la distribución numérica de los datos. 

I. Las frecuencias relativas en su forma decimal
1. Definición

La frecuencia relativa de una modalidad de un carácter determinado, es el resultado de dividir la frecuencia absoluta de esa modalidad entre la frecuencia total (la suma de todas las frecuencias absolutas).

2. Ejemplo
En un campamento de verano, los jóvenes son encuestados acerca de cuáles de las siguientes actividades son sus favoritas: fútbol, ping-pong, tiro con arco, vela y bicicleta de montaña. La tabla de abajo muestra los resultados de la encuesta.


Calculamos la frecuencia total: 48 + 35 + 15 + 112 + 40 = 250.
Obtendremos la frecuencia relativa dividiendo cada una de las frecuencias entre la frecuencia total: 48 : 250 = 0,192; 35 : 250 = 0,14; 15 : 250 = 0,06; 112 : 250 = 0,448 y 40 : 250 = 0,16.


Notas:
—una frecuencia relativa es siempre un valor comprendido entre 0 y 1;
—el resultado de la suma de todas las frecuencias relativas, en una tabla estadística, es 1. Podemos comprobarlo con la tabla de arriba: 0,192 + 0,14 + 0,06 + 0,448 + 0,16 = 1;
—en el caso de que al calcular una frecuencia relativa, la división no sea exacta, tal como ocurre en el ejemplo de abajo, siempre podemos redondear el resultado. No obstante debemos tener en cuenta que la suma de estos valores aproximados nunca dará 1, debido al error de redondeo.


Calculamos las frecuencias relativas, redondeando a las centésimas: 7 : 30 = 0,23; 22 : 30 = 0,73 y 1 : 30 = 0,03.
La suma no es 1: 0,23 + 0,73 + 0,03 = 0,99.
II. La frecuencia relativa en forma de porcentaje
1. Recordemos los porcentajes

El número también puede ser escrito como a%.
Ejemplo: .
2. Ejemplo

Observa de nuevo el ejemplo que hemos estudiado sobre las actividades favoritas de los jóvenes en un campamento. Las frecuencias relativas pueden ser expresadas en forma de porcentaje. Obtenemos así la siguiente tabla:


Notas:
—una frecuencia relativa, expresada como porcentaje, siempre toma valores situados entre 0% y 100%;
—la suma de todos los porcentajes es igual a 100%. Podemos comprobarlo en el ejemplo de arriba: 19,2% + 14% + 6% + 44,8% + 16% = 100%;
—si se trata de frecuencias relativas redondeadas, los porcentajes también lo serán. Por lo tanto, la suma de sus valores, que son aproximados, nunca será el 100%. Si volvemos al ejemplo del estudio del color de los ojos, tendríamos que: 23% + 73% + 3% = 99%.

Calcular la mediana de una serie de datos







Un alumno ha obtenido una nota de 7 sobre 20 en matemáticas. Ante un resultado tan malo, intenta hacer que sus padres se sientan menos molestos por la nota que ha sacado, diciéndoles que hay la misma cantidad de alumnos con notas más bajas y más altas que las suyas.

Utilizando el vocabulario estadístico, diríamos que la nota que ha sacado el alumno se corresponde con la mediana. Como en geometría, la palabra mediana se corresponde con la idea de término medio. La mediana de una serie de datos es semejante a la media, una medida de tendencia central. Pero, ¿cómo se calcula?

I. Definiciones y algunos ejemplos
1. Definición

Si tenemos una serie de datos ordenada, el valor de la mediana es aquel que se encuentra en el centro de la serie, es decir, corta o divide la serie en dos grupos del mismo tamaño (con igual número de datos):
—un grupo está formado por valores menores que la mediana o iguales a ella;
—el otro grupo está formado por valores mayores que la mediana o iguales a ella.

2. Ejemplos

Cuando la muestra es impar
Vamos a calcular la mediana de cada una de las siguientes series de números.
Lo primero que tenemos que hacer, si los datos no están ordenados, es ordenar la serie, ya sea de forma creciente o decreciente, tal como mostramos a continuación.

Primera serie: 2, 6, 7, 25, 58.
El número 7 es la mediana de la serie pues divide la serie en dos grupos de igual número de datos: 2 y 6 (valores menores que 7), y 25 y 58 (valores mayores que 7).

Segunda serie: 4, 7, 9, 9, 11, 15, 17.
El número 9 es la mediana de la serie. Divide la serie en dos grupos de igual número de datos: 4, 7 y 9 (valores menores o iguales que 9), y 11, 15 y 17 (valores mayores que 9).
Conclusión: si la muestra de datos es impar, la mediana se calcula fácilmente: es el valor central de la serie. La serie queda dividida en dos grupos que contienen la misma cantidad de datos y cuyos valores están por encima y por debajo de la mediana.

Cuando la muestra de datos es una cantidad par

Vamos a calcular la mediana de cada una de las siguientes series de valores.
Lo primero que tenemos que hacer, si los datos no están ordenados, es ordenar la serie, ya sea de forma creciente o decreciente, tal como mostramos a continuación.

Primera serie: 1, 5, 12, 13, 21, 24.
Tomamos los dos valores que se hallan en el centro de la serie y calculamos su media:

El valor 12,5 es el valor de la mediana de esta serie ya que divide la serie en dos grupos de igual número de datos: 1, 5 y 12 (valores menores que 12,5), y 13, 21 y 24 (valores mayores que 12,5).
Segunda serie: 5, 14, 18, 19, 19, 25, 47, 56.
En este caso no hay mayor problema porque los dos valores centrales de la serie son el mismo número. Luego el 19 es el valor de la mediana de esta serie de valores. El 19 divide la serie en dos grupos del mismo número de datos: 5, 14, 18 y 19 (valores menores o iguales que 19), y 19, 25, 47 y 56 (valores mayores o iguales que 19).
Conclusión: si la serie contiene un número par de datos, los dos grupos con igual número de datos se corresponden con las dos mitades de la serie ordenada. Y para calcular la mediana solo es necesario hallar la media de los dos valores centrales de la serie.
II. Calcular la mediana
1. Cuando los datos están desordenados
Si la serie de datos no está ordenada, debemos ordenarla.
Ejemplo: mostramos una serie ordenada de las puntuaciones que ha obtenido un alumno en un examen:
2; 3; 5; 6; 6; 8; 9; 9,5; 10; 10; 10; 11; 11; 12; 14; 14; 15,5; 16; 17; 17,5; 19.
Al contar el número de puntuaciones, encontramos que hay un total de 21 valores. Como tenemos que dividir la serie en dos mitades con el mismo número de elementos, nos quedarían dos grupos de 10 valores; por tanto, la mediana será el valor sobrante que no esté en ninguno de estos grupos. Es decir, será el valor undécimo de la serie. La mediana es 10.
Podemos representarla así:

2. Cuando los datos vienen dados en una tabla de frecuencias
Ejemplo: la tabla de abajo nos muestra la distribución de las notas (sobre 20) obtenidas por los alumnos de una clase en el último examen.

Primer paso: calcular las frecuencias acumuladas. Observa como la última frecuencia acumulada siempre nos informa acerca del número total de individuos que forman la muestra. En este caso es 22.

Segundo paso: dividimos el total de datos entre dos: como el total es 22, dividimos las notas en dos grupos de 11.
Tercer paso: observamos en la tabla solo la columna de frecuencias acumuladas y escogemos la primera modalidad cuya frecuencia acumulada sea mayor que 11. Es decir, el 9 tiene una frecuencia acumulada de 14 (14 > 11), por lo tanto, el 9 es la mediana de esta serie.
3. Los datos vienen dados en un gráfico de frecuencias acumuladas
El gráfico es una curva llamada polígono de frecuencias acumuladas y nos muestra la distribución de las notas en una clase de 22 alumnos. Se construye colocando las notas en el eje de las x (abscisas) y su correspondiente frecuencia acumulada en el eje y (ordenadas). A continuación, se marcan los puntos definidos por cada par de valores (xy) y se conectan mediante líneas. De esta forma queda dibujado el polígono de frecuencias.

La mitad del número total de datos es 11. Podemos observar en el gráfico que a este valor de y, le corresponde un valor de que se encuentra comprendido entre 6 y 7. Por lo tanto, la mediana sería el valor de la media de 6 y 7:

Es decir, la mediana es 6,5.

Estadística matemáticas







Un estudio estadístico se desarrolla normalmente en varias etapas:

—recogida de los datos;
—clasificación de los datos en una tabla;
—representación del conjunto o serie de datos en una gráfica o diagrama estadístico;
—caracterización de la serie de datos usando varios parámetros.
Aquí definiremos varios de estos parámetros, como varianza, desviación típica, cuartiles… y utilizaremos el diagrama de caja, un método de representación que nos permite comparar de un vistazo dos conjuntos de datos.

I. Calcular la varianza y la desviación típica
Sea la serie de datos estadísticos de tamaño o dimensión siguiente:

La media de X es: .
Llamamos varianza del conjunto de datos X, al número:

También podemos escribir esta expresión como:
.
La desviación típica es el número: .
Cuando, en vez de tener un valor discreto , lo que tenemos es un intervalo, las fórmulas son las mismas, pero sustituimos por el valor central del intervalo, o marca de clase.
Ejemplo:
Estudiamos la edad, X, de los empleados de una empresa. Obtenemos estos valores:

La media de X es:

.
La varianza es:

.
Y la desviación típica es: .
Nota:
La varianza y la desviación típica miden cómo se distribuyen los valores de X con relación a la media. Son parámetros o medidas de dispersión (mientras que la media y la mediana son parámetros omedidas de centralización, que especifican los valores más representativos de un conjunto de datos).
También podemos hallar la varianza usando la siguiente fórmula:
.
II. Calcular la mediana de un conjunto o serie de datos
La mediana, que representamos por Me, es el número que divide a la serie de datos ordenada por valores crecientes en dos grupos con el mismo peso o cantidad de valores.
Para calcularla, escribimos la lista de todos los valores de la serie ordenados en orden creciente, repitiendo cada uno de ellos tantas veces como indique su frecuencia absoluta. Ahora podemos distinguir dos situaciones:
—si la población total n es un número impar, la mediana es el término que ocupa el lugar  ;
—si la población total n es un número par, la mediana es el valor central del intervalo formado por los términos que ocupan las posiciones .
Cuando los datos de la serie vienen agrupados en clases o intervalos, podemos determinar gráficamente la mediana, usando el polígono de frecuencias absolutas o el polígono de frecuencias absolutas acumuladas, interpolando linealmente si fuera necesario.
Ejemplo:
Retomamos el ejemplo anterior. Estudiamos X, la edad de los empleados de una empresa. Tenemos:


Hemos incorporado en la tercera columna de la tabla las frecuencias absolutas acumuladas. En esa columna podemos ver que hay 1.050 empleados menores de 35 años y 1.800 menores de 40 años.
La mediana Me, que corresponderá a la frecuencia absoluta acumulada de 1.500, pertenece al intervalo 35 ≤ x < 40.
Tenemos:

Fijémonos en los puntos A(35, 1.050) y B(40, 1.800) que corresponden a los extremos de dicho intervalo .
Buscamos Me, que es la coordenada x o abscisa del punto M situado sobre el segmento AB para el que la coordenada y u ordenada toma el valor 1.500.
son vectores que tienen la misma dirección.
Por tanto: , o .
III. Hallar los cuartiles de un conjunto de datos
Sea la serie de datos estadísticos X de tamaño n.
El primer cuartil o cuartil inferiorQ1, es el valor más pequeño de la serie tal que al menos el 25% de los datos son menores o iguales que Q1.
El tercer cuartil o cuartil superiorQ3, es el valor más pequeño de la serie tal que al menos el 75% de los datos son menores o iguales que Q3.
El intervalo intercuartiles es el intervalo .
La diferencia es la amplitud o rango del intervalo intercuartiles.
Podemos hallar los cuartiles Q1 y Q3 de una forma similar a como hallamos la mediana.
Escribimos una lista con todos los valores de la serie en orden creciente, repitiendo cada uno de ellos tantas veces como indique su frecuencia absoluta. Podemos distinguir dos situaciones:
—si es un número entero pQ1 es el valor de número de orden p y Q3 es el valor de número de orden 3p;
—si no es un número entero, Q1 es el valor cuyo número de orden sea una unidad superior a Q3 es el valor cuyo número de orden sea una unidad superior a .
Si la serie viene agrupada en clases o intervalos, podemos determinar gráficamente los cuartiles utilizando el polígono de frecuencias absolutas o el polígono de frecuencias absolutas acumuladas, interpolando linealmente si es necesario.
Ejemplo:
Continuamos con el mismo ejemplo: estamos estudiando la edad X de los empleados de una empresa. Teníamos:


El 25% de 3.000 es 750. Usando las frecuencias absolutas acumuladas, podemos ver que Q1 pertenece al intervalo 30 ≤ x < 35. Obtenemos la gráfica siguiente:

Representemos los puntos A(30, 450) y B(35, 1.050).
Buscamos Q1, que es la coordenada x del punto M sobre la recta AB, cuya coordenada y toma el valor 750.
tienen la misma dirección.
Por tanto: , de donde .
El 75% de 3.000 es 2.250. Utilizando las frecuencias absolutas acumuladas, podemos ver que 2.250 empleados son menores de 45 años. Por tanto, Q3 es igual a 45.
IV. Parámetros de un conjunto de datos tras una transformación afín (de la forma y = ax + b)
Sea la serie de datos estadísticos de tamaño n:


Se considera la serie de datos estadísticos , es decir, la serie:

en la que .
Usando nuestra notación, tenemos que:
 ;  ; .
Si son, respectivamente, los valores de la mediana, el cuartil inferior y el cuartil superior de X y si son, respectivamente, los valores de la mediana, el cuartil inferior y el cuartil superior de Y, tenemos:
 ;
si a > 0,  ;  ;
si a < 0,  ; .
V. Dibujar un diagrama de caja
Para dibujar un diagrama de caja :
—marcamos los valores de la serie estadística sobre un eje horizontal o vertical;
—se coloca el mínimo y el máximo valor de la serie sobre el eje, así como los cuartiles inferior (1er cuartil) y superior (3er cuartil), y la mediana;
—construimos un rectángulo (caja) paralelo al eje, de longitud igual a la amplitud del intervalo intercuartiles, y anchura arbitraria.
Al diagrama de caja se le llama a veces “diagrama de bigotes” o “diagrama de patas”.
Ejemplo:
Retomemos de nuevo el ejemplo en el que estudiábamos la edad de los empleados de una empresa.
El máximo es 55 y el mínimo es 20. La mediana es 38, el cuartil inferior es 32,5 y el cuartil superior es 45. Obtenemos el diagrama de caja siguiente:


Recuerda
Si X es una serie de datos estadísticos:
—La varianza es el número: .
—La desviación típica es la raíz cuadrada de la varianza: .
—El cuartil inferior, representado por Q1, es el valor más pequeño de la serie tal que al menos el 25% de los datos son menores o iguales que Q1.
—El cuartil superior, representado por Q3, es el valor más pequeño de la serie tal que al menos el 75% de los datos son menores o iguales que Q3.
—El intervalo intercuartiles es el intervalo .


Entradas populares

Me gusta

Seguidores