Estimador
En estadística, un estimador es un estadístico (esto es, una función de la muestra) usado para estimar un parámetro desconocido de la población. Por ejemplo, si se desea conocer el precio medio de un artículo (el parámetro desconocido) se recogerán observaciones del precio de dicho artículo en diversos establecimientos (la muestra) y la media aritmética de las observaciones puede utilizarse como estimador del precio medio.
Para cada parámetro pueden existir varios estimadores diferentes. En general, escogeremos el estimador que posea mejores propiedades que los restantes, como insesgadez, eficiencia, convergencia y robustez (consistencia).
El valor de un estimador proporciona lo que se denomina en estadística una estimación puntual del valor del parámetro en estudio. En general, se suele preferir realizar una estimación mediante un intervalo, esto es, obtener un intervalo [a,b] dentro del cual se espera esté el valor real del parámetro con un cierto nivel de confianza. Utilizar un intervalo resulta más informativo, al proporcionar información sobre el posible error de estimación, asociado con la amplitud de dicho intervalo. El nivel de confianza es la probabilidad de que a priori el verdadero valor del parámetro quede contenido en el intervalo.
En la práctica, en los intervalos suelen indicarse dando el valor del estimador puntual utilizado como centro del intervalo y un valor que debe sumarse y restarse para obtener el límite superior e inferior, por ejemplo:
equivale a
Propiedades de los estimadores
Insesgadez [editar]Se denomina sesgo de un estimador a la diferencia entre la esperanza (o valor esperado) del estimador y el verdadero valor del parámetro a estimar. Es deseable que un estimador sea insesgado o centrado, es decir, que su sesgo sea nulo por ser su esperanza igual al parámetro que se desea estimar.
Por ejemplo, si se desea estimar la media de una población, la media aritmética de la muestra es un estimador insesgado de la misma, ya que su esperanza (valor esperado) es igual a la media de la población.
En efecto, si una muestra X=(X1,X2,...,Xn)t procede de una población de media μ, quiere decir que:
E[Xi] = μ para cualquier i=1...n
La media aritmética o media muestral,
, con lo que, al aplicar las propiedades de linealidad de la esperanza matemática se tiene que:
Eficiencia
Diremos que un estimador es más eficiente o más preciso que otro estimador, si la varianza del primero es menor que la del segundo. Por ejemplo, si y son ambos estimadores de θ y
,
diremos que es más eficiente que . Un estimador es más eficiente (más preciso), por tanto, cuanto menor es su varianza.
La eficiencia de los estimadores está limitada por las características de la distribución de probabilidad de la muestra de la que proceden. El teorema de Cramér-Rao determina que la varianza de un estimador insesgado de un parámetro θ es, como mínimo,
donde f(X;θ) es la función de densidad de probabilidad de la muestra en función del parámetro θ, (denominada función de verosimilitud). Si un estimador alcanza esta cota mínima, entonces se dice que el estimador es de mínima varianza.
Consistencia
Si no es posible emplear estimadores de mínima varianza, el requisito mínimo deseable para un estimador es que a medida que el tamaño de la muestra crece, el valor del estimador tienda a ser el valor del parámetro, propiedad que se denomina consistencia. Existen diversas definiciones de consistencia, más o menos restrictivas, pero la más utilizada es la denominada consistencia en media cuadrática que exige que:
cuando
cuando
Robustez
El estimador será un estimador robusto del parámetro θ si la vulneración de los supuestos de partida en los que se basa la estimación (normalmente, atribuir a la población un determinado tipo de función de distribución que, en realidad, no es la correcta), no altera de manera significativa los resultados que éste proporciona.
miércoles, 3 de diciembre de 2008
Muestreo estadistico
INTRODUCCIÓN
Se hará referencia sobre el muestreo estadístico, técnicas, niveles y tipos fundamentales de un muestreo; se describen conceptos básicos que explican lo que esto se refiere al igual se aprecia como y que tipo de técnicas se pueden utilizar para poner en practica la realización de una auditoria con la finalidad de obtener una información determinada para lograr un objetivo especifico.
El muestreo estadístico es un procedimiento por el que se ingresan los valores verdaderos de una población a través de la experiencia obtenida con una muestra
El muestreo como herramienta de la investigación científica arroja resultados que se pueden utilizar para concluir un determinado estudio X de población, al igual las técnicas selectivas que se requieren para dicho estudio de acuerdo a lo que se va a evaluar.
El muestreo permite una reducción considerable de los costos materiales del estudio, una mayor rapidez en la obtención de la información y el logro de resultados con máxima calidad.
Conceptos de Muestreo Estadístico
En estadística un muestreo es la técnica para la selección de una muestra a partir de una población. En el muestreo, si el tamaño de la muestra es más pequeño que el tamaño de la población, se puede extraer dos o más muestras de la misma población. Al conjunto de muestras que se pueden obtener de la población se denomina espacio muestral. La variable que asocia a cada muestra su probabilidad de extracción
El muestreo: es una herramienta de la investigación científica. Su función básica es determinar que parte de una realidad en estudio (población o universo) debe examinarse con la finalidad de hacer inferencias sobre dicha población
El Muestreo es más que el procedimiento empleado para obtener una o más muestras de una población; el muestreo es una técnica que sirve para obtener una o más muestras de población.
Este se realiza una vez que se ha establecido un marco muestral representativo de la población, se procede a la selección de los elementos de la muestra aunque hay muchos diseños de la muestra.
Al tomar varias muestras de una población, las estadísticas que calculamos para cada muestra no necesariamente serían iguales, y lo más probable es que variaran de una muestra a otra.
Muestreo Estadístico: son aquellos que se basan en el principio de equiprobabilidad. Es decir, aquellos en los que todos los individuos tienen la misma probabilidad de ser elegidos para formar parte de una muestra y, consiguientemente, todas las posibles muestras de tamaño n tienen la misma probabilidad de ser elegidas.
Técnicas de selección del muestreo a través del muestreo estadístico
Muestreo probabilístico: Forman parte de este tipo de muestreo todos aquellos métodos para los que puede calcularse la probabilidad de extracción de cualquiera de las muestras posibles. Este conjunto de técnicas de muestreo es el más aconsejable, aunque en ocasiones no es posible optar por él.
Muestreo estratificado: Consiste en la división previa de la población de estudio en grupos o clases que se suponen homogéneos respecto a característica a estudiar. A cada uno de estos estratos se le asignaría una cuota que determinaría el número de miembros del mismo que compondrán la muestra.
Muestreo sistemático: Es la elección de una muestra a partir de los elementos de una lista según un orden determinado, o recorriendo la lista a partir de un número aleatorio determinado.
Muestreo por conglomerados: Cuando la población se encuentra dividida, de manera natural, en grupos que se suponen que contienen toda la variabilidad de la población, es decir, la representan fielmente respecto a la característica a elegir, pueden seleccionarse sólo algunos de estos grupos o conglomerados para la realización del estudio.
Muestreo errático: También se llama sin norma. La muestra se realiza de cualquier forma, valorando únicamente la comodidad o la oportunidad en términos de costes, tiempo u otro factor no estadístico.
Al realizar un muestreo en una población podemos hablar de muestreos probabilísticas y no probabilísticas, entre estas técnicas o procedimientos están:
Muestreo simple: Este tipo de muestreo toma solamente una muestra de una población dada para el propósito de inferencia estadística. Puesto que solamente una muestra es tomada, el tamaño de muestra debe ser los suficientemente grandes para extraer una conclusión. Una muestra grande muchas veces cuesta demasiado dinero y tiempo.
Muestreo aleatorio simple: Es aquel en que cada elemento de la población tiene la misma probabilidad de ser seleccionado para integrar la muestra. Una muestra simple aleatoria es aquella en que sus elementos son seleccionados mediante el muestreo aleatorio simple.
Se hará referencia sobre el muestreo estadístico, técnicas, niveles y tipos fundamentales de un muestreo; se describen conceptos básicos que explican lo que esto se refiere al igual se aprecia como y que tipo de técnicas se pueden utilizar para poner en practica la realización de una auditoria con la finalidad de obtener una información determinada para lograr un objetivo especifico.
El muestreo estadístico es un procedimiento por el que se ingresan los valores verdaderos de una población a través de la experiencia obtenida con una muestra
El muestreo como herramienta de la investigación científica arroja resultados que se pueden utilizar para concluir un determinado estudio X de población, al igual las técnicas selectivas que se requieren para dicho estudio de acuerdo a lo que se va a evaluar.
El muestreo permite una reducción considerable de los costos materiales del estudio, una mayor rapidez en la obtención de la información y el logro de resultados con máxima calidad.
Conceptos de Muestreo Estadístico
En estadística un muestreo es la técnica para la selección de una muestra a partir de una población. En el muestreo, si el tamaño de la muestra es más pequeño que el tamaño de la población, se puede extraer dos o más muestras de la misma población. Al conjunto de muestras que se pueden obtener de la población se denomina espacio muestral. La variable que asocia a cada muestra su probabilidad de extracción
El muestreo: es una herramienta de la investigación científica. Su función básica es determinar que parte de una realidad en estudio (población o universo) debe examinarse con la finalidad de hacer inferencias sobre dicha población
El Muestreo es más que el procedimiento empleado para obtener una o más muestras de una población; el muestreo es una técnica que sirve para obtener una o más muestras de población.
Este se realiza una vez que se ha establecido un marco muestral representativo de la población, se procede a la selección de los elementos de la muestra aunque hay muchos diseños de la muestra.
Al tomar varias muestras de una población, las estadísticas que calculamos para cada muestra no necesariamente serían iguales, y lo más probable es que variaran de una muestra a otra.
Muestreo Estadístico: son aquellos que se basan en el principio de equiprobabilidad. Es decir, aquellos en los que todos los individuos tienen la misma probabilidad de ser elegidos para formar parte de una muestra y, consiguientemente, todas las posibles muestras de tamaño n tienen la misma probabilidad de ser elegidas.
Técnicas de selección del muestreo a través del muestreo estadístico
Muestreo probabilístico: Forman parte de este tipo de muestreo todos aquellos métodos para los que puede calcularse la probabilidad de extracción de cualquiera de las muestras posibles. Este conjunto de técnicas de muestreo es el más aconsejable, aunque en ocasiones no es posible optar por él.
Muestreo estratificado: Consiste en la división previa de la población de estudio en grupos o clases que se suponen homogéneos respecto a característica a estudiar. A cada uno de estos estratos se le asignaría una cuota que determinaría el número de miembros del mismo que compondrán la muestra.
Muestreo sistemático: Es la elección de una muestra a partir de los elementos de una lista según un orden determinado, o recorriendo la lista a partir de un número aleatorio determinado.
Muestreo por conglomerados: Cuando la población se encuentra dividida, de manera natural, en grupos que se suponen que contienen toda la variabilidad de la población, es decir, la representan fielmente respecto a la característica a elegir, pueden seleccionarse sólo algunos de estos grupos o conglomerados para la realización del estudio.
Muestreo errático: También se llama sin norma. La muestra se realiza de cualquier forma, valorando únicamente la comodidad o la oportunidad en términos de costes, tiempo u otro factor no estadístico.
Al realizar un muestreo en una población podemos hablar de muestreos probabilísticas y no probabilísticas, entre estas técnicas o procedimientos están:
Muestreo simple: Este tipo de muestreo toma solamente una muestra de una población dada para el propósito de inferencia estadística. Puesto que solamente una muestra es tomada, el tamaño de muestra debe ser los suficientemente grandes para extraer una conclusión. Una muestra grande muchas veces cuesta demasiado dinero y tiempo.
Muestreo aleatorio simple: Es aquel en que cada elemento de la población tiene la misma probabilidad de ser seleccionado para integrar la muestra. Una muestra simple aleatoria es aquella en que sus elementos son seleccionados mediante el muestreo aleatorio simple.
Estadistica inferencial
Estadística inferencial
La inferencia estadística es una parte de la Estadística que comprende los métodos y procedimientos para deducir propiedades (hacer inferencias) de una población, a partir de una pequeña parte de la misma (muestra).
La bondad de estas deducciones se mide en términos probabilísticos, es decir, toda inferencia se acompaña de su probabilidad de acierto.
La estadística inferencial comprende:
La Teoría de muestras.
La estimación de parámetros.
El Contraste de hipótesis.
El Diseño experimental.
La Inferencia bayesiana.
Método
Un estudio estadístico comprende los siguientes pasos:
Planteamiento del problema [editar]Suele iniciarse con una fijación de objetivos o algunas preguntas como ¿cuál será la media de esta población respecto a tal característica?, ¿se parecen estas dos poblaciones?, ¿hay alguna relación entre... ?
En el planteamiento se definen con precisión la población, la característica a estudiar, las variables, etcétera.
Se analizan también en este punto los medios de los que se dispone y el procedimiento a seguir.
Elaboración de un modelo
Se establece un modelo teórico de comportamiento de la variable de estudio. En ocasiones no es posible diseñar el modelo hasta realizar un estudio previo.
Los posibles modelos son distribuciones de probabilidad.
Extracción de la muestra
Se usa alguna técnica de muestreo o un diseño experimental para obtener información de una pequeña parte de la población.
Tratamiento de los datos
En esta fase se eliminan posibles errores, se depura la muestra, se tabulan los datos y se calculan los valores que serán necesarios en pasos posteriores, como la media muestral, la varianza muestral
Los métodos de esta etapa están definidos por la estadística descriptiva.
Estimación de los parámetros
Con determinadas técnicas se realiza una predicción sobre cuáles podrían ser los parámetros de la población.
Contraste de hipótesis
Artículo principal: contraste de hipótesis
Los constrastes de hipótesis son técnicas que permiten simplificar el modelo matemático bajo análisis. Frecuentemente el contraste de hipótesis recurre al uso de estadísticos muestrales.
Conclusiones
Se critica el modelo y se hace un balance. Las conclusiones obtenidas en este punto pueden servir para tomar decisiones o hacer predicciones.
El estudio puede comenzar de nuevo a partir de este momento, en un proceso cíclico que permite conocer cada vez mejor la población y características de estudio.
La inferencia estadística es una parte de la Estadística que comprende los métodos y procedimientos para deducir propiedades (hacer inferencias) de una población, a partir de una pequeña parte de la misma (muestra).
La bondad de estas deducciones se mide en términos probabilísticos, es decir, toda inferencia se acompaña de su probabilidad de acierto.
La estadística inferencial comprende:
La Teoría de muestras.
La estimación de parámetros.
El Contraste de hipótesis.
El Diseño experimental.
La Inferencia bayesiana.
Método
Un estudio estadístico comprende los siguientes pasos:
Planteamiento del problema [editar]Suele iniciarse con una fijación de objetivos o algunas preguntas como ¿cuál será la media de esta población respecto a tal característica?, ¿se parecen estas dos poblaciones?, ¿hay alguna relación entre... ?
En el planteamiento se definen con precisión la población, la característica a estudiar, las variables, etcétera.
Se analizan también en este punto los medios de los que se dispone y el procedimiento a seguir.
Elaboración de un modelo
Se establece un modelo teórico de comportamiento de la variable de estudio. En ocasiones no es posible diseñar el modelo hasta realizar un estudio previo.
Los posibles modelos son distribuciones de probabilidad.
Extracción de la muestra
Se usa alguna técnica de muestreo o un diseño experimental para obtener información de una pequeña parte de la población.
Tratamiento de los datos
En esta fase se eliminan posibles errores, se depura la muestra, se tabulan los datos y se calculan los valores que serán necesarios en pasos posteriores, como la media muestral, la varianza muestral
Los métodos de esta etapa están definidos por la estadística descriptiva.
Estimación de los parámetros
Con determinadas técnicas se realiza una predicción sobre cuáles podrían ser los parámetros de la población.
Contraste de hipótesis
Artículo principal: contraste de hipótesis
Los constrastes de hipótesis son técnicas que permiten simplificar el modelo matemático bajo análisis. Frecuentemente el contraste de hipótesis recurre al uso de estadísticos muestrales.
Conclusiones
Se critica el modelo y se hace un balance. Las conclusiones obtenidas en este punto pueden servir para tomar decisiones o hacer predicciones.
El estudio puede comenzar de nuevo a partir de este momento, en un proceso cíclico que permite conocer cada vez mejor la población y características de estudio.
Distribucion t
En probabilidad y estadística, la distribución-t o distribución t de Student es una distribución de probabilidad que surge del problema de estimar la media de una población normalmente distribuida cuando el tamaño de la muestra es pequeño. Ésta es la base del popular test de la t de Student para la determinación de las diferencias entre dos medias muestrales y para la construcción del intervalo de confianza para la diferencia entre las medias de dos poblaciones.
La distribución t surge, en la mayoría de los estudios estadísticos prácticos, cuando la desviación típica de una población se desconoce y debe ser estimada a partir de los datos de una muestra.
Aparición y especificaciones de la distribución t de Student [editar]Supongamos que X1,..., Xn son variables aleatorias independientes distribuidas normalmente, con media μ y varianza σ2. Sea
la media muestral y
la varianza muestral. Entonces, está demostrado que
tiende a la distribución normal de media 0 y varianza 1 cuando n tiende a infinito.
Gosset estudió una expresión relacionada,
y mostró que T tiene la siguiente función de densidad:
Con ν igual a n − 1.
La distribución de T se llama ahora la distribución-t.
El parámetro ν se llama convencionalmente el número de grados de libertad. La distribución depende de ν , pero no de μ o σ; la independencia de μ y σ es lo que hace a la distribución t tan importante en la teoría y en la práctica. Γ es la función gamma.
Grados De Libertad (gl): Número de observaciones que se utilizaron para calcular la desviación estándar muestral menos 1, es decir (n-1).
Intervalos de confianza derivados de la distribución t de Student [editar]El procedimiento para el cálculo del intervalo de confianza basado en la t de Student consiste en estimar la desviación típica de los datos S y calcular el error estándar de la media= S/(raíz cuadrada de n), siendo entonces el intervalo de confianza para la media = x media +- t (alfa/2) multiplicado por (S/(raíz cuadradada de n)). fuente: www.seh-lelha.org/stat1.htm
Es este resultado el que se utiliza en el test de Student: puesto que la diferencia de las medias de muestras de dos distribuciones normales se distribuye también normalmente, la distribución t puede usarse para examinar si esa diferencia puede razonablemente suponerse igual a cero.
para efectos practicos el valor esperado y la varianza son :
E(t(n))= 0 y Var (t(n)) = n/(n-2) para n > 2
Distribución t de Student Función de densidad de probabilidad
Función de distribución de probabilidad
Parámetros grados de libertad (real)
Dominio
Función de densidad (pdf)
Distribución de probabilidad (cdf) donde es la función hipergeométrica
Media 0 para ν > 1, indefinida para otros valores
Mediana 0
Moda 0
Varianza para ν > 2, indefinida para otros valores
Coeficiente de simetría 0 para ν > 3
Curtosis para ν > 4,
Entropía
ψ: función digamma,
B: función beta
Función generadora de momentos (mgf) (No definida)
Función característica
La distribución t surge, en la mayoría de los estudios estadísticos prácticos, cuando la desviación típica de una población se desconoce y debe ser estimada a partir de los datos de una muestra.
Aparición y especificaciones de la distribución t de Student [editar]Supongamos que X1,..., Xn son variables aleatorias independientes distribuidas normalmente, con media μ y varianza σ2. Sea
la media muestral y
la varianza muestral. Entonces, está demostrado que
tiende a la distribución normal de media 0 y varianza 1 cuando n tiende a infinito.
Gosset estudió una expresión relacionada,
y mostró que T tiene la siguiente función de densidad:
Con ν igual a n − 1.
La distribución de T se llama ahora la distribución-t.
El parámetro ν se llama convencionalmente el número de grados de libertad. La distribución depende de ν , pero no de μ o σ; la independencia de μ y σ es lo que hace a la distribución t tan importante en la teoría y en la práctica. Γ es la función gamma.
Grados De Libertad (gl): Número de observaciones que se utilizaron para calcular la desviación estándar muestral menos 1, es decir (n-1).
Intervalos de confianza derivados de la distribución t de Student [editar]El procedimiento para el cálculo del intervalo de confianza basado en la t de Student consiste en estimar la desviación típica de los datos S y calcular el error estándar de la media= S/(raíz cuadrada de n), siendo entonces el intervalo de confianza para la media = x media +- t (alfa/2) multiplicado por (S/(raíz cuadradada de n)). fuente: www.seh-lelha.org/stat1.htm
Es este resultado el que se utiliza en el test de Student: puesto que la diferencia de las medias de muestras de dos distribuciones normales se distribuye también normalmente, la distribución t puede usarse para examinar si esa diferencia puede razonablemente suponerse igual a cero.
para efectos practicos el valor esperado y la varianza son :
E(t(n))= 0 y Var (t(n)) = n/(n-2) para n > 2
Distribución t de Student Función de densidad de probabilidad
Función de distribución de probabilidad
Parámetros grados de libertad (real)
Dominio
Función de densidad (pdf)
Distribución de probabilidad (cdf) donde es la función hipergeométrica
Media 0 para ν > 1, indefinida para otros valores
Mediana 0
Moda 0
Varianza para ν > 2, indefinida para otros valores
Coeficiente de simetría 0 para ν > 3
Curtosis para ν > 4,
Entropía
ψ: función digamma,
B: función beta
Función generadora de momentos (mgf) (No definida)
Función característica
Distribucion Normal
Distribución normal
Distribución normal Función de densidad de probabilidad
La línea verde corresponde a la distribución normal estandar
Función de distribución de probabilidad
Parámetros
Dominio
Función de densidad (pdf)
Distribución de probabilidad (cdf)
Media
Mediana
Moda
Varianza
Coeficiente de simetría 0
Curtosis 0
Entropía
Función generadora de momentos (mgf)
Función característica
La distribución normal, también llamada distribución de Gauss o distribución gaussiana, es la distribución de probabilidad que con más frecuencia aparece en estadística y teoría de probabilidades. Esto se debe a dos razones fundamentalmente:
Su función de densidad es simétrica y con forma de campana, lo que favorece su aplicación como modelo a gran número de variables estadísticas.
Es, además, límite de otras distribuciones y aparece relacionada con multitud de resultados ligados a la teoría de las probabilidades gracias a sus propiedades matemáticas.
La función de densidad está dada por:
donde (mu) es la media y (sigma) es la desviación estándar ( es la varianza).
Muchas variables aleatorias continuas presentan una función de densidad cuya gráfica tiene forma de campana.
La importancia de la distribución normal se debe principalmente a que hay muchas variables asociadas a fenómenos naturales que siguen el modelo de la normal:
Caracteres morfológicos de individuos
Caracteres fisiológicos como el efecto de un fármaco
Caracteres sociológicos como el consumo de cierto producto por un mismo grupo de individuos
Caracteres psicológicos como el cociente intelectual
Nivel de ruido en Telecomunicaciones
Errores cometidos al medir ciertas magnitudes
Valores estadísticos muestrales como la media
Contenido [ocultar]
1 Distribución normal estándar. Estandarización
2 Uso de tablas
3 Véase también
4 Enlaces externos
Distribución normal estándar. Estandarización
Cuando y , la distribución se conoce con el nombre de normal estándar.
Dada una variable aleatoria normal X, con media (también llamada Esperanza matemática) y desviación típica , si definimos otra variable aleatoria entonces la variable aleatoria Z tendrá una distribución de porcentaje altamente normal aunque algunas veces muy estándar y a la vez pequeña y . Se dice que se ha tipificado o estandarizado la variable X.
Uso de tablas
La probabilidad de que una variable aleatoria (que sigue una distribución normal) se encuentre entre dos valores determinados será en general difícil de calcular (hay que usar la integral de la función de probabilidad). Para ello, existen tablas de distribución normal tipificada, si bien éstas se calculan para la distribución Normal Tipificada.
Básicamente, se busca un valor de x (por ejemplo, ), y la tabla nos da la probabilidad de que :
En el caso de que la distribución no sea estándar, por ejemplo, con y , tendremos que tipificar la variable:
Se obtiene una variable Z normal, que además está tipificada. Si ahora se consulta en la tabla,
Distribución normal Función de densidad de probabilidad
La línea verde corresponde a la distribución normal estandar
Función de distribución de probabilidad
Parámetros
Dominio
Función de densidad (pdf)
Distribución de probabilidad (cdf)
Media
Mediana
Moda
Varianza
Coeficiente de simetría 0
Curtosis 0
Entropía
Función generadora de momentos (mgf)
Función característica
La distribución normal, también llamada distribución de Gauss o distribución gaussiana, es la distribución de probabilidad que con más frecuencia aparece en estadística y teoría de probabilidades. Esto se debe a dos razones fundamentalmente:
Su función de densidad es simétrica y con forma de campana, lo que favorece su aplicación como modelo a gran número de variables estadísticas.
Es, además, límite de otras distribuciones y aparece relacionada con multitud de resultados ligados a la teoría de las probabilidades gracias a sus propiedades matemáticas.
La función de densidad está dada por:
donde (mu) es la media y (sigma) es la desviación estándar ( es la varianza).
Muchas variables aleatorias continuas presentan una función de densidad cuya gráfica tiene forma de campana.
La importancia de la distribución normal se debe principalmente a que hay muchas variables asociadas a fenómenos naturales que siguen el modelo de la normal:
Caracteres morfológicos de individuos
Caracteres fisiológicos como el efecto de un fármaco
Caracteres sociológicos como el consumo de cierto producto por un mismo grupo de individuos
Caracteres psicológicos como el cociente intelectual
Nivel de ruido en Telecomunicaciones
Errores cometidos al medir ciertas magnitudes
Valores estadísticos muestrales como la media
Contenido [ocultar]
1 Distribución normal estándar. Estandarización
2 Uso de tablas
3 Véase también
4 Enlaces externos
Distribución normal estándar. Estandarización
Cuando y , la distribución se conoce con el nombre de normal estándar.
Dada una variable aleatoria normal X, con media (también llamada Esperanza matemática) y desviación típica , si definimos otra variable aleatoria entonces la variable aleatoria Z tendrá una distribución de porcentaje altamente normal aunque algunas veces muy estándar y a la vez pequeña y . Se dice que se ha tipificado o estandarizado la variable X.
Uso de tablas
La probabilidad de que una variable aleatoria (que sigue una distribución normal) se encuentre entre dos valores determinados será en general difícil de calcular (hay que usar la integral de la función de probabilidad). Para ello, existen tablas de distribución normal tipificada, si bien éstas se calculan para la distribución Normal Tipificada.
Básicamente, se busca un valor de x (por ejemplo, ), y la tabla nos da la probabilidad de que :
En el caso de que la distribución no sea estándar, por ejemplo, con y , tendremos que tipificar la variable:
Se obtiene una variable Z normal, que además está tipificada. Si ahora se consulta en la tabla,
Distribución de probabilidad continua
Características:
Es generada por una variable continua (x).
x® Es una variable que puede tomar tanto valores enteros como fraccionarios.
x® 1.0, 3.7, 4.0, 4.6, 7.9, 8.0, 8.3, 11.5, .....,¥
f(x)³ 0 Las probabilidades asociadas a cada uno de los valores que toma x deben ser mayores o iguales a cero. Dicho de otra forma, la función de densidad de probabilidad deberá tomar solo valores mayores o iguales a cero. La función de densidad de probabilidad sólo puede estar definida en los cuadrantes I y II.
La sumatoria de las probabilidades asociadas a cada uno de los valores que toma x debe ser igual a 1. El área definida bajo la función de densidad de probabilidad deberá ser de 1.
Hasta el momento se han considerado las distribuciones de probabilidad para variables discretas, donde se podía asignar el valor que toma la función de probabilidad cuando la variable aleatoria tomaba un valor en concreto. Sin embargo, al considerar las variables continuas se encuentra uno el problema de que, lo más probable, los datos que se puedan recabar no sean completamente exactos, o dos o más de ellos no coincidan, por lo que se tienen que trabajar en intervalos y, en ese momento, modelar una función se convierte en un problema serio.
Sin embargo, se pueden realizar aproximaciones y describir la probabilidad a través de modelos teóricos de probabilidad cuya gráfica es una línea continua, a diferencia de las variables discretas que le corresponde un histograma.
Para clarificar cómo se realiza esta aproximación al modelo teórico consideremos el siguiente caso:
Se han registrado los tiempos que le tomó a una empresa de mensajería entregar 190 paquetes con destinatarios diferentes dentro de una misma ciudad. Los datos se han agrupado en una distribución de frecuencias considerando intervalos de cinco días como sigue:
Tiempo de entrega
(días)
No. de
paquetes
[0,5)
115
[5,10)
31
[10,15)
17
[15,20)
12
[20,25)
10
[25,30)
5
Supongamos que un posible cliente, conociendo esta información, quisiera saber qué probabilidad tiene de que su paquete sea entregado en dos días. El problema es que al manejar intervalos de cinco días estamos suponiendo que dentro de cada intervalo los datos se distribuyen uniformemente, cosa que no es real.
Podríamos aumentar la muestra y seguir recogiendo información para hacer una distribución de frecuencias similar a la anterior, pero se tendría el mismo problema: dentro de cada intervalo se está presuponiendo que los datos se distribuyen uniformemente.
Otra posible solución es reducir la amplitud de los intervalos, de tal suerte que podríamos tomar una amplitud de tres días por intervalo y hacer la siguiente distribución de frecuencias:
Tiempo de entrega
(días)
No. de
paquetes
(frec.)
[0,3)
93
[3,6)
30
[6,9)
18
[9,12)
13
[12,15)
9
[15,18)
8
[18,21)
6
[21,24)
6
[24,27)
4
[27,30)
3
Al seguir reduciendo la amplitud a dos días se obtiene la distribución:
Tiempo de entrega
(días)
No. de
paquetes
(frec.)
[0,2)
76
[2,4)
29
[4,6)
18
[6,8)
13
[8,10)
10
[10,12)
8
[12,14)
6
[14,16)
6
[16,18)
5
[18,20)
4
[20,22)
4
[22,24)
4
[24,26)
3
[26,28)
2
[28,30)
2
Y al reducirla a intervalos de un día se tiene la distribución:
Tiempo de entrega
(días)
No. de
paquetes
(frec.)
[0,1)
51
[1,2)
25
[2,3)
17
[3,4)
12
[4,5)
10
[5,6)
8
[6,7)
7
[7,8)
6
[8,9)
5
[9,10)
5
[10,11)
4
[11,12)
4
[12,13)
3
[13,14)
3
[14,15)
3
[15,16)
3
[16,17)
3
[17,18)
2
[18,19)
2
[19,20)
2
[20,21)
2
[21,22)
2
[22,23)
2
[23,24)
2
[24,25)
2
[25,26)
1
[26,27)
1
[27,28)
1
[28,29)
1
[29,30)
1
Ahora, veamos. Lo que le interesa al futuro cliente es la probabilidad de que se haga una entrega en un cierto tiempo, por lo que habría que considerar las frecuencias relativas y, como antes, reducir la amplitud de los intervalos. Con esto se obtendrían las siguientes distribuciones de frecuencias:
Intervalos de dos días
Intervalos de un día
Y podríamos graficar tal información en histogramas para poder ver cómo se aproximan, si es que ocurre, los valores a una curva continua:
donde las barras rosas (y la línea roja) corresponden a los intervalos de cinco días; las barras y línea azules, a los intervalos de tres días; las barras y línea amarillas, a los intervalos de dos días; y las barras y líneas verdes, a los intervalos de un día.
Se han incluido de una vez las líneas que unen los puntos medios de las barras del histograma porque se puede ver que las barras de las frecuencias relativas se "achaparran" y las líneas graficadas están tan separadas del lado izquierdo (en este caso) que no se puede hablar de una aproximación continua a una sóla línea.
Una posible solución es utilizando la densidad del intervalo, que se va a definir como el cociente de la frecuencia relativa entre la amplitud del intervalo:
(De hecho, existe la función de densidad de una distribución de probabilidad, de donde se deriva esta definición de densidad del intervalo.)
De esta manera, a las distribuciones de frecuencias anteriores se les puede añadir la columna correspondiente a la densidad:
Intervalos de cinco días
Intervalo
frec.
frec. rel.
densidad
[0,5)
115
0.605
0.121
[5,10)
31
0.163
0.033
[10,15)
17
0.089
0.018
[15,20)
12
0.063
0.013
[20,25)
10
0.053
0.011
[25,30)
5
0.026
0.005
Intervalos de tres días
Intervalo
frec.
frec. rel.
densidad
[0,3)
93
0.489
0.163
[3,6)
30
0.158
0.053
[6,9)
18
0.095
0.032
[9,12)
13
0.068
0.023
[12,15)
9
0.047
0.016
[15,18)
8
0.042
0.014
[18,21)
6
0.032
0.011
[21,24)
6
0.032
0.011
[24,27)
4
0.021
0.007
[27,30)
3
0.016
0.005
Intervalos de dos días
Intervalos de un día
Intervalo
frec.
frec. rel.
densidad
[20,21)
2
0.011
0.011
[21,22)
2
0.011
0.011
[22,23)
2
0.011
0.011
[23,24)
2
0.011
0.011
[24,25)
2
0.011
0.011
[25,26)
1
0.005
0.005
[26,27)
1
0.005
0.005
[27,28)
1
0.005
0.005
[28,29)
1
0.005
0.005
[29,30)
1
0.005
0.005
y realizar los histogramas correspondientes, que quedan como sigue:
donde las barras rosas, y la línea roja, corresponden a los intervalos de cinco días; las barras y línea verdes, a los intervalos de tres días; las barra y línea amarillas, a los intervalos de dos días; y las barras y línea azules, a los intervalos de un día.
Igual que en el caso anterior, se han graficado simultáneamente las barras y las líneas que unen los puntos medios de éstas para observar que con la densidad sí se aproximan los histogramas a una línea continua (que la mejor aproximación presentada es la línea azul) cuando los intervalos se reducen continuamente.
El resultado es una línea continua que es la gráfica de una cierta función denominada función de densidad de la distribución probabilística.
Ahora, considerando la manera en que se definió la densidad de un intervalo como:
y recordando que la frecuencia relativa es la probabilidad de un evento (en el ejemplo de la mensajería sería la probabilidad de entregar un paquete dentro de un intervalo dado de tiempo):
Entonces, despejando en el primer cociente la frecuencia relativa e igualando con esta segunda expresión obtenemos que
probabilidad del evento = (densidad del intervalo)· (amplitud del intervalo)
Es decir, que la probabilidad de que ocurra un evento corresponde al área de las barras del histograma hecho tomando en cuenta la densidad de los intervalos; y que cuando tales intervalos tienen una amplitud que tiende a cero, y la gráfica se convierte en la curva continua de la función de densidad, entonces la probabillidad de que un evento ocurra en un intervalo (a,b) es el área bajo la curva de la función en ese intervalo:
y, por tanto, el cálculo de tal probabilidad se realiza utilizando cálculo integral:
donde f(x) es la función de densidad de la distribución probabilística correspondiente.
Hay que estar conscientes de que en el caso de las variables continuas sólo se puede calcular la probabilidad de que un evento caiga dentro de un intervalo, debido a que la exactitud de los instrumentos de medición siempre es relativa y muy lejana a la "exactitud" de los cálculos matemáticos.
Por esto, la probabilidad de que la variable aleatoria tome un valor exacto es nula:
Esto se puede explicar de la siguiente manera: si, como ya dijimos, la probabilidad (frecuencia relativa) es igual a la densidad del intervalo por la amplitud del intervalo, entonces no importa qué tan grande sea la densidad de tal intervalo porque, como ya también se dijo, por ser variable continua la amplitud del intervalo tiende a cero y, por tanto, la probabilidad es igual a cero.
Modelos de distribución de probabilidad de variables continuas
Al igual que en el caso de las distribuciones de probabilidad de variables discreta, en el caso de las distribuciones de probabilidad de variables continuas se tienen varios modelos teóricos que en seguida presentamos.
A la derecha de cada modelo aparece la función de densidad correspondiente a cada modelo.
Uniforme. Es la distribución en donde todos los eventos tienen la misma probabilidad.
Exponencial. Se utiliza para estudiar el tiempo entre dos sucesos. La función de Excel que le corresponde es DISTR.EXP.
Beta. Sirve para el estudio de variaciones, a través de varias muestras, de un porcentaje que representa algún fenómeno. La función DISTR.BETA del Excel sirve para obtener sus valores; y la función DISTR.BETA.INV proporciona los valores inversos de la función, es decir, se utiliza como parámetro la imagen de la función y regresa la variabla independiente.
Gamma. Se utiliza para estudiar variables cuya distribución puede ser asimétrica. La función de Excel que le corresponde es DISTR.GAMMA; y la función DISTR.GAMMA.INV es la inversa de la anterior.
ji cuadrada (c²). Es una distribución asociada a la prueba c², y se usa para comparar los valores observados con los esperados. La función DISTR.CHI de Excel sirve para este
Normal. Es la distribución más utilizada porque la mayoría de las variables utilizadas en fenómenos sociales se distribuyen aproximadamente siguiendo este modelo. Es la que tocaremos a continuación y se le llama comúnmente distribución normal.
Cálculo de media y desviación estándar para una distribución continua
Media o valor esperado de x.- Para calcular la media de una distribución de probabilidad continua se utiliza la siguiente fórmula:
Donde:
m = E(x) = media o valor esperado de la distribución
x = variable aleatoria continua
f(x) = función de densidad de la distribución de probabilidad
Desviación estándar.- La fórmula para determinar la desviación estándar de una distribución continua es;
luego:
Ejemplo:
Para la siguiente función,
cuando 0£ x £ 3, f(x) = 0 para cualquier otro valor
Diga si esta función nos define una distribución de probabilidad.
Si la función define una distribución de probabilidad, entonces, determine su media y desviación estándar.
Determine la probabilidad de que 1£ x < 2.
Solución:
Para verificar que la función nos define una distribución de probabilidad, es necesario que cumpla con las características que se habían mencionado.
x ® sí es una variable continua porque puede tomar cualquier valor entre 0 y 3
f(x)³ 0, lo que se comprueba si damos diferentes valores a x para ver que valores toma f(x), dándonos cuenta de que efectivamente f(x) solo toma valores mayores o iguales a cero.
x
f(x)
0
0.0
0.5
0.02778
1.0
0.11111
1.4
0.21778
2.1
0.49
2.7
0.81
3.0
1.0
Para comprobar que la sumatoria de las probabilidades que toma cada valor de x es de 1, se integra la función de 0 a 3 como se muestra a continuación:
A= área bajo la función
Con las operaciones anteriores comprobamos que la función sí nos define una distribución de probabilidad continua.
Cálculo de media y desviación estándar.
Las barras nos indican la evaluación de la integral entre 0 y 3.
c)
La barra nos indica la evaluación de la integral de 1 a 2.
Con las operaciones anteriores nos damos cuenta que para evaluar probabilidades para variables de tipo continuo, es necesario evaluar la función de densidad de probabilidad en el rango de valores que se desea; que vendría siendo el área que se encuentra entre f(x) y el eje de las x y entre el rango de valores definidos por la variable x.
Suponga que el error en la temperatura de reacción, en oC, para un experimento controlado de laboratorio es una variable aleatoria continua x, que tiene la función de densidad de probabilidad:
, para -1< x < 2 y f(x)= 0 en cualquier otro caso
Verifique la tercera condición de la definición de una distribución de probabilidad continua.
Determine la media o valor esperado de la distribución de probabilidad.
Encuentre la probabilidad de que 0< x £ 1.
Solución:
Como la tercera condición es que la sumatoria de las probabilidades asociadas a cada uno de los valores que toma x debe de ser 1, esto se comprueba de la siguiente manera:
Es generada por una variable continua (x).
x® Es una variable que puede tomar tanto valores enteros como fraccionarios.
x® 1.0, 3.7, 4.0, 4.6, 7.9, 8.0, 8.3, 11.5, .....,¥
f(x)³ 0 Las probabilidades asociadas a cada uno de los valores que toma x deben ser mayores o iguales a cero. Dicho de otra forma, la función de densidad de probabilidad deberá tomar solo valores mayores o iguales a cero. La función de densidad de probabilidad sólo puede estar definida en los cuadrantes I y II.
La sumatoria de las probabilidades asociadas a cada uno de los valores que toma x debe ser igual a 1. El área definida bajo la función de densidad de probabilidad deberá ser de 1.
Hasta el momento se han considerado las distribuciones de probabilidad para variables discretas, donde se podía asignar el valor que toma la función de probabilidad cuando la variable aleatoria tomaba un valor en concreto. Sin embargo, al considerar las variables continuas se encuentra uno el problema de que, lo más probable, los datos que se puedan recabar no sean completamente exactos, o dos o más de ellos no coincidan, por lo que se tienen que trabajar en intervalos y, en ese momento, modelar una función se convierte en un problema serio.
Sin embargo, se pueden realizar aproximaciones y describir la probabilidad a través de modelos teóricos de probabilidad cuya gráfica es una línea continua, a diferencia de las variables discretas que le corresponde un histograma.
Para clarificar cómo se realiza esta aproximación al modelo teórico consideremos el siguiente caso:
Se han registrado los tiempos que le tomó a una empresa de mensajería entregar 190 paquetes con destinatarios diferentes dentro de una misma ciudad. Los datos se han agrupado en una distribución de frecuencias considerando intervalos de cinco días como sigue:
Tiempo de entrega
(días)
No. de
paquetes
[0,5)
115
[5,10)
31
[10,15)
17
[15,20)
12
[20,25)
10
[25,30)
5
Supongamos que un posible cliente, conociendo esta información, quisiera saber qué probabilidad tiene de que su paquete sea entregado en dos días. El problema es que al manejar intervalos de cinco días estamos suponiendo que dentro de cada intervalo los datos se distribuyen uniformemente, cosa que no es real.
Podríamos aumentar la muestra y seguir recogiendo información para hacer una distribución de frecuencias similar a la anterior, pero se tendría el mismo problema: dentro de cada intervalo se está presuponiendo que los datos se distribuyen uniformemente.
Otra posible solución es reducir la amplitud de los intervalos, de tal suerte que podríamos tomar una amplitud de tres días por intervalo y hacer la siguiente distribución de frecuencias:
Tiempo de entrega
(días)
No. de
paquetes
(frec.)
[0,3)
93
[3,6)
30
[6,9)
18
[9,12)
13
[12,15)
9
[15,18)
8
[18,21)
6
[21,24)
6
[24,27)
4
[27,30)
3
Al seguir reduciendo la amplitud a dos días se obtiene la distribución:
Tiempo de entrega
(días)
No. de
paquetes
(frec.)
[0,2)
76
[2,4)
29
[4,6)
18
[6,8)
13
[8,10)
10
[10,12)
8
[12,14)
6
[14,16)
6
[16,18)
5
[18,20)
4
[20,22)
4
[22,24)
4
[24,26)
3
[26,28)
2
[28,30)
2
Y al reducirla a intervalos de un día se tiene la distribución:
Tiempo de entrega
(días)
No. de
paquetes
(frec.)
[0,1)
51
[1,2)
25
[2,3)
17
[3,4)
12
[4,5)
10
[5,6)
8
[6,7)
7
[7,8)
6
[8,9)
5
[9,10)
5
[10,11)
4
[11,12)
4
[12,13)
3
[13,14)
3
[14,15)
3
[15,16)
3
[16,17)
3
[17,18)
2
[18,19)
2
[19,20)
2
[20,21)
2
[21,22)
2
[22,23)
2
[23,24)
2
[24,25)
2
[25,26)
1
[26,27)
1
[27,28)
1
[28,29)
1
[29,30)
1
Ahora, veamos. Lo que le interesa al futuro cliente es la probabilidad de que se haga una entrega en un cierto tiempo, por lo que habría que considerar las frecuencias relativas y, como antes, reducir la amplitud de los intervalos. Con esto se obtendrían las siguientes distribuciones de frecuencias:
Intervalos de dos días
Intervalos de un día
Y podríamos graficar tal información en histogramas para poder ver cómo se aproximan, si es que ocurre, los valores a una curva continua:
donde las barras rosas (y la línea roja) corresponden a los intervalos de cinco días; las barras y línea azules, a los intervalos de tres días; las barras y línea amarillas, a los intervalos de dos días; y las barras y líneas verdes, a los intervalos de un día.
Se han incluido de una vez las líneas que unen los puntos medios de las barras del histograma porque se puede ver que las barras de las frecuencias relativas se "achaparran" y las líneas graficadas están tan separadas del lado izquierdo (en este caso) que no se puede hablar de una aproximación continua a una sóla línea.
Una posible solución es utilizando la densidad del intervalo, que se va a definir como el cociente de la frecuencia relativa entre la amplitud del intervalo:
(De hecho, existe la función de densidad de una distribución de probabilidad, de donde se deriva esta definición de densidad del intervalo.)
De esta manera, a las distribuciones de frecuencias anteriores se les puede añadir la columna correspondiente a la densidad:
Intervalos de cinco días
Intervalo
frec.
frec. rel.
densidad
[0,5)
115
0.605
0.121
[5,10)
31
0.163
0.033
[10,15)
17
0.089
0.018
[15,20)
12
0.063
0.013
[20,25)
10
0.053
0.011
[25,30)
5
0.026
0.005
Intervalos de tres días
Intervalo
frec.
frec. rel.
densidad
[0,3)
93
0.489
0.163
[3,6)
30
0.158
0.053
[6,9)
18
0.095
0.032
[9,12)
13
0.068
0.023
[12,15)
9
0.047
0.016
[15,18)
8
0.042
0.014
[18,21)
6
0.032
0.011
[21,24)
6
0.032
0.011
[24,27)
4
0.021
0.007
[27,30)
3
0.016
0.005
Intervalos de dos días
Intervalos de un día
Intervalo
frec.
frec. rel.
densidad
[20,21)
2
0.011
0.011
[21,22)
2
0.011
0.011
[22,23)
2
0.011
0.011
[23,24)
2
0.011
0.011
[24,25)
2
0.011
0.011
[25,26)
1
0.005
0.005
[26,27)
1
0.005
0.005
[27,28)
1
0.005
0.005
[28,29)
1
0.005
0.005
[29,30)
1
0.005
0.005
y realizar los histogramas correspondientes, que quedan como sigue:
donde las barras rosas, y la línea roja, corresponden a los intervalos de cinco días; las barras y línea verdes, a los intervalos de tres días; las barra y línea amarillas, a los intervalos de dos días; y las barras y línea azules, a los intervalos de un día.
Igual que en el caso anterior, se han graficado simultáneamente las barras y las líneas que unen los puntos medios de éstas para observar que con la densidad sí se aproximan los histogramas a una línea continua (que la mejor aproximación presentada es la línea azul) cuando los intervalos se reducen continuamente.
El resultado es una línea continua que es la gráfica de una cierta función denominada función de densidad de la distribución probabilística.
Ahora, considerando la manera en que se definió la densidad de un intervalo como:
y recordando que la frecuencia relativa es la probabilidad de un evento (en el ejemplo de la mensajería sería la probabilidad de entregar un paquete dentro de un intervalo dado de tiempo):
Entonces, despejando en el primer cociente la frecuencia relativa e igualando con esta segunda expresión obtenemos que
probabilidad del evento = (densidad del intervalo)· (amplitud del intervalo)
Es decir, que la probabilidad de que ocurra un evento corresponde al área de las barras del histograma hecho tomando en cuenta la densidad de los intervalos; y que cuando tales intervalos tienen una amplitud que tiende a cero, y la gráfica se convierte en la curva continua de la función de densidad, entonces la probabillidad de que un evento ocurra en un intervalo (a,b) es el área bajo la curva de la función en ese intervalo:
y, por tanto, el cálculo de tal probabilidad se realiza utilizando cálculo integral:
donde f(x) es la función de densidad de la distribución probabilística correspondiente.
Hay que estar conscientes de que en el caso de las variables continuas sólo se puede calcular la probabilidad de que un evento caiga dentro de un intervalo, debido a que la exactitud de los instrumentos de medición siempre es relativa y muy lejana a la "exactitud" de los cálculos matemáticos.
Por esto, la probabilidad de que la variable aleatoria tome un valor exacto es nula:
Esto se puede explicar de la siguiente manera: si, como ya dijimos, la probabilidad (frecuencia relativa) es igual a la densidad del intervalo por la amplitud del intervalo, entonces no importa qué tan grande sea la densidad de tal intervalo porque, como ya también se dijo, por ser variable continua la amplitud del intervalo tiende a cero y, por tanto, la probabilidad es igual a cero.
Modelos de distribución de probabilidad de variables continuas
Al igual que en el caso de las distribuciones de probabilidad de variables discreta, en el caso de las distribuciones de probabilidad de variables continuas se tienen varios modelos teóricos que en seguida presentamos.
A la derecha de cada modelo aparece la función de densidad correspondiente a cada modelo.
Uniforme. Es la distribución en donde todos los eventos tienen la misma probabilidad.
Exponencial. Se utiliza para estudiar el tiempo entre dos sucesos. La función de Excel que le corresponde es DISTR.EXP.
Beta. Sirve para el estudio de variaciones, a través de varias muestras, de un porcentaje que representa algún fenómeno. La función DISTR.BETA del Excel sirve para obtener sus valores; y la función DISTR.BETA.INV proporciona los valores inversos de la función, es decir, se utiliza como parámetro la imagen de la función y regresa la variabla independiente.
Gamma. Se utiliza para estudiar variables cuya distribución puede ser asimétrica. La función de Excel que le corresponde es DISTR.GAMMA; y la función DISTR.GAMMA.INV es la inversa de la anterior.
ji cuadrada (c²). Es una distribución asociada a la prueba c², y se usa para comparar los valores observados con los esperados. La función DISTR.CHI de Excel sirve para este
Normal. Es la distribución más utilizada porque la mayoría de las variables utilizadas en fenómenos sociales se distribuyen aproximadamente siguiendo este modelo. Es la que tocaremos a continuación y se le llama comúnmente distribución normal.
Cálculo de media y desviación estándar para una distribución continua
Media o valor esperado de x.- Para calcular la media de una distribución de probabilidad continua se utiliza la siguiente fórmula:
Donde:
m = E(x) = media o valor esperado de la distribución
x = variable aleatoria continua
f(x) = función de densidad de la distribución de probabilidad
Desviación estándar.- La fórmula para determinar la desviación estándar de una distribución continua es;
luego:
Ejemplo:
Para la siguiente función,
cuando 0£ x £ 3, f(x) = 0 para cualquier otro valor
Diga si esta función nos define una distribución de probabilidad.
Si la función define una distribución de probabilidad, entonces, determine su media y desviación estándar.
Determine la probabilidad de que 1£ x < 2.
Solución:
Para verificar que la función nos define una distribución de probabilidad, es necesario que cumpla con las características que se habían mencionado.
x ® sí es una variable continua porque puede tomar cualquier valor entre 0 y 3
f(x)³ 0, lo que se comprueba si damos diferentes valores a x para ver que valores toma f(x), dándonos cuenta de que efectivamente f(x) solo toma valores mayores o iguales a cero.
x
f(x)
0
0.0
0.5
0.02778
1.0
0.11111
1.4
0.21778
2.1
0.49
2.7
0.81
3.0
1.0
Para comprobar que la sumatoria de las probabilidades que toma cada valor de x es de 1, se integra la función de 0 a 3 como se muestra a continuación:
A= área bajo la función
Con las operaciones anteriores comprobamos que la función sí nos define una distribución de probabilidad continua.
Cálculo de media y desviación estándar.
Las barras nos indican la evaluación de la integral entre 0 y 3.
c)
La barra nos indica la evaluación de la integral de 1 a 2.
Con las operaciones anteriores nos damos cuenta que para evaluar probabilidades para variables de tipo continuo, es necesario evaluar la función de densidad de probabilidad en el rango de valores que se desea; que vendría siendo el área que se encuentra entre f(x) y el eje de las x y entre el rango de valores definidos por la variable x.
Suponga que el error en la temperatura de reacción, en oC, para un experimento controlado de laboratorio es una variable aleatoria continua x, que tiene la función de densidad de probabilidad:
, para -1< x < 2 y f(x)= 0 en cualquier otro caso
Verifique la tercera condición de la definición de una distribución de probabilidad continua.
Determine la media o valor esperado de la distribución de probabilidad.
Encuentre la probabilidad de que 0< x £ 1.
Solución:
Como la tercera condición es que la sumatoria de las probabilidades asociadas a cada uno de los valores que toma x debe de ser 1, esto se comprueba de la siguiente manera:
Valor Esperado
Valor Esperado
En estadística el valor esperado o esperanza matemática (o simplemente esperanza) de una variable aleatoria es la suma de la probabilidad de cada suceso multiplicado por su valor. Por ejemplo en un juego de azar el valor esperado es el beneficio medio. Si todos los sucesos son de igual probabilidad la esperanza es la media aritmética. Definición Para una variable aleatoria discreta con valores posibles y sus posibilidades representadas por la función de masa p(xi) la esperanza se calcula con
Para una variable aleatoria continua la esperanza se calcula mediante la integral de todos valores y la función de densidad f(x):
Las esperanzas E[Xk] para k = 0,1,2… se llaman momentos de orden k. Más importantes son los momentos centrados E[(X − E[X])k]. No todas las variables aleatorias tienen un valor esperado (por ejemplo la distribución de Cauchy). El valor esperado es una función lineal. Por eso E[aX + b] = aE[X] + b
En estadística el valor esperado o esperanza matemática (o simplemente esperanza) de una variable aleatoria es la suma de la probabilidad de cada suceso multiplicado por su valor. Por ejemplo en un juego de azar el valor esperado es el beneficio medio. Si todos los sucesos son de igual probabilidad la esperanza es la media aritmética. Definición Para una variable aleatoria discreta con valores posibles y sus posibilidades representadas por la función de masa p(xi) la esperanza se calcula con
Para una variable aleatoria continua la esperanza se calcula mediante la integral de todos valores y la función de densidad f(x):
Las esperanzas E[Xk] para k = 0,1,2… se llaman momentos de orden k. Más importantes son los momentos centrados E[(X − E[X])k]. No todas las variables aleatorias tienen un valor esperado (por ejemplo la distribución de Cauchy). El valor esperado es una función lineal. Por eso E[aX + b] = aE[X] + b
Suscribirse a:
Entradas (Atom)
