sábado, 22 de abril de 2017

Tema 8: Medidas de tendencia central, posición y dispersión.

1. Resumen numérico de una Serie Estadística.

Podemos sintetizar una serie de observaciones mediante estadísticos (función de los  datos observados. Hay que tener en cuenta que se imparte sobre cuantitativas continuas.

Existen tres grandes tipos:

       · Medidas de posición: dan idea de la magnitud, tamaño o posición de los datos (ordenados de mayor a menor).

       · Medidas de tendencia variabilidad: dan idea del comportamiento central de los sujetos.

       · Medidas de dispersión o variabilidad: informan sobre la heterogeneidad de los sujetos (diferencias).

2. Medidas de tendencia central.

   ·  Media aritmética (=mediana).

    Es la suma de los valores de la variable entre el total de observaciones. Es utilizada para calcular variables cuantitativas.
Cuando los se encuentra en dos intervalos: se calcula una media aritmética ponderada (suma de la marca de clase por la frecuencia absoluta/n).
·  Mediana.

Medida de posición y central (50% de los datos  menor y otro 50% de los datos mayor)

- Número de observaciones impar: la mediana seria en la posición n+1/2


- Número de observaciones par: la mediana seria la media entre la observación n/2 y la observación (n/2)+1. Ejemplo: cuatro sujetos de edades, 10, 15, 20, 25, cogemos los dos sujetos centrales y hacemos la media aritmética entre ambos.

      · Propiedad.
Se tiene en cuenta la posición de los valores en la muestra.

     · Moda: valor con mayor frecuencia. Muestra Bimodal = dos modas, muestra Multimodal = más de dos modas. Hay que tener en cuenta que la moda no es el número más frecuente si no  la categoría.

3. Medidas de posición o cuantiles.

Se calcula para variables cuantitativas y solo se tiene en cuenta la posición de los valores, ordenados de mayor a menor.
Los cuantiles se dividen en: - Perciles: muestras ordenadas en 100.
                                             - Deciles: muestras ordenadas en 10.
                                       - Cuartiles: muestras ordenadas en 4.

  • Percentiles (Pi): valor que ordena las observaciones  en forma creciente. Para buscar la posición de un percentil, buscamos el intervalo en la que la frecuencia relativa acumulada sea superior al valor del percentil. P50  = mediana. 

  • Deciles (Di): valor que ordena las observaciones en forma creciente. D5 = Mediana = P50
             · Cuartil: 
                           - El Q1, indica el valor que ocupa una posición en la serie numérica de forma que el 25% de las observaciones son menores y que el 75% son mayores.

  - El Q2, indica el valor que ocupa una posición en la serie numérica de forma que el 50% de las observaciones son menores y que el 50% son mayores. Q2 = D5 = P50.

  - El Q3, indica el valor que ocupa una posición en la serie numérica de forma que el 75% de las observaciones son menores y que el 25% son mayores.

  - El Q4, indica el valor mayor que se alcanza en la serie numérica.

4. Medidas de dispersión.

La información que nos aporta es limitada.

  • Rango o recorrido: diferencia entre el mayor y e menor valor de la muestra     lXn-X1l.


  • Desviación media: media aritmética de las distancias de cada observación con respecto  a la media de la muestra.

  • Desviación típica o estándar: calcular el error que cometemos si representamos una muestra únicamente por su media.
  • Varianza: expresa la misma información en valores cuadráticos
  • Recorrido intercuartílico: diferencia entre el tercer y primer cuartil = lQ3-Q1l.
  • Coeficiente de variación: medida de dispersión relativa (adimensional). Se utiliza para comparar la heterogeneidad de dos series numéricas con independencia de las unidades de medidas. C.V = S/ X (sin unidades).

5. Distribuciones normales.

Se llama distribución normal, distribución de Gauss o distribución gaussina, a la distribución de probabilidad de variable continua que con más frecuencia aparece en fenómenos reales.

La gráfica de su función de densidad tiene una forma acampanada y es simétrica de los valores de posición central. Es simétrica dejando la mitad de los valores por debajo del punto máximo y la mitad de los valores por encima. 

6. Asimetrías y Curtosis. 



La asimétrica hacia la izquierda se sabe porque la media está a la izquierda. La asimétrica hacia la derecha es porque la media está a la derecha.

Hay que tener en cuenta que la asimetría lo marca la media y que el pico de la gráfica es la moda.

  • Coeficiente de asimetría de una variable: grado de asimetría de la distribución de sus datos en torno a su media.
                               - g1 = 0: distribución simétrica.

                               - g1 > 0: distribución asimétrica positiva.

                               - g1 < 0: distribución asimétrica negativa.

  • Curtosis: también recibe el nombre de apuntamiento de la curva, sirve para medir el grado de concentración de los valores que toma en torno a su media.
Como referencia se elige una variable  con distribución normal.



Los resultados pueden ser:
- g2 = 0: distribución mesocúrtica (en la imagen es la B).

- g2 > 0: distribución leptocúrtica (en la imagen es la A).

- g2 < 0: distribución platicúrtica (en la imagen es la C).

7. Tipicación de los valores y su relación con la campana de Gauss.

La tipificación nos permite conocer si el valor corresponde o no a esa distribución con frecuencia.


Por la forma de la curva se sabe:

La media coincide con lo más alto de la campana: 8

La desviación típica es de 2 puntos:

-          El 50 % tienen puntuaciones >8

-          El 50% tiene puntuaciones <8

-          Aproximadamente el 68% puntúa entre 6 y 10

            Media +/- 1 desviación típica: 68%

·         8+/-1: 6-10
Media +/- 2 desviaciones típicas: 95%

·         4-12
Media +/- 3 desviación típica: 99%

·         2-12





miércoles, 19 de abril de 2017

TEMA 7: Introducción a la Bioestadística.

1. Estadística.
La estadística es el conocimiento utilizado para aprender de la experiencia, para ello, se suele utilizar números provenientes de medias que muestran variaciones entre los diferentes individuos.

La estadística tiene como base las diferentes variables que se pueden estudiar. A consecuencia de esto, la estadística es la ciencia que se encarga de la variabilidad, la medición de signos y síntomas.

Como consecuencia de que existen variables de diferentes naturalezas, tenemos presente diferentes métodos de medición.

2. Escalas de medición.
Se utilizan diferentes escalas para medir las distintas variables.
          ·         Escala Nominal.
La escala nominal es el nivel inferior de medida. Ante una variable solo se puede comprobar si son iguales o diferentes.

Ejemplo: Genero: Hombre o Mujer.

Los números se utilizan como meros nombres, se caracterizan por:

- No tienen ninguna de las propiedades aritméticas.

- Las categorías deben de ser exhaustivas y mutuamente excluyentes.
          
          ·        Escala Ordinaria.
Dados dos o más tipos de variables, podemos:

- Saber si son iguales o diferentes.

- Si son distintas, saber cuál es mayor.

Los números reflejan la relación de igualdad, desigualdad y orden. 

Ejemplo: El grado de mejoría de un paciente tras un tratamiento: Nula, leve, moderada, máxima.

Esto se debe a que no existe una escala cuantificada que permita decir el grado exacto de mejoría, por lo que no se pude realizar de forma matemática.

Características:

· No se puede establecer la cantidad de mejoría diferencial que un nivel.

· Se carece de información para determinar si entre unos niveles existe el mismo grado de mejoría que en otro.

· Solo podemos establecer un orden, el cual es una jerarquía. Información de igualdad o desigualdad.
            
              ·         Escala de intervalo.
Tiene las mismas características que las dos escalas anteriores.

Ejemplo: Temperatura: 36º, 37º, 38º.

El cambio de  temperatura que existe entre 36º y 37º es igual al que hay entre 40º y 41º, es decir 1ºC. En esta escala no se puede sacar razones o propiedades, ya que por ejemplo no se puede afianzar que 20ºC es el doble que 10ºC, ya que aunque numéricamente si lo sea, no lo es hablando de temperatura.

En esta escala se puede aplicar las estadísticas como: mediana, desviación y correlación.

·         Escala de razón.

Presenta las características de las tres escalas anteriores (misma información que las  tres escalas anteriores). Tiene el nivel más alto de mediación.

· Igualdad, desigualdad da lugar a identidad.

· La distancia es equivalente entre los intervalos.

· Tiene la ventaja adicional de poseer el 0 absoluto que es la ausencia de lo que se está estudiando.  

3. Tipos de variables.

- Cualitativas: estas le dan significado a propiedades que no pueden ser medidas. Estas variables son nominales ya que se miden con escalas nominales.
· Dicotómicas: tienen 2 niveles, todo lo que se responda con sí o no es considerado dicotómico.
            
            · Policotómicas: más de 2 categorías.
            
            · Ordinales: establecen un orden y jerarquía, dependiendo la diferencia de importancia y valor
    
            · Existen dos criterios: exhaustividad, en el cual puede ser clasificad en algún punto de la escala. Y exclusividad, en el que puede ser clasificado en un punto de la escala.

- Cuantitativas: son las que se utilizan para medir términos numéricos.

· Utiliza la escala intervalo/razón.

· Discretas: solo toman un número finito de valores. Son números enteros y aislados.

· Continuas: pueden valer cualquier número dentro de un rango. La unidad puede ser de forma infinita.

4. Variables: Representación de datos.

·         Tablas de frecuencia: son imágenes en las cuales se muestran los datos (columnas) y las categorías de las variables (filas).

·         Requisitos: ser autoexplicativa (fácil comprensión), título breve y claro, tienen que incluir las unidades de medida en cada cabecera y la base de las medidas relativas, indicar el lugar/fecha/fuente.

·         Frecuencia relativa: se divide la frecuencia absoluta entre el número total de la muestra          (0-1).

5. Variables continuas: representación de datos.

Se encarga de la definición de  intervalos y de los extremos de los intervalos (distancia entre los extremos).


Por otro lado realiza la media entre los dos valore extremos del intervalo.




6. Representación Gráfica.

Se caracteriza porque es una forma rápida de transmitir información numérica, son consideradas como las imágenes de las ideas (ya que representa gráficamente las conclusiones del estudio), facilita la comprensión escrita (orientación visual, sin reemplazar al texto). Como norma básica una gráfica tiene que ser visualmente clara.

  • Reacciones locales más frecuentes:
Diagrama de barra: para medir una variable cualitativa, nominales y las policotómicas.           




Pictograma: para representar variables cualitativas.




Se expresan en el eje X las variables y en el eje Y las frecuencias.

  • Histogramas y polígonos de frecuencia.
Histograma: es para variables continuas. En el eje X se representan los intervalos de las variables y en la Y la frecuencia.

Polígono de frecuencia: es el polígono que se forma al unir los distintos valores

Media: es el punto medio de cada intervalo. 




7. Gráfico.

  • Gráfico de tronco y hojas: Formas de expresar variables cuantitativas, continúas particularmente.
  • Gráfico de sectores: para trabajar con variables cualitativas. Ejemplo: dicotómicas.
  • Gráfico para datos bidimensionales: para variables cuantitativas
















sábado, 15 de abril de 2017

Tema 6: La Etapa Empírica de la Investigación: el diseño, material y métodos

1. Material y Métodos.
   ·  Población de estudio: se trata de realizar una selección de individuos en búsqueda de validez interna y externa. Para ello tenemos que evitar los sesgos de selección.
   · Muestreo: se realiza cuando no es posible estudiar a toda la población de estudio. Tenemos que tener en cuenta:
               - Tamaño de la muestra: con ello se consigue deducir con un error determinado (p < 0,5).
              - El sistema que garantiza las condiciones de representatividad es el muestreo aleatorio simple.             Existe: muestreo aleatorio simple, sistemático, estratificado, por conglomerados y multietápico.  

2. Medidas de frecuencia en estudios descriptivos.
La medida de prevalencia es la situación en un punto determinado en el tiempo.
     ·  Porción de población que presenta la enfermedad en un punto determinado en el tiempo. Ejemplo: personas diabéticas en Sevilla en febrero 2017.
     ·  Depende de la duración de la enfermedad y de su velocidad de aparición (incidencia). Si se mide una enfermedad de corta duración en un momento determinado, podrá existir menos prevalencia que si se mide una enfermedad de larga duración.
      ·  Incidencia: lo que está pasando durante un periodo de tiempo.
    · Flujo de sanos a enfermos: es la frecuencia de nuevos casos que ocurren durante un periodo de tiempo.
En conclusión la prevalencia es el número de individuos con la enfermedad en un tiempo específico/número de individuos en la población en un punto en el tiempo.  
La prevalencia no puede ser inferior a cero ni superior a uno. P = 0-1
Se caracteriza por que es adimensional, por lo que no puede ser medida y es una proporción ya que P = 0-1.
La incidencia la podemos definir como el número de nuevos casos detectados durante el seguimiento que se desarrollan en la enfermedad/número de personas libres de enfermedad al comienzo del seguimiento.
La incidencia acumulada significa calcular una porción de incidencias,  es decir, calcular el riesgo de que se produzca la patología. Para calcularlo se utiliza un periodo de tiempo durante el cual consideramos que todos los individuos de la población están con riesgo de padecer la enfermedad y observamos la porción de los sujetos que desarrollan la enfermedad. Es decir, mide el riesgo de padecer la enfermedad (promedio).
IA = número de nuevos casos en un tiempo determinado/población a riesgo en el momento inicial.
Se caracteriza por medir la probabilidad de tener la patología, no  tiene unidades si no que se expresa en % (proporción), sus valores se encuentran entre 0 y 1, no puede existir perdidas en el seguimiento ya que se tiene  que seguir todos los sujetos durante todo el periodo, fuera del periodo de estudio no se permite obtener conclusiones y no lleva implícito el periodo de tiempo.


3. Tasa de incidencia o densidad de incidencia.
Este término es la velocidad con la que aparecen los nuevos casos con respecto al  tamaño de la población. Si disponemos de los diferentes “tiempos en riesgo” de los diferentes individuos, podemos llegar a obtener la tasa de incidencia.
Para obtener la tasa de incidencia, es necesario:
- Especificar la unidad de tiempo a las que se refiere la tasa.
- Una misma cantidad de personas-tiempo, se puede obtener mediante  el seguimiento de distintos grupos de población.
- Se mide en unidad de tiempo elevado a menos 1.
- Es una tasa instantánea y puedo obtener valores por encima de 1 (No son proporciones).
- Expresa la tasa a la cual ocurren los eventos.

- Expresa la velocidad: rapidez con la que se desarrolla el evento en la población.









4. Estudios de seguimiento y experimentales.
- Medida de asociación:
            Incidencia en expuestos = Número de casos nuevos entre los expuestos (I.e)
                                                       Número total de individuos expuestos.
Incidencia en no expuestos = Número de casos nuevos entre los no expuestos (I.ne.)
                                                Número total de individuos no expuestos.

- Riego relativo:
Es la relación entre el riesgo de los expuestos y el de los no expuestos.
                                               R.R = I.e/I.ne
· Si R.R = 1 à Las incidencias de expuestos y no expuestos es la  misma. Aceptamos la hipótesis nula.  
· Si R.R < 1 à Aceptamos la hipótesis nula.
· Si R.R > 1 à Despreciamos la hipótesis nula.



Ejemplo:
Un grupo de investigadores estudian durante 1 año a 1500 escolares para estudiar las enfermedades periodontales con y sin uso de colutorios. 900 usaban colutorios. A lo largo del año se observa que 15 de los escolares que usaban colutorios presentaron síntomas de infección periodontal, mientras que 40 de lo que no usaban colutorios presentaron estos síntomas.
a)   Hipótesis nulas y alternativas identificando las variables.
b)   Qué tipo de diseño es el utilizado.
c)    Magnitud de asociación existente entre el uso de colutorios y enfermedades periodontales.
d)   A qué conclusión se puede llegar a la vista de los resultados del estudio.

a)  Variables
Dependiente: aparición de caries
Independiente: uso del colutorio
Hipótesis nula: el uso de colutorios no influye en la aparición de caries
H1: el uso de los colutorios disminuye la aparición de caries.
H2: el uso de colutorios aumenta la aparición de caries.

     b) Diseño
Estudio de cohortes o seguimiento prospectivo. No es experimental porque nadie le dice a los sujetos lo que tiene que hacer.

        c)  Magnitud de asociación
Al tratarse de un estudio de cohortes hay que calcular el riesgo relativo.
Incidencia de niños con colutorio: 15 nuevos caos / 900= 0,02
Incidencia de niños sin colutorio: 40 casos nuevos / 600= 0,07
Riesgo relativo: 0,7/0,2 = 3,5
Nota: En el numerador ponemos la incidencia del factor de exposición (causante de la enfermedad)

    
           d) Resultado: Descartamos la hipótesis nula y escogemos la H1. 



5. Estudios de casos y controles. Estimación de la magnitud de asociación.
En este estudio se realiza la comparación de dos grupos, uno con variable dependiente y otro, el cual, no presente la variable.

Se calcula la ODDS RATIO:












Otra forma de calcular ODDS RATIO (Tabla 2x2):




Resultados:
· si es 0 à nula
· si supera a 1 à los casos tienen más riesgo de exposición al factor (H1)
· si es inferior a 1à los controles tienen más riesgo de exposición al                                                                        factor (H2)
Ejemplo
1. En un centro de salud se pretende realizar un estudio sobre la influencia del tabaquismo sobre las EPOC. Para ello, a partir de un grupo de 337 pacientes EPOC que acuden a consulta, se selecciona un grupo de otros 337 pacientes sin EPOC pero que acudían a consulta de enfermería en el programa de atención al paciente diabético. Tras recoger los datos de antecedentes del tabaquismo de los sujetos de estudio, se comprueba que en el primer grupo había 215 pacientes con antecedentes del tabaquismo mientras que en el segundo grupo se detectaron 122 pacientes con antecedentes. Se pide:
1.                 Hipótesis más adecuada y variables
2.                 Diseño de investigación
3.                 Calcular la magnitud de asociación
4.                 Resultado


1)  Variables
Dependiente: EPOC
Independiente: tabaquismo
Hipótesis nula: el tabaquismo no influye en la EPOC
H1: fumar influye en el EPOC
H2: no fumar influye en el EPOC
2) Tipo de Estudio
Estudio de casos y controles.

3) Magnitud de asociación
Al tratarse de un estudio de casos y controles hay que calcular OR.




OR= (215x215) / (122x122)= 3,09

337
337


4) Resultado: se confirma hipótesis 1: el tabaco influye en el EPOC.
· Si es 0à nula
· si supera a 1à los casos tienen más riesgo de exposición al factor (H1)
· si es inferior a 1à los controles tienen más riesgo de exposición al                                                                        factor (H2)