Sin conexión: estás viendo lo guardado en tu móvil

Investigación y bioestadística · M26-T02

Sesgos, validez y precisión

M26-T02 · Investigación y bioestadísticaSesgos, validez y precisiónPracticar · 12

Todo estudio se equivoca de dos maneras: por azar (error aleatorio, que resta precisión) o de forma sistemática (sesgo, que resta validez). El EIR pregunta sobre todo nombres y definiciones: qué es un error sistemático, qué significa validez interna, cómo se llama cada sesgo (selección, autoselección, detección, Hawthorne, adelanto diagnóstico) y qué distingue la fiabilidad de la validez de un instrumento, además de la escala del índice kappa. En el banco hay 13 preguntas válidas de este tema entre 2005 y 2026 (y una de 2006, anulada).

Apuntes para el EIR · versión 2026-09-27 · sin revisión enfermera. Todas las preguntas son reales, de exámenes EIR, con su año y su número; ninguna está escrita por IA. Las respuestas están en el solucionario, al final.

Cómo cae en el EIR

Toca una barra para ver sus preguntas.

13 preguntas de este tema en 22 exámenes (2004-2026, ordinarias, clasificación segura).

Lo más repetido

  • Fiabilidad de un instrumento: resultados consistentes en repetidas aplicaciones (2 exámenes)
  • Sesgo de (auto)selección por participación voluntaria (2 exámenes)

Índice

  1. Resumen para repasar3
  2. Puntos clave5
  3. 1. Error aleatorio y error sistemático: precisión y exactitud6
  4. 2. Validez del estudio: interna y externa8
  5. 3. Sesgo de selección10
  6. 4. Sesgo de información o de medición12
  7. 5. Confusión14
  8. 6. Sesgos de los programas de cribado15
  9. 7. Calidad de un instrumento de medida: fiabilidad y validez17
  10. 8. Concordancia: índice kappa y coeficiente de correlación intraclase20
  11. Todas las preguntas del tema (13)22
  12. Preguntas que también podrían ser de este tema (1)26
  13. Solucionario27
  14. Fuentes28

Resumen para repasar

1. Error aleatorio y error sistemático: precisión y exactitud

  • Error aleatorio: desviación debida solo al azar; fuentes: variación biológica, error de muestreo y error de medida; nunca se elimina del todo; el de muestreo se reduce aumentando el tamaño del estudio F1.
  • Error sistemático = sesgo: los resultados se apartan de forma sistemática del valor real; poco error sistemático = exactitud alta; no depende del tamaño muestral F1.
  • Un instrumento es preciso si da resultados consistentes al repetirlo en las mismas circunstancias F19.
  • Sesgos principales: selección y medición (clasificación) F1.

2. Validez del estudio: interna y externa

  • Un estudio es válido si sus resultados corresponden a la verdad: sin error sistemático y con el menor error aleatorio posible F1.
  • Validez interna: resultados correctos para el grupo estudiado; la amenazan todas las fuentes de error sistemático y mejora con buen diseño; se valoraba como «calidad metodológica», hoy como riesgo de sesgo F1,F10.
  • Validez externa = generalización a personas que no estaban en el estudio; la interna es necesaria pero no suficiente para la externa F1.

3. Sesgo de selección

  • Selección: los participantes difieren sistemáticamente de la población de interés F2.
  • Autoselección / voluntarios: los que se ofrecen difieren de la población general; es un sesgo de selección F1,F3.
  • Berkson: estudiar pacientes hospitalizados crea asociaciones espurias F4. Neyman (prevalencia-incidencia): se pierden los casos fatales, breves o leves por mirar tarde F5.
  • Trabajador sano: los trabajadores tienen que estar sanos para trabajar F1. No respuesta y desgaste (pérdidas desiguales) F6,F7.

4. Sesgo de información o de medición

  • Información: errores sistemáticos al recoger, recordar, registrar o manejar los datos F8; si es no diferencial, según la OMS casi siempre infraestima la asociación, aunque sus efectos pueden ser impredecibles F1,F12.
  • Recuerdo: casos y controles recuerdan distinto la exposición F1,F9. Observador: se evita con ciego o doble ciego F1.
  • Detección: diferencias sistemáticas en cómo se determinan los desenlaces F11.
  • Efecto Hawthorne: los participantes cambian su conducta al saberse observados F13.

5. Confusión

  • Un factor de confusión es factor de riesgo de la enfermedad y está asociado a la exposición (café, tabaco y cardiopatía) F1,F14.
  • Control en el diseño: aleatorización, restricción, emparejamiento; en el análisis: estratificación y modelos multivariantes F1.

6. Sesgos de los programas de cribado

  • Adelanto diagnóstico (lead time): la supervivencia parece más larga porque se cuenta desde un diagnóstico adelantado, aunque el curso no cambie F15,F17.
  • Duración (length time): el cribado detecta preferentemente las formas de progresión lenta F16.
  • Sobrediagnóstico: cánceres que nunca se habrían manifestado clínicamente F17.
  • El NCI atribuye la mejora de supervivencia sin descenso de la mortalidad al adelanto y también al sobrediagnóstico F17.

7. Calidad de un instrumento de medida: fiabilidad y validez

  • Fiabilidad: medir de forma constante; resultados comparables al aplicarlo en distintas ocasiones F18.
  • Validez: el instrumento mide lo que quiere medir; puede ser fiable y no válido F18.
  • Fiabilidad: consistencia interna (relación entre los ítems; alfa de Cronbach), estabilidad (test-retest), equivalencia y armonía interjueces F18.
  • Validez: aparente, de contenido (todas las dimensiones), de criterio (frente al estándar de oro; concomitante y predictiva) y de constructo F18.

8. Concordancia: índice kappa y coeficiente de correlación intraclase

  • Kappa (Cohen, 1960): variables categóricas; acuerdo observado más allá del azar respecto al máximo posible más allá del azar; 1 = acuerdo perfecto, 0 = el esperado por azar F20,F19.
  • Escala de Cohen: 0,21-0,40 fair (discreto); 0,41-0,60 moderado; 0,61-0,80 sustancial; 0,81-1 casi perfecto; otras escalas son más exigentes (McHugh: < 0,60 inadecuado) F21.
  • CCI: equivalente del kappa para variables continuas; Pearson no mide concordancia F19.

Puntos clave

  1. El error aleatorio se debe al azar y se reduce aumentando el tamaño del estudio; el sistemático (sesgo) no depende del tamaño muestral F1.
  2. Un error que aparta todas las mediciones del valor real de forma sistemática (por ejemplo, un aparato mal calibrado) es un error sistemático o sesgo F1,F19.
  3. Validez interna: resultados correctos en los sujetos estudiados, amenazada por todos los sesgos y mejorada por el buen diseño (antes «calidad metodológica», hoy «riesgo de sesgo»); validez externa: generalización F1,F10.
  4. Sesgo de selección: la población estudiada difiere sistemáticamente de la población de interés; la participación voluntaria produce autoselección, un sesgo de selección F1,F2,F3.
  5. Sesgo de detección: diferencias sistemáticas en cómo se determinan los desenlaces F11.
  6. Efecto Hawthorne: los participantes cambian su conducta al saberse observados F13.
  7. Confusor: factor de riesgo de la enfermedad y asociado a la exposición; se controla con aleatorización, restricción, emparejamiento, estratificación o modelos multivariantes F1.
  8. Sesgo de adelanto diagnóstico: el cribado alarga la supervivencia aparente desde el diagnóstico sin cambiar el curso de la enfermedad F15,F17.
  9. Fiabilidad = resultados constantes en distintas ocasiones; validez = medir lo que se pretende; consistencia interna = relación entre los ítems (alfa de Cronbach) F18.
  10. Kappa: concordancia de variables categóricas corregida por el azar; en la escala de Cohen, 0,61-0,80 es sustancial y 0,21-0,40 «fair» (discreto) F20,F21.

1. Error aleatorio y error sistemático: precisión y exactitud

En un estudio epidemiológico hay dos grandes tipos de error. El error aleatorio se produce cuando el valor medido en la muestra se aparta del verdadero valor de la población debido solo al azar, y produce medidas de asociación inexactas F1. Sus tres fuentes principales son la variación biológica individual, el error de muestreo y el error de medida F1.

El error aleatorio nunca puede eliminarse por completo, porque solo se estudia una muestra de la población F1. El error de muestreo suele deberse a que una muestra pequeña no representa todas las variables de la población, y la mejor forma de reducirlo es aumentar el tamaño del estudio F1. El error de medida se reduce con protocolos estrictos y haciendo cada medición lo más precisa posible F1. La precisión de un estudio también mejora si los grupos que se comparan tienen un tamaño relativo adecuado F1.

El error sistemático o sesgo se produce cuando los resultados difieren de forma sistemática de los valores verdaderos F1. Un estudio con poco error sistemático tiene alta exactitud, y la exactitud no se ve afectada por el tamaño de la muestra F1. Se han descrito más de 30 tipos concretos de sesgo; los principales son el sesgo de selección y el sesgo de medición (o de clasificación) F1.

Aplicado a un instrumento, se dice que es preciso si sus resultados son consistentes cuando se aplica más de una vez al mismo individuo bajo las mismas circunstancias; su precisión depende de la variación propia del instrumento (calidad y calibrado del equipo) y de la variación del examinador F19. Epidat pone el ejemplo de dos básculas, una de las cuales pesa sistemáticamente 1 kg más que la otra: la correlación entre ambas puede ser casi 1 aunque la concordancia sea nula F19.

Error aleatorioError sistemático (sesgo)
OrigenEl azar F1Se aparta del valor real de forma sistemática F1
Qué afectaLa precisión F1La exactitud y la validez F1
Tamaño de la muestraEl error de muestreo disminuye al aumentar el tamaño del estudio F1No se corrige aumentando la muestra F1
Se puede eliminarNunca del todo F1Se reduce con buen diseño y atención al detalle F1
Diana

Aleatorio = dardos dispersos alrededor del centro (poco precisos). Sistemático = dardos agrupados pero lejos del centro (precisos pero inexactos). Un aparato que se aparta del valor real siempre en el mismo sentido y en la misma cantidad comete un error sistemático, no aleatorio.

EIR 2018 · 169P8 · respuesta en el solucionario
Error sistemático

En el estudio que está usted realizando sobre el aumento de peso entre lactantes con lactancia materna exclusiva, lactancia mixta y lactancia exclusiva con fórmulas de leche preparada, la báscula que usted utiliza indica siempre un peso de 200 gramos superior al peso real. Esto causaría un error de tipo:

  1. Sistemático.
  2. De selección.
  3. Aleatorio.
  4. De falseamiento.

2. Validez del estudio: interna y externa

La validez expresa el grado en que una prueba es capaz de medir lo que pretende medir. Un estudio es válido si sus resultados corresponden a la verdad: no debe haber error sistemático y el error aleatorio debe ser lo más pequeño posible F1. Una alta fiabilidad (repetibilidad) de las mediciones no garantiza la validez, porque todas pueden estar lejos del valor real F1. Hay dos tipos de validez: interna y externa F1.

La validez interna es el grado en que los resultados de una observación son correctos para el grupo concreto de personas estudiado F1. Para que un estudio sirva de algo tiene que ser internamente válido F1. La validez interna puede verse amenazada por todas las fuentes de error sistemático, pero puede mejorarse con un buen diseño y atención al detalle F1. El Manual Cochrane explica que las herramientas actuales para valorar la validez interna de los resultados se centran en el riesgo de sesgo, mientras que las anteriores se centraban en la noción más amplia de «calidad metodológica» F10. Validez interna y calidad metodológica hablan, pues, del rigor con que se hizo el estudio, no de su aplicabilidad a otros pacientes F1,F10.

La validez externa o generalizabilidad es el grado en que los resultados de un estudio se aplican a personas que no participaron en él F1. La validez interna es necesaria para la externa, pero no la garantiza, y es más fácil de conseguir F1. Juzgar la validez externa exige un juicio sobre hasta qué punto se pueden extrapolar los resultados (por ejemplo, si el efecto de bajar el colesterol en varones sirve para mujeres), y se refuerza si estudios en otras poblaciones encuentran resultados similares F1.

Validez internaValidez externa
Pregunta que responde¿Son correctos los resultados en los sujetos estudiados? F1¿Se pueden aplicar a otras personas? F1
Depende deAusencia de error sistemático; buen diseño F1Juicio sobre la extrapolación; resultados similares en otras poblaciones F1
RelaciónNecesaria para la externa y más fácil de lograr F1Requiere la interna, que no basta F1
Lo que cae

Validez interna = resultados correctos en la muestra estudiada, amenazada por todos los sesgos y mejorada por el buen diseño; antes se valoraba como «calidad metodológica» y hoy como riesgo de sesgo. Validez externa = aplicabilidad o generalización F1,F10.

EIR 2019 · 48P7 · respuesta en el solucionario
Validez interna: calidad metodológica

Cuando se dice que un estudio de investigación tiene validez interna, se refiere a que tiene:

  1. Pertinencia clínica.
  2. Aplicabilidad.
  3. Calidad metodológica.
  4. Pocos sesgos de confusión.

3. Sesgo de selección

El sesgo de selección se produce cuando los individuos o grupos de un estudio difieren sistemáticamente de la población de interés, lo que lleva a un error sistemático en una asociación o un resultado F2. La OMS lo describe como una diferencia sistemática entre las características de las personas seleccionadas para un estudio y las de las que no lo son F1. Por ejemplo, los participantes de un ensayo de vacuna antigripal pueden ser adultos jóvenes sanos, mientras que quienes recibirán la vacuna en la práctica son mayores con comorbilidad: la muestra no representa a la población a la que se quiere aplicar el resultado F2.

Si las personas que entran o permanecen en un estudio tienen características distintas de las que no son seleccionadas o de las que abandonan antes de terminar, se obtiene una estimación sesgada de la asociación entre exposición y efecto; todos los diseños epidemiológicos deben tener en cuenta el sesgo de selección F1.

EIR 2017 · 208P9 · respuesta en el solucionario
Sesgo de selección: la población de estudio no representa a la diana

El sesgo de selección sucede cuando:

  1. El error se comete en la recogida de datos.
  2. El análisis es inapropiado.
  3. La población de estudio no representa a la población diana.
  4. Hay un error por la relación que mantienen variables con la exposición y el efecto dentro de la población base.

Una fuente evidente de sesgo de selección es que los participantes se seleccionen a sí mismos para un estudio, porque se encuentran mal o porque les preocupa especialmente una exposición F1. Por ejemplo, quienes responden a una invitación para un estudio sobre tabaco fuman de forma distinta que quienes no responden, que suelen ser más fumadores F1. Es el sesgo de autoselección o del voluntario: los participantes que se ofrecen voluntariamente tienen características intrínsecamente distintas de la población general de interés, y la muestra corre el riesgo de no ser representativa F3. Puede aparecer en todas las fases, desde el reclutamiento hasta el seguimiento, y las diferencias no se limitan a factores sociodemográficos, sino también a actitudes hacia el estudio F3.

Voluntariedad = selección

Cuando los sujetos deciden por sí mismos si participan (o la voluntariedad es criterio de inclusión), el sesgo es de autoselección (voluntario), que es un tipo de sesgo de selección, no de información ni de confusión F1,F3.

EIR 2005 · 94P13 · respuesta en el solucionario
Sesgo de (auto)selección por participación voluntaria

Los sesgos que se producen cuando en un estudio los sujetos seleccionados toman decisiones propias en relación a su participación, se denominan:

  1. Sesgo o paralogismo de Berkson.
  2. Sesgo de detección de la enfermedad.
  3. Sesgo de prevalencia / incidencia (paralogismo de Nyman).
  4. Sesgo de autoselección.
  5. Sesgo del trabajador sano.
EIR 2015 · 151P12 · respuesta en el solucionario
Sesgo de (auto)selección por participación voluntaria

Si en un estudio epidemiológico, la población participante tiene como criterio de inclusión la voluntariedad, la validez de los resultados están sometidos a un sesgo de:

  1. Información.
  2. Confusión.
  3. Selección.
  4. Interpretación.
  5. Publicación.

Otras variantes del sesgo de selección que aparecen como distractores F1,F4,F5,F6,F7:

SesgoQué ocurre
Berkson (de admisión o ingreso)La combinación de exposición y enfermedad hace más probable el ingreso hospitalario; en un estudio de casos y controles con pacientes hospitalizados aparece una asociación espuria entre enfermedad y factor F4
Neyman (prevalencia-incidencia)Por el momento en que se incluyen los casos: una mirada tardía pierde los episodios mortales o breves y los casos leves o silentes; excluir a los fallecidos hace parecer la enfermedad menos grave F5
Trabajador sanoLos trabajadores tienen que estar lo bastante sanos para trabajar y los enfermos graves suelen quedar fuera del empleo; es un sesgo de selección de la epidemiología laboral F1
No respuestaDiferencias sistemáticas entre quienes responden y quienes no F6
Desgaste (attrition)Pérdidas desiguales de participantes entre los grupos de un ensayo F7

4. Sesgo de información o de medición

El sesgo de información es cualquier diferencia sistemática respecto a la verdad que surge en la recogida, el recuerdo, el registro o el manejo de la información de un estudio, incluido el tratamiento de los datos que faltan F8. Sus tipos principales son el sesgo de clasificación errónea, el del observador, el de recuerdo y el de notificación F8. La OMS lo llama sesgo de medición: las mediciones o clasificaciones de enfermedad o exposición son inexactas, es decir, no miden correctamente lo que deben medir F1.

La clasificación errónea es no diferencial cuando la probabilidad de clasificar mal es igual en todos los grupos y diferencial cuando difiere entre ellos F12. Según la OMS, si el sesgo de medición ocurre por igual en los grupos comparados, casi siempre infraestima la verdadera fuerza de la asociación F1; el Catalogue of Bias matiza que la clasificación errónea puede tener efectos impredecibles, aumentando o disminuyendo la asociación observada F12.

SesgoQué ocurreCómo se previene
RecuerdoCasos y controles recuerdan de forma distinta la exposición pasada; típico de los estudios de casos y controles retrospectivos F1,F9Preguntar a todos del mismo modo F9
ObservadorConocer la exposición influye en las mediciones del investigador, del técnico o del participante F1Medir a ciego o doble ciego F1
DetecciónDiferencias sistemáticas entre grupos en cómo se determinan los desenlaces (cómo se recoge o verifica la información del resultado) F11Evaluadores del desenlace cegados F11

Es, por tanto, el sesgo que se produce en el momento de establecer si ha aparecido el desenlace, y afecta tanto a ensayos como a estudios observacionales: en una cohorte de supervivientes de cáncer de mama, las mujeres recibían más o menos cribado según los medicamentos que tomaban, lo que podía sesgar las asociaciones observadas F11. El sesgo de detección puede sobreestimar o infraestimar el efecto: en ensayos aleatorizados, los evaluadores del desenlace no cegados exageraron las odds ratio de media un 36 % F11. Tampoco es lo mismo que el sesgo de realización (performance): diferencias sistemáticas en la atención que reciben los grupos, aparte de la intervención estudiada, por conocer la asignación F22. El de detección no debe confundirse con el sesgo de selección (quién entra en el estudio) ni con el de desgaste (quién se pierde durante el seguimiento) F2,F7.

EIR 2021 · 38P5 · respuesta en el solucionario
Sesgo de detección

En estudios no aleatorizados, la evaluación de errores sistemáticos en el momento temporal en el que se establece la presencia del desenlace de interés supone la detección de:

  1. Sesgo de selección.
  2. Sesgo de detección.
  3. Sesgo de confusión.
  4. Sesgo de desgaste.

El efecto Hawthorne se produce cuando las personas modifican algún aspecto de su conducta porque saben que están siendo observadas F13. Puede afectar a hábitos como la dieta o la higiene y contaminar un estudio de intervención si uno de los grupos se observa con más frecuencia que el otro F13. El nombre viene del estudio original en la fábrica Hawthorne Works, donde la atención prestada a los trabajadores aumentó temporalmente la producción F13. En un estudio sobre higiene de manos del personal, el cumplimiento fue un 55 % mayor cuando sabían que los observaban F13. Se previene con observación oculta F13.

EIR 2025 · 38P2 · respuesta en el solucionario
Efecto Hawthorne

En un estudio de investigación en el que la unidad de observación son las personas, ¿cómo se llama al sesgo en el que los participantes que están siendo observados, alteran su comportamiento?:

  1. Sesgo del entrevistador.
  2. Falacia de Neyman.
  3. Falacia de Berkson.
  4. Efecto Hawthorne.

5. Confusión

La confusión es una distorsión de la asociación entre una exposición y un efecto porque un factor está asociado de forma independiente con la exposición y con el efecto F14. Puede sugerir una asociación donde no la hay o enmascarar una asociación real F14. Para que una variable sea un factor de confusión debe cumplir dos condiciones: ser por sí misma determinante de la enfermedad (factor de riesgo) y estar asociada a la exposición estudiada F1.

El ejemplo de la OMS: la relación entre beber café y la cardiopatía coronaria puede deberse a que los bebedores de café fuman más, y el tabaco causa cardiopatía F1. La edad y la clase social son confusores frecuentes F1. Según la OMS, la confusión puede parecer un sesgo, pero en realidad no resulta de un error sistemático del diseño, sino de la distribución no aleatoria de los factores de riesgo en la población de origen F1. Es frecuente en los estudios observacionales, aunque también puede darse en los aleatorizados F14.

FaseMétodos de control de la confusión F1
DiseñoAleatorización (ideal en estudios experimentales), restricción (p. ej., solo no fumadores) y emparejamiento (cada caso con un control de igual edad y sexo; si es excesivo, sobreemparejamiento)
AnálisisEstratificación y modelos estadísticos multivariantes
No confundir los tres errores

Selección = quién entra o queda en el estudio. Información = cómo se miden exposición o efecto. Confusión = una tercera variable relacionada con exposición y efecto F1,F2,F8,F14.

6. Sesgos de los programas de cribado

El sesgo de adelanto diagnóstico (lead time) es una distorsión que sobreestima el tiempo aparente de supervivencia con una enfermedad por adelantar el momento de su diagnóstico F15. En las personas cribadas, la supervivencia medida desde el diagnóstico parecerá más larga aunque la detección precoz no tenga ningún efecto sobre el curso de la enfermedad F15. Según el NCI, este sesgo alarga la supervivencia estimada de los cánceres detectados por cribado porque el cálculo incluye el tiempo previo a lo que habría sido el diagnóstico clínico sin cribado F17. Por eso, una supervivencia más larga no prueba por sí sola el beneficio de la detección precoz F15.

El sesgo de duración (length time) produce un beneficio aparente de supervivencia en los casos detectados por cribado porque éste detecta preferentemente las formas de progresión lenta y se le escapan las de progresión rápida F16. El sobrediagnóstico se produce cuando el cribado detecta cánceres que nunca se habrían manifestado clínicamente sin él; aumenta los casos y mejora la supervivencia sin modificar la mortalidad por la causa F17. El NCI cita la PSA como ejemplo de alta tasa de sobrediagnóstico F17.

Sesgo del cribadoMecanismo
Adelanto diagnóstico (lead time)Se cuenta la supervivencia desde un diagnóstico adelantado; el reloj empieza antes, aunque la muerte llegue igual F15,F17
Duración (length time)Se detectan más las formas lentas, de mejor pronóstico F16
SobrediagnósticoSe detectan cánceres que nunca habrían dado clínica F17
EIR2026-050: ¿adelanto diagnóstico o sobrediagnóstico?

La pregunta EIR2026-050 describe un cribado con PSA en el que la supervivencia a 5 años desde el diagnóstico mejora sin que baje la mortalidad, y pide el sesgo que lo explica principalmente. El sesgo de adelanto diagnóstico explica exactamente ese tiempo añadido, porque el cálculo incluye el tiempo previo al diagnóstico clínico F17, y no es la excepción sino la regla en cualquier detección precoz eficaz F15. Pero el NCI atribuye el mismo patrón también al sobrediagnóstico, frecuente con la PSA, que mejora la supervivencia sin modificar la mortalidad por la causa F17, y el sesgo de duración también alarga la supervivencia de los casos cribados F16. Varias opciones describen, pues, mecanismos reales; la respuesta oficial no se corrige.

EIR 2026 · 50P1 · respuesta en el solucionario
Sesgo de adelanto diagnóstico (lead time)

En un programa de cribado de cáncer de próstata mediante Prostate-Specific Antigen (PSA), se observa que la supervivencia a 5 años desde el diagnóstico es del 95 % en pacientes detectados por cribado frente al 70 % en pacientes con diagnóstico clínico. Sin embargo, la mortalidad global por esta causa no se ha reducido. ¿Qué sesgo explica principalmente este fenómeno?:

  1. Sesgo de duración.
  2. Sesgo de adelanto diagnóstico.
  3. Sesgo de sobrediagnóstico.
  4. Sesgo de voluntariado.

7. Calidad de un instrumento de medida: fiabilidad y validez

Las dos características métricas esenciales de un instrumento (cuestionario, escala) son la fiabilidad y la validez; la sensibilidad al cambio y la factibilidad completan sus propiedades psicométricas F18. La fiabilidad hace referencia a medir una variable de manera constante y la validez a que el instrumento mide lo que quiere medir F18. No todo instrumento fiable es válido: puede medir de forma constante y aun así no medir el fenómeno que pretende F18.

Fiabilidad es la propiedad que designa la constancia y precisión de los resultados que obtiene un instrumento al aplicarlo en distintas ocasiones; un instrumento es fiable cuando los resultados son comparables en situaciones similares F18. Se expresa como un coeficiente de 0 (ausencia de correlación) a 1 (correlación perfecta), y, según algunos autores, el margen aceptable se sitúa entre 0,7 y 0,9 F18. La OMS lo resume así: una prueba es fiable si da resultados consistentes F1.

EIR 2017 · 19P11 · respuesta en el solucionario
Fiabilidad de un instrumento: resultados consistentes en repetidas aplicaciones

¿Cuándo se considera que un instrumento de medida es fiable?:

  1. Cuando lo recomiendan un grupo de expertos acreditados.
  2. Cuando mide la variable que pretende medir.
  3. Cuando produce resultados consistentes cuando se aplica en diferentes ocasiones: estabilidad o reproductibilidad.
  4. Cuando es útil y sensible al problema de salud que tiene que evaluar.
EIR 2019 · 53P6 · respuesta en el solucionario
Fiabilidad de un instrumento: resultados consistentes en repetidas aplicaciones

Se dice que un cuestionario es fiable cuando:

  1. Cuandomide lo que quiere medir.
  2. Si contempla todos los aspectos relacionados con el concepto de estudio.
  3. Se obtienen resultados consistentes cuando se aplica en diferentes ocasiones.
  4. Tiene validez de criterio.
Forma de fiabilidadQué mide F18
Consistencia internaLa homogeneidad de los enunciados del instrumento, indicando la relación entre ellos; es el método más usado. Técnicas: alfa de Cronbach (grado de correlación interna entre los ítems; el más usado), mitad y mitad, Kuder-Richardson (ítems dicotómicos) y correlación internunciados (cada ítem con la puntuación total)
Estabilidad (test-retest)La constancia de las respuestas en repetidas ocasiones, en las mismas condiciones y con los mismos sujetos; se suele sugerir un intervalo de 2-4 semanas para variables estables
EquivalenciaCorrelación entre dos versiones paralelas del mismo test aplicadas a la vez
Armonía interjuecesLa concordancia entre dos o más observadores que miden lo mismo (o del mismo observador en dos ocasiones); Carvajal señala que habitualmente se calcula con Pearson o Spearman, aunque kappa, análisis de varianza o correlación intraclase podrían dar resultados más fiables (Epidat desaconseja Pearson para medir concordancia: ver sección 8)

Según Epidat, un conjunto de ítems (variable sintética) exhibe consistencia interna cuando hay una alta asociación entre los ítems que la integran, y la técnica más común para analizarla es el alfa de Cronbach F19. Valores más altos de alfa indican mayor consistencia interna; según George y Mallery, por debajo de 0,5 no es aceptable y por encima de 0,9 es excelente F18.

EIR 2025 · 35P3 · respuesta en el solucionario
Consistencia interna: interrelación entre los ítems

En el análisis de las propiedades de medición de un instrumento, ¿a qué se refiere la consistencia interna?:

  1. Al grado en que el contenido de un instrumento es un reflejo adecuado del constructo que se va a medir.
  2. Al grado de interrelación entre los elementos del instrumento.
  3. Al grado en que las puntuaciones de un instrumento son un reflejo adecuado del “estándar de oro”.
  4. El grado en que las puntuaciones de un instrumento no cambian para mediciones repetidas por varios evaluadores.

La validez explora en qué grado un instrumento mide lo que debería medir, es decir, aquello para lo que ha sido diseñado F18. Se estima de varias formas, cada una de las cuales aporta evidencia a la validación global F18:

Tipo de validezQué evalúa F18
AparenteEl grado en que los ítems parecen medir lo que se proponen; la parte de «sentido común» de la validez de contenido
De contenidoSi el cuestionario abarca todas las dimensiones del fenómeno; es válido en su contenido si contempla todos los aspectos relacionados con el concepto. Métodos: Delphi, Fehring, metodología Q, estimación de magnitud
De criterioCorrelación con otra medida de referencia; si está aceptada por los investigadores, estándar o regla de oro. Concomitante (a la vez) y predictiva (medida posterior)
De constructoRelación del instrumento con la teoría; convergente-divergente, análisis factorial y validez discriminante

La sensibilidad de un instrumento es su capacidad de detectar cambios en los sujetos evaluados tras una intervención, y la factibilidad mide si es asequible en la práctica (tiempo, sencillez, preguntas sin contestar) F18.

Fiable frente a válido

Fiable = siempre da lo mismo (constancia, reproducibilidad). Válido = da lo que tiene que dar (mide la variable que pretende). Si una opción dice «resultados consistentes en distintas ocasiones», es fiabilidad; si dice «mide lo que pretende medir», es validez.

EIR 2017 · 20P10 · respuesta en el solucionario
Validez de un instrumento: mide lo que pretende medir

¿Qué es validez de un instrumento de medida?:

  1. Es el grado en que un instrumento es sensible a los cambios.
  2. Es el grado en que un instrumento mide la variable que pretende medir.
  3. Es el grado en que un instrumento produce resultados consistentes.
  4. Es el grado en que un instrumento es estable en sus mediciones.

8. Concordancia: índice kappa y coeficiente de correlación intraclase

La variabilidad entre observadores es una fuente importante de error de medida; su estudio distingue el sesgo entre observadores (uno da consistentemente valores mayores que otro) y la concordancia (hasta qué punto coinciden) F20. Si los datos son continuos se usa el coeficiente de correlación intraclase; si son categóricos, el estadístico más empleado es el índice kappa F20. Epidat lo aplica a escalas nominales u ordinales y a dos o más observadores F19.

El porcentaje de acuerdo observado es la medida más intuitiva, pero parte de ese acuerdo puede deberse solo al azar F19. El kappa, elaborado por Cohen en 1960 F19, corrige ese problema: es la razón entre el exceso de concordancia observado más allá del atribuible al azar y el máximo exceso posible F20. Kappa = 1 es la máxima concordancia; kappa = 0, la concordancia esperada solo por azar; kappa < 0, menos acuerdo del esperado por azar F20. Para un mismo acuerdo observado, el kappa depende de la prevalencia del fenómeno (prevalencias muy altas o muy bajas dan kappas bajos) F19.

La interpretación del kappa depende de una escala convencional, y hay varias. McHugh recoge la que sugirió Cohen, que usa las etiquetas «moderado», «sustancial» y «casi perfecto» F21:

KappaGrado de acuerdo según Cohen (McHugh) F21Escala de Fisterra F20
≤ 0Sin acuerdo—
0,01-0,20Nulo a leve (none to slight)Pobre (< 0,20)
0,21-0,40«Fair» (discreto)Débil
0,41-0,60ModeradoModerada
0,61-0,80Sustancial (substantial)Buena
0,81-1,00Casi perfecto (almost perfect)Muy buena
EIR2022-049: ¿es «insuficiente» un kappa de 0,21-0,40?

La pregunta EIR2022-049 usa la etiqueta «sustancial» para 0,61-0,80, que es la de la escala sugerida por Cohen; en ella, 0,21-0,40 se califica de «fair» (discreto), por encima de «nulo a leve», y no de insuficiente F21. Otras lecturas son más exigentes: McHugh (2012) propone que cualquier kappa por debajo de 0,60 indica un acuerdo inadecuado y llama «mínimo» al tramo 0,21-0,39 F21; Fisterra califica 0,21-0,40 de débil F20, y Epidat atribuye a Landis y Koch (1977) una escala que considera aceptable un kappa mayor o igual a 0,40, además de recordar que no hay un valor exacto de buena concordancia F19. Con esas escalas, 0,21-0,40 sí podría llamarse insuficiente; con la de Cohen, cuyas etiquetas usa la pregunta, no. La respuesta oficial no se corrige.

EIR 2022 · 49P4 · respuesta en el solucionario
Índice kappa: grados de acuerdo

Atendiendo al Índice kappa (κ), sería INCORRECTO:

  1. El índice kappa (κ) se usa para evaluar la concordancia o reproducibilidad de instrumentos de medida cuyo resultado es categórico (2 o más categorías).
  2. El índice kappa (κ) representa la proporción de acuerdos observados más allá del azar, respecto del máximo acuerdo posible más allá del azar.
  3. Un resultado entre 0,21-0,40 supone un grado de acuerdo insuficiente.
  4. Un resultado entre 0,61-0,80 supone un grado de acuerdo sustancial.

Para variables continuas, el coeficiente de correlación intraclase (CCI) mide la concordancia entre mediciones repetidas y puede considerarse el equivalente del kappa; toma valores de 0 a 1 y se interpreta como medida de reproducibilidad o fiabilidad F19. Según Fleiss, un CCI inferior a 0,4 indica poca reproducibilidad y uno igual o superior a 0,75, reproducibilidad excelente F19. El coeficiente de correlación de Pearson no sirve para medir concordancia: solo cuantifica la asociación lineal, y dos básculas que difieren sistemáticamente 1 kg pueden correlacionar casi perfectamente con concordancia nula F19. Para comparar dos métodos continuos se usa el gráfico de Bland y Altman, con límites de concordancia a ±1,96 desviaciones estándar de la diferencia media F19.

Tipo de variableMedida de concordancia F19
Nominal u ordinalKappa de Cohen (dos o más observadores)
ContinuaCoeficiente de correlación intraclase (dos o más observadores)
Continua, dos métodosBland-Altman (gráfico)
Consistencia interna de un cuestionarioAlfa de Cronbach

Todas las preguntas del tema (13)

De la más reciente a la más antigua. Las respuestas, en el solucionario.

EIR 2026 · 50P1 · respuesta en el solucionario

En un programa de cribado de cáncer de próstata mediante Prostate-Specific Antigen (PSA), se observa que la supervivencia a 5 años desde el diagnóstico es del 95 % en pacientes detectados por cribado frente al 70 % en pacientes con diagnóstico clínico. Sin embargo, la mortalidad global por esta causa no se ha reducido. ¿Qué sesgo explica principalmente este fenómeno?:

  1. Sesgo de duración.
  2. Sesgo de adelanto diagnóstico.
  3. Sesgo de sobrediagnóstico.
  4. Sesgo de voluntariado.
EIR 2025 · 38P2 · respuesta en el solucionario

En un estudio de investigación en el que la unidad de observación son las personas, ¿cómo se llama al sesgo en el que los participantes que están siendo observados, alteran su comportamiento?:

  1. Sesgo del entrevistador.
  2. Falacia de Neyman.
  3. Falacia de Berkson.
  4. Efecto Hawthorne.
EIR 2025 · 35P3 · respuesta en el solucionario

En el análisis de las propiedades de medición de un instrumento, ¿a qué se refiere la consistencia interna?:

  1. Al grado en que el contenido de un instrumento es un reflejo adecuado del constructo que se va a medir.
  2. Al grado de interrelación entre los elementos del instrumento.
  3. Al grado en que las puntuaciones de un instrumento son un reflejo adecuado del “estándar de oro”.
  4. El grado en que las puntuaciones de un instrumento no cambian para mediciones repetidas por varios evaluadores.
EIR 2022 · 49P4 · respuesta en el solucionario

Atendiendo al Índice kappa (κ), sería INCORRECTO:

  1. El índice kappa (κ) se usa para evaluar la concordancia o reproducibilidad de instrumentos de medida cuyo resultado es categórico (2 o más categorías).
  2. El índice kappa (κ) representa la proporción de acuerdos observados más allá del azar, respecto del máximo acuerdo posible más allá del azar.
  3. Un resultado entre 0,21-0,40 supone un grado de acuerdo insuficiente.
  4. Un resultado entre 0,61-0,80 supone un grado de acuerdo sustancial.
EIR 2021 · 38P5 · respuesta en el solucionario

En estudios no aleatorizados, la evaluación de errores sistemáticos en el momento temporal en el que se establece la presencia del desenlace de interés supone la detección de:

  1. Sesgo de selección.
  2. Sesgo de detección.
  3. Sesgo de confusión.
  4. Sesgo de desgaste.
EIR 2019 · 53P6 · respuesta en el solucionario

Se dice que un cuestionario es fiable cuando:

  1. Cuandomide lo que quiere medir.
  2. Si contempla todos los aspectos relacionados con el concepto de estudio.
  3. Se obtienen resultados consistentes cuando se aplica en diferentes ocasiones.
  4. Tiene validez de criterio.
EIR 2019 · 48P7 · respuesta en el solucionario

Cuando se dice que un estudio de investigación tiene validez interna, se refiere a que tiene:

  1. Pertinencia clínica.
  2. Aplicabilidad.
  3. Calidad metodológica.
  4. Pocos sesgos de confusión.
EIR 2018 · 169P8 · respuesta en el solucionario

En el estudio que está usted realizando sobre el aumento de peso entre lactantes con lactancia materna exclusiva, lactancia mixta y lactancia exclusiva con fórmulas de leche preparada, la báscula que usted utiliza indica siempre un peso de 200 gramos superior al peso real. Esto causaría un error de tipo:

  1. Sistemático.
  2. De selección.
  3. Aleatorio.
  4. De falseamiento.
EIR 2017 · 208P9 · respuesta en el solucionario

El sesgo de selección sucede cuando:

  1. El error se comete en la recogida de datos.
  2. El análisis es inapropiado.
  3. La población de estudio no representa a la población diana.
  4. Hay un error por la relación que mantienen variables con la exposición y el efecto dentro de la población base.
EIR 2017 · 20P10 · respuesta en el solucionario

¿Qué es validez de un instrumento de medida?:

  1. Es el grado en que un instrumento es sensible a los cambios.
  2. Es el grado en que un instrumento mide la variable que pretende medir.
  3. Es el grado en que un instrumento produce resultados consistentes.
  4. Es el grado en que un instrumento es estable en sus mediciones.
EIR 2017 · 19P11 · respuesta en el solucionario

¿Cuándo se considera que un instrumento de medida es fiable?:

  1. Cuando lo recomiendan un grupo de expertos acreditados.
  2. Cuando mide la variable que pretende medir.
  3. Cuando produce resultados consistentes cuando se aplica en diferentes ocasiones: estabilidad o reproductibilidad.
  4. Cuando es útil y sensible al problema de salud que tiene que evaluar.
EIR 2015 · 151P12 · respuesta en el solucionario

Si en un estudio epidemiológico, la población participante tiene como criterio de inclusión la voluntariedad, la validez de los resultados están sometidos a un sesgo de:

  1. Información.
  2. Confusión.
  3. Selección.
  4. Interpretación.
  5. Publicación.
EIR 2005 · 94P13 · respuesta en el solucionario

Los sesgos que se producen cuando en un estudio los sujetos seleccionados toman decisiones propias en relación a su participación, se denominan:

  1. Sesgo o paralogismo de Berkson.
  2. Sesgo de detección de la enfermedad.
  3. Sesgo de prevalencia / incidencia (paralogismo de Nyman).
  4. Sesgo de autoselección.
  5. Sesgo del trabajador sano.

Preguntas que también podrían ser de este tema (1)

La clasificación automática dudó entre este tema y otro.

EIR 2011 · 13P14 · respuesta en el solucionario

Cuando se realiza una valoración crítica del diseño de un estudio de investigación, el tamaño y representatividad de la muestra de estudio, la validez de los procedimientos de investigación y la validez de las técnicas de análisis de los datos, se están analizando las dimensiones:

  1. Reales y técnicas.
  2. Metodológicas.
  3. Fundamentales.
  4. Interpretativas.
  5. Estilísticas.

Solucionario

NºPreguntaRespuesta oficialNotas
P1EIR 2026 · 502
P2EIR 2025 · 384
P3EIR 2025 · 352
P4EIR 2022 · 493
P5EIR 2021 · 382
P6EIR 2019 · 533hoja del archivo oficial
P7EIR 2019 · 483hoja del archivo oficial
P8EIR 2018 · 1691hoja del archivo oficial
P9EIR 2017 · 2083
P10EIR 2017 · 202
P11EIR 2017 · 193
P12EIR 2015 · 1513reconstruida por un tercero
P13EIR 2005 · 944reconstruida por un tercero
P14EIR 2011 · 132

Fuentes

Pendiente de verificar

  • EIR2011-013 (dudosa entre M26-T02 y M26-T06, no intercalada): las «dimensiones» de la valoración crítica de una investigación (sustantivas, metodológicas, éticas, interpretativas, de presentación y estilísticas) proceden de Polit y Hungler, que no está en acceso abierto; M26-T06 la dejó igualmente en pendiente. Verificar en el manual o en una muestra de la editorial.
  • Escala de Landis y Koch (Biometrics 1977;33:159-74): no se ha podido leer en acceso abierto; confirmar sus etiquetas y si coinciden con las que McHugh atribuye a Cohen, frente a la lectura de Epidat (aceptable a partir de 0,40).