Las propiedades técnicas de un instrumento sustentan la validez del diagnóstico. Según los Standards (AERA, APA, NCME, 2014), la validez es el grado en que la evidencia y la teoría apoyan las interpretaciones de las puntuaciones para los usos propuestos: es una propiedad de la interpretación de las puntuaciones, no del instrumento en sí. En la concepción contemporánea (Messick, 1989) la validez es un concepto unitario: no existen "tipos" separados, sino cinco fuentes de evidencia —contenido del test, procesos de respuesta, estructura interna, relación con otras variables y consecuencias de la evaluación—.
La confiabilidad se refiere a la consistencia o estabilidad de las puntuaciones ante repeticiones del procedimiento; se asocia con la ausencia de error aleatorio. Se estima por: consistencia interna —alfa de Cronbach (1951), entre 0 y 1; KR-20 para ítems dicotómicos—; test-retest o coeficiente de estabilidad (correlación entre dos aplicaciones); y entre evaluadores, con kappa de Cohen (1960) para categorías nominales, que corrige el azar. Se considera .70 como mínimo aceptable para investigación y .80–.90 para decisiones sobre individuos (Nunnally, 1978).
En la Teoría Clásica de los Tests (Lord & Novick, 1968), la puntuación observada es X = V + E (verdadera más error). El error estándar de medición es EEM = DE·√(1 − rxx) y permite construir intervalos de confianza en torno al puntaje. La confiabilidad es condición necesaria pero no suficiente para la validez: la correlación de validez no puede superar rxy ≤ √rxx.
La estandarización implica uniformidad en aplicación y calificación, y normas o baremos (percentiles, puntuaciones T y z) derivados de una muestra representativa. Conviene distinguir la referencia normativa (comparar al sujeto con un grupo) de la referencia criterial (comparar contra un estándar de dominio). Frente a las pruebas psicométricas, las proyectivas exploran contenidos menos estructurados. La propiedad relevante se elige según el objetivo de medición: predicción (validez predictiva), diagnóstico estable (test-retest) o clasificación consistente (consistencia interna).
1. De acuerdo con los Standards for Educational and Psychological Testing (AERA, APA & NCME, 2014), la validez de un instrumento psicológico se define como...
La validez es la propiedad de la interpretación de las puntuaciones respaldada por evidencia y teoría para un uso específico, no una característica fija del instrumento; las otras opciones describen confiabilidad, consistencia interna y estandarización. (Standards for Educational and Psychological Testing (AERA, APA, NCME, 2014), Capítulo 1)
2. Un psicólogo afirma que 'la Escala de Depresión de Beck es válida'. De acuerdo con la conceptualización contemporánea de la validez, esta afirmación resulta imprecisa porque...
Messick (1989) y los Standards (2014) sostienen que la validez corresponde a la interpretación de las puntuaciones para un uso determinado, no es un atributo permanente ni exclusivo del instrumento. (Messick, S. (1989), Validity, en Educational Measurement (3a ed.); Standards (AERA/APA/NCME, 2014))
3. Según los Standards (AERA, APA & NCME, 2014), ¿cuál de las siguientes NO corresponde a una de las cinco fuentes de evidencia de validez reconocidas?
Las cinco fuentes son contenido, procesos de respuesta, estructura interna, relación con otras variables y consecuencias de la evaluación; la estabilidad temporal es un indicador de confiabilidad, no una fuente de validez. (Standards for Educational and Psychological Testing (AERA, APA, NCME, 2014), Capítulo 1)
4. De acuerdo con la concepción psicométrica contemporánea (Messick, 1989; Standards, 2014), la validez de contenido, de criterio y de constructo se consideran actualmente como...
La validez es un concepto unitario: contenido, criterio y constructo son fuentes de evidencia complementarias, no categorías independientes de validez. (Messick, S. (1989); Standards for Educational and Psychological Testing (AERA, APA, NCME, 2014), Capítulo 1)
5. Un equipo de psicometristas desarrolla un inventario de ansiedad y solicita a un panel de clínicos expertos que revise si los reactivos representan adecuadamente los componentes cognitivos, fisiológicos y conductuales del constructo. Este procedimiento aporta evidencia de validez...
La revisión por jueces expertos sobre la representatividad del dominio conceptual constituye evidencia de validez de contenido, distinta de la evidencia de criterio o de constructo. (Standards for Educational and Psychological Testing (AERA, APA, NCME, 2014), Capítulo 1)
6. Una empresa aplica una prueba de aptitud mecánica a sus candidatos y, un año después de la contratación, correlaciona esas puntuaciones con las evaluaciones de desempeño laboral. El tipo de validez de criterio que se está estimando es la validez...
Cuando el criterio se mide en un momento posterior a la aplicación del test, se trata de validez predictiva; si se midiera al mismo tiempo, sería concurrente. (Standards for Educational and Psychological Testing (AERA, APA, NCME, 2014); Anastasi & Urbina (1997), Psychological Testing, Cap. 5)
7. Cuando un psicólogo aplica una nueva escala de depresión y, en la misma sesión, aplica un instrumento ya validado del mismo constructo para correlacionar ambas puntuaciones, obtiene evidencia de validez de criterio de tipo...
Cuando el criterio se mide en el mismo momento que el test, la validez de criterio obtenida es concurrente, a diferencia de la predictiva, donde el criterio se mide después. (Standards for Educational and Psychological Testing (AERA, APA, NCME, 2014); Anastasi & Urbina (1997), Psychological Testing, Cap. 5)
8. En la matriz multirrasgo-multimétodo (MTMM) propuesta por Campbell y Fiske (1959), la validez convergente se evidencia cuando...
La validez convergente se sustenta en correlaciones altas entre medidas de un mismo constructo aunque se usen métodos diferentes; correlaciones altas entre constructos distintos indicarían varianza de método, no convergencia. (Campbell, D. T., & Fiske, D. W. (1959), Convergent and discriminant validation by the multitrait-multimethod matrix, Psychological Bulletin, 56(2), 81-105)
9. Un investigador diseña un nuevo cuestionario de autoestima. Encuentra que sus puntuaciones correlacionan .72 con una escala ya validada de autoestima (mismo constructo, método distinto) y solo .08 con una escala de deseabilidad social (constructo distinto). En conjunto, estos resultados aportan evidencia de validez...
La correlación alta con una medida del mismo constructo aporta evidencia convergente, y la correlación baja con un constructo distinto aporta evidencia discriminante, ambas componentes de la validez de constructo. (Cronbach, L. J., & Meehl, P. E. (1955); Campbell, D. T., & Fiske, D. W. (1959), Psychological Bulletin)
10. En psicometría, la estandarización de un instrumento se refiere a...
La estandarización implica uniformidad en la administración y calificación, y el desarrollo de normas o baremos con base en una muestra de estandarización representativa. (Anastasi, A., & Urbina, S. (1997), Psychological Testing (7a ed.), Cap. 3; Standards (AERA/APA/NCME, 2014), Cap. 5)
11. Un instrumento de inteligencia fue normado únicamente con una muestra de estudiantes universitarios de la Ciudad de México. Si se aplica a un adulto mayor de una comunidad rural, la principal limitación psicométrica para interpretar su puntuación es...
Las normas solo permiten interpretaciones válidas cuando la muestra de estandarización es representativa del grupo al que pertenece el examinado; aquí ese supuesto se incumple. (Anastasi, A., & Urbina, S. (1997), Psychological Testing (7a ed.), Cap. 3)
12. La puntuación estándar z de un examinado se obtiene mediante la fórmula...
La puntuación z se define como la diferencia entre la puntuación bruta y la media, dividida entre la desviación estándar del grupo normativo. (Anastasi, A., & Urbina, S. (1997), Psychological Testing (7a ed.), Cap. 4)
13. En una prueba con media de 100 y desviación estándar de 15, un examinado obtiene 130 puntos. Su puntuación z correspondiente es...
z = (130 − 100) / 15 = 2.0; los distractores corresponden a errores comunes como omitir la resta de la media o la división entre la desviación estándar. (Anastasi, A., & Urbina, S. (1997), Psychological Testing (7a ed.), Cap. 4)
14. Un examinado obtiene una puntuación z de 1.5 en una prueba de personalidad. Al convertirla a la escala T (media = 50, desviación estándar = 10), utilizada por ejemplo en el MMPI-2, su puntaje T equivalente es...
T = 10z + 50 = 10(1.5) + 50 = 65; confundir la desviación estándar de la escala T (10) con la de escalas de CI (15) es un error frecuente. (Anastasi, A., & Urbina, S. (1997), Psychological Testing (7a ed.), Cap. 4)
15. Un percentil de 70 en una prueba estandarizada indica que el examinado...
El percentil indica la posición relativa del examinado respecto al grupo normativo, no el porcentaje de reactivos correctos ni una distancia en puntos o desviaciones estándar. (Anastasi, A., & Urbina, S. (1997), Psychological Testing (7a ed.), Cap. 4)
16. ¿Cuál de las siguientes afirmaciones sobre las normas o baremos de un instrumento psicológico es INCORRECTA?
Las normas requieren actualización periódica (renormación) porque el desempeño poblacional cambia con el tiempo; asumir su vigencia indefinida y universal es incorrecto. (Standards for Educational and Psychological Testing (AERA, APA, NCME, 2014), Capítulo 5)
17. En una distribución normal estándar, una puntuación z de +1.0 corresponde aproximadamente al percentil...
Bajo el modelo de curva normal, una puntuación z de +1.0 deja aproximadamente el 84% de los casos por debajo; el 68% corresponde al área entre z=−1 y z=+1, no al percentil de z=+1. (Anastasi, A., & Urbina, S. (1997), Psychological Testing (7a ed.), Cap. 4 (propiedades de la curva normal))
18. En un informe psicológico, reportar únicamente la puntuación bruta (natural) de un paciente en una prueba, sin convertirla a una puntuación estándar o percentil, resulta inadecuado principalmente porque...
Sin transformarla mediante las normas del instrumento, la puntuación bruta carece de un marco de referencia poblacional para interpretar el desempeño del examinado. (Anastasi, A., & Urbina, S. (1997), Psychological Testing (7a ed.), Cap. 3)
19. De acuerdo con la Teoría Clásica de los Tests (Lord y Novick, 1968), la relación entre la puntuación observada, la puntuación verdadera y el error de medición se expresa como...
La Teoría Clásica de los Tests postula que la puntuación observada es igual a la puntuación verdadera más un componente de error aleatorio: X = V + E. (Lord, F. M., & Novick, M. R. (1968), Statistical Theories of Mental Test Scores, Addison-Wesley)
20. Un paciente obtiene 45 puntos en un inventario de ansiedad. Según el supuesto básico de la Teoría Clásica de los Tests sobre el error de medición, este componente de error se asume...
La Teoría Clásica de los Tests supone que el error de medición es aleatorio y tiene media cero, no un sesgo sistemático ni una función del número de reactivos. (Lord, F. M., & Novick, M. R. (1968), Statistical Theories of Mental Test Scores, Addison-Wesley)
21. Un test de razonamiento verbal tiene una desviación estándar de 15 puntos y un coeficiente de confiabilidad de .91. El error estándar de medición (EEM) de este instrumento es aproximadamente...
EEM = DE·√(1 − rxx) = 15·√(0.09) = 15(0.3) = 4.5 puntos; los distractores reproducen errores típicos como omitir la raíz o aplicarla al término equivocado. (Standards for Educational and Psychological Testing (AERA, APA, NCME, 2014), Capítulo 2)
22. El coeficiente alfa de Cronbach, utilizado para estimar la consistencia interna de un test, puede tomar valores comprendidos entre...
El coeficiente alfa de Cronbach oscila entre 0 y 1, donde valores más cercanos a 1 indican mayor consistencia interna entre los ítems. (Cronbach, L. J. (1951), Coefficient alpha and the internal structure of tests, Psychometrika, 16(3), 297-334)
23. Un psicólogo clínico debe decidir, con base en las puntuaciones de una prueba, si un paciente requiere hospitalización involuntaria. Para sustentar una decisión individual de esta relevancia, el coeficiente de confiabilidad del instrumento utilizado debería ser de al menos...
Nunnally (1978) recomienda confiabilidades de .80 a .90 o superiores para decisiones importantes sobre individuos, un estándar más exigente que el .70 mínimo aceptable en investigación. (Nunnally, J. C. (1978), Psychometric Theory (2a ed.), McGraw-Hill)
24. El coeficiente Kuder-Richardson 20 (KR-20) se utiliza para estimar la consistencia interna de un test cuando los reactivos se califican de forma...
El KR-20 fue desarrollado específicamente para ítems dicotómicos; para ítems politómicos se emplea alfa de Cronbach en su forma general. (Kuder, G. F., & Richardson, M. W. (1937), Psychometrika, 2(3), 151-160)
25. Un investigador aplica el mismo test de memoria a un grupo de participantes en dos ocasiones separadas por tres semanas y correlaciona ambas series de puntuaciones. El coeficiente obtenido se denomina coeficiente de...
La correlación entre dos aplicaciones del mismo test en momentos distintos se conoce como coeficiente de estabilidad o confiabilidad test-retest. (Anastasi, A., & Urbina, S. (1997), Psychological Testing (7a ed.), Cap. 4)
26. Dos psicólogos clasifican de manera independiente a 50 pacientes en las categorías 'presencia' o 'ausencia' de un trastorno según los criterios diagnósticos del DSM-5-TR. Para cuantificar el grado de acuerdo entre ambos evaluadores, corrigiendo el acuerdo esperado por azar, el estadístico apropiado es...
El coeficiente kappa de Cohen mide el acuerdo entre evaluadores para variables categóricas, corrigiendo el acuerdo esperado por azar, a diferencia de alfa o Pearson. (Cohen, J. (1960), A coefficient of agreement for nominal scales, Educational and Psychological Measurement, 20(1), 37-46)
27. Un test tiene una confiabilidad (rxx) de .64. De acuerdo con el principio de atenuación por error de medición, el coeficiente de validez de este test frente a cualquier criterio externo no podrá exceder, en teoría, un valor de...
Por atenuación, rxy ≤ √rxx = √.64 = .80; confundir este límite con rxx mismo o con la mitad de su valor son errores frecuentes. (Nunnally & Bernstein (1994), Psychometric Theory (3a ed.); Lord & Novick (1968), Statistical Theories of Mental Test Scores)
28. En el marco de la matriz multirrasgo-multimétodo (MTMM) propuesta por Campbell y Fiske (1959), la validez convergente de un instrumento se evidencia cuando:
La validez convergente se sustenta en correlaciones altas entre medidas heterométodo del mismo rasgo (monorrasgo-heterométodo); la opción de rasgos distintos con métodos distintos corresponde a validez discriminante, no convergente. (Campbell, D. T., & Fiske, D. W. (1959), Convergent and discriminant validation by the multitrait-multimethod matrix, Psychological Bulletin, 56(2), 81-105)
29. La validez discriminante (o divergente) de un instrumento se sustenta principalmente en la evidencia de que:
La validez discriminante requiere correlaciones bajas con medidas de constructos distintos; correlacionar alto con el mismo constructo describe validez convergente, y la estabilidad temporal corresponde a confiabilidad test-retest. (Campbell, D. T., & Fiske, D. W. (1959), Psychological Bulletin, 56(2), 81-105)
30. Una psicóloga valida una escala nueva de ansiedad correlacionándola con una escala de ansiedad ya establecida (r = .78) y con una escala de depresión (r = .25). Con base en estos resultados, la interpretación más adecuada es que:
La correlación alta con una medida del mismo constructo aporta evidencia convergente, y la correlación baja con un constructo distinto aporta evidencia discriminante, conforme al modelo de Campbell y Fiske (1959). (Campbell, D. T., & Fiske, D. W. (1959), Psychological Bulletin, 56(2), 81-105)
31. El procedimiento que permite examinar de manera conjunta la validez convergente y discriminante, comparando correlaciones monorrasgo-heterométodo y heterorrasgo-monométodo, fue formalizado por:
La matriz multirrasgo-multimétodo (MTMM) de Campbell y Fiske (1959) es el procedimiento específico para contrastar validez convergente y discriminante; la red nomológica de Cronbach y Meehl es su antecedente conceptual, no el procedimiento formal de contraste. (Campbell, D. T., & Fiske, D. W. (1959), Psychological Bulletin, 56(2), 81-105)
32. En un análisis multirrasgo-multimétodo, un investigador observa que las correlaciones entre rasgos distintos medidos con el mismo método (heterorrasgo-monométodo) son más altas que las correlaciones entre el mismo rasgo medido con métodos distintos (monorrasgo-heterométodo). Esta situación indica principalmente:
Cuando las correlaciones por método compartido superan a las correlaciones por rasgo compartido, la varianza de método está inflando las correlaciones, lo que debilita la evidencia de validez discriminante, según Campbell y Fiske (1959). (Campbell, D. T., & Fiske, D. W. (1959), Psychological Bulletin, 56(2), 81-105)
33. De acuerdo con los Standards for Educational and Psychological Testing (2014), la evidencia de validez convergente y discriminante corresponde a la fuente denominada:
Los Standards (2014) ubican las correlaciones convergentes y discriminantes dentro de la fuente 'relación con otras variables', una de las cinco fuentes de evidencia de validez, junto con contenido, procesos de respuesta, estructura interna y consecuencias. (Standards for Educational and Psychological Testing (AERA, APA, NCME, 2014), Capítulo 1)
34. Cronbach y Meehl (1955) propusieron que la validez de constructo se evalúa ubicando al test dentro de una red nomológica de relaciones teóricas esperadas. Este planteamiento constituye el antecedente conceptual directo de:
La noción de red nomológica de Cronbach y Meehl (1955) sentó las bases teóricas que Campbell y Fiske (1959) operacionalizaron mediante la matriz multirrasgo-multimétodo para contrastar convergencia y discriminación. (Cronbach, L. J., & Meehl, P. E. (1955), Construct validity in psychological tests, Psychological Bulletin, 52(4), 281-302)
35. Todas las siguientes afirmaciones sobre la validez convergente son correctas, EXCEPTO:
Correlacionar el test consigo mismo en dos momentos corresponde a la confiabilidad test-retest, no a la validez convergente, que exige medidas del mismo constructo, idealmente por métodos distintos. (Campbell, D. T., & Fiske, D. W. (1959); Anastasi & Urbina (1997), Psychological Testing (7a ed.), Cap. 4-5)