Lección

Pretest y postest en la planeación de datos

🟢 Nivel doctoral  ·  Cambio, comparación e inferencia

Medir antes y después no demuestra que una intervención haya producido el cambio observado.

Entre el pretest y el postest pueden actuar historia, maduración, regresión a la media, cambios de medición, selección y pérdida de participantes. El diseño debe convertir el tiempo en evidencia comparativa, no simplemente en dos columnas de puntuaciones.

Decisión inicial

Ejemplo construido. Veinte estudiantes obtienen una media baja en una prueba diagnóstica. Reciben un programa de tutoría y seis semanas después obtienen una puntuación mayor. ¿Qué puede concluirse únicamente con esta información?

Qué lograrás

Objetivo didáctico

🎯 Al finalizar esta lección
diseñarás una estrategia pretest-postest metodológicamente pertinente para tu proyecto, definiendo temporalidad, grupos o condiciones de comparación, equivalencia inicial, medición, estimando, tratamiento del cambio, pérdidas y amenazas a la validez, de modo que el alcance de la inferencia sea congruente con la arquitectura del diseño.

Punto de partida

Introducción

La estructura pretest-postest parece intuitiva: medir una variable, introducir una intervención y medirla de nuevo. El problema aparece cuando el investigador convierte automáticamente la diferencia observada en efecto de la intervención. Entre ambas mediciones transcurre tiempo y, con él, pueden cambiar simultáneamente numerosos procesos.

Un pretest proporciona información del estado de una variable antes del momento de intervención o exposición que interesa estudiar. El postest registra su estado después de un intervalo definido. La utilidad del pretest no reside solamente en permitir una resta entre dos puntuaciones; también puede aportar información sobre comparabilidad inicial, pronóstico del resultado posterior, heterogeneidad de efectos, elegibilidad, precisión analítica o dinámica temporal.

El diseño se vuelve especialmente valioso cuando la pregunta investiga cambio. Sin embargo, medir cambio y explicar cambio constituyen problemas diferentes. El primero exige observaciones temporalmente comparables. El segundo exige una arquitectura capaz de distinguir la explicación de interés de otras causas plausibles.

Por ello, esta lección no propone una receta universal de análisis. La decisión entre comparación de postest, puntuaciones de cambio, ajuste por línea base, modelos longitudinales o estrategias cuasiexperimentales depende del diseño, del estimando y de los supuestos que el investigador pueda defender.

💡 Distinción crítica
Cambio observado responde “¿qué fue diferente entre momentos?”. Efecto causal responde “¿qué habría ocurrido en ausencia de la intervención?”. La segunda pregunta necesita una comparación contrafactual defendible.

El contenido

Desarrollo del tema

01

Pretest-postest de un solo grupo: medir cambio no identifica su causa

El diseño más simple puede representarse como O1 → X → O2: una observación inicial, una intervención y una observación posterior. Permite documentar cambio dentro del grupo estudiado, pero deja abiertas múltiples explicaciones rivales.

Historia refiere acontecimientos distintos de la intervención ocurridos entre las mediciones. Maduración incluye cambios derivados del paso del tiempo o del desarrollo. Instrumentación aparece cuando cambia la manera de medir. Efecto de prueba puede surgir cuando responder el pretest modifica el desempeño posterior. Regresión a la media adquiere especial importancia cuando los participantes son seleccionados por obtener puntuaciones iniciales extremas.

La regresión a la media no implica que la intervención sea ineficaz ni que toda mejoría sea ilusoria. Significa que una medición extrema contiene tanto señal como variación aleatoria y que, en una medición posterior, parte de esa extremidad puede desaparecer sin intervención. El riesgo aumenta cuando la elegibilidad depende precisamente de valores extremos.

El investigador debe transformar estas amenazas en explicaciones rivales concretas para su propio proyecto. Decir simplemente “existe amenaza de historia” no basta. Debe preguntar qué acontecimiento externo podría afectar el mismo resultado, en qué dirección y durante qué intervalo.

PRETEST O1 INTERVENCIÓN X POSTEST O2 Historia Maduración Instrumentación Efecto de prueba Regresión a la media PérdidasO2 − O1 describe cambio; no elimina por sí mismo las explicaciones alternativas.

Identifica la explicación rival

Aplicación. Construye cinco explicaciones rivales del cambio que esperas observar en tu proyecto. Para cada una especifica qué evidencia adicional necesitarías para volverla menos plausible. Si solo puedes escribir “la intervención” como explicación, tu diseño todavía está razonando desde el resultado esperado y no desde alternativas contrastables.

02

Agregar un grupo de comparación cambia la lógica de la pregunta

El grupo de comparación intenta representar qué habría sucedido durante el mismo intervalo temporal sin recibir la condición de interés, o bajo una condición alternativa. Esto permite controlar algunas explicaciones que afectan simultáneamente a ambos grupos, pero no elimina automáticamente el sesgo.

Si las unidades son asignadas aleatoriamente antes de la intervención y el proceso se conserva adecuadamente, la comparación adquiere una base experimental más fuerte. En diseños cuasiexperimentales, los grupos pueden existir previamente o recibir condiciones mediante mecanismos no aleatorios. En ese caso, la selección se convierte en una amenaza central: los grupos podrían diferir inicialmente en características relacionadas con el resultado.

El pretest permite examinar parte de esa diferencia inicial. La equivalencia observada en una medida basal importante fortalece el argumento, pero no demuestra que los grupos sean equivalentes en todo aquello que no fue medido. Por ello, “no encontramos diferencias significativas al inicio” tampoco debe interpretarse automáticamente como prueba de identidad de los grupos.

Los estándares del What Works Clearinghouse para determinados diseños educativos cuasiexperimentales otorgan un papel explícito a la equivalencia basal y al ajuste cuando existen diferencias iniciales relevantes. Este principio ilustra una regla más general: cuando la asignación no es aleatoria, la comparabilidad inicial forma parte del argumento causal y debe analizarse con criterios previamente definidos.

Intervención O1 X O2Comparación O1 O2El argumento depende de cómo se formaron los grupos, qué ocurre entre mediciones y qué unidades permanecen en el análisis.

Elige el comparador que responde la pregunta

Ejemplo construido. Un programa nuevo sustituirá una tutoría convencional. El objetivo no es saber si los estudiantes mejoran respecto de sí mismos, sino si el programa nuevo produce mejores resultados que la práctica habitual.

Aplicación. Escribe el contrafactual de tu proyecto en una frase: “Para estimar el efecto de X necesito aproximar qué habría ocurrido con estas unidades si…”. A partir de esa oración define el grupo o condición de comparación. Si tu comparador no representa esa situación, revisa el diseño.

03

La planeación temporal debe anteceder a la recolección

Un pretest útil debe ubicarse temporalmente respecto de la intervención de manera que represente realmente la condición basal pertinente. Si se administra después de que la intervención comenzó, puede incorporar ya parte de su efecto. Si se administra demasiado antes, cambios ocurridos antes del inicio pueden volverlo menos representativo de la condición de entrada.

El postest tampoco debe fijarse por comodidad. Una medición inmediatamente posterior puede capturar adquisición de corto plazo; una medición tardía puede aproximarse mejor a retención, transferencia o persistencia, pero también abre más oportunidades para acontecimientos externos, pérdidas y nuevas exposiciones.

Por ello, el momento de medición debe derivarse del modelo temporal del efecto. Si se espera que el mecanismo actúe gradualmente, un único postest inmediato podría ser insuficiente. Si el efecto puede decaer, incorporar seguimiento permite distinguir ganancia inicial de persistencia.

También debe preservarse la comparabilidad de la medición. Cambiar condiciones de aplicación, criterios de puntuación, plataforma, evaluador o versión del instrumento puede introducir variación ajena al fenómeno. Cuando se utilizan formas diferentes para reducir memoria del pretest, debe existir fundamento para interpretar sus puntuaciones en una escala comparable.

Diseña la línea temporal

Aplicación. Dibuja tu calendario completo desde elegibilidad hasta última medición. Añade sobre la línea de tiempo acontecimientos externos previsibles: evaluaciones institucionales, vacaciones, cambios curriculares, exámenes finales o cualquier evento capaz de afectar el resultado. Decide si tu comparador estará expuesto a los mismos eventos.

04

Analizar cambio exige definir primero qué efecto se quiere estimar

Los datos pretest-postest permiten diferentes estrategias analíticas y estas no son intercambiables en todos los diseños. Una diferencia simple post − pre responde a una lógica diferente de un modelo que utiliza el postest como resultado y ajusta por la medición basal.

En ensayos aleatorizados con resultados continuos, el análisis de covarianza que ajusta el postest por el valor basal suele aprovechar la correlación entre ambas mediciones y puede mejorar la precisión respecto de enfoques que ignoran la línea base. Sin embargo, esta recomendación depende del contexto y de los supuestos del modelo; no debe convertirse en una regla automática para cualquier estudio observacional o cuasiexperimental.

En diseños no aleatorizados, el papel del pretest es todavía más delicado. Una puntuación basal puede funcionar como confusora, antecedente, criterio de selección o componente de una trayectoria causal. Analizar únicamente puntuaciones de cambio no garantiza que se haya identificado un efecto causal.

Antes de seleccionar una prueba estadística debe declararse el estimando: la cantidad o contraste que representa exactamente el efecto de interés. Puede ser, por ejemplo, una diferencia promedio de resultados postintervención bajo dos condiciones, ajustada por línea base; una diferencia entre cambios promedio bajo determinados supuestos; o un contraste longitudinal entre trayectorias. El estimando debe derivarse de la pregunta, no del menú del software.

EstrategiaQué utilizaPregunta que debes resolver antes
Cambio simplePostest − pretest¿Qué significa esa diferencia dentro de la arquitectura causal del diseño?
Ajuste por línea basePostest condicionado al pretest y otras covariables justificadas¿Qué variables deben ajustarse y qué supuestos requiere el modelo?
Diferencias en diferenciasCambio de intervención comparado con cambio del grupo de comparación¿Qué supuesto justifica utilizar la trayectoria del comparador como contrafactual?
Modelo longitudinalMúltiples observaciones y su dependencia temporal¿Qué trayectoria, heterogeneidad o estructura temporal pretende representar el modelo?

Primero el estimando, después la prueba

Ejemplo construido. Dos grupos son comparados antes y después de una intervención. El investigador abre el software y pregunta qué prueba debe ejecutar. ¿Qué debe definirse primero?

Aplicación. Redacta tu estimando sin mencionar una técnica estadística. Completa: “Quiero estimar la diferencia en ______ entre ______ y ______ para ______ durante ______”. Después identifica qué variables y mediciones necesita ese contraste. Si no puedes formularlo sin decir “haré una ANOVA” o “usaré una t”, todavía estás confundiendo estimación con procedimiento.

05

Pérdidas, datos faltantes y comparabilidad del postest

El diseño pretest-postest depende de conservar información comparable a lo largo del tiempo. Cuando algunas unidades tienen pretest pero no postest, la pérdida no representa solamente una reducción del tamaño muestral: puede modificar la composición de los grupos analizados.

El riesgo es especialmente serio cuando la probabilidad de permanecer en el estudio depende de la intervención, del resultado esperado o de características relacionadas con este. Analizar únicamente a quienes completaron todas las mediciones puede producir una población analítica diferente de aquella que originalmente ingresó al estudio.

Por ello, la planeación debe anticipar qué se considera pérdida, cómo se documentarán sus razones, qué variables permitirán comparar participantes retenidos y no retenidos y qué estrategia analítica se utilizará frente a datos faltantes. Estas decisiones no deberían improvisarse después de observar qué grupo perdió más participantes.

En ensayos con asignación aleatoria, conservar la lógica de la asignación inicial en el análisis constituye una consideración central; cuando existen resultados faltantes, distintas estrategias implican supuestos diferentes. En estudios no aleatorizados, las pérdidas también pueden alterar la equivalencia observada inicialmente y obligar a reconsiderar la inferencia.

Mapa preventivo de pérdidas

Aplicación. Construye una tabla que compare la muestra prevista en pretest con la muestra que podría quedar en postest bajo tres escenarios de pérdida. Explica qué conclusión dejaría de ser defendible si las pérdidas se concentran en participantes con determinados valores iniciales o en una de las condiciones del estudio.

Cierre

Conclusión

El diseño pretest-postest adquiere valor cuando las dos mediciones se incorporan a una arquitectura inferencial explícita. En un solo grupo permite documentar cambio, pero deja abiertas explicaciones alternativas. Un comparador puede fortalecer el diseño, aunque su utilidad depende de cómo se construyeron los grupos y de si representan trayectorias contrafactuales plausibles.

La medición inicial cumple varias funciones: caracteriza la condición basal, permite examinar comparabilidad, puede aumentar precisión y ayuda a reconocer heterogeneidad. Sin embargo, una diferencia en pretest tampoco se resuelve simplemente restando puntuaciones. El análisis debe corresponder al estimando, a la forma de asignación y a la estructura causal del estudio.

La temporalidad forma parte de la teoría del efecto. Un postest inmediato, uno retardado y varias mediciones de seguimiento responden a preguntas diferentes. Del mismo modo, cambiar instrumentos o condiciones entre momentos puede transformar un aparente cambio educativo en una diferencia de medición.

Las pérdidas completan la arquitectura: el postest puede terminar representando una muestra diferente de aquella que inició el estudio. Prevenir, documentar y analizar esa transformación es parte del diseño y no una corrección administrativa posterior.

La siguiente lección trasladará estas decisiones al procesamiento de la evidencia: sistematización y análisis de datos. Allí el doctorando deberá construir una estrategia capaz de transformar registros en evidencia analítica sin perder la trazabilidad entre pregunta, variable o categoría, procedimiento y conclusión.

🔭 Para seguir aprendiendo

  • Localiza un estudio educativo pretest-postest y separa con precisión qué evidencia demuestra cambio y qué argumento utiliza para atribuirlo a una intervención.
  • Examina cómo se formó el grupo de comparación y qué información basal se utiliza para defender comparabilidad.
  • Identifica qué participantes quedaron fuera del análisis final y decide si su ausencia podría modificar la interpretación del efecto.
Ahora tú

Actividad de aprendizaje autónoma

Diseño del plan pretest-postest y auditoría de inferencia

Diseña la arquitectura temporal y analítica de producción de datos para tu proyecto. Si concluyes que un esquema pretest-postest no es pertinente para tu pregunta, deberás demostrarlo y construir la alternativa longitudinal, transversal o secuencial que resulte más coherente.

Tu entrega debe incluir:

  1. Decisión de pertinencia. Explica qué pregunta de cambio o efecto justificaría utilizar pretest y postest. Si tu problema no requiere comparar estados temporales, argumenta por qué esta arquitectura debe descartarse.
  2. Estimando. Formula con precisión qué diferencia, efecto o trayectoria pretendes estimar. Define población o unidades, condición de intervención, comparador, resultado y periodo relevante sin comenzar por el nombre de una prueba estadística.
  3. Diagrama del diseño. Representa pretest, intervención o exposición, postest, seguimiento y grupos o condiciones. Identifica también el mecanismo mediante el cual las unidades llegan a cada condición.
  4. Modelo temporal. Explica cuándo esperas que comience el efecto, cuándo alcanzaría su manifestación relevante y si debería mantenerse, crecer o disminuir. Justifica a partir de este modelo los momentos de medición.
  5. Comparador. Define qué condición aproxima el resultado contrafactual. Explica por qué representa lo que habría ocurrido sin la intervención o bajo la alternativa de interés.
  6. Equivalencia inicial. Identifica qué variables o medidas basales son sustantivamente importantes para examinar comparabilidad entre grupos. Si la asignación no es aleatoria, explica qué diferencias iniciales podrían sesgar la inferencia.
  7. Amenazas a la validez. Construye al menos cinco explicaciones rivales específicas para tu contexto, incluyendo cuando correspondan historia, maduración, regresión a la media, efecto de prueba, instrumentación, selección y contaminación entre condiciones. Para cada una establece una respuesta de diseño o una limitación que deberá reconocerse.
  8. Equivalencia de medición. Define qué instrumento, escala, rúbrica o procedimiento se utilizará en cada momento y explica cómo preservarás comparabilidad. Si utilizarás formas alternativas, justifica por qué permiten interpretaciones equivalentes.
  9. Plan de análisis. Describe qué papel tendrá la línea base y qué estrategias analíticas son candidatas. Compara por lo menos dos alternativas y justifica cuál corresponde mejor al estimando y al mecanismo de asignación.
  10. Plan de pérdidas y datos faltantes. Anticipa causas de abandono o mediciones incompletas, procedimientos de seguimiento, variables para analizar pérdidas diferenciales y criterios para tratar datos faltantes sin decidirlos después de conocer los resultados.
  11. Frontera causal. Redacta la afirmación más fuerte que el diseño permitiría realizar si los resultados fueran favorables y otra afirmación que seguiría estando fuera de alcance. Explica qué evidencia adicional sería necesaria para cruzar esa frontera.

🛠 Planificador de diseño pretest-postest

📊 Evidencia de logro

Documento técnico de aproximadamente 2,200 a 3,200 palabras acompañado por diagrama temporal, matriz de amenazas y esquema de análisis. La evidencia se considera lograda cuando el pretest y el postest responden a un modelo temporal explícito, el comparador tiene una función contrafactual defendible, la línea base forma parte de la estrategia analítica y el proyecto diferencia con precisión cambio observado de efecto atribuible.

🤔

Si tu postest mejora exactamente como esperabas, ¿qué explicación rival seguiría siendo suficientemente plausible para impedirte atribuir el cambio a la intervención?

Referencias bibliográficas

  • Barnett, A. G., van der Pols, J. C., & Dobson, A. J. (2005). Regression to the mean: What it is and how to deal with it. International Journal of Epidemiology, 34(1), 215–220.
  • Dimitrov, D. M., & Rumrill, P. D., Jr. (2003). Pretest-posttest designs and measurement of change. Work, 20(2), 159–165.
  • Shadish, W. R., Cook, T. D., & Campbell, D. T. (2002). Experimental and quasi-experimental designs for generalized causal inference. Houghton Mifflin.
  • Vickers, A. J., & Altman, D. G. (2001). Analysing controlled trials with baseline and follow up measurements. BMJ, 323(7321), 1123–1124.
  • What Works Clearinghouse. (2022). What Works Clearinghouse procedures and standards handbook, version 5.0. U.S. Department of Education, Institute of Education Sciences, National Center for Education Evaluation and Regional Assistance.