Medir una diferencia después de implementar un programa no demuestra, por sí mismo, que el programa produjo esa diferencia.
La fuerza de una conclusión cuantitativa depende de cómo fueron seleccionadas las unidades, cuándo se realizaron las mediciones, qué grupos pueden compararse y qué explicaciones alternativas controla —o deja abiertas— el diseño.
🔎 El resultado parece convincente
Caso construido: una universidad implementa un programa de tutoría. Al terminar el año, la permanencia de quienes participaron es mayor que la de quienes no participaron. Los estudiantes eligieron voluntariamente inscribirse al programa. ¿Qué conclusión está mejor justificada únicamente con esta información?
Objetivo didáctico
Al finalizar esta lección podrás explicar la relación entre pregunta, alcance inferencial y diseño cuantitativo; distinguir diseños descriptivos, correlacionales, experimentales, cuasi experimentales y observacionales; y ejemplificar los límites de las inferencias causales según la asignación, comparación y temporalidad del estudio.
💡 Regla de lectura
No preguntes solamente «¿qué diseño utilizaron?». Pregunta también «¿qué afirmación quieren sostener y qué características del diseño hacen defendible —o excesiva— esa afirmación?».
Introducción
La investigación cuantitativa trabaja con variables expresadas mediante sistemas numéricos y utiliza procedimientos de análisis para describir distribuciones, comparar grupos, estudiar relaciones, estimar parámetros o examinar efectos. Sin embargo, la presencia de números no determina por sí misma el tipo ni la calidad de la inferencia. Dos estudios pueden analizar la misma variable y permitir conclusiones radicalmente distintas debido a su diseño (American Psychological Association, n.d.).
Las clasificaciones metodológicas no son completamente uniformes. El material del Institute of Education Sciences para evaluación educativa organiza cuatro categorías amplias: diseños descriptivos, correlacionales, cuasi experimentales y ensayos controlados aleatorizados. Otros textos distinguen primero entre estudios experimentales y no experimentales y luego especifican variantes particulares (Creswell & Creswell, 2023; Institute of Education Sciences, n.d.).
Para evitar convertir una taxonomía en dogma, esta lección separará dos preguntas. La primera es qué alcance tiene la afirmación: describir un fenómeno, establecer una asociación o sostener una explicación causal. La segunda es cómo está construido el estudio: qué unidades se observan, cómo se asigna una intervención cuando existe, qué grupos se comparan y en qué momentos se realizan las mediciones.
Esta distinción es particularmente importante en administración educativa. La toma de decisiones institucionales suele utilizar indicadores existentes y comparaciones entre escuelas, periodos o grupos. Esos datos pueden informar decisiones valiosas, pero la inferencia debe corresponder con el diseño que los produjo.
Desarrollo del tema
Alcance inferencial y diseño: dos dimensiones que conviene separar
Una investigación descriptiva pretende caracterizar qué ocurre: frecuencias, promedios, distribuciones, tendencias o características de una población o programa. Preguntas como «¿qué proporción de directores abandonó el cargo durante los primeros tres años?» o «¿cómo se distribuye la rotación entre regiones?» no requieren por sí mismas una explicación causal.
Una pregunta relacional o correlacional examina si dos o más variables cambian conjuntamente. Puede preguntar si el apoyo organizacional se asocia con la intención de permanencia o si determinadas características institucionales se relacionan con niveles de rotación. Encontrar una asociación permite describir un patrón, pero todavía debe explicarse por qué ese patrón no puede atribuirse a otras variables o procesos.
Una afirmación causal añade una exigencia más fuerte: sostiene que modificar una condición produciría una diferencia en el resultado, bajo determinadas condiciones. Este tipo de inferencia requiere comparar lo observado con una situación contrafactual: qué habría ocurrido con las mismas unidades, en el mismo periodo, si la exposición o intervención hubiera sido diferente. Como ambas condiciones no pueden observarse simultáneamente en la misma unidad, el diseño intenta construir una comparación creíble.
Por eso, «descriptivo», «correlacional» y «causal» pueden entenderse como niveles de la afirmación que se desea sostener, mientras que aleatorización, grupos de comparación, mediciones repetidas o seguimiento longitudinal describen características de la arquitectura utilizada para sostenerla.
🧭 Dos preguntas para leer cualquier diseño
Selecciona cada eje. La clasificación completa surge de combinarlos.
Esta forma de lectura evita un problema frecuente: creer que el nombre del diseño determina automáticamente toda la conclusión. La inferencia depende de los detalles concretos de implementación, medición, pérdida de participantes, comparabilidad y análisis.
Diseños descriptivos y correlacionales: conocer patrones sin convertirlos en causas
Los diseños descriptivos permiten conocer quién, qué, dónde, cuándo y en qué medida ocurre un fenómeno. En administración educativa pueden utilizarse para caracterizar matrícula, movilidad, perfiles directivos, implementación de políticas, uso de recursos o distribución de resultados. Describir rigurosamente no es una etapa inferior de la investigación: numerosos problemas exigen primero conocer correctamente su distribución.
Los diseños correlacionales examinan relaciones entre variables sin que la presencia de una relación establezca por sí sola una dirección causal. Si la confianza institucional se asocia con intención de permanencia, al menos tres explicaciones generales siguen abiertas: la confianza puede influir en la permanencia, la intención de permanecer puede modificar la percepción de confianza o una tercera condición puede afectar a ambas.
El análisis estadístico puede incorporar variables de control y modelos multivariados para examinar algunas explicaciones alternativas. Sin embargo, «controlar estadísticamente» no convierte automáticamente un estudio observacional en experimento. La validez de la inferencia depende de qué variables fueron medidas adecuadamente, qué supuestos se adoptaron y qué factores relevantes pudieron quedar sin observar.
Esta cautela no reduce el valor del estudio. Una asociación robusta puede identificar grupos de riesgo, generar explicaciones, orientar nuevas preguntas o mostrar dónde conviene realizar una evaluación más fuerte. El error aparece cuando el lenguaje de la conclusión sobrepasa el diseño.
🧠 El mismo resultado, cuatro titulares
Un estudio transversal encuentra que mayor apoyo organizacional percibido se relaciona con mayor intención de permanencia docente. ¿Cuál titular respeta mejor el diseño?
Una regla útil de escritura consiste en distinguir descripción, asociación y efecto. Palabras como «se relaciona», «se asocia» o «covaría» no significan lo mismo que «produce», «incrementa», «reduce» o «causa».
Diseño experimental: por qué importa la asignación aleatoria
En un experimento aleatorizado, las unidades elegibles son asignadas mediante un mecanismo aleatorio a una intervención o a una condición de comparación. La lógica de la aleatorización no consiste simplemente en «tener dos grupos»: busca que la asignación no dependa sistemáticamente de características de las unidades y, de ese modo, construir un contrafactual más creíble.
En educación la aleatorización puede ocurrir al nivel de estudiantes, aulas, docentes, escuelas u otras agrupaciones, dependiendo de cómo opere la intervención. El nivel de asignación tiene consecuencias para el análisis: si escuelas completas son asignadas, no puede ignorarse que estudiantes dentro de una misma escuela comparten condiciones.
La aleatorización tampoco hace invulnerable al estudio. Pérdidas diferenciales de participantes, incumplimiento de la intervención, contaminación entre grupos, medidas poco válidas o análisis incompatibles con la asignación pueden comprometer la interpretación. El What Works Clearinghouse evalúa precisamente varias de estas condiciones antes de asignar una calificación de evidencia a un estudio.
Además, una inferencia causal internamente sólida no garantiza generalización universal. Un programa puede producir un efecto bajo determinadas condiciones, población y forma de implementación sin que esa evidencia demuestre el mismo efecto en cualquier otra universidad. Validez interna y validez externa responden preguntas diferentes.
🎲 ¿Qué hace realmente la aleatorización?
Selecciona una afirmación para revelar su evaluación.
En administración educativa, la posibilidad de aleatorizar puede estar restringida por condiciones éticas, políticas o logísticas. Esa limitación no obliga a abandonar la pregunta causal, pero sí conduce a diseños que dependen de supuestos y estrategias de comparación diferentes.
Diseños cuasi experimentales: construir comparaciones sin aleatorización
Los diseños cuasi experimentales buscan estimar efectos cuando la asignación aleatoria no está disponible. Su característica no es simplemente «parecerse un poco a un experimento». Deben construir una comparación que permita argumentar por qué las diferencias observadas después de una intervención no se explican mejor por diferencias previas, tendencias preexistentes u otros cambios simultáneos.
Una estrategia frecuente consiste en comparar un grupo que recibió la intervención con otro grupo semejante que no la recibió, utilizando características basales para valorar o mejorar su comparabilidad. El What Works Clearinghouse exige criterios específicos de equivalencia inicial para determinados diseños cuasi experimentales utilizados en evaluaciones educativas.
Existen también estrategias cuasi experimentales cuya lógica no se reduce al emparejamiento. Entre ellas se encuentran diseños de discontinuidad en la regresión, series temporales interrumpidas o aproximaciones de diferencias en diferencias, siempre que las condiciones concretas permitan sostener los supuestos que cada estrategia necesita.
La ausencia de aleatorización mantiene especialmente visible el problema de sesgo de selección. Si las escuelas que adoptan voluntariamente un programa ya tenían mayor capacidad directiva, recursos o motivación antes de implementarlo, una comparación posterior puede atribuir al programa diferencias que existían —o estaban desarrollándose— previamente.
🔀 De comparación ingenua a comparación defendible
Caso construido: veinte escuelas adoptan voluntariamente un programa de liderazgo; otras veinte no lo adoptan. Se quiere estudiar su efecto sobre rotación docente.
La expresión «cuasi experimental» no debería utilizarse simplemente porque existen un pretest y un postest. Un único grupo medido antes y después sigue siendo vulnerable a historia, maduración, cambios de medición y otros acontecimientos concurrentes. La fuerza procede de la estructura concreta de comparación, no del nombre del diseño.
Diseños observacionales, temporalidad y límites de la inferencia causal
APA utiliza la categoría de estudios sin manipulación experimental para diseños en los que las variables se observan sin asignar deliberadamente una condición. Dentro de esta familia pueden encontrarse estudios transversales, longitudinales y otras arquitecturas observacionales. En otras disciplinas se utilizan clasificaciones como cohortes, casos y controles o estudios transversales; STROBE mantiene listas de reporte específicas para esas tres formas principales.
Un diseño transversal observa variables en un momento o ventana temporal limitada. Puede describir prevalencias y asociaciones, pero suele ofrecer poca información sobre cuál variable ocurrió antes. Un diseño longitudinal sigue unidades o mediciones a través del tiempo, permitiendo estudiar cambio y establecer mejor la secuencia temporal.
Sin embargo, «longitudinal» tampoco equivale a «causal». Si la confianza institucional medida en enero predice la permanencia un año después, la temporalidad fortalece el razonamiento respecto de una encuesta simultánea, pero todavía pueden existir diferencias previas que expliquen ambas variables.
Por eso, las inferencias causales en estudios no aleatorizados exigen hacer explícitas sus suposiciones. Entre las amenazas clásicas se encuentran selección, confusión, historia, cambios de medición, pérdida diferencial de participantes y causalidad inversa. El diseño y el análisis buscan reducir algunas de estas amenazas; ninguna técnica debería presentarse como eliminación automática de todas ellas.
El criterio final es la proporcionalidad entre diseño y lenguaje. Cuanto más fuerte sea la afirmación —especialmente si utiliza «efecto», «impacto», «provoca» o «causa»—, más explícita debe ser la argumentación que descarte explicaciones alternativas.
Figura 1. Alcance de la afirmación y condiciones que fortalecen una inferencia causal. Elaboración propia.
🕒 Cambia el tiempo, cambia la inferencia
Explora tres formas de observar apoyo institucional y permanencia docente.
Conclusión
La investigación cuantitativa no se organiza adecuadamente mediante una única lista que coloca «experimental», «no experimental» y «cuasi experimental» como si fueran categorías perfectamente equivalentes y mutuamente excluyentes. Resulta más productivo examinar qué pregunta se formula, cómo se construye la evidencia, cómo se forman los grupos y qué inferencia se pretende sostener.
Los diseños descriptivos permiten caracterizar fenómenos y los correlacionales estudiar relaciones. Ambos pueden producir conocimiento valioso sin que sus resultados deban traducirse a causalidad. El lenguaje de la conclusión necesita conservar esta frontera.
La asignación aleatoria fortalece la construcción del contrafactual porque desvincula la condición recibida de características previas de las unidades. Los diseños cuasi experimentales buscan aproximarse a una comparación causal creíble sin aleatorización y, por ello, deben examinar con especial atención equivalencia inicial, tendencias previas y selección.
Los estudios observacionales pueden ser transversales o longitudinales y responder preguntas descriptivas, predictivas y relacionales de gran relevancia. La temporalidad fortalece algunas inferencias, pero no elimina automáticamente la confusión. Ninguna etiqueta metodológica sustituye el análisis de amenazas y supuestos.
La siguiente lección cambiará la lógica de evidencia: estudiaremos diseños y métodos de investigación cualitativa, donde la pregunta no se centra necesariamente en estimar distribuciones o efectos, sino en comprender experiencias, significados, prácticas, procesos y contextos sin reducirlos prematuramente a variables.
🔭 Para seguir aprendiendo
- Localiza una noticia institucional que utilice expresiones como «impacto», «efecto» o «provocó» y pregúntate qué diseño necesitarías conocer antes de aceptar ese lenguaje.
- Selecciona un artículo cuantitativo de administración educativa e identifica por separado la pregunta, el diseño, la temporalidad y la conclusión más fuerte que formula.
- Compara un estudio transversal con uno longitudinal sobre el mismo fenómeno y explica qué pregunta puede responder mejor el segundo sin asumir que por ello demuestra causalidad.
Actividad de aprendizaje autónoma
Hasta dónde permite llegar el diseño
Analiza los siguientes cuatro estudios construidos. No debes proponer todavía procedimientos estadísticos ni diseñar un proyecto nuevo. Tu tarea consiste en explicar qué puede y qué no puede concluirse a partir de la arquitectura descrita.
- Caso A · Descripción. Una universidad utiliza registros administrativos para describir la rotación anual de directores durante diez años, diferenciando facultad, antigüedad y tipo de contratación.
- Caso B · Asociación transversal. En una encuesta aplicada una sola vez, 600 docentes responden una escala de apoyo organizacional y una escala de intención de permanencia. Se observa una asociación positiva entre ambas puntuaciones.
- Caso C · Intervención aleatorizada. Cuarenta escuelas elegibles son asignadas aleatoriamente a implementar un programa de acompañamiento directivo o continuar con las prácticas habituales. La rotación docente se compara al finalizar el ciclo.
- Caso D · Comparación cuasi experimental. Veinte escuelas adoptan voluntariamente el mismo programa. Se seleccionan veinte escuelas de comparación con características iniciales semejantes y se cuenta con información de rotación de los tres años previos y los dos posteriores a la implementación.
Elabora un análisis de entre 850 y 1,050 palabras que incluya:
- Pregunta compatible. Explica qué tipo de pregunta puede responder razonablemente cada caso.
- Diseño. Describe las características que justifican clasificar cada caso como descriptivo, correlacional u observacional, experimental aleatorizado o cuasi experimental.
- Inferencia permitida. Formula para cada caso una conclusión que respete la fuerza de la evidencia.
- Inferencia excesiva. Escribe una conclusión que el diseño no permitiría sostener y explica por qué.
- Temporalidad. Compara B y D para explicar qué aporta disponer de mediciones en distintos momentos y por qué ello no resuelve automáticamente todos los problemas causales.
- Contrafactual. Compara C y D y explica con tus palabras cómo intenta construir cada diseño aquello que habría ocurrido sin la intervención.
- Cierre. Explica por qué «no experimental» no significa «sin rigor» y por qué «experimental» tampoco significa «sin limitaciones».
Antes de entregar, comprueba que:
- No utilizas causalidad para describir una asociación transversal.
- No confundes significancia estadística con fortaleza del diseño.
- Explicas la función de la asignación aleatoria en lugar de limitarte a nombrarla.
- Reconoces el sesgo de selección como cuestión central del caso cuasi experimental.
- Distingues temporalidad de causalidad.
- Reconoces que la validez de una medida y la comparabilidad de los grupos también condicionan la inferencia.
📋 Prueba el lenguaje de tu conclusión
Selecciona un caso, escribe una conclusión y confronta si su verbo exige más evidencia de la que el diseño proporciona.
🎯 Evidencia de logro
Un análisis de 850 a 1,050 palabras que distinga cuatro arquitecturas cuantitativas, formule inferencias proporcionales a cada diseño y explique con palabras propias las funciones de la temporalidad, la comparación, la aleatorización y el control de explicaciones alternativas.
¿Qué información necesitarías conocer sobre un estudio antes de aceptar que la palabra «impacto» en su título corresponde realmente con lo que su diseño permite demostrar?
Referencias bibliográficas
- American Psychological Association. (n.d.). Quantitative research design: Journal article reporting standards. APA Style.
- Creswell, J. W., & Creswell, J. D. (2023). Research design: Qualitative, quantitative, and mixed methods approaches (6th ed.). SAGE Publications.
- Creswell, J. W., & Guetterman, T. C. (2024). Educational research: Planning, conducting, and evaluating quantitative and qualitative research (7th ed.). Pearson.
- Institute of Education Sciences. (2022). What Works Clearinghouse procedures and standards handbook, version 5.0 (Rev. December 2022). U.S. Department of Education.
- Institute of Education Sciences. (n.d.). Program evaluation toolkit: Module 3, evaluation design. U.S. Department of Education.
- Shadish, W. R., Cook, T. D., & Campbell, D. T. (2002). Experimental and quasi-experimental designs for generalized causal inference. Houghton Mifflin.
- STROBE Initiative. (n.d.). STROBE checklists.