Lección

Sistematización y análisis de datos

🟢 Nivel doctoral  ·  Evidencia, análisis e inferencia

Los datos no contienen respuestas esperando ser descubiertas: una misma base puede producir conclusiones distintas según cómo se construya, codifique, modele y relacione con la pregunta.

Sistematizar significa preservar el significado y la trazabilidad de la evidencia. Analizar significa ejecutar operaciones explícitas que transforman esa evidencia en patrones, contrastes, categorías, estimaciones o explicaciones cuya interpretación pueda defenderse.

Decisión inicial

Ejemplo construido. Una investigación concluye la recolección y posee cuestionarios, transcripciones, registros institucionales y notas de campo. El investigador afirma: “Ya tengo los datos; ahora solo falta analizarlos”. ¿Qué problema revela principalmente esta afirmación?

Qué lograrás

Objetivo didáctico

🎯 Al finalizar esta lección
diseñarás un plan de sistematización y análisis que vincule cada pregunta, objetivo, hipótesis o categoría con unidades de análisis, estructura de datos, reglas de transformación, procedimientos analíticos, verificaciones de calidad y criterios de interpretación, preservando la trazabilidad entre evidencia original y conclusión.

Punto de partida

Introducción

La sistematización de datos suele confundirse con actividades administrativas como ordenar archivos, numerar cuestionarios o guardar transcripciones. Estas operaciones son necesarias, pero una sistematización doctoral cumple una función más profunda: conservar las relaciones que permiten reconstruir cómo una observación original termina convertida en evidencia analítica.

En una investigación cuantitativa, esa cadena puede incluir captura, definición de variables, codificación, transformación, identificación de valores imposibles, tratamiento de datos faltantes, construcción de escalas y modelado. En investigación cualitativa puede incluir preparación del corpus, segmentación, codificación, memos analíticos, comparación entre casos, construcción de categorías y búsqueda de evidencia discrepante. En métodos mixtos aparece además una exigencia de integración entre resultados producidos mediante lógicas diferentes.

Miles, Huberman y Saldaña conciben el análisis cualitativo como un proceso iterativo que involucra condensación de datos, presentación y construcción y verificación de conclusiones. Saldaña desarrolla la codificación como una operación de enlace entre datos y construcción analítica, no como simple etiquetado. En datos estructurados, la lógica de *tidy data* propuesta por Wickham muestra igualmente que la forma en que se organizan observaciones y variables condiciona qué operaciones posteriores son transparentes y reproducibles.

La cuestión doctoral es, por tanto, menos “¿qué técnica usaré?” y más “¿qué serie explícita de transformaciones permite que esta evidencia responda a esta pregunta sin introducir cambios silenciosos en su significado?”.

💡 Regla de trazabilidad
Una conclusión defendible debería poder recorrerse hacia atrás: conclusión → resultado → procedimiento analítico → dato transformado → registro original → unidad o fuente que produjo la evidencia.

El contenido

Desarrollo del tema

01

Sistematizar significa construir una cadena de custodia analítica

La primera exigencia consiste en preservar la diferencia entre dato original, dato procesado y resultado analítico. Sobrescribir una base original después de corregir valores, reemplazar transcripciones después de depurarlas o modificar categorías sin conservar versiones impide reconstruir qué transformaciones produjeron el resultado final.

Por ello conviene mantener una arquitectura de datos donde los registros originales permanezcan inalterados y las transformaciones se ejecuten de forma documentada sobre copias de trabajo. Cada variable derivada, recodificación, exclusión o corrección necesita una regla explícita. En corpus cualitativos, cada modificación relevante de segmentación o del sistema de códigos necesita también conservarse mediante versiones y memos.

El diccionario de datos cumple una función clave en bases estructuradas. Debe especificar nombre de variable, significado, unidad, valores permitidos, códigos de ausencia, fuente, momento de medición y transformaciones relevantes. En corpus cualitativos, una función semejante puede cumplirla un inventario que documente identificador, tipo de fuente, participante o caso, fecha, contexto, versión de transcripción y restricciones de uso.

La sistematización debe preservar además vínculos entre fuentes. Si un estudio integra pretest, postest, entrevistas y observaciones, los identificadores tienen que permitir relacionar registros correspondientes sin exponer innecesariamente identidades personales. La separación entre identificadores analíticos y datos directamente identificables forma parte también de una gestión responsable de la investigación.

¿Qué transformación rompe la trazabilidad?

Ejemplo construido. Un investigador encuentra valores imposibles en una base y decide corregirlos consultando formularios originales.

Registro original Fuente preservada Procesamiento Reglas explícitas Dato analítico Unidad preparada Análisis Operación Resultado Hallazgo Interpretación Inferencia defendida Verificación ¿Otra decisión produciría una conclusión distinta? Revisión Supuestos y datos El análisis es auditable cuando cada transformación conserva una ruta de regreso hacia la evidencia original.

Aplicación. Dibuja la ruta de una sola observación de tu proyecto desde el momento en que se produce hasta el resultado analítico en el que participará. Marca cada punto en que será modificada, codificada, resumida o combinada. Para cada transformación documenta quién la ejecutará, mediante qué regla y dónde quedará registrado el cambio.

02

Estructurar datos significa preservar la unidad de observación

Una base cuantitativa debe permitir distinguir con claridad qué representa cada fila, cada variable y cada nivel de observación. Cuando varias unidades se mezclan en una misma estructura —por ejemplo, estudiantes, cursos y escuelas— el análisis puede producir errores si no reconoce la jerarquía real de los datos.

La propuesta de *tidy data* de Wickham ofrece una convención útil: cada variable ocupa una columna, cada observación una fila y cada tipo de unidad observacional una tabla. No constituye una teoría de análisis, pero mejora la legibilidad de las transformaciones y facilita que las operaciones sean reproducibles.

Los datos longitudinales requieren decisiones adicionales. Una base puede organizarse en formato ancho, con momentos en columnas diferentes, o en formato largo, donde cada fila representa una observación de una unidad en un momento. La elección depende del procedimiento analítico, pero la correspondencia entre persona, tiempo, condición y medida debe permanecer inequívoca.

También deben codificarse explícitamente los datos faltantes. Un espacio vacío, cero y “no aplica” no significan lo mismo. Si múltiples causas de ausencia son colapsadas en un único código sin documentación, posteriormente será imposible estudiar los procesos que produjeron la falta de información.

Explora una estructura analítica

Tabla 1: Diferencias entre dato crudo, dato procesado y variable derivada.

Nivel Ejemplo construido Pregunta de control
Registro original Respuesta seleccionada por el participante: categoría 4. ¿Conservo exactamente lo registrado?
Dato procesado Categoría recodificada conforme al diccionario. ¿La regla de recodificación puede reproducirse?
Variable derivada Puntuación compuesta obtenida a partir de varios reactivos. ¿Está documentada la fórmula y justificada su interpretación?

Nota: ejemplo elaborado para esta lección a partir de principios generales de estructuración y trazabilidad de datos.

Aplicación. Diseña el diccionario de las cinco variables o campos más importantes de tu proyecto. Incluye definición, tipo, unidad, valores permitidos, códigos de ausencia, procedencia y cualquier transformación prevista. Si un colaborador externo no pudiera reconstruir el significado a partir del diccionario, todavía depende demasiado de conocimiento tácito.

03

El análisis cuantitativo debe derivarse del estimando y de la estructura de los datos

Seleccionar un análisis cuantitativo no consiste en emparejar mecánicamente “tipo de variable” con “prueba estadística”. La decisión comienza en la pregunta y el estimando: qué cantidad, diferencia, asociación, efecto o trayectoria representa la inferencia principal.

Después deben examinarse la estructura de dependencia, distribución, temporalidad y mecanismo de selección. Observaciones repetidas de una misma persona no son equivalentes a observaciones independientes; estudiantes pertenecientes a una misma clase pueden compartir condiciones; una variable de resultado acotada o categórica puede requerir una función de modelado distinta de una variable continua.

El análisis descriptivo antecede y acompaña al inferencial. Distribuciones, valores extremos, patrones de ausencia y relaciones entre variables pueden revelar problemas que no deberían ocultarse detrás de un modelo. Sin embargo, utilizar la exploración para ensayar múltiples decisiones y reportar únicamente la que produce el resultado preferido debilita la credibilidad del análisis.

Por ello conviene distinguir entre análisis confirmatorio, previamente vinculado con hipótesis y decisiones del protocolo, y análisis exploratorio, utilizado para descubrir patrones que generan nuevas hipótesis. Ambos son legítimos si su función se declara con transparencia.

Diseña desde la inferencia

Aplicación. Para cada hipótesis o pregunta cuantitativa de tu proyecto escribe cinco elementos: estimando, resultado, predictores o exposiciones, estructura de dependencia y procedimiento analítico candidato. Después describe qué supuesto del modelo, si fuera gravemente falso, modificaría más la interpretación.

04

En análisis cualitativo, codificar no equivale a encontrar temas

La codificación constituye una operación intermedia entre corpus e interpretación. Un código puede condensar una acción, significado, proceso, valor, condición o atributo presente en un segmento de datos. Sin embargo, una lista extensa de códigos no constituye todavía un análisis.

Saldaña distingue distintos ciclos y métodos de codificación según las necesidades del estudio. La decisión relevante no consiste en aplicar el mayor número de técnicas, sino en utilizar aquellas que permitan responder a la pregunta y desarrollar progresivamente una estructura analítica.

Los códigos deben compararse entre fuentes, casos y contextos. Algunos se agrupan, otros se dividen, otros desaparecen y algunos modifican su significado conforme el análisis avanza. Los memos analíticos documentan estas decisiones: por qué una categoría fue creada, qué evidencia la sostiene, qué casos la contradicen y cómo se relaciona con otras.

Una categoría organiza conceptualmente múltiples observaciones. Un tema, cuando la metodología utiliza este término, necesita expresar un patrón de significado relevante para la pregunta y no solamente el nombre del asunto mencionado con mayor frecuencia. La frecuencia puede ser analíticamente útil, pero la importancia de una categoría no depende exclusivamente de cuántas veces aparece.

Del fragmento a la interpretación

Ejemplo construido: “Cuando mi asesora me devuelve el texto completamente reescrito, normalmente acepto los cambios porque pienso que ella sabe mejor qué espera el comité; después me cuesta explicar por qué el argumento quedó así”.

Aplicación. Selecciona tres fragmentos de tu corpus piloto o, si todavía no existe, tres fragmentos de fuentes metodológicamente comparables. Produce códigos iniciales, una categoría provisional y un memo que explique la relación. Después busca deliberadamente un fragmento que no encaje y documenta qué cambia en la categoría.

05

Integrar datos mixtos significa producir una inferencia que ninguna fuente produciría sola

Un estudio no se vuelve mixto únicamente porque contenga una tabla estadística y varias entrevistas. La integración exige especificar qué relación existe entre los componentes y qué conocimiento adicional surge al ponerlos en diálogo.

Fetters, Curry y Creswell distinguen estrategias de integración que pueden ocurrir mediante conexión entre fases, construcción de un componente a partir de resultados de otro, fusión durante el análisis o incorporación de una fuente dentro de un diseño mayor. La elección depende del propósito del proyecto.

Una herramienta especialmente útil es la presentación conjunta o *joint display*: una estructura donde resultados cuantitativos y cualitativos se colocan en relación explícita. El interés no radica en presentar dos columnas paralelas, sino en identificar convergencia, complementariedad, expansión, contradicción o condiciones bajo las cuales los resultados adquieren significados diferentes.

La contradicción entre componentes no debe eliminarse automáticamente. Si una encuesta indica alta satisfacción mientras entrevistas revelan experiencias de presión o dependencia, la discrepancia puede señalar que ambas fuentes capturan dimensiones diferentes del fenómeno, que existe heterogeneidad entre subgrupos o que alguna de las medidas necesita ser revisada.

Escenario de integración

Tabla 2: Funciones posibles de la integración analítica.

Relación Pregunta analítica
Convergencia ¿Ambas fuentes sostienen una interpretación compatible?
Complementariedad ¿Una fuente explica dimensiones que la otra no captura?
Expansión ¿La combinación amplía la pregunta o revela mecanismos adicionales?
Discordancia ¿Qué supuesto, medición, subgrupo o condición podría explicar resultados aparentemente incompatibles?

Nota: organización didáctica basada en la lógica de integración de métodos mixtos desarrollada por Fetters, Curry y Creswell.

Aplicación. Si tu proyecto es mixto, construye una presentación conjunta provisional antes de recolectar datos. Define qué resultado ocuparía cada columna o fila y qué inferencia nueva esperas producir al relacionarlos. Si la tabla solo coloca “resultados cuantitativos” junto a “resultados cualitativos” sin una pregunta de integración, todavía no existe una estrategia mixta de análisis.

Cierre

Conclusión

Sistematizar datos significa preservar la arquitectura mediante la cual la evidencia puede ser examinada y reconstruida. Una carpeta ordenada no es suficiente si las transformaciones, códigos, exclusiones y versiones permanecen implícitos. La primera condición del análisis es que el investigador pueda explicar de dónde proviene cada elemento y qué ocurrió con él.

En datos cuantitativos, la estructura de la base, la unidad de observación y el diccionario determinan la transparencia de las operaciones posteriores. El análisis debe derivarse del estimando y conservar dependencias temporales, jerárquicas y muestrales relevantes. La técnica estadística se selecciona después de estas decisiones.

En investigación cualitativa, codificar inicia una construcción analítica pero no la completa. Los códigos deben compararse, relacionarse y someterse a casos discrepantes hasta producir categorías o explicaciones capaces de responder a la pregunta. Los memos conservan la historia intelectual de esas transformaciones.

En métodos mixtos, el punto decisivo es la integración. Los resultados no se vuelven más sólidos por existir en dos formatos; adquieren valor adicional cuando la relación entre ellos produce una interpretación que ninguna fuente aislada habría permitido construir.

La siguiente lección trasladará esta arquitectura del análisis a la viabilidad del proyecto: recursos y cronograma de investigación. Allí cada procedimiento deberá convertirse en tareas, dependencias, responsables, productos y recursos, de modo que el rigor metodológico diseñado hasta ahora pueda ejecutarse realmente.

🔭 Para seguir aprendiendo

  • Toma un resultado publicado de tu campo e intenta reconstruir todas las transformaciones necesarias desde la evidencia original hasta la tabla, figura, categoría o modelo final.
  • Identifica una decisión de análisis de tu proyecto que actualmente solo exista porque “así lo hace el software” y reformúlala desde la pregunta o el estimando.
  • Construye una explicación rival de tu hallazgo esperado y determina qué análisis de sensibilidad, caso discrepante o fuente adicional podría distinguir ambas interpretaciones.
Ahora tú

Actividad de aprendizaje autónoma

Protocolo de sistematización y análisis de datos

Construye el plan analítico completo de tu proyecto antes de disponer de la base definitiva. El producto debe permitir que otro investigador reconstruya qué ocurrirá con cada fuente de datos desde su recepción hasta la conclusión que ayudará a sostener.

Tu entrega debe incluir:

  1. Inventario de fuentes. Enumera cada fuente de evidencia y especifica unidad de observación, unidad de análisis, momento de producción, formato, identificador y pregunta u objetivo al que contribuirá.
  2. Arquitectura de almacenamiento. Diferencia datos originales, copias de trabajo, archivos procesados, resultados y documentación. Define convenciones de nombres, versiones y mecanismos para impedir que los originales sean sobrescritos.
  3. Diccionario o inventario analítico. Para datos estructurados documenta variables, tipos, unidades, valores permitidos, ausencias y procedencia. Para material cualitativo documenta fuente, caso, contexto, versión, estado de transcripción y restricciones analíticas.
  4. Reglas de calidad. Define cómo identificarás duplicados, valores imposibles, inconsistencias temporales, errores de captura, archivos incompletos y problemas de correspondencia entre fuentes. Especifica qué decisiones pueden corregirse y cuáles deben conservarse como datos faltantes o incidencias.
  5. Transformaciones. Documenta recodificaciones, variables derivadas, puntuaciones compuestas, segmentaciones, normalizaciones, exclusiones y cualquier otra operación. Cada transformación debe indicar entrada, regla y salida esperada.
  6. Ruta cuantitativa, cuando corresponda. Para cada pregunta o hipótesis identifica estimando, variables, estructura de dependencia, descriptivos necesarios, modelo candidato, supuestos, datos faltantes, análisis de sensibilidad y resultado esperado del procedimiento.
  7. Ruta cualitativa, cuando corresponda. Define unidad de codificación, estrategia inicial de codificación, proceso para construir categorías, uso de memos, comparación entre casos, búsqueda de evidencia discrepante y criterio mediante el cual una categoría será considerada suficientemente desarrollada.
  8. Ruta mixta, cuando corresponda. Define dónde ocurrirá la integración, qué resultados se conectarán, qué estructura de presentación conjunta utilizarás y qué tipo de inferencia adicional podrá surgir de convergencias, complementariedades o discordancias.
  9. Mapa de decisiones sensibles. Identifica al menos cinco decisiones analíticas alternativas capaces de modificar la conclusión: tratamiento de datos faltantes, exclusiones, definiciones, modelos, códigos, agrupaciones u otras. Para cada una establece cómo comprobarás la robustez de la interpretación.
  10. Trazabilidad final. Construye una matriz donde cada objetivo o pregunta pueda recorrerse hasta fuente, transformación, procedimiento, resultado e inferencia. Ningún análisis debe quedar sin pregunta y ninguna pregunta debe quedar sin una ruta analítica.
  11. Frontera de interpretación. Redacta la afirmación más fuerte que tu estrategia analítica podría sostener y otra que seguiría excediendo la evidencia aun si los resultados fueran favorables.

🛠 Planificador de trazabilidad analítica

📊 Evidencia de logro

Protocolo técnico acompañado por matriz de trazabilidad, diccionario o inventario de datos y esquema de análisis. La evidencia se considera lograda cuando cada pregunta posee una ruta explícita desde la fuente original hasta la inferencia, las transformaciones son reproducibles, los análisis principales tienen criterios previos y las decisiones alternativas capaces de modificar la interpretación han sido identificadas y sometidas a verificación.

🤔

Si otra persona recibiera mañana tus datos originales y tu protocolo de análisis, ¿podría reconstruir una conclusión comparable sin preguntarte qué decisiones tomaste “sobre la marcha”?

Referencias bibliográficas

  • Fetters, M. D., Curry, L. A., & Creswell, J. W. (2013). Achieving integration in mixed methods designs: Principles and practices. Health Services Research, 48(6 Pt 2), 2134–2156.
  • Miles, M. B., Huberman, A. M., & Saldaña, J. (2020). Qualitative data analysis: A methods sourcebook (4th ed.). SAGE.
  • Saldaña, J. (2021). The coding manual for qualitative researchers (4th ed.). SAGE.
  • van Buuren, S. (2018). Flexible imputation of missing data (2nd ed.). CRC Press.
  • Wickham, H. (2014). Tidy data. Journal of Statistical Software, 59(10), 1–23.