Lenguaje multimodal y arquitectura del mensaje

🟢 Posgrado  ·  Profundidad: Crear

Una imagen no mejora una explicación por el simple hecho de aparecer junto a ella.

Palabra, imagen, sonido, movimiento y tiempo poseen posibilidades representacionales distintas. Diseñar un mensaje audiovisual consiste en decidir qué debe hacer cada código, cómo se relacionará con los demás y qué integración deberá construir el estudiante.

🔎 ¿Más modalidades significa mejor comunicación?

Una explicación audiovisual muestra simultáneamente un diagrama complejo, una narración que lo explica, el mismo texto completo escrito en pantalla y una animación decorativa. ¿Cuál es el mejor diagnóstico inicial?

Qué lograrás

Objetivo didáctico

🎯 Al finalizar esta lección podrás
Crear una arquitectura multimodal para un mensaje educativo, asignando funciones diferenciadas a lenguaje verbal, imagen, sonido, movimiento y temporalidad, y justificando sus relaciones mediante criterios de complementariedad, integración, señalización y economía cognitiva.

Punto de partida

Introducción

Una parte importante de la tradición de tecnología educativa describió materiales formados por mensajes verbo-icónicos: mensajes donde las palabras y las imágenes participan conjuntamente en la construcción de significado. La categoría sigue siendo útil, pero el entorno audiovisual contemporáneo exige ampliarla. Hoy una pieza puede articular también voz, música, sonido ambiental, animación, movimiento corporal, posición espacial, ritmo, interacción y cambios temporales.

Por ello resulta más preciso hablar de arquitectura multimodal del mensaje. El concepto no significa simplemente utilizar muchos medios. Significa asignar funciones a recursos semióticos diferentes y establecer relaciones entre ellos. Una representación visual puede mostrar una configuración espacial; una formulación verbal puede expresar una condición abstracta; una animación puede hacer observable una transformación; el sonido puede comunicar ritmo, intensidad, ambiente o habla.

La investigación sobre aprendizaje multirrepresentacional muestra que distintas representaciones pueden contener información equivalente y, sin embargo, permitir operaciones diferentes. Un diagrama puede hacer perceptible una relación espacial con rapidez, mientras una formulación verbal puede expresar condiciones, abstracciones o negaciones con mayor precisión. Esta diferencia es precisamente una razón para combinar códigos, siempre que el estudiante pueda integrarlos.

El problema central, entonces, deja de ser «¿qué imagen acompaña este texto?» y se convierte en «¿qué parte del significado debería construir cada representación y qué relación deberá establecer el estudiante entre ellas?».

💡 Multimodalidad
Organización coordinada de distintos recursos de representación y comunicación para construir significado. En diseño educativo, su valor no depende del número de modalidades, sino de las funciones que cumplen y de las relaciones que el estudiante puede construir entre ellas.

El contenido

Desarrollo del tema

01

Lenguaje verbal y lenguaje icónico: representar no es duplicar

El lenguaje verbal y el lenguaje icónico no son dos versiones intercambiables de un mismo mensaje. Cada sistema obliga a seleccionar y hacer explícitas propiedades diferentes. Una frase puede indicar que «el elemento A se encuentra cerca del elemento B» sin especificar con precisión tamaño, orientación, color o forma. Una imagen que represente esa misma relación debe tomar decisiones sobre esas propiedades, aunque no todas sean relevantes para el aprendizaje.

Esta diferencia permite distinguir entre equivalencia informativa y equivalencia operativa. Dos representaciones pueden permitir inferir una información semejante, pero una puede hacer cierta relación mucho más fácil de reconocer. Un mapa y una descripción escrita pueden señalar el mismo recorrido; sin embargo, no imponen el mismo costo para localizar proximidades, cruces o direcciones.

Las representaciones icónicas poseen además un grado de especificidad: obligan a mostrar determinadas propiedades del referente. Esa característica puede restringir una interpretación equivocada, pero también introducir detalles irrelevantes. El diseñador necesita decidir qué propiedades deben permanecer visibles y cuáles pueden simplificarse.

Por eso una imagen educativa no se evalúa primordialmente por su realismo. Se evalúa por la relación entre lo que representa y la inferencia que debería favorecer. En ocasiones una fotografía es indispensable; en otras, un esquema simplificado revela mejor la estructura que una imagen visualmente más rica.

Lenguaje verbal abstracción · condición secuencia · explicación negación · argumentación Lenguaje icónico forma · posición proporción · configuración comparación visual · patrón Integración el estudiante relaciona representaciones para construir un modelo coherente Comprensión transferible explicar · interpretar · aplicar · producir

Figura 1. Relación funcional entre representación verbal, representación icónica e integración. Elaboración propia a partir de Ainsworth (2006, 2025) y Mayer (2024).

🧭 Elige la representación por la operación

Determina qué representación debería asumir la función principal. Las opciones cambian de posición.

Aplicación. Regresa al brief de L3 y localiza una idea importante. Redáctala primero exclusivamente en palabras y después exclusivamente como representación visual. Compara qué información se vuelve explícita, qué información desaparece y qué inferencias son más fáciles en cada versión.

02

Funciones de la imagen en los mensajes verbo-icónicos

La función de una imagen no puede deducirse únicamente de su apariencia. La misma fotografía puede utilizarse como evidencia, ejemplo, contexto, objeto de análisis o simple decoración. Por ello, para diseñar mensajes verbo-icónicos resulta más útil describir qué relación pretende producir la imagen con respecto al contenido verbal.

Ainsworth propone tres grandes funciones para sistemas de representaciones múltiples. La primera consiste en complementar: una representación ofrece información o posibilidades de procesamiento que la otra no proporciona con la misma facilidad. La segunda consiste en restringir la interpretación: una representación ayuda a limitar ambigüedades o interpretaciones incorrectas de otra. La tercera consiste en construir una comprensión más profunda: el estudiante debe relacionar representaciones para abstraer una estructura o producir una nueva inferencia.

Para uso operativo en este curso añadiremos una cuarta función transversal: señalar. No constituye una categoría independiente del marco de Ainsworth, sino una decisión de diseño derivada de la investigación sobre aprendizaje multimedia. Flechas, encuadres, cambios de contraste o indicadores temporales pueden dirigir la atención hacia la parte que debe relacionarse con la explicación.

Esta clasificación permite cuestionar imágenes aparentemente «educativas». Si una imagen repite de manera innecesaria lo que ya es evidente en la palabra, puede no cumplir una función adicional. Si exige interpretar detalles irrelevantes, puede incluso competir con el mensaje. La pregunta decisiva es: ¿qué comprensión se perdería si esta imagen desapareciera?

🔍 Cuatro funciones para auditar una imagen

Explora las funciones. La cuarta es una categoría operativa incorporada para esta lección.

FunciónPregunta de diseñoRiesgo
Complementar¿Qué aporta la imagen que la palabra no representa con la misma eficacia?Añadir una imagen sin función diferencial.
Restringir¿Qué interpretación ambigua o incorrecta ayuda a descartar?Crear una falsa precisión que no existe en el concepto.
Construir¿Qué inferencia aparece al relacionarla con otra representación?Esperar integración sin proporcionar claves suficientes.
Señalar¿Hacia qué elemento o relación debe dirigirse la atención?Destacar demasiados elementos hasta destruir la jerarquía.

Nota: complementar, restringir y construir se basan en Ainsworth (2006, 2025); señalamiento se incorpora como función operativa de diseño a partir de la literatura sobre aprendizaje multimedia.

Aplicación. Elige tres imágenes de un material educativo existente. Para cada una escribe un verbo funcional: complementa, restringe, construye o señala. Si la única explicación posible es «decora» o «hace más atractivo», decide si su permanencia es pedagógicamente defendible.

03

Combinación de códigos: redundancia, complementariedad e interdependencia

Cuando palabra e imagen aparecen juntas, su relación puede adoptar configuraciones muy distintas. Para diseñarlas resulta útil distinguir tres tipos operativos: redundante, complementaria e interdependiente. Esta tipología se emplea aquí como instrumento de análisis del curso y no pretende sustituir otras clasificaciones semióticas.

En una relación redundante, ambos códigos transmiten esencialmente la misma información y uno puede resultar prescindible. La redundancia no es automáticamente incorrecta: puede cumplir funciones de accesibilidad, énfasis, recordatorio o apoyo bajo determinadas condiciones. El problema aparece cuando obliga al estudiante a procesar simultáneamente duplicaciones que no aportan nada al desempeño.

En una relación complementaria, cada representación aporta información diferente pero coordinada. Por ejemplo, la imagen muestra la disposición de componentes y la narración explica por qué esa disposición produce determinado resultado. Ningún código necesita contener toda la información del otro.

En una relación interdependiente, la interpretación central exige integrar los códigos. El mensaje completo no se encuentra en una sola representación: emerge de su relación. Esta configuración puede producir comprensión profunda, pero también plantea una exigencia elevada porque el estudiante necesita localizar correspondencias y construir integración.

🧩 Diagnóstico verbo-icónico

Clasifica la relación dominante. Las respuestas cambian de posición en cada caso.

En el diseño de un recurso audiovisual conviene evitar además el problema de atención dividida. Si dos representaciones necesitan integrarse, pero aparecen separadas espacial o temporalmente de forma innecesaria, el estudiante debe emplear recursos adicionales para localizar correspondencias. La proximidad y el señalamiento pueden disminuir ese costo.

Aplicación. Selecciona un segmento de tu proyecto y define explícitamente si la relación entre palabra e imagen será redundante, complementaria o interdependiente. Después responde qué ganaría y qué perdería el estudiante si una de las dos representaciones desapareciera.

04

Audio, texto y movimiento: distribuir información sin convertir principios en recetas

La modalidad auditiva amplía las posibilidades del mensaje, pero exige comprender el carácter temporal del sonido. Una explicación oral desaparece a medida que avanza; un texto impreso permanece disponible para inspección. Esto significa que narración y texto no deben sustituirse mecánicamente entre sí.

El principio de modalidad ha mostrado que, bajo condiciones específicas, distribuir parte de la información entre procesamiento visual y auditivo puede reducir la sobrecarga que se produciría si toda la información esencial compitiera visualmente. Un ejemplo típico es una visualización compleja acompañada de explicación oral, en vez de exigir que el estudiante observe la visualización y lea simultáneamente un bloque extenso.

Sin embargo, esas condiciones importan. El contenido verbal puede requerir revisión, comparación o precisión terminológica; el estudiante puede encontrarse en un entorno donde el audio no sea utilizable; y las necesidades de accesibilidad exigen alternativas equivalentes. Además, el conocimiento previo modifica qué apoyos son útiles: una ayuda necesaria para una persona novel puede resultar redundante para una persona experta.

El movimiento también debe justificarse. Una animación tiene una función fuerte cuando el cambio mismo forma parte de lo que debe comprenderse: trayectoria, secuencia, transformación, gesto o evolución temporal. Si lo importante es una estructura estable, una representación estática puede permitir una inspección más detenida y controlada.

🎧 Distribuye el trabajo entre modalidades

Evalúa cada propuesta. No existe una regla de «audio siempre» o «texto siempre».

Aplicación. Revisa un segmento de tu brief y registra cada elemento que pretendes utilizar: narración, texto, fotografía, diagrama, movimiento, música o sonido. Para cada uno escribe una función. Si dos elementos cumplen exactamente la misma función, decide si la duplicación está justificada.

Cierre

Conclusión

El lenguaje audiovisual educativo no consiste en traducir un texto a imágenes ni en acumular estímulos. Consiste en construir una arquitectura de representaciones donde cada modalidad realiza un trabajo específico y las relaciones entre ellas son comprensibles para el estudiante.

La distinción entre lenguaje verbal e icónico permite reconocer que las representaciones poseen capacidades diferentes. Las imágenes pueden complementar, restringir interpretaciones y contribuir a construir nuevas inferencias; también pueden señalar relaciones relevantes. Sin embargo, para que esas funciones produzcan aprendizaje, el estudiante necesita identificar y coordinar las representaciones.

Por ello, una decisión multimodal madura puede consistir tanto en añadir una representación necesaria como en eliminar una representación redundante. Crear implica elegir, jerarquizar y justificar. En la siguiente lección estas decisiones se convertirán en producción: guion, ritmo, realización, montaje y diseño de una experiencia audiovisual interactiva.

🔭 Para seguir aprendiendo

  • Identifica una imagen educativa que cumpla una función complementaria y explica qué perdería la explicación sin ella.
  • Localiza un caso de redundancia verbo-icónica y determina si la duplicación tiene una razón defendible.
  • Compara una representación estática y una dinámica del mismo contenido y decide qué operación facilita mejor cada una.
Ahora tú

Actividad de aprendizaje autónoma

Dos arquitecturas multimodales para un mismo contenido

Retoma el problema y el desempeño definidos en tu brief tecnopedagógico de la L3. Diseña dos propuestas audiovisuales distintas para enseñar exactamente el mismo contenido. Ambas deben perseguir el mismo desempeño, pero distribuir de manera diferente las funciones entre palabra, imagen, audio, movimiento y temporalidad.

El objetivo no es decidir cuál propuesta es «más creativa», sino demostrar que puedes construir y justificar arquitecturas multimodales alternativas.

Instrucciones:

  1. Selecciona un núcleo del brief. Elige una idea, procedimiento, relación o caso que sea suficientemente importante para formar parte del prototipo final.
  2. Define la información esencial. Señala qué debe comprender o ser capaz de hacer el estudiante después de este segmento.
  3. Construye la propuesta A. Distribuye funciones entre lenguaje verbal, imagen, audio, movimiento y texto. No es obligatorio utilizar todos los códigos.
  4. Construye la propuesta B. Mantén el mismo objetivo y contenido, pero cambia de manera sustantiva la arquitectura de representaciones. No basta con modificar colores, estética o herramienta.
  5. Clasifica las imágenes. En cada propuesta indica si cumplen principalmente una función de complementar, restringir, construir o señalar.
  6. Analiza la relación verbo-icónica. Identifica los segmentos redundantes, complementarios o interdependientes y justifica por qué la relación es adecuada.
  7. Justifica la modalidad. Explica qué información se presenta mediante narración, texto escrito, representación visual o movimiento y por qué esa distribución es pertinente.
  8. Identifica riesgos de procesamiento. Señala posibles redundancias innecesarias, atención dividida, exceso de detalle o elementos sin función.
  9. Construye un storyboard comparativo. Representa entre seis y ocho cuadros de cada propuesta. Cada cuadro debe especificar qué ve el estudiante, qué escucha o lee y qué operación cognitiva debe realizar.
  10. Emite una decisión. Selecciona cuál de las dos arquitecturas llevarías a producción. Justifica la elección mediante criterios pedagógicos y representacionales, no mediante gusto personal.

🧩 Matriz de decisiones multimodales

Define qué trabajo asignarás a cada código. El resultado funciona como borrador para tu storyboard.

✅ Evidencia de logro

La entrega será satisfactoria si ambas propuestas persiguen el mismo desempeño pero muestran arquitecturas multimodales realmente distintas; cada código posee una función justificable; se identifican las relaciones verbo-icónicas; el storyboard permite reconstruir qué ve, escucha o lee el estudiante; se anticipan riesgos de procesamiento; y la selección final se sostiene mediante criterios explícitos.

Formato de entrega: PDF. Incluye una síntesis del contenido y desempeño, dos arquitecturas multimodales, dos storyboards comparables de seis a ocho cuadros cada uno y una justificación final de aproximadamente 800 a 1,000 palabras. Conserva esta evidencia: la propuesta seleccionada pasará directamente a producción en L5.

🤔

Si cada palabra, imagen y sonido de tu recurso tuviera que justificar su permanencia, ¿cuántos elementos seguirían realmente ahí?

Referencias bibliográficas

  • Ainsworth, S. (2006). DeFT: A conceptual framework for considering learning with multiple representations. Learning and Instruction, 16(3), 183–198.
  • Ainsworth, S. E. (2025). Multi-representational learning. Open Encyclopedia of Cognitive Science.
  • Castro-Alonso, J. C., & Sweller, J. (2021). The modality principle in multimedia learning. En R. E. Mayer & L. Fiorella (Eds.), The Cambridge handbook of multimedia learning (3rd ed.). Cambridge University Press.
  • Kalyuga, S., & Sweller, J. (2021). The redundancy principle in multimedia learning. En R. E. Mayer & L. Fiorella (Eds.), The Cambridge handbook of multimedia learning (3rd ed.). Cambridge University Press.
  • Kress, G., & van Leeuwen, T. (2021). Reading images: The grammar of visual design (3rd ed.). Routledge.
  • Mayer, R. E. (2021). Multimedia learning (3rd ed.). Cambridge University Press.
  • Mayer, R. E. (2024). The past, present, and future of the cognitive theory of multimedia learning. Educational Psychology Review, 36, Article 8.
  • van Gog, T. (2021). The signaling (or cueing) principle in multimedia learning. En R. E. Mayer & L. Fiorella (Eds.), The Cambridge handbook of multimedia learning (3rd ed.). Cambridge University Press.