Convocatoria abierta

I Premios Universidad y Divulgación Fundación Muy Interesante

Reconocemos el trabajo de investigadores, divulgadores, profesores, doctorandos y unidades de cultura científica que acercan el conocimiento a la sociedad.

Fundación » Ciencia e innovación » La IA ahora puede hablar con tu voz, pero ¿sigue siendo tu mensaje?

La IA ahora puede hablar con tu voz, pero ¿sigue siendo tu mensaje?

Cuando la tecnología y la inteligencia artificial cambian tu voz en lugar de tus palabras, surgen dudas sobre identidad, autenticidad y contexto. Aun así, estas herramientas prometen derribar barreras lingüísticas y hacer la comunicación más accesible.

Creado: 06.05.2026

Actualizado: 07.05.2026

Estás probando una aplicación nueva para hablar por teléfono en otra lengua y que una Inteligencia Artificial (IA) doble tu voz a ese idioma que tu interlocutor va a entender. Te escuchas y te reconoces, pero hay algo que no encaja. Las palabras en inglés (o en alemán, o en japonés) son exactamente las que tú dirías, y el timbre de voz es, sin duda, el tuyo. Sin embargo, suenas extrañamente asertivo, casi agresivo, cuando en realidad estabas bromeando. O quizás suenas dubitativo en el punto exacto donde querías mostrar firmeza. Lo que tienes ante ti es tu “doble digital”: un prodigio de la IA que ha cruzado la frontera del idioma, pero que en el camino ha dejado atrás tu intención. Bienvenido a la era de la pérdida de la esencia prosódica, es decir, de los matices de la voz, donde la traducción es exacta, pero el mensaje ya no es del todo tuyo.

La IA puede hacer que parezca que alguien habla con fluidez una lengua que nunca ha aprendido. Al combinar clonación de voz, síntesis del habla y sincronización labial, los sistemas de IA reproducen el tono, el ritmo y el carácter vocal de una persona con tal grado de verosimilitud que el resultado se percibe como auténtico. Pero esta innovación conlleva un nuevo y sutil riesgo: la desinformación auditiva. Las palabras pueden estar traducidas con precisión, pero pequeños cambios en el énfasis, el ritmo o el tono emocional pueden alterar la forma en que se interpreta un mensaje, haciendo que un hablante suene más o menos asertivo, seguro o emotivo de lo que realmente era.

Este artículo examina las cuestiones éticas que surgen cuando la tecnología transforma no lo que decimos, sino cómo sonamos. Explora la voz como una forma de identidad personal, los límites de los sistemas que imitan el habla sin comprender el contexto y por qué esto importa en un panorama mediático global. Junto a estas preocupaciones, también destaca el verdadero potencial de estas herramientas para mejorar la accesibilidad y derribar barreras lingüísticas en todo el mundo.

Cuando la IA te presta una lengua: la orfebrería del habla

La IA ha logrado lo que parecía imposible: que tu identidad sonora sea políglota. Al combinar traducción automática, clonación de voz, síntesis del habla y, en entornos audiovisuales, sincronización labial, los sistemas actuales reproducen el tono, el ritmo y el timbre de una persona con tal verosimilitud que el resultado se percibe como auténtico. Los sistemas actuales no solo traducen el significado, sino que también “mapean” tus características acústicas —el tono, la intensidad de cómo suenas y tu ritmo respiratorio— y los inyectan en un idioma que nunca has hablado.

Figura 1. La voz contiene matices que cambian de una lengua a otra. ¿Es capaz la IA de trabajar esa orfebrería? Fuente: Gemini.

En el proyecto RELANZA hemos creado un pódcast para que cualquier oyente pueda escuchar todos los episodios en dos lenguas. Dos de las investigadoras invitadas, españolas y bilingües en inglés, fueron entrevistadas en español. Sin embargo, los oyentes también pueden escuchar una versión en inglés generada mediante IA que conserva su huella vocal (Episodios 3 y 4). No se trata de un doblaje convencional ni de una voz sintética genérica: es, aparentemente, la suya, recreada mediante un proceso de clonación de voz. Este proceso no es una simple sustitución de pistas de audio, sino una reconstrucción estadística de la personalidad, es decir, una manipulación sutil de los rasgos característicos del habla humana basada en algoritmos. Sin embargo, aquí yace la paradoja: la herramienta es capaz de reproducir la textura de la voz con una precisión asombrosa, pero opera en un vacío de experiencia (Schuller & Batliner, 2013). La IA no sabe que ese silencio antes de una palabra era un rasgo de timidez, o que esa subida de tono era un énfasis irónico. Para el algoritmo, solo son datos de amplitud (medida en decibelios) y frecuencia (medida en hercios). Sin la supervisión humana que ajuste esos «pesos» emocionales, la fluidez técnica puede acabar sepultando la autenticidad del hablante. En definitiva, la fluidez que escuchamos no es el resultado de un aprendizaje lingüístico humano, sino de una modelización algorítmica de la voz (Yang et al., 2020).

Jonathan Castilla Linares (Universidad Internacional de La Rioja), técnico responsable del proceso de clonación y doblaje con IA del pódcast RELANZA, describe el trabajo como un ejercicio de orfebrería digital. “El objetivo no era solo clonar el timbre, sino capturar rasgos como el ritmo al hablar, las pausas o la forma de enfatizar ciertas palabras”, explica. “Dos versiones del mismo texto pueden transmitir percepciones muy diferentes dependiendo del tono, la velocidad o la colocación del énfasis. Aunque la traducción lingüística sea correcta, la percepción del hablante puede cambiar si la prosodia no se mantiene fiel al original”, añade.

La herramienta es capaz de reproducir patrones acústicos con gran precisión, pero no comprende el contexto ni la experiencia que hay detrás de cada frase. Por eso, la supervisión humana sigue siendo esencial, porque, como apunta Jonathan Castilla, “el receptor final sigue siendo humano”.

La voz como identidad y el riesgo de la desinformación auditiva

La voz no es un mero vehículo de información, es una arquitectura de la identidad. En ella se entrelazan la biografía de una persona, sus emociones, su manera de mostrarse ante los demás y su forma de pensar. En lingüística, la prosodia es lo que permite que una misma frase —como la del reto “Cállate” en TikTok— signifique desde una aceptación alegre hasta una resignación amarga. Cuando delegamos nuestra voz en una IA para que hable por nosotros en otro idioma, corremos el riesgo de sufrir una desinformación auditiva sutil.

Figura 2. ¿Los cambios en los matices de la voz implican un cambio en nuestra identidad? Esto puede llevar a una desinformación auditiva en nuestro oyente. Fuente: Gemini.

Como señalan Noelia Ruiz Madrid (Universitat Jaume I) y Emma Dafouz (Universidad Complutense de Madrid), las investigadoras participantes en RELANZA, la sensación al escuchar la versión en inglés de su entrevista es de una extraña ambivalencia. “La primera impresión fue: ‘ostras, es mi voz’”, recuerda Noelia Ruiz, “pero al mismo tiempo sabía que no era exactamente yo: el ritmo y el énfasis no eran los mismos”.

Emma Dafouz describe una sensación similar: “Al principio me sorprendí bastante, porque sonaba como yo, pero no era exactamente yo. Sobre todo, me llamó la atención que se marcaban ciertas variantes del inglés, creo que algo parecido al acento de Nueva Zelanda, que en realidad forman una pequeña parte de mi forma de hablar, quizá heredada de mi madre, pero que en la versión generada por IA aparecían mucho más acentuadas».

Para ambas, la diferencia está en los matices. “Una voz puede parecerse mucho a la tuya”, explica Noelia Ruiz, “pero el énfasis o la forma de construir el discurso dependen de decisiones muy personales. Y eso, de momento, la IA no lo reproduce”.

Figura 3. La IA puede reproducir una voz humana, pero no siempre los matices que imprimen su estilo personal. Fuente: Gemini.

El “tú” que llega al oyente en inglés ha pasado por el filtro de una red de datos que prioriza la claridad sobre el matiz. Si la IA decide que tu tono debe ser más plano para sonar “profesional” en inglés, está alterando tu estilo y tu posicionamiento social. No se están falseando los hechos, como en una fake news, pero sí se está distorsionando algo más sutil: la verdad de la personalidad. En un mundo donde la confianza se basa en la percepción de la autoridad y la empatía, un ligero error en el “color” emocional de la voz puede cambiar drásticamente cómo te juzga tu audiencia. Ahí aparece un riesgo nuevo y sutil: la desinformación auditiva. No se trata de inventar declaraciones falsas, sino de modificar imperceptiblemente cómo suena una persona. Un ligero ajuste en el tono puede hacer que alguien parezca más asertivo o más dubitativo. Un ritmo diferente puede transmitir mayor frialdad o mayor entusiasmo (Gobl & Chasaide, 2003). En un panorama mediático global, donde la comunicación circula sin fricciones entre idiomas, esos matices influyen en la percepción de credibilidad y autoridad.

Los sistemas actuales pueden imitar el habla, pero no comprenden el contexto cultural ni las implicaciones pragmáticas de cada matiz. Esa distancia entre imitación técnica y comprensión significativa marca uno de los límites éticos de la tecnología.

Entre la oportunidad y la responsabilidad

Sería un error reducir esta innovación a sus riesgos. Las mismas herramientas que pueden alterar matices permiten derribar barreras lingüísticas y ampliar el acceso al conocimiento. En el caso de RELANZA, la IA facilita que investigaciones realizadas en español circulen en inglés conservando la identidad vocal de sus autoras. Para la transferencia social del conocimiento, esto supone un avance notable: amplía audiencias, reduce costes y democratiza la difusión científica.

Además, estas tecnologías pueden mejorar la accesibilidad, por ejemplo, permitiendo a personas con dificultades del habla preservar una versión digital de su voz y favorecer la comunicación intercultural en educación, ciencia o cooperación internacional.

El desafío no es tecnológico, sino normativo y ético (Boletín Oficial del Estado, 2024). ¿Debe considerarse la voz un dato biométrico especialmente protegido? ¿Cómo garantizar el consentimiento informado cuando una identidad vocal puede reproducirse en múltiples idiomas? ¿Qué mecanismos de control evitan que pequeñas modulaciones alteren la percepción pública?

Para el técnico del proyecto, Jonathan Castilla, el primer riesgo aparece en el terreno de la interpretación. Aunque las palabras sean correctas, la percepción del hablante puede cambiar: “el riesgo no es que cambie lo que se dice, sino cómo se percibe a quien lo dice”.

Las investigadoras entrevistadas añaden otros matices. Noelia Ruiz sitúa el problema en el contexto de uso: “En un entorno académico no me preocupa, porque hay normas éticas y control sobre cómo se utiliza. Lo que sí me inquieta es qué podría pasar si esta tecnología se usa fuera de ese marco”.

Emma Dafouz, en cambio, pone el foco en la dimensión más personal del fenómeno. “La forma de hablar es una de las señales más fuertes de identidad. Cuando interviene una IA, sientes que parte de ese control sobre tu propia identidad se desplaza”. Sus reflexiones apuntan a un mismo fondo común: cuando la tecnología puede reproducir nuestra voz en otros idiomas, no solo se amplían las posibilidades de comunicación, también se abre una nueva negociación sobre quién controla cómo somos escuchados. La IA ya no solo transforma lo que decimos. Empieza a transformar cómo sonamos. Y en una sociedad donde la autenticidad se percibe tanto como se escucha, esa diferencia importa.

Figura 4. El riesgo parece estar en cómo percibimos lo que la voz clonada ha modificado. Fuente: Gemini.

Cuando una máquina puede hablar con nuestra voz en cualquier lengua, la pregunta deja de ser si la traducción es correcta. La pregunta es si la identidad que se proyecta sigue siendo plenamente nuestra. En esa frontera, entre precisión técnica e interpretación humana, se juega una parte crucial de la confianza en la comunicación global del siglo XXI.El reto de este siglo no es que las máquinas aprendan a hablar como nosotros, sino evitar que nosotros olvidemos cómo suena la verdad sin filtros. La próxima vez que escuches una voz familiar en otro idioma, haz una pausa. Quizás las palabras sean suyas, pero el alma del mensaje podría ser puro código.

Referencias

  • Proyecto RELANZA. Redefiniendo la enseñanza de lenguas: ODS y estrategias educativas innovadoras. https://relanza.net
  • Boletín Oficial del Estado (2024). Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo, de 13 de junio de 2024, por el que se establecen normas armonizadas en materia de inteligencia artificial y por el que se modifican los Reglamentos (CE) nº 300/2008, (UE) nº 167/2013, (UE) nº 168/2013, (UE) 2018/858, (UE) 2018/1139 y (UE) 2019/2144 y las Directivas 2014/90/UE, (UE) 2016/797 y (UE) 2020/1828 (Reglamento de Inteligencia Artificial). https://www.boe.es/buscar/doc.php?id=DOUE-L-2024-81079
  • Gobl, C., & Chasaide, A. N. (2003). The role of voice quality in communicating emotion, mood and attitude. Speech Communication, 40(1-2), 189–212. https://doi.org/10.1016/S0167-6393(02)00082-1
  • Schuller, B., & Batliner, A. (2013). Computational Paralinguistics: Emotion, Affect and Personality in Speech and Language Processing. Wiley.
  • Yang, Q., Zhang, Y., Dai, W., & Pan, S. J. (2020). Transfer Learning. Cambridge University Press.
Mercedes Querol-Julián

Mercedes Querol-Julián

Doctora en Lingüística Aplicada
Aarón Pérez Bernabeu

Aarón Pérez Bernabeu

Doctor en Lingüística Aplicada y Didáctica del español

Artículos relacionados

Una GPU, muchas tareas y una IA que decide: cómo el aprendizaje por refuerzo optimiza su planificación

Una GPU, muchas tareas y una IA que decide: cómo el aprendizaje por refuerzo optimiza su planificación

¿Y si una IA pudiera aprender a repartir una GPU sobre la marcha? Investigadores de la Universidad Complutense de Madrid han desarrollado un sistema de aprendizaje por refuerzo profundo capaz de decidir cómo asignar los recursos de una GPU a distintas tareas.

Jorge Villarrubia Elvira, Luis Mª Costero Valero, Katzalin Olcoz Herrero, Francisco Daniel Igual Peña

OP 313: el viaje de ocho mil millones de años que ilumina la historia del universo

OP 313: el viaje de ocho mil millones de años que ilumina la historia del universo

Un equipo internacional coliderado por el Instituto de Astrofísica de Andalucía (IAA-CSIC) ha publicado en 'Astronomy & Astrophysics' el análisis detallado de OP 313, el blázar más lejano detectado hasta la fecha en rayos gamma de muy alta energía.

Pablo Donato Pablos Rivera

De imprimir formas a estructuras inteligentes: así es la impresión 4D

De imprimir formas a estructuras inteligentes: así es la impresión 4D

No podemos negar que la impresión 3D ha marcado un antes y un después en nuestra forma de fabricar. Hoy podemos imprimir desde juguetes y prototipos en casa hasta componentes de motores de cohetes espaciales en grandes empresas. Pero, ¿qué pensarías si te dijera que, además de imprimir objetos, podemos fabricar estructuras que «cobran vida», capaces de reaccionar a su entorno y transformarse con el tiempo?

Carlos Aguilar Vega

Impresión 3D y luz solar: diseñando materiales capaces de capturar y degradar microplásticos del agua

Impresión 3D y luz solar: diseñando materiales capaces de capturar y degradar microplásticos del agua

Podrían estar en el agua que bebemos, pero eliminarlos no es sencillo. Los microplásticos escapan de muchos sistemas de tratamiento y se dispersan por el medio ambiente. Una estructura impresa en 3D combina la captura de microplásticos con su degradación mediante luz.

Katherine Villa Gómez, Neus Munar Barceló