Estás probando una aplicación nueva para hablar por teléfono en otra lengua y que una Inteligencia Artificial (IA) doble tu voz a ese idioma que tu interlocutor va a entender. Te escuchas y te reconoces, pero hay algo que no encaja. Las palabras en inglés (o en alemán, o en japonés) son exactamente las que tú dirías, y el timbre de voz es, sin duda, el tuyo. Sin embargo, suenas extrañamente asertivo, casi agresivo, cuando en realidad estabas bromeando. O quizás suenas dubitativo en el punto exacto donde querías mostrar firmeza. Lo que tienes ante ti es tu “doble digital”: un prodigio de la IA que ha cruzado la frontera del idioma, pero que en el camino ha dejado atrás tu intención. Bienvenido a la era de la pérdida de la esencia prosódica, es decir, de los matices de la voz, donde la traducción es exacta, pero el mensaje ya no es del todo tuyo.
La IA puede hacer que parezca que alguien habla con fluidez una lengua que nunca ha aprendido. Al combinar clonación de voz, síntesis del habla y sincronización labial, los sistemas de IA reproducen el tono, el ritmo y el carácter vocal de una persona con tal grado de verosimilitud que el resultado se percibe como auténtico. Pero esta innovación conlleva un nuevo y sutil riesgo: la desinformación auditiva. Las palabras pueden estar traducidas con precisión, pero pequeños cambios en el énfasis, el ritmo o el tono emocional pueden alterar la forma en que se interpreta un mensaje, haciendo que un hablante suene más o menos asertivo, seguro o emotivo de lo que realmente era.
Este artículo examina las cuestiones éticas que surgen cuando la tecnología transforma no lo que decimos, sino cómo sonamos. Explora la voz como una forma de identidad personal, los límites de los sistemas que imitan el habla sin comprender el contexto y por qué esto importa en un panorama mediático global. Junto a estas preocupaciones, también destaca el verdadero potencial de estas herramientas para mejorar la accesibilidad y derribar barreras lingüísticas en todo el mundo.
Cuando la IA te presta una lengua: la orfebrería del habla
La IA ha logrado lo que parecía imposible: que tu identidad sonora sea políglota. Al combinar traducción automática, clonación de voz, síntesis del habla y, en entornos audiovisuales, sincronización labial, los sistemas actuales reproducen el tono, el ritmo y el timbre de una persona con tal verosimilitud que el resultado se percibe como auténtico. Los sistemas actuales no solo traducen el significado, sino que también “mapean” tus características acústicas —el tono, la intensidad de cómo suenas y tu ritmo respiratorio— y los inyectan en un idioma que nunca has hablado.

En el proyecto RELANZA hemos creado un pódcast para que cualquier oyente pueda escuchar todos los episodios en dos lenguas. Dos de las investigadoras invitadas, españolas y bilingües en inglés, fueron entrevistadas en español. Sin embargo, los oyentes también pueden escuchar una versión en inglés generada mediante IA que conserva su huella vocal (Episodios 3 y 4). No se trata de un doblaje convencional ni de una voz sintética genérica: es, aparentemente, la suya, recreada mediante un proceso de clonación de voz. Este proceso no es una simple sustitución de pistas de audio, sino una reconstrucción estadística de la personalidad, es decir, una manipulación sutil de los rasgos característicos del habla humana basada en algoritmos. Sin embargo, aquí yace la paradoja: la herramienta es capaz de reproducir la textura de la voz con una precisión asombrosa, pero opera en un vacío de experiencia (Schuller & Batliner, 2013). La IA no sabe que ese silencio antes de una palabra era un rasgo de timidez, o que esa subida de tono era un énfasis irónico. Para el algoritmo, solo son datos de amplitud (medida en decibelios) y frecuencia (medida en hercios). Sin la supervisión humana que ajuste esos «pesos» emocionales, la fluidez técnica puede acabar sepultando la autenticidad del hablante. En definitiva, la fluidez que escuchamos no es el resultado de un aprendizaje lingüístico humano, sino de una modelización algorítmica de la voz (Yang et al., 2020).
Jonathan Castilla Linares (Universidad Internacional de La Rioja), técnico responsable del proceso de clonación y doblaje con IA del pódcast RELANZA, describe el trabajo como un ejercicio de orfebrería digital. “El objetivo no era solo clonar el timbre, sino capturar rasgos como el ritmo al hablar, las pausas o la forma de enfatizar ciertas palabras”, explica. “Dos versiones del mismo texto pueden transmitir percepciones muy diferentes dependiendo del tono, la velocidad o la colocación del énfasis. Aunque la traducción lingüística sea correcta, la percepción del hablante puede cambiar si la prosodia no se mantiene fiel al original”, añade.
La herramienta es capaz de reproducir patrones acústicos con gran precisión, pero no comprende el contexto ni la experiencia que hay detrás de cada frase. Por eso, la supervisión humana sigue siendo esencial, porque, como apunta Jonathan Castilla, “el receptor final sigue siendo humano”.
La voz como identidad y el riesgo de la desinformación auditiva
La voz no es un mero vehículo de información, es una arquitectura de la identidad. En ella se entrelazan la biografía de una persona, sus emociones, su manera de mostrarse ante los demás y su forma de pensar. En lingüística, la prosodia es lo que permite que una misma frase —como la del reto “Cállate” en TikTok— signifique desde una aceptación alegre hasta una resignación amarga. Cuando delegamos nuestra voz en una IA para que hable por nosotros en otro idioma, corremos el riesgo de sufrir una desinformación auditiva sutil.

Como señalan Noelia Ruiz Madrid (Universitat Jaume I) y Emma Dafouz (Universidad Complutense de Madrid), las investigadoras participantes en RELANZA, la sensación al escuchar la versión en inglés de su entrevista es de una extraña ambivalencia. “La primera impresión fue: ‘ostras, es mi voz’”, recuerda Noelia Ruiz, “pero al mismo tiempo sabía que no era exactamente yo: el ritmo y el énfasis no eran los mismos”.
Emma Dafouz describe una sensación similar: “Al principio me sorprendí bastante, porque sonaba como yo, pero no era exactamente yo. Sobre todo, me llamó la atención que se marcaban ciertas variantes del inglés, creo que algo parecido al acento de Nueva Zelanda, que en realidad forman una pequeña parte de mi forma de hablar, quizá heredada de mi madre, pero que en la versión generada por IA aparecían mucho más acentuadas».
Para ambas, la diferencia está en los matices. “Una voz puede parecerse mucho a la tuya”, explica Noelia Ruiz, “pero el énfasis o la forma de construir el discurso dependen de decisiones muy personales. Y eso, de momento, la IA no lo reproduce”.

El “tú” que llega al oyente en inglés ha pasado por el filtro de una red de datos que prioriza la claridad sobre el matiz. Si la IA decide que tu tono debe ser más plano para sonar “profesional” en inglés, está alterando tu estilo y tu posicionamiento social. No se están falseando los hechos, como en una fake news, pero sí se está distorsionando algo más sutil: la verdad de la personalidad. En un mundo donde la confianza se basa en la percepción de la autoridad y la empatía, un ligero error en el “color” emocional de la voz puede cambiar drásticamente cómo te juzga tu audiencia. Ahí aparece un riesgo nuevo y sutil: la desinformación auditiva. No se trata de inventar declaraciones falsas, sino de modificar imperceptiblemente cómo suena una persona. Un ligero ajuste en el tono puede hacer que alguien parezca más asertivo o más dubitativo. Un ritmo diferente puede transmitir mayor frialdad o mayor entusiasmo (Gobl & Chasaide, 2003). En un panorama mediático global, donde la comunicación circula sin fricciones entre idiomas, esos matices influyen en la percepción de credibilidad y autoridad.
Los sistemas actuales pueden imitar el habla, pero no comprenden el contexto cultural ni las implicaciones pragmáticas de cada matiz. Esa distancia entre imitación técnica y comprensión significativa marca uno de los límites éticos de la tecnología.
Entre la oportunidad y la responsabilidad
Sería un error reducir esta innovación a sus riesgos. Las mismas herramientas que pueden alterar matices permiten derribar barreras lingüísticas y ampliar el acceso al conocimiento. En el caso de RELANZA, la IA facilita que investigaciones realizadas en español circulen en inglés conservando la identidad vocal de sus autoras. Para la transferencia social del conocimiento, esto supone un avance notable: amplía audiencias, reduce costes y democratiza la difusión científica.
Además, estas tecnologías pueden mejorar la accesibilidad, por ejemplo, permitiendo a personas con dificultades del habla preservar una versión digital de su voz y favorecer la comunicación intercultural en educación, ciencia o cooperación internacional.
El desafío no es tecnológico, sino normativo y ético (Boletín Oficial del Estado, 2024). ¿Debe considerarse la voz un dato biométrico especialmente protegido? ¿Cómo garantizar el consentimiento informado cuando una identidad vocal puede reproducirse en múltiples idiomas? ¿Qué mecanismos de control evitan que pequeñas modulaciones alteren la percepción pública?
Para el técnico del proyecto, Jonathan Castilla, el primer riesgo aparece en el terreno de la interpretación. Aunque las palabras sean correctas, la percepción del hablante puede cambiar: “el riesgo no es que cambie lo que se dice, sino cómo se percibe a quien lo dice”.
Las investigadoras entrevistadas añaden otros matices. Noelia Ruiz sitúa el problema en el contexto de uso: “En un entorno académico no me preocupa, porque hay normas éticas y control sobre cómo se utiliza. Lo que sí me inquieta es qué podría pasar si esta tecnología se usa fuera de ese marco”.
Emma Dafouz, en cambio, pone el foco en la dimensión más personal del fenómeno. “La forma de hablar es una de las señales más fuertes de identidad. Cuando interviene una IA, sientes que parte de ese control sobre tu propia identidad se desplaza”. Sus reflexiones apuntan a un mismo fondo común: cuando la tecnología puede reproducir nuestra voz en otros idiomas, no solo se amplían las posibilidades de comunicación, también se abre una nueva negociación sobre quién controla cómo somos escuchados. La IA ya no solo transforma lo que decimos. Empieza a transformar cómo sonamos. Y en una sociedad donde la autenticidad se percibe tanto como se escucha, esa diferencia importa.

Cuando una máquina puede hablar con nuestra voz en cualquier lengua, la pregunta deja de ser si la traducción es correcta. La pregunta es si la identidad que se proyecta sigue siendo plenamente nuestra. En esa frontera, entre precisión técnica e interpretación humana, se juega una parte crucial de la confianza en la comunicación global del siglo XXI.El reto de este siglo no es que las máquinas aprendan a hablar como nosotros, sino evitar que nosotros olvidemos cómo suena la verdad sin filtros. La próxima vez que escuches una voz familiar en otro idioma, haz una pausa. Quizás las palabras sean suyas, pero el alma del mensaje podría ser puro código.
Referencias
- Proyecto RELANZA. Redefiniendo la enseñanza de lenguas: ODS y estrategias educativas innovadoras. https://relanza.net
- Boletín Oficial del Estado (2024). Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo, de 13 de junio de 2024, por el que se establecen normas armonizadas en materia de inteligencia artificial y por el que se modifican los Reglamentos (CE) nº 300/2008, (UE) nº 167/2013, (UE) nº 168/2013, (UE) 2018/858, (UE) 2018/1139 y (UE) 2019/2144 y las Directivas 2014/90/UE, (UE) 2016/797 y (UE) 2020/1828 (Reglamento de Inteligencia Artificial). https://www.boe.es/buscar/doc.php?id=DOUE-L-2024-81079
- Gobl, C., & Chasaide, A. N. (2003). The role of voice quality in communicating emotion, mood and attitude. Speech Communication, 40(1-2), 189–212. https://doi.org/10.1016/S0167-6393(02)00082-1
- Schuller, B., & Batliner, A. (2013). Computational Paralinguistics: Emotion, Affect and Personality in Speech and Language Processing. Wiley.
- Yang, Q., Zhang, Y., Dai, W., & Pan, S. J. (2020). Transfer Learning. Cambridge University Press.





