Aufnahme von Schallplatten und einem Audio-Interface auf einem Schreibtisch zeigt eine tonoptimierte Arbeitsumgebung.

Reconocimiento de canciones al límite: acelerados, remix y falsificaciones de inteligencia artificial

▶ 6:40 Tiempo de lectura

Escuchas una canción en un TikTok, acercas tu teléfono al altavoz y la aplicación dice: no hay resultado. Sin embargo, conoces la canción. La has escuchado cien veces. El problema no es tu aplicación. El problema es que el clip se reproduce a 1,3 veces la velocidad y, por lo tanto, la canción se ha vuelto diferente para el reconocimiento.

 

DROP

  • El reconocimiento clásico, como Shazam, compara una huella acústica. Si se modifica el tono o el tempo, la huella ya no coincide.
  • Las ediciones de ritmo acelerado y reverberación lenta son comunes en TikTok. Precisamente eso es lo que la aplicación a menudo rechaza con «no hay resultado».
  • Según Apple, Shazam cuenta con más de 100 mil millones de reconocimientos. La técnica detrás de esto proviene de una época anterior a la era de las ediciones.
  • El nuevo enigma: pistas generadas por IA que en realidad no existen.
  • El reconocimiento se está reconfigurando: alejándose de la huella fija y acercándose a modelos de aprendizaje como Google Hum to Search.

 

Cómo funciona el reconocimiento de canciones

Cuando acercas Shazam a una canción, la aplicación no escucha como un humano. Graba unos segundos de sonido y calcula un espectrograma: un mapa de frecuencias a lo largo del tiempo. En este mapa, el algoritmo busca los picos de frecuencia más altos y los combina en un patrón. Este patrón es la huella. Se compara con una enorme base de datos. Si coinciden suficientes puntos, tienes tu resultado.

El procedimiento es robusto contra interferencias. Funciona en un bar ruidoso, con voces de fondo y un micrófono de teléfono mediocre. Precisamente por eso ha funcionado desde que Shazam se lanzó en 2002 como servicio de SMS. El inconveniente: la huella describe una grabación muy específica. No la canción como idea, sino ese archivo específico.

¿Qué es la huella de audio? La huella de audio convierte un fragmento de sonido en un patrón compacto de puntos de frecuencia destacados. Este patrón se compara con una base de datos para identificar de forma única una grabación. Reconoce de forma fiable un archivo concreto, pero no una versión modificada de la misma canción.

 

Por qué engañar a la aplicación con versiones aceleradas y ralentizadas

Aquí es donde se pone concreto. Una edición acelerada (Sped-up) acelera la canción, generalmente entre un 10 y un 30 por ciento. Al hacerlo, no solo aumenta el tempo, sino también el tono. De una pista en A-Dur se convierte en una que suena un semitono más alta. Para tu oído es la misma canción, más rápida y más aguda. Para la huella digital es un patrón extraño: los picos de frecuencia están en todas partes, el tiempo entre ellos ya no coincide.

Slowed-Reverb hace lo contrario. La canción se ralentiza, suena más grave y adquiere un efecto de reverberación encima. Esto también desplaza todo el mapa de frecuencias. La aplicación busca un patrón que nunca estuvo en la base de datos de esta forma. No puede encontrar la canción porque, estrictamente hablando, busca otra.

Esto ya no es un caso marginal. En TikTok, la versión acelerada suele ser la única que obtiene un fragmento de canción. Canciones completas se han vuelto virales a través de su versión Sped-up, mientras que la grabación original permaneció en la sombra. Quien luego recurre a la aplicación de reconocimiento, pregunta por una versión que oficialmente no existe.

100 mil millones+
Reconocimientos de Shazam desde el inicio (dato de Apple)
10-30 %
Aumento típico de tempo en ediciones Sped-up
2002
Shazam inicia, mucho antes de la era de las ediciones

 

Remixes, mashups y versiones en vivo: los viejos puntos ciegos

Sped-up es solo la última variante de un problema que siempre ha existido. Una grabación en vivo suena diferente a la versión de estudio: diferente tempo, diferente reverberación, público intermedio. Un remix reconstruye parcialmente la pista. Un mashup superpone dos canciones. En todos estos casos, tu oído escucha una conexión con el original, pero no la huella digital.

Por eso, una aplicación a menudo no reconoce una grabación en vivo de tu canción favorita, aunque la canción de estudio ya esté en la base de datos. Busca exactamente esa grabación. Una versión cover de una banda indie, un edit de DJ, una grabación bootleg: todo son lagunas. El reconocimiento es extremadamente bueno para encontrar un archivo conocido. Es malo para reconocer una canción en una forma nueva.

 

El nuevo problema: ¿reconoce la aplicación una canción de IA?

Existe una laguna que hace dos años nadie tenía en mente. ¿Qué sucede si la canción que quieres reconocer es generada por una IA? Los servicios de streaming informan que un porcentaje de dos dígitos de las pistas cargadas diariamente son completamente generadas por IA. Deezer, por ejemplo, ha hecho público que una parte significativa de las cargas diarias proviene de producción de IA.

Para el reconocimiento, esto significa dos cosas. Primero: una pista de IA que acaba de ser cargada aún no tiene entrada en la base de datos. La aplicación no encuentra nada porque no hay nada que encontrar. Segundo, y más delicado: las herramientas de IA pueden producir piezas que suenan como un artista determinado, sin que exista un original real. La pregunta ya no es solo qué canción es esta, sino si es una canción de un ser humano.

Precisamente aquí se desplaza la tarea. El reconocimiento ha sido durante años un problema puro de asignación. Ahora también se convierte en una cuestión de autenticidad. Algunos servicios ya están trabajando en filtros que deberían marcar las pistas de IA. Sin embargo, esto aún no es fiable.

Una aplicación de reconocimiento siempre ha sido una promesa: agárrame a la música y te diré el nombre. La promesa solo se mantiene mientras la música es un archivo fijo. Precisamente eso no es lo que hay ahora.

 

Hacia dónde se dirige el reconocimiento de canciones

Se está produciendo un cambio tecnológico. En lugar de comparar solo huellas dactilares rígidas, se están agregando modelos de aprendizaje. Google lo muestra de manera más clara con Hum to Search: cantas una melodía y el sistema encuentra la canción, aunque tu canto no tenga la altura tonal correcta, ni el tempo correcto, ni un instrumento. Esto funciona porque el modelo no busca un espectrograma, sino una representación abstracta de la melodía.

Esta representación se llama Embedding. Simplificando: el sistema aprende qué constituye el núcleo de una canción. Ignora precisamente las cosas en las que falla la huella dactilar clásica. El tempo, la altura tonal y el timbre pasan a ser secundarios. Lo que queda es la idea musical. Un modelo así tiene una verdadera oportunidad de reconocer la versión acelerada y el original como la misma canción.

La reestructuración no ha terminado. La huella dactilar clásica sigue siendo rápida y económica y se utiliza en el caso claro. Los modelos de aprendizaje se agregan donde se vuelve difuso. Por lo tanto, el reconocimiento no se reemplaza, sino que adquiere una segunda capa.

 

Qué cambia esto para ti al encontrar música

En la práctica, esto significa: si la aplicación no encuentra un resultado para un sonido de TikTok, rara vez se debe a ti. Prueba dos cosas en ese caso. Primero, busca directamente en la aplicación una línea de texto que hayas entendido. La búsqueda de letras de canciones es insensible a los cambios de tempo. Segundo, usa la función de tarareo si tienes la melodía en la cabeza, en lugar de reproducir el clip distorsionado.

Y el punto más importante: el reconocimiento de canciones fue durante mucho tiempo un problema resuelto sobre el que nadie pensaba más. Eso ha terminado. Mientras la música se descompone en ediciones, se acelera, se vuelve a componer y es generada por máquinas, el reconocimiento sigue siendo un trabajo en curso. La próxima generación de aplicaciones preguntará menos qué archivo es este y más qué canción hay detrás. Esta es una diferencia que notarás en los próximos años.

 

Playlist para escuchar

Tres temas muy escuchados en los últimos dos años que probablemente también te hayan sonado en clips acelerados de TikTok. Escucha aquí la versión original a velocidad normal e imagina que pones la app de reconocimiento frente a la versión acelerada.

Preguntas y respuestas tras el programa

Haz clic en una pregunta para desplegar la respuesta.

¿Por qué Shazam no reconoce una canción acelerada?
Porque al acelerar también cambia la altura del tono. Shazam compara una huella dactilar basada en puntos de frecuencia fijos. En una versión acelerada, estos puntos están todos en otra posición, por lo que la huella ya no coincide con la grabación original en la base de datos.
¿Cómo encuentro una canción de un TikTok de todas formas?
Dos métodos funcionan incluso con clips acelerados: buscar una frase de letra entendible o usar funciones como Google Hum to Search. Ambos ignoran el ritmo y la tonalidad, superando así las distorsiones del editado.
¿Reconocen las aplicaciones también canciones generadas por IA?
Solo si la pista ya está en la base de datos. Las canciones nuevas generadas por IA no tienen entrada y no se encuentran. Si una pieza proviene o no de una IA, la detección clásica ni siquiera lo aborda. Los servicios están empezando a trabajar en ello.
¿Por qué Shazam no encuentra una versión en directo?
Una grabación en directo tiene un ritmo diferente, más reverberación y ruido de fondo del público. Pero la huella dactilar describe exactamente la grabación de estudio. Mientras la versión en directo no esté registrada en la base de datos, la app la considerará una canción desconocida.
¿Mejorará en el futuro el reconocimiento de canciones con ediciones?
Probablemente sí. Proveedores como Google están complementando el sistema rígido de huellas dactilares con modelos de aprendizaje automático que no buscan un archivo específico, sino la idea musical. Estos modelos de incrustación (embedding) tienen una verdadera posibilidad de reconocer la versión original y la acelerada como la misma canción.

También disponible en



X