Tutorial en español para separar voz e instrumentos de una canción usando IA con la aplicación Replay, explicado paso a paso.
Ask about this video. Answers come from its transcript only — with the timestamp, so you can check them.
Generated from the transcript and can be wrong — check the timestamp.
Key Takeaways
- Replay permite separar fácilmente voz e instrumentos de una canción usando IA.
- El proceso es accesible para personas con discapacidad visual mediante NVDA.
- Usar GPU acelera significativamente el procesamiento comparado con CPU.
- No es necesario tener modelos de voz para realizar la separación en Replay.
- El tutorial forma parte de una serie completa sobre inteligencia artificial aplicada a audio.
What the video covers
- Presentación del canal TecnoConocimiento Accesible y del presentador Albardo Nova desde Colombia.
- Este video es el octavo tutorial de una serie sobre modelos de voz, clonación y conversión de texto a voz con IA.
- Se explica cómo separar la voz y el instrumental de una canción utilizando la aplicación Replay.
- Se recomienda ver el tutorial anterior para entender mejor la inferencia en Replay.
- Se utiliza el lector de pantalla NVDA para accesibilidad durante la demostración.
- Se muestra cómo cargar un archivo de audio (ejemplo: recorte flamenco MP3) en Replay para procesarlo.
- Se explica la diferencia entre usar CPU y GPU para el procesamiento, siendo la GPU más rápida.
- No se requiere un modelo de voz para el proceso de separación en Replay.
- Se detalla la navegación por la interfaz de Replay y las opciones para separar pistas vocales e instrumentales.
- Al finalizar, se muestra cómo acceder a los archivos resultantes en la carpeta de salida.
Chapters
- 00:00Introducción y presentación de la serie de tutoriales
- 00:53Objetivo del tutorial: separar voz e instrumental en Replay
- 02:03Preparación y uso del lector de pantalla NVDA
- 03:00Carga y selección del archivo de audio en Replay
- 04:57Configuración de dispositivo de renderización: CPU vs GPU
- 06:05Proceso de separación de pistas y navegación en Replay
- 07:13Visualización y manejo de archivos separados
- 10:53Finalización del proceso y conclusiones
Full Transcript — Download SRT & Markdown
Speaker A
Muy buenos días, tardes para todos aquellos que visitan el blog y el canal de TecnoConocimiento Accesible. Les saluda Albardo Nova desde Colombia. Este es el octavo de una serie de tutoriales relacionados con modelos de voz, clonaciones, inferencias, conversión de texto a voz utilizando la inteligencia artificial.
Speaker A
texto a voz utilizando la Inteligencia artificial en los dos primeros tutoriales y el quinto aprendimos a convertir de texto a voz mediante un archivo de audio en los tutoriales tres y cuat aprendimos a convertir de texto a voz utilizando modelos de voz en el
Speaker A
En los dos primeros tutoriales y el quinto aprendimos a convertir de texto a voz mediante un archivo de audio. En los tutoriales tres y cuatro aprendimos a convertir de texto a voz utilizando modelos de voz. En el sexto tutorial aprendimos a descargar modelos de voz en la plataforma Wits. En el séptimo tutorial aprendimos a crear covers musicales, cambiar la voz de una canción o locución por la voz de un modelo RVC utilizando Replay. Hoy aprenderemos a separar la voz y el instrumental de una canción en Replay.
Speaker A
separar la voz y el instrumental de una canción en Replay entonces comenzamos Tecno conocimiento accesible Abre caminos en la oscuridad luz está guiando suscríbete al Canal la mano de tecno conocimiento accesible todos podemos avanzar qu estás esperando suscríbete al
Speaker A
Entonces, comenzamos. TecnoConocimiento Accesible abre caminos en la oscuridad, luz está guiando. Suscríbete al canal. La mano de TecnoConocimiento Accesible, todos podemos avanzar. ¿Qué estás esperando? Suscríbete al
Speaker A
mismo pero en la aplicación Replay vamos a abrirlo Replay documento Replay antes de continuar aquellos que no hayan visto o escuchado el tutorial anterior relacionado con la inferencia en Replay Es recomendable hacerlo puesto que allí se dan algunas especificaciones que son
Speaker A
[Música] canal. Bien, vamos a comenzar. Estamos utilizando el lector de pantalla NVDA. Hace mucho tiempo aprendimos a separar voz e instrumental de una canción a través de la aplicación Audacity con un complemento llamado OpenVINO. Hoy aprenderemos a hacer lo
Speaker A
combinado contraído vamos a buscar en nuestro computador un audio de una canción recor flamenco MP3 ejemplo Este es un recorte de una canción pulsamos intro Replay el foco se pierde pulsamos la tecla Windows dos veces inicio Replay Replay documento audio Select bajamos
Speaker A
mismo pero en la aplicación Replay. Vamos a abrirlo. Replay documento. Replay. Antes de continuar, aquellos que no hayan visto o escuchado el tutorial anterior relacionado con la inferencia en Replay, es recomendable hacerlo, puesto que allí se dan algunas especificaciones que son
Speaker A
Select botón hasta el botón sin etiquetar para escuchar este audio pulsamos la barra espaciadora en este botón de la mano de Teo conocimiento accesible todos podemos avanzar que estás esperando suscríbete al canal suscríbete al Canal de Teo conocimiento
Speaker A
generales para Replay. Vamos a navegar por encabezados pulsando la tecla H. Your library. Otra vez create, de nuevo Select audio. Select audio. Bajamos con flecha selector Drop audio. Pulsamos intro. Acá seleccione o arrastre un audio. Aquí abrir diálogo. Nombre, nombre cuadro
Speaker A
elanor chip Alvin de Chip mo Donald Duck vemar o Martínez sin encabezado siguiente hasta que nos verbal sin encabezado siguiente aquí pulsamos la bd botón vi un White botón otra vez botón botón si subimos con flecha settings settings o vien settings
Speaker A
combinado contraído. Vamos a buscar en nuestro computador un audio de una canción. Recorte flamenco MP3, ejemplo. Este es un recorte de una canción. Pulsamos intro. Replay el foco se pierde. Pulsamos la tecla Windows dos veces. Inicio Replay. Replay documento audio Select. Bajamos
Speaker A
barra espaciadora para marcar esta casilla marcado baj bajamos con flecha prestem selective input audio y Sol ria vocal Track without instrumentals bajamos con flecha casilla de verificación sin marcar Esta casilla debe estar desmarcada bajamos con flecha sample Mode on use the First 30 Seconds
Speaker A
con flecha botón recorte flamenco MP3. Aquí aparece el nombre de la canción como botón. Recuerde que para eliminarlo y subir otra canción simplemente pulsamos la barra espaciadora y luego la tecla suprimir. Bajamos con flecha selector Drop audio otra vez triman
Speaker A
ft cuadro combinado contraído tiene Auto completado editable render device dispositivo de renderización device t de model cpu GP mps Fast test lo que está diciendo es que con cpu el proceso es más lento con una gpu es mucho más
Speaker A
Select botón hasta el botón sin etiquetar. Para escuchar este audio pulsamos la barra espaciadora en este botón. De la mano de TecnoConocimiento Accesible todos podemos avanzar. ¿Qué estás esperando? Suscríbete al canal. Suscríbete al canal de TecnoConocimiento
Speaker A
pulsar intro y seleccionaríamos la gpu cuadro combinado contraído tiene auto completado editable en este cuadro combinado advan settings aquí navegamos por botones botón otra vez botón stem song algo así como separar la canción pulsamos intro diogo War c1
Speaker A
Accesible con sus tutoriales. Lo que antes no se podía, ahora es posible. [Música] Seguimos navegando por encabezados con la tecla H. Model. Model. Para este proceso de separación no necesitamos ningún modelo de voz. Seguimos navegando por encabezados con la tecla H. Ardilla
Speaker A
flecha indicador de ocupado indicador de ocupado quiere decir que el proceso se Está realizando esperamos a que termine separating Track 78.5 7% si subimos encontramos el porcentaje que lleva el proceso alerta sonc success Fuji Close botón sonc success Fuji Close
Speaker A
Elanor chip Alvin de Chip, Mo Donald Duck, Vemar o Martínez. Sin encabezado siguiente hasta que nos verbal. Sin encabezado siguiente aquí pulsamos la BD botón. Vi un White botón otra vez botón, botón. Si subimos con flecha settings, settings o vien settings, o vi en botón. Pulsamos intro.
Speaker A
resultado de la mano de teng conocimiento accesible todos podemos avanzar qué estás esperando suscríbete al canal suscríbete al Canal de Reino conocimiento accesible con sus tutoriales rantes no se podía ahora es posible tenemos entonces acá la pista vocal pulsamos insert barra espaciadora
Speaker A
Bajamos con flecha esipo conversion output vocal Sony. Esta opción es la que utilizaremos para la separación, omitir la conversión de voz y generar solo las voces. Bajamos casilla de verificación sin marcar y pulsamos barra espaciadora para marcar esta casilla. Marcado baj.
Speaker A
fecha botón y un botón sin etiquetar pulsamos intro o barra espaciadora bajamos con flecha menú elemento de menú edit encontraremos cuatro opciones edit Esto es para editar el nombre del archivo bajamos con flecha elemento de menú delete delete eliminar
Speaker A
Bajamos con flecha prestem selective input audio y Sol ria vocal Track without instrumentals. Bajamos con flecha casilla de verificación sin marcar. Esta casilla debe estar desmarcada. Bajamos con flecha sample Mode on use the First 30 Seconds of the input audio. Casilla de verificación sin marcar.
Speaker A
descargas por defecto y acá tenemos el archivo comienza con el nombre unknown desconocido vamos a cerrarlo al F4 rep documento fuera de menú botón notific quedamos en el botón puls damos intro una vez más botón bajamos con flecha menú elemento
Speaker A
De hecho rever remove de hecho un rever Front de vocal strat. Casilla de verificación sin marcar. Este método método set audio método de separación de audio marcado vrm dx netb. FT cuadro combinado contraído tiene auto completado editable render device dispositivo de renderización device t de model CPU GP mps Fast test.
Speaker A
instrumental debemos pulsar intro en esta opción View in folder cpu explorador de archivos vista elementos lista se nos Abre en una carpeta que se llama cpu en esta carpeta cpu encontramos todos los archivos tanto el original como los que se ha separado en
Speaker A
Lo que está diciendo es que con CPU el proceso es más lento, con una GPU es mucho más rápido. Bajamos con flecha CPU. En mi caso, mi computador no cuenta con una tarjeta gráfica dedicada, por lo tanto utilizará la CPU. Si su computador tiene una tarjeta gráfica dedicada debería aparecer acá de primero. De no ser así,
Speaker A
flecha lo encontramos no vocals prev mp34 seguimos bajando vocals 34 vocals WAP bajamos vocals prev mp34 d4 este punto WAP es el que ya descargamos y que quedó dentro de la carpeta descargas si no lo hubiésemos hecho en ese menú aquí
Speaker A
pulsar intro y seleccionaríamos la GPU. Cuadro combinado contraído tiene auto completado editable en este cuadro combinado advan settings. Aquí navegamos por botones. Botón otra vez botón stem song, algo así como separar la canción. Pulsamos intro. Diogo War c1
Speaker A
para que no se nos almacene demasiado vamos a cerrar con alf4 Replay en Replay pulsamos la tecla aplicaciones Replay botón de menú submenú con flecha derecha Vamos hasta botón de menú submenú edit botón de menú sub local Data botón de
Speaker A
mps el mismo mensaje por CPU es más lento, por GPU tarjeta gráfica dedicada es más rápido. Simplemente impulsamos sient en aceptar alerta son Close Bot nueva notificación de electr rep son. El proceso de separación ha comenzado. Si pulsamos control fin botón subimos con
Speaker A
almacenan tanto modelos como los archivos de salida bajamos con flecha output 27 output salida pulsamos intro vista elementos lista 567 402 b4 e6 b5 de 87 f25 ff1 de 92 F sin seleccionar uno de cuatro encontramos acá cuatro
Speaker A
flecha indicador de ocupado. Indicador de ocupado quiere decir que el proceso se está realizando. Esperamos a que termine separating Track 78.5 7%. Si subimos encontramos el porcentaje que lleva el proceso alerta sonc success Fuji Close botón sonc success Fuji Close
Speaker A
le coloca un nombre bastante extenso con la extensión que le corresponde para este caso un punto MP3 bajamos con flecha stems 34 stems se refiere a la separación que acabamos de realizar dentro de ella encontramos otra carpeta y dentro otra carpeta hasta que llegamos
Speaker A
notification nueva notificación de electron Replay conversión complete recorte flamenco fin. De una ventana notification sal bien el proceso ha terminado. Pulsamos control inicio Replay para ir al principio de la aplicación. Insert barra espaciadora y ahora barra espaciadora para escuchar el
Speaker A
aparece vacía entonces la recomendación es cuando ya hemos sacado de estas carpetas los archivos que nos interesan eliminar lo demás bien Hemos llegado al final de este tutorial recuerde que este es el octavo de una serie de tutoriales
Speaker A
resultado. De la mano de TecnoConocimiento Accesible todos podemos avanzar. ¿Qué estás esperando? Suscríbete al canal. Suscríbete al canal de Reino conocimiento accesible con sus tutoriales. Antes no se podía, ahora es posible. Tenemos entonces acá la pista vocal. Pulsamos insert barra espaciadora
Speaker A
haciendo Únicamente con fines didácticos Un saludo para todos
Topics:separar voz e instrumentosinteligencia artificialReplaytutorial en españolmodelos de vozconversión texto a vozaccesibilidad NVDAprocesamiento audioCPU vs GPUTecnoConocimiento Accesible











