IA Generativa

Gemini estrena Lyria 3.5 para crear canciones con voces y pistas de hasta 3 minutos

Google lleva Lyria 3.5 a Gemini para generar música con voces o instrumental, controlar género y duración y crear pistas de hasta tres minutos.

Google ha integrado Lyria 3.5 en la aplicación Gemini, ampliando las capacidades del asistente con generación de música mediante inteligencia artificial. Los usuarios pueden describir el tipo de canción que quieren crear, elegir entre pistas vocales o instrumentales y ajustar aspectos como el género y la duración. El modelo está disponible globalmente para todos los usuarios de Gemini tanto en la web como en las aplicaciones móviles.

Lyria 3.5 no es un modelo completamente nuevo. Google DeepMind lo presentó originalmente el 29 de julio de 2026 en Google Flow Music. La novedad del 4 de septiembre es su llegada a Gemini y a la Gemini API, lo que amplía considerablemente las formas de acceder a esta tecnología.

Gemini puede generar canciones completas con Lyria 3.5

Desde Gemini, el usuario puede indicar mediante texto el género, estilo, instrumentación o ambiente que busca. Google también ha incorporado plantillas para acelerar la creación de contenidos como música de fondo, canciones de cumpleaños, jingles o tonos personalizados.

El sistema permite seleccionar entre composiciones instrumentales y canciones con voz. Lyria 3.5 mejora especialmente este último apartado respecto a generaciones anteriores, con voces que Google describe como más naturales y expresivas, mejor pronunciación y una interpretación más ajustada al carácter solicitado en el prompt.

El modelo puede producir desde fragmentos relativamente breves hasta composiciones de hasta tres minutos. Google señala que Lyria 3.5 mantiene mejor la coherencia musical en piezas largas, incluyendo estructuras con diferentes secciones, versos, estribillos y puentes.

Lyria 3.5 mejora letras, voces y estructura musical

Google DeepMind entrenó Lyria 3.5 para generar audio de alta fidelidad a partir de instrucciones de texto. El modelo utiliza una arquitectura de difusión latente aplicada sobre representaciones temporales de audio y puede producir tanto música como letras.

Entre las mejoras anunciadas se encuentran estructuras melódicas más complejas, mayor fidelidad al prompt y un mejor entendimiento de la organización de una canción. Esto permite especificar con más precisión elementos como tempo, duración, instrumentación y estilo vocal.

Las evaluaciones internas de Google compararon Lyria 3.5 con generaciones anteriores en aspectos como calidad musical, fidelidad del audio, voces y cumplimiento de instrucciones. Según la ficha técnica del modelo, Lyria 3.5 consiguió mejoras especialmente importantes en calidad de audio y en la capacidad de seguir instrucciones para generar letras.

También puede convertir una imagen en música

Lyria 3.5 no se limita necesariamente a las instrucciones escritas. Google también permite utilizar imágenes como punto de partida para crear una composición, de modo que Gemini pueda interpretar el contenido visual y generar una pista inspirada en él.

Esta capacidad amplía los posibles usos del modelo para creadores de contenido que necesiten bandas sonoras asociadas a fotografías, ilustraciones u otros elementos visuales sin definir manualmente cada característica musical.

Lyria 3.5 también llega a la Gemini API

Google está abriendo el modelo más allá de la aplicación Gemini. Lyria 3.5 está disponible para desarrolladores mediante la Gemini API y Google AI Studio, además de formar parte de Google Flow Music y Google Vids.

En la API, Google ha preparado variantes orientadas a diferentes casos de uso. Lyria 3.5 Clip Preview está optimizado para fragmentos de unos 30 segundos, bucles y experimentación rápida, mientras que Lyria 3.5 Pro Preview está pensado para generar canciones completas con mayor coherencia estructural.

Las variantes para desarrolladores admiten entradas de texto e imagen y generan audio estéreo de alta fidelidad a 44,1 kHz. Esto permite integrar la generación musical en aplicaciones y flujos de producción propios sin depender directamente de la interfaz de Gemini.

Todas las canciones incluyen una marca de agua SynthID

Google aplica SynthID a las pistas creadas con Lyria. Esta tecnología introduce en el audio una marca de agua imperceptible diseñada para permitir la identificación posterior de contenidos creados o modificados mediante inteligencia artificial.

La compañía también utiliza filtros de seguridad durante el entrenamiento y en los productos donde despliega el modelo. Google reconoce que Lyria todavía presenta limitaciones y recomienda revisar los resultados generados antes de utilizarlos en un proyecto final.

Con su incorporación a Gemini, Lyria 3.5 pasa de ser principalmente una herramienta orientada a entornos especializados de creación musical a estar disponible directamente para la base global de usuarios del asistente de Google. La actualización coloca la generación de canciones junto a las capacidades de texto, imagen, vídeo y voz que Google ha ido incorporando progresivamente a Gemini.