Riffusion
Riffusion est un modèle de génération musicale par IA qui produit de la musique en temps réel à partir de prompts textuels, en utilisant une approche originale : au lieu de synthétiser directement de l’audio, il génère des images de spectrogrammes via Stable Diffusion, puis les convertit en son.
- Catégorie
- Génération musicale IA (approche par spectrogrammes)
- Créateurs
- Seth Forsgren et Hayk Martiros (projet hobby devenu startup, San Francisco)
- Date de sortie
- Décembre 2022
- Architecture
- Fine-tuning de Stable Diffusion v1.5 sur des spectrogrammes audio
- Financement
- 4 M$ en seed round
- Prix
- Mode Basic gratuit (illimité) / Studio payant (heures mensuelles) / bêta publique en cours
- Voix
- Oui (génération de voix IA + possibilité d’ajouter des paroles)
- Licence originale
- Open source (CreativeML OpenRAIL-M pour le modèle v1)
- URL
- riffusion.com
L’innovation fondamentale : traiter le son comme une image
L’idée derrière Riffusion est aussi simple que brillante. Un spectrogramme est une représentation visuelle de l’audio : l’axe horizontal représente le temps, l’axe vertical les fréquences, et l’intensité du pixel l’amplitude du signal. En d’autres termes, un spectrogramme est une « image du son ». L’intuition de Forsgren et Martiros a été de se demander : si Stable Diffusion peut générer des images photoréalistes à partir de texte, pourrait-il aussi générer des spectrogrammes suffisamment fidèles pour être reconvertis en audio exploitable ?
La réponse s’est révélée positive, et même au-delà des attentes initiales. En fine-tunant Stable Diffusion v1.5 sur un dataset de spectrogrammes tagués par genre et caractéristiques sonores (« blues guitar », « afrobeat », « ambient drone »), le modèle a appris à reconnaître « l’apparence visuelle » de chaque style musical. Le spectrogramme généré est ensuite reconverti en audio via une transformée de Fourier inverse. Le résultat : de la musique créée en temps réel, à partir d’un pipeline initialement conçu pour les images.
Cette approche cross-modale (texte → image → audio) est ce qui distingue fondamentalement Riffusion de tous les autres générateurs musicaux IA. Des modèles comme Suno, MusicGen ou Stable Audio génèrent l’audio directement à partir de tokens ou de représentations latentes audio. Riffusion, lui, passe par le domaine visuel, ce qui lui confère des propriétés uniques mais aussi des limitations spécifiques.
Architecture technique
Le pipeline technique de Riffusion se décompose en plusieurs composants. Le modèle de base est un checkpoint Stable Diffusion v1.5, fine-tuné sur des spectrogrammes. L’encodeur textuel CLIP (ViT-L/14) conditionne la génération. Grâce à l’entraînement sur le dataset LAION-5B original de Stable Diffusion, CLIP possède déjà une compréhension riche du langage, y compris des concepts musicaux, même s’ils n’apparaissent pas explicitement dans le dataset de fine-tuning.
Le modèle génère des spectrogrammes qui sont ensuite traités par un pipeline de conversion audio : normalisation, conversion en forme d’onde via transformée de Fourier inverse, et post-traitement audio. Le dépôt original incluait aussi des « seed images » (spectrogrammes pré-générés servant de point de départ), permettant un contrôle plus fin sur les caractéristiques de l’output.
L’une des capacités les plus intéressantes de l’architecture est la navigation dans l’espace latent. En interpolant entre deux prompts dans l’espace latent de Stable Diffusion (via les capacités img2img), Riffusion peut créer des transitions fluides entre deux styles musicaux distincts. Vous pouvez passer progressivement d’un « morceau jazz au piano » à un « beat EDM énergique » en parcourant l’espace latent, ce qui produit des fondus enchaînés musicaux naturels. C’est une propriété unique qui découle directement de l’approche par spectrogrammes.
De l’open source au produit commercial
Riffusion a connu une évolution significative depuis sa publication initiale. Le modèle v1, publié en décembre 2022, était un projet hobby entièrement open source avec le code sur GitHub et les poids sur Hugging Face (licence CreativeML OpenRAIL-M). Il générait des clips de quelques secondes, suffisants pour des boucles et des riffs courts mais trop limités pour des morceaux complets.
L’équipe a ensuite levé 4 millions de dollars en seed funding et développé la plateforme commerciale riffusion.com, qui va bien au-delà du modèle original. La plateforme actuelle propose deux modes : un mode Basic gratuit et illimité pour la génération de base, et un mode Studio payant avec des fonctionnalités avancées : génération plus rapide (jusqu’à 16 générations simultanées), contrôles améliorés (mode, modèle, curseur « weirdness »), et des outils d’édition IA.
Les fonctionnalités d’édition incluent Extend (allonger un morceau), Replace (remplacer une section spécifique), Cover (recréer un morceau dans un style différent), Stem Swap (échanger des pistes instrumentales) et la séparation de stems avec export en MP3, M4A et WAV. La plateforme a aussi développé une fonction de génération de voix IA et un outil d’écriture de paroles avec un « prompt genius » pour aider à formuler des descriptions musicales efficaces.
Utilisation pratique
Via riffusion.com
L’interface web est le moyen le plus simple d’utiliser Riffusion. Vous créez un compte, entrez un prompt textuel décrivant la musique souhaitée (genre, instruments, ambiance, paroles optionnelles), et l’IA génère trois variantes (« riffs ») avec un nom unique et une image d’accompagnement. Vous pouvez ensuite remixer, étendre, ou éditer les résultats avec les outils intégrés. La génération est en temps réel et le résultat est immédiatement écoutable dans le navigateur.
Via le modèle open source original
Le modèle v1 reste disponible sur Hugging Face (riffusion/riffusion-model-v1) et GitHub. Il s’exécute avec Python, PyTorch et un GPU compatible CUDA. Le fine-tuning sur des données personnelles est possible, y compris via des méthodes Dreambooth pour obtenir des styles custom. L’infrastructure est standard pour un modèle Stable Diffusion, ce qui le rend accessible à quiconque a déjà travaillé avec des modèles de diffusion d’images.
Communauté et partage
Riffusion a développé un aspect communautaire : les utilisateurs créent des profils personnalisés, partagent leurs playlists, et découvrent les créations d’autres utilisateurs. La plateforme encourage l’exploration collaborative, avec des « featured songs » et des riffs populaires mis en avant. C’est un environnement stimulant pour l’expérimentation, même si la communauté reste plus petite que celle de Suno (r/SunoAI : 100 000+ membres).
Forces et limites honnêtes
L’approche par spectrogrammes confère à Riffusion des forces uniques. L’interpolation dans l’espace latent produit des transitions musicales impossibles à obtenir avec les autres modèles. La génération est rapide et en temps réel. Le modèle est intuitif pour les utilisateurs familiers avec l’écosystème Stable Diffusion. L’aspect visuel (spectrogramme = image) ouvre des perspectives intéressantes pour l’éducation et les installations artistiques interactives.
Mais cette approche a aussi des limites structurelles. La conversion spectrogramme → audio implique une perte d’information de phase, ce qui introduit des artefacts et une distorsion sonore. La qualité audio est inférieure à celle des modèles qui génèrent directement l’audio comme Suno, Udio ou MusicGen. Les morceaux longs posent problème : le modèle original génère des clips très courts, et même la plateforme commerciale ne rivalise pas avec Suno (8 minutes) ou Stable Audio 2.5 (3 minutes) en termes de cohérence structurelle sur la durée. La génération vocale existe mais reste en deçà de la qualité de Suno ou Udio. Enfin, la plateforme est encore en bêta, avec un pricing non stabilisé et des fonctionnalités qui évoluent rapidement.
Héritage et influence
L’impact de Riffusion dépasse ses capacités directes. Le projet a démontré, dès fin 2022, que les applications cross-modales de l’IA pouvaient produire des résultats surprenants. L’idée de « traiter le son comme une image » a inspiré de nombreux travaux de recherche en génération audio. En décembre 2022, Mubert a d’ailleurs utilisé une approche similaire pour transformer du texte en boucles musicales via Stable Diffusion.
Plus fondamentalement, Riffusion a montré que les modèles de diffusion pré-entraînés sur des images pouvaient être réutilisés pour d’autres modalités avec un fine-tuning ciblé, une idée qui a depuis été explorée dans de nombreux autres domaines (vidéo, 3D, audio). C’est une contribution conceptuelle importante, indépendamment de la qualité audio du modèle original.
Verdict
Riffusion n’est pas le meilleur générateur de musique IA en termes de qualité audio pure. Suno et Udio produisent des résultats supérieurs pour les chansons complètes. Stable Audio et MusicGen sont plus performants pour l’instrumental. Mais Riffusion occupe une place unique grâce à son approche par spectrogrammes, qui offre des capacités d’interpolation et de transition inégalées, une accessibilité remarquable (mode Basic gratuit et illimité), et un intérêt technique et pédagogique majeur pour comprendre les modèles de diffusion appliqués à l’audio.
Si vous cherchez un outil pour expérimenter avec la musique IA de manière créative et gratuite, ou si vous êtes intéressé par l’intersection entre génération d’images et génération audio, Riffusion mérite votre attention. Pour de la production musicale commerciale sérieuse, orientez-vous plutôt vers Suno (chansons avec voix) ou Soundraw (musique de fond royalty-free avec sécurité juridique maximale).
Questions fréquentes
Riffusion est-il gratuit ?
Oui, le mode Basic est gratuit et offre une génération illimitée de musique à partir de prompts textuels. Le mode Studio (payant) ajoute des fonctionnalités avancées : génération plus rapide, générations simultanées multiples, contrôles étendus et outils d’édition IA. La plateforme est encore en bêta publique, et les détails de pricing des modes payants peuvent évoluer. Le modèle v1 original reste aussi disponible gratuitement en open source sur Hugging Face et GitHub.
Comment Riffusion génère-t-il de la musique à partir d’images ?
Riffusion utilise Stable Diffusion, un modèle de génération d’images, fine-tuné sur des spectrogrammes audio. Un spectrogramme est une représentation visuelle du son (fréquences × temps × amplitude). Le modèle génère un spectrogramme à partir de votre prompt textuel, puis ce spectrogramme est reconverti en audio via une transformée de Fourier inverse. C’est comme si l’IA « dessinait » le son avant de le « jouer ». Cette approche unique permet l’interpolation fluide entre styles musicaux en naviguant dans l’espace latent du modèle.
La qualité audio de Riffusion est-elle comparable à Suno ou Udio ?
Non. L’approche par spectrogrammes introduit une perte d’information de phase et des artefacts audio que les modèles générant directement l’audio (Suno, Udio, MusicGen) n’ont pas. La qualité de Riffusion a été décrite comme « otherworldly » (d’un autre monde) : intéressante et créative, mais avec une texture sonore distincte qui la rend plus adaptée à l’expérimentation et aux ambiances qu’à la production musicale professionnelle. Pour de la production sérieuse, Suno et Udio restent les références.
Peut-on utiliser la musique Riffusion commercialement ?
Oui, le mode Basic gratuit inclut des droits pour un usage personnel et non commercial. Les modes payants (Studio) incluent des droits commerciaux. Le modèle open source v1 est sous licence CreativeML OpenRAIL-M, qui autorise l’usage commercial sous certaines conditions. Vérifiez toujours les conditions de licence actuelles sur riffusion.com, car la plateforme est en bêta et les termes peuvent évoluer.
Riffusion est-il toujours open source ?
Le modèle v1 original (fine-tuning de Stable Diffusion sur spectrogrammes) reste open source, disponible sur GitHub et Hugging Face. Le code source et les poids sont accessibles. Cependant, la plateforme commerciale riffusion.com a développé des modèles et des fonctionnalités propriétaires qui vont bien au-delà du modèle v1. La partie open source reste un excellent point de départ pour la recherche et l’expérimentation, tandis que la plateforme commerciale offre un produit plus complet et plus facile d’accès.