Modèles de génération
Modèle de diffusion
Aussi appelé : diffusion model
Un modèle de diffusion génère une image ou une vidéo en partant d'un bruit aléatoire qu'il débruite progressivement jusqu'à obtenir le résultat demandé.
Le principe explique deux comportements que tout créateur rencontre. D'abord la variabilité : le point de départ étant aléatoire, deux générations identiques donnent deux résultats différents. Ensuite la lenteur relative, chaque étape de débruitage coûtant du calcul.
Les modèles vidéo récents combinent diffusion et architecture transformer, ce qui améliore la cohérence temporelle, la partie la plus difficile : garder les mêmes objets aux mêmes endroits d'une frame à l'autre.
Si un rendu te plaît, note immédiatement la seed. C'est le seul moyen de retrouver une variation proche.
Notions liées
Seed
La seed est le nombre qui initialise le hasard d'une génération : à prompt et paramètres identiques, la même seed redonne le même résultat.
Text to video
Le text to video désigne la génération d'un plan vidéo à partir d'une description écrite, sans image de départ.
Artefact
Un artefact est un défaut produit par le modèle : main à six doigts, membre qui se dédouble, texte illisible, objet qui traverse la matière.
Les films de DelgadoWorks montrent ces choix appliqués, avec le détail de fabrication sur chaque page.
Même catégorie
Modèles de génération
Image to video
L'image to video anime une image fixe fournie en entrée, ce qui verrouille le cadrage, le décor et le personnage avant même la génération.
Interpolation d'images
L'interpolation crée des images intermédiaires entre deux frames existantes pour augmenter la fluidité ou fabriquer un ralenti.
Seed
La seed est le nombre qui initialise le hasard d'une génération : à prompt et paramètres identiques, la même seed redonne le même résultat.
Start frame et end frame
Le start frame et le end frame sont les deux images fournies au modèle pour qu'il fabrique la transition entre elles.
Text to video
Le text to video désigne la génération d'un plan vidéo à partir d'une description écrite, sans image de départ.
Upscaling vidéo
L'upscaling vidéo augmente la définition d'un plan généré en reconstruisant les détails manquants par apprentissage.