Vidéo IA : la vitesse de réponse compte désormais plus que la définition
Par Jocelyn Bouget ·
La course à la vitesse d'inférence change la façon de produire de la vidéo avec l'IA. On passe de la commande qu'on attend au geste qui répond, et c'est le matériel qui tranche.

On a longtemps couru après la définition et la finesse du grain. La vraie frontière aujourd'hui, c'est la latence : le délai entre votre action et la réponse de la machine. Ce que je vois passer en clientèle, c'est une frustration qui monte : attendre trente secondes pour un clip, c'est déjà trop long pour créer sans casser son élan. Le passage au temps réel n'est pas un simple progrès technique, c'est un basculement côté matériel.
La réponse immédiate n'est pas le travail de fond
L'analyste Ben Thompson parle d'un « basculement de l'inférence », l'inférence étant la phase où l'IA produit un résultat à partir d'une consigne. Il distingue deux marchés. D'un côté, l'inférence de réponse : vous êtes dans la boucle et vous attendez une réaction immédiate. C'est là, à mon sens, que se jouent des outils comme Krea pour la vidéo. De l'autre, l'inférence agentique, où l'IA mène seule des tâches complexes : la vitesse y compte moins que la mémoire et la capacité de réflexion.
Pour la vidéo en direct, tout dépend de la vitesse à laquelle le modèle produit ses tokens, et de la capacité du matériel à éviter les goulots d'étranglement. Sur le papier, ça marche. En vrai, il faut des puces capables de déplacer les données à une vitesse vertigineuse.
La vraie bataille : la bande passante mémoire
Le piège, c'est de croire que la puissance brute du processeur suffit. Pour générer des images à la volée, ce qui limite, c'est la bande passante mémoire : la vitesse à laquelle les données circulent entre le stockage et le calcul. Les architectures classiques de Nvidia, toutes dominantes qu'elles sont, doivent gérer des flux énormes qui créent de la latence. En face, Cerebras mise sur la mémoire SRAM, une mémoire très rapide gravée directement dans la puce. Selon Ben Thompson, sa puce WSE-3 offre une bande passante mémoire environ 6 000 fois supérieure à celle d'une Nvidia H100. Cerebras, de son côté, annonce 21 pétaoctets par seconde, soit 7 000 fois une H100 selon ses propres calculs.
Là où ça coince concrètement, c'est le coût de ces infrastructures. Mais pour ceux qui créent, la direction est claire : on va passer d'une production « à la commande » (on tape un texte, on attend) à une production « au geste » (l'image évolue en même temps que le curseur ou la voix).
Vous voulez brancher ce genre d'outil sur votre site ou votre production ?
2 sources
- Stratechery, The Inference Shift (Ben Thompson, 11 mai 2026)
- Cerebras, Introducing Cerebras Inference: AI at Instant Speed (27 août 2024)