Griffin, le deepfake qui trompe un humain sur deux — Tavus l'a construit, puis a refusé de le vendre

Griffin, le deepfake qui trompe un humain sur deux — Tavus l'a construit, puis a refusé de le vendre

Un appel vidéo d'une minute. Au bout du fil, quelqu'un vous regarde, vous écoute, vous coupe la parole au bon moment. Une fois sur deux, vous jurez que c'est un humain. C'est un modèle. Et son créateur refuse de le mettre en vente.

Le 1er octobre 2026, la boîte californienne Tavus a lâché un chiffre qui a fait le tour des rédactions tech : 48 %. Dans une étude maison menée auprès de 54 participants, 26 personnes ont cru, après une visio d'une minute, avoir parlé à un être humain. En face, il y avait Griffin, un modèle vidéo temps réel. Le test de Turing, celui qu'Alan Turing imaginait pour le texte en 1950, vient de changer de visage. Littéralement.

Une visio d'une minute, et vous êtes piégé

Reprenons. Un test de Turing, dans sa version originale, c'est simple : si une machine peut converser par écrit sans qu'on la distingue d'un humain, elle a gagné. Des décennies de chatbots ont échoué. Puis les LLM sont arrivés, et la barrière du texte est tombée. Restait le visage.

Tavus affirme l'avoir fait tomber. Le chiffre à retenir, c'est la comparaison : la pile technologique précédente de la boîte (un assemblage de trois modèles : Phoenix-4.5 pour le visage, Sparrow-2 pour les tours de parole, Raven-1 pour la perception) ne trompait que 2,4 % des participants. Un sur quarante et un. Griffin, lui, en trompe vingt fois plus.

La nuance a son importance. Ces 48 % ne signifient pas que Griffin est « à moitié humain ». Ils signifient qu'à pile ou face, un humain ne fait pas mieux que le hasard pour détecter la machine. C'est exactement le seuil dont rêvait Turing. Et c'est pour ça que la presse s'est emballée, du Business Today aux sites spécialisés.

Le test de Turing a changé de visage

Le test de Turing, tout le monde le connaît. Peu de gens l'ont vu en vidéo. C'est pourtant la bascule que Tavus revendique : passer d'un test textuel, obsolète depuis que les LLM écrivent mieux que la moyenne des stagiaires, à un test vidéo où tout compte. Le regard. Les micro-hochements. Le « mm-hm » placé au bon moment. L'interruption naturelle.

Griffin est ce que Tavus appelle un « Human Interaction Model » — un HIM, pour faire pendant au LLM. L'idée : un modèle ne doit pas seulement comprendre le langage, il doit comprendre l'interaction. Ce qui a été dit, certes. Mais aussi comment ça a été dit, et ce que votre visage racontait pendant que vous le disiez.

Résultat revendiqué : une visio d'une minute où le modèle tient la conversation, perçoit que vous doutez, et réagit en conséquence. Les participants lui ont donné 5,4 sur 7 en naturel, 5,6 en fiabilité, 5,8 en « envie de reparler ». La fluidité, elle, plafonne à 4,9. C'est là que le masque grince encore un peu.

Comment ça marche : un visage qui vous lit pendant que vous parlez

Ici, on entre dans la mécanique, et elle est plus intéressante que le marketing.

La plupart des avatars conversationnels (les HeyGen, Synthesia et consorts) fonctionnent en cascade. On transcrit votre voix, on envoie le texte à un LLM, le LLM répond, un synthétiseur vocal récite, un avatar anime les lèvres. Chaque étape ajoute sa latence : environ 1,5 seconde de silence entre votre phrase et la réaction. Résultat, un visage qui vous fixe poliment pendant une éternité, puis se met à parler comme un automate.

Griffin casse la chaîne. C'est un système « full duplex » : il perçoit, décide et génère en continu, sans attendre la fin de votre phrase. Il peut vous couper, placer un retour, hocher la tête pendant que vous parlez encore. La latence audio-vers-vidéo revendiquée : 0,43 seconde en moyenne sur une puce H100, environ deux fois mieux que le suivant au classement.

Sous le capot, deux moteurs. D'un côté, le « continuous conversational modeling » : à intervalles infra-seconde, le modèle réévalue l'état de la conversation et émet des signaux de contrôle. De l'autre, la génération audio-vidéo. Côté voix, un transformer de diffusion autorégressif et un codec maison baptisé Tavec, qui compresse l'audio 48 kHz en paquets de 10 millisecondes. Côté image, un générateur à trois pas de diffusion qui sort de la 720p par tranches de 320 millisecondes, 25 images par seconde.

Une minute de parole, c'est 6 000 frames latentes chez Griffin, contre 2,88 millions d'échantillons bruts. La compression est brutale. C'est ce qui lui permet de tourner en temps réel sans faire fondre le datacenter. Enfin, presque : Tavus ne divulgue pas le coût GPU réel de la chose.

Le benchmark qui met tout le monde d'accord

Une affirmation de boîte, c'est une chose. Un benchmark indépendant, c'en est une autre. Tavus s'appuie sur VideoFDB, un banc d'essai construit et noté par NVIDIA pour mesurer la qualité des agents vidéo conversationnels.

Les chiffres, là encore, sont parlants. En génération, Griffin-Lite (la version allégée ouverte à quelques testeurs) décroche 3,83 sur 5, contre 3,92 pour la référence humaine et 2,80 pour le meilleur système concurrent (Gemini 2.5 + Anam). En perception, 3,73 contre 4,20 pour l'humain, et 3,44 pour la meilleure baseline, MiniCPM-o 4.5. Sur l'alignement « theory-of-mind », Griffin-Lite caracole à 62,8 % en génération et 73,8 % en perception, meilleur de tous.

Bref, sur le papier, ça écrase. Mais gardez une réserve : ces notes sont attribuées par un juge LLM, pas par un panel d'humains. Elles mesurent une qualité perçue, pas un taux de tromperie. Ce n'est pas la même chose.

Face à Meta : deux manières de faire parler un fantôme

Le concurrent le plus direct s'appelle Muse Realtime Avatar, dévoilé par Meta le 23 septembre 2026. La comparaison vaut le détour, parce qu'elle révèle deux philosophies opposées.

Meta part de la parole de l'agent : un flux de tokens vocaux transformé en visage synchronisé. Griffin, lui, part de la personne en face : il lit votre vidéo, votre audio, et décide quoi dire. L'un vend de la vitesse — 870 millisecondes entre la fin du tour de parole et le premier octet vidéo, douze sessions temps réel sur une seule carte GB200. L'autre vend de la crédibilité — 48 % de tromperie.

Aucun des deux n'a d'API publique. Aucun des deux n'a de prix. Aucun des deux n'a de date de disponibilité. Deux laboratoires qui font la course au fantôme le plus crédible, et qui, pour l'instant, ne vendent rien.

Le deepfake qu'on ne peut pas acheter

C'est le détail qui change tout, et que les communiqués mettent en avant avec une franchise inhabituelle : Tavus refuse de commercialiser Griffin.

Pas par fausse modestie. Par prudence. Les propriétés qui rendent Griffin convaincant (ce regard qui suit, ces micro-expressions justes, ce clonage de voix à partir de dix secondes d'audio) sont exactement celles qui permettent de tromper un humain. La boîte le reconnaît noir sur blanc dans son dossier de recherche : le modèle est capable d'usurper une identité, et il ne sortira pas tant que les garde-fous de divulgation ne sont pas en place.

Seul Griffin-Lite, une version réduite, est accessible à un cercle de testeurs triés sur le volet. Griffin, lui, n'existe qu'en vidéo de démo. On peut le voir dans le film de lancement, où le CEO Hassaan Raza passe un appel de fin de journée avec « Vanessa », une PAL propulsée par Griffin. Vanessa n'existe pas. On jurerait le contraire.

L'entreprise n'est pas un garage : fondée en 2021 à San Francisco, 75 employés, 64,2 millions de dollars levés sur quatre tours, dont une Série B de 40 millions menée par CRV en novembre 2025. Sa plateforme PAL revendique plus de 150 000 développeurs et entreprises. Griffin devait en être l'étape suivante. Il est en vitrine, pas en rayon.

Ce que 48 % ne veut pas dire

Maintenant, respirons un coup. Ce chiffre de 48 %, il faut le lire avec les bonnes lunettes.

D'abord, l'étude est menée par Tavus. Pas répliquée par un tiers. Des appels d'une minute, dans des conditions contrôlées, pas des heures de conversation avec un interlocuteur qui pose des questions pièges. Ensuite, et c'est le point le plus solide, plusieurs analyses indépendantes le rappellent : sembler humain n'a rien à voir avec raisonner de façon fiable. Griffin ne passe aucun test de raisonnement. On ne sait pas ce qu'il vaut sur un appel technique, une négociation, une question médicale.

Enfin, la réception communautaire est glaciale. Le fil Hacker News qui a relayé l'annonce plafonne à un point et zéro commentaire. Les développeurs, eux, ne sont pas tombés dans le panneau. Ils attendent de voir, et de tester. Ce qu'ils ne peuvent pas faire, puisque le modèle n'est pas disponible.

Le plus parlant reste la confiance des participants. Ceux qui ont dit « humain » en étaient convaincus à 79 %. Ceux qui ont dit « IA », à 81 %. Personne ne doute. Tout le monde se trompe la moitié du temps. C'est exactement ce qui rend la chose à la fois fascinante et légèrement inquiétante.

Verdict

Griffin est une vraie avancée technique, pas un coup marketing. Le passage de la cascade au full duplex, le codec Tavec, la distillation en trois étapes : c'est du travail d'ingénierie sérieux, validé par un benchmark NVIDIA. Tavus a construit un deepfake d'une crédibilité inédite, et a eu l'intelligence (ou le réflexe de survie) de ne pas le mettre en vente.

Mais un modèle qu'on ne peut pas tester, avec un chiffre vedette issu d'une étude maison, ça reste une promesse. La moitié des gens se sont fait avoir une minute. Sur une heure, sur un sujet qu'ils connaissent, sur une question qui exige de la rigueur ? On n'en sait rien. Et tant que Griffin restera derrière la vitrine, on continuera à deviner.

L'histoire ne dit pas si Vanessa regrette son appel. Vanessa n'existe pas.

Sources

✦ Idée d'illustration : un portrait en buste d'une jeune femme souriante en visioconférence, cadré comme une capture d'écran d'appel vidéo, mais dont la moitié du visage se dissout en un maillage de points lumineux et de lignes de code, révélant le modèle en dessous. Arrière-plan : un écran d'ordinateur flou avec une interface d'appel. Style néobrutaliste, contraste dur, une dominante froide (bleu nuit et cyan) tranchée par une touche de rouge sur l'icône « appel » en haut. Aucun texte.

V

Auteur

Vincent

Développeur fullstack & responsable informatique

Développeur fullstack et responsable informatique. Vulgarise l'IA au quotidien : décryptages sans langue de bois, tutoriels concrets et comparatifs d'outils testés sur le terrain.