01
Filmer, sans enregistrer le son
La caméra avant suit votre visage à 25 images par seconde. Le microphone reste fermé : Lipsapp n’en a pas besoin pour lire.
Bientôt sur iOS et macOS
Lipsapp regarde vos lèvres et écrit ce que vous dites. Pas de microphone, pas de serveur : la lecture se calcule sur votre iPhone ou votre Mac, en moins d’une seconde.
Image par image
Faites défiler : votre scroll fait bouger de vraies lèvres, filmées puis réduites à leurs contours, à 25 images par seconde, comme le modèle les voit.
Fonctionnement
01
La caméra avant suit votre visage à 25 images par seconde. Le microphone reste fermé : Lipsapp n’en a pas besoin pour lire.
02
Cinq repères (yeux, nez, commissures) alignent le visage sur une référence fixe. Même si vous bougez la tête, la bouche arrive toujours au même endroit.
03
Chaque image devient un carré gris de 88 × 88 pixels centré sur les lèvres. C’est tout ce que le modèle reçoit : ni le décor, ni votre voix.
04
Un réseau visuel transforme la séquence en mots, et propose plusieurs hypothèses avec leur probabilité. Pour piloter un ordinateur, il compare vos lèvres à la liste des commandes et rejette ce qui ne ressemble à aucune.
05
Un petit adaptateur personnel (LoRA) s’entraîne sur vos propres prises, sur l’appareil. Il n’est gardé que s’il fait nettement mieux que le modèle général sur des phrases qu’il n’a jamais vues.
Accessibilité d’abord
Aphonie, laryngectomie, trachéotomie, maladie neuromusculaire, surdité, milieu où l’on ne peut pas parler fort : Lipsapp transforme une articulation silencieuse en texte, en commande ou en voix.
Fonctionne aujourd’hui
Comme le Contrôle vocal d’Apple, mais sans vocaliser. Articulez « ouvrir Safari », « afficher les numéros » puis « numéro sept », « écrire » puis votre phrase. Chaque action sensible attend « confirmer » : rien ne part par erreur.
En préparation
Les mots lus sur les lèvres sont prononcés par une voix de synthèse. Avec quelques minutes d’anciens enregistrements, cette voix peut ressembler à la vôtre. Pour les personnes privées de voix après une opération ou une maladie.
Fonctionne aujourd’hui
Articulez sans émettre de son : l’iPhone écrit la phrase, la copie et la partage. Utile à l’hôpital, dans un open space, dans les transports, ou quand parler fatigue.
En préparation
Pour les personnes sourdes ou malentendantes qui lisent déjà sur les lèvres : une proposition de texte en direct, face à l’interlocuteur qui l’accepte, pour lever un doute sur un mot.
Recherche
Visualiser comment le modèle lit chaque mot aide à travailler l’articulation, avec un orthophoniste, après un AVC ou pour une prothèse vocale.
Studio
Placez-vous devant la caméra et parlez de ce que vous voulez : votre journée, un voyage, une recette. Aucun texte à lire.
Le son sert uniquement à étiqueter : il est transcrit sur la machine, découpé en phrases de six secondes, et chaque phrase est associée aux images de votre bouche. Un adaptateur personnel s’entraîne ensuite, et se mesure sur des phrases qu’il n’a jamais vues.
Chaque séance s’ajoute à votre profil. Dix minutes de parole suffisent pour une première mesure fiable.
Signatures
Tous les contours des lèvres d’une phrase, superposés comme une photo en pose longue, du bleu (début) au vert (fin). C’est ce motif, et non le son, que le modèle apprend à reconnaître. Survolez-les pour les rejouer ; sur téléphone, elles se rejouent seules.
Usages
Fonctionne aujourd’hui
Chirurgie, atelier, cuisine, gants, bruit de machines : commander un écran sans toucher ni crier.
En préparation
Proposer un sous-titre quand le son est inaudible, coupé ou saturé, et le corriger en quelques clics.
En préparation
Un micro qui décroche, un passage couvert par le vent : les lèvres restent visibles. Lipsapp propose les mots manquants, qu’une voix de synthèse peut réinsérer.
Recherche
Des bulles de bande dessinée posées près de chaque visage dans une vidéo muette. Attribuer la parole sans le son reste un problème de recherche ouvert.
Recherche
Retrouver le texte articulé à l’écran pour caler une traduction sur le mouvement des lèvres.
Recherche
Films de famille, images d’archives sans bande-son : proposer ce que disaient les gens, avec l’accord des familles ou des institutions.
Recherche
Pour des enquêtes judiciaires, des expertises ou des journalistes, sur réquisition ou avec le consentement des personnes filmées. Jamais pour écouter quelqu’un à son insu.
Recherche
Voir si votre articulation se lit comme le mot visé : un retour visuel pour travailler la prononciation.
Fonctionne aujourd’hui
Écrire un message dans une salle d’attente ou une bibliothèque, sans que personne n’entende.
Confiance
La lecture, l’entraînement et vos vidéos restent sur votre iPhone ou votre Mac. Aucune image n’est envoyée à un serveur.
Un profil personnel ne s’entraîne que sur la personne qui l’a voulu. Lipsapp n’est pas conçu pour lire les lèvres de quelqu’un à son insu, et ne sera pas vendu pour cela.
Chaque action sensible attend votre confirmation. Chaque texte proposé reste modifiable. Les corrections d’une IA sont toujours affichées à côté du texte lu.
Nous publions des taux d’erreur mesurés sur des phrases jamais vues à l’entraînement, avec la taille du test. Pas de promesse sans protocole.
Disponibilité
Lipsapp arrive sur iOS et macOS, en français et en anglais. Les puces Apple font tourner le modèle localement, en temps réel. D’autres plateformes suivront.
Association, hôpital, orthophoniste, studio, chercheur, ou simplement concerné : parlez-nous de votre usage. Les premiers testeurs façonnent l’app.
Ou retrouvez-nous sur ohadja.com