07Vocal FlowEn production

« l'atelier s'arrête dix fois, pour dire dix fois la même chose au téléphone »

moi, pendant un atelier céramique

Une voix qui décroche, et prend le rendez-vous pendant l'appel.

Le professionnel renvoie ses appels vers un numéro dédié. Une voix répond à toute heure, renseigne, fixe le rendez-vous dans l'agenda, transfère quand c'est urgent, puis envoie le résumé par SMS. Si le moteur de la voix tombe, sa doublure prend l'appel sur un second moteur.

Du premier fichier au premier appel décroché
2 jours
Ce qui en reste aujourd'hui
Décroche 24h/24, prend le rendez-vous pendant l'appel
Premier appel réel
15 mars 2026

Vitrine et démonstration en ligne · conception, code, mise en production, en solo

un vrai appel, écoutez-le

Salon Camille0:00

06 12 34 56 78au bout du fil
Arial'assistante du salon

AriaSalon Camille, bonsoir ! Je suis Aria, l'assistante du salon. Qu'est-ce que je peux faire pour vous ?

ClientBonsoir... euh, je voudrais une coupe demain, plutôt en fin de journée si possible ?

AriaBonsoir Monsieur Ferrand, avec plaisir. Demain en fin de journée, je peux vous proposer 17h30 ou 18h15.

Client18h15, parfait.

AriaJe récapitule : une coupe, demain à 18h15, au nom de Monsieur Ferrand. C'est bien ça ?

ClientOui, c'est ça.

AriaC'est réservé. Je vous envoie la confirmation par SMS à l'instant. Je peux faire autre chose pour vous ?

ClientNon, ce sera tout, merci.

AriaMerci à vous, Monsieur Ferrand. À demain, et bonne soirée !

RDV noté · SMS envoyé

  • Numéro reconnu
  • Agenda consulté
  • Rendez-vous créé
  • SMS de confirmation envoyé
Les deux voix sont celles du moteur, en conditions téléphone.
L'appel du soir de la vitrine : neuf répliques, toutes rendues par le moteur qui répond vraiment, en qualité téléphone. Le salon et le client sont inventés.

Ce que la phrase voulait dire

Un atelier céramique. Les fours sont en panne, les cuissons des pièces déposées par les clients ont pris des semaines de retard, et chaque personne qui attend la sienne appelle pour savoir où elle en est. Le cours que je suis s'arrête à chaque sonnerie : on décroche, on explique, on raccroche, on reprend. La même explication, mot pour mot, dix fois dans la soirée.

Les personnes qui donnaient le cours s'excusaient à chaque sonnerie, visiblement gênées. Cette tâche n'est pas la leur : elle pouvait leur être retirée des épaules, et confiée à un outil.

Pendant l'appel

Ce qui se passe quand ça sonne

Quand ça sonne, la voix décroche avec une annonce d'accueil, puis mène l'échange en temps réel : elle renseigne, propose des créneaux, prend le rendez-vous, et passe la main à un humain s'il le faut. Elle se sert des outils qu'on lui branche. L'agenda et le transfert sont les deux premiers, et rien n'empêche d'en écrire d'autres, pour un métier ou pour un seul commerce : la suite est une bibliothèque d'outils qui se partage d'un client à l'autre, et se règle pour chacun.

L'APPELANT appelle, à toute heure LA VOIX A Aria la voix du moteur annonce d'accueil aucun blanc au décroché écoute, répond en temps réel, une seule voix décroche et mène l'échange un seul modèle, en temps réel SES OUTILS L'AGENDA les créneaux libres, le rendez-vous LE TRANSFERT passe l'appel au gérant ET CEUX QU'ON AJOUTE un outil écrit pour un métier le rendez-vous est pris pendant l'appel, ou l'appel passe à un humain APRÈS L'APPEL résumé en 2 ou 3 phrases intention, urgence, actions envoyé au gérant URGENT en tête si l'urgence est haute une fois raccroché, quelques secondes plus tard

Il lui est interdit de dire « c'est réservé » ou « c'est noté » tant que l'agenda n'a pas confirmé.

Quelques secondes après avoir raccroché, un modèle relit la transcription et écrit un résumé en deux ou trois phrases, « pour un gérant qui lit entre deux clients » : l'objet de l'appel, le résultat, l'intention, l'urgence, et jusqu'à trois actions à faire. Le résumé part par SMS, WhatsApp, e-mail ou notification, et peut être relayé vers un autre outil. Si l'urgence est haute, le message commence par URGENT et part sans attendre.

Les appels de moins de dix secondes ne produisent rien : c'est presque toujours un robot. La voix trie donc aussi le démarchage de la vraie demande, et certains ne veulent que ça : un filtre devant leur ligne.

SMS · au gérant du salon

Salon Camille : appel reçu Julien Ferrand souhaitait une coupe demain en fin de journée. Rendez-vous fixé demain à 18h15, confirmé pendant l'appel et par SMS. Rien à rappeler. Intent: reservation

Après l'appel.
Les voix

Écoutez qui va décrocher

cliquez, elles parlent vraiment

Comment ces voix sont faites

Les voix, côté technique

  • Au téléphone : Grok pour Aria, Ève et Romain ; OpenAI pour Marine et Sacha.
  • Sur le site : Cartesia, c'est la voix de Nathan.
  • Six voix au téléphone, retenues après l'audition de 34 voix et un sondage.
  • Les extraits sont en 8 kHz, la qualité de la ligne, pas celle du studio.
  • Chaque voix a sa doublure chez l'autre moteur.

Quatre des voix du catalogue, rendues par le moteur qui répond vraiment, en qualité téléphone.

La latence

En temps réel, et on peut lui couper la parole

Depuis juillet 2026, un seul modèle écoute, pense et parle : la chaîne précédente, en trois étages, mettait environ deux secondes à répondre. Le silence avant sa réponse est aujourd'hui de 0,85 seconde. C'est perceptible, et ce n'est pas l'argument du produit : la fiabilité l'est.

ENTRE LA FIN DE LA QUESTION ET LE PREMIER SON DE LA RÉPONSE l'appelant parle la voix répond 0,85 s mesuré chez OpenAI 0,78 s annoncé par Grok environ 2 s : l'ancienne chaîne en trois étages
Mesure interne du 3 août 2026.

On peut lui couper la parole comme à quelqu'un. Dès que l'appelant parle, la voix se tait, et ce qu'elle n'a pas fini de dire est retiré de sa mémoire : elle ne croit pas avoir dit ce que personne n'a entendu.

L'APPELANT PEUT COUPER LA PAROLE la voix parle jamais entendu, retiré de sa mémoire parole détectée l'appelant coupe : la voix se tait en quelques dizaines de millisecondes
Elle laisse 0,6 seconde de silence avant de considérer qu'une phrase est finie. Si on la coupe, elle se tait en quelques dizaines de millisecondes, quand il lui en faut 850 pour commencer à répondre.
La consigne

Configurée en langage naturel

Le gérant ne règle pas des paramètres : il décrit son activité en quelques phrases. Le produit en tire une consigne courte pour la voix, quinze lignes au plus, parce qu'une consigne longue la ralentit, puis la lui relit en français courant pour validation. Cette consigne se glisse entre un socle que personne ne modifie, la voix, les tours de parole, les outils, les limites, la fin d'appel, et les données brutes : horaires, adresse, tarifs, questions fréquentes.

le gérant écrit en français courant 3 · LE SOCLE voix, tours, outils, limites, fin : jamais modifiable par le client 2 · LE COMPORTEMENT la description du gérant, ramenée à 15 lignes au plus 1 · LES DONNÉES horaires, adresse, tarifs, questions fréquentes, tels quels A la consigne de la voix

Un exemple de configuration

Comportement de l'assistant

Décrivez en quelques phrases ce que votre assistant doit faire : son objectif principal, son ton, vos règles métier. L'IA traduit votre description en instructions précises, et vous validez le résultat avant qu'il soit actif.

Ex : Je tiens une école de surf. L'assistant doit prendre les réservations de cours, demander le niveau (débutant ou confirmé) avant de proposer un créneau, et être décontracté : on tutoie tout le monde. Si quelqu'un parle de blessure, prendre son numéro pour que je rappelle en urgence.

0 caractères

La confirmation, par la mer

Le besoin s'est confirmé depuis un tout autre métier. Un prof de surf passe des heures dans l'eau, sans téléphone. S'il ne répond pas, la personne qui voulait réserver compose le numéro suivant et finit chez la concurrence. Pour lui, comme pour tous les métiers qui ont les mains prises, une voix qui décroche n'est pas un confort : c'est la différence entre un client et un appel manqué.

En ligne

La vitrine

La vitrine vit sur app.antton-brunel.com depuis le 17 juillet 2026 : papier crème, encre espresso, tampons inclinés. Elle fait entendre une voix en moins de dix secondes.

La vitrine de Vocal Flow sur ordinateur : le titre Vous travaillez. On décroche., les boutons Essayer gratuitement et Écouter les voix, et à droite la carte de l'appel du soir, Aria, assistante du Salon Camille, avec ses bulles et le bouton Écouter l'appel.
Écran large, le 29 août 2026.
La vitrine de Vocal Flow sur téléphone : le logo, le titre Vous travaillez. On décroche. et le bouton Essayer gratuitement.
Téléphone.

Le tarif tient sur un reçu : 79 euros par mois, 150 minutes incluses, 99 euros de mise en service, sans engagement. L'activation en libre-service, elle, est encore fermée : on entre sur rendez-vous.

· Vocal Flow ·

Abonnement mensuel, 150 min incluses79 €

Mise en service, une seule fois99 €

Au-delà des minutes incluses0,25 €/min

Par mois
79 € /mois
Sans engagement · résiliable à tout moment
Le tarif, tel que la vitrine l'affiche.

Ce que la voix ne fait pas

Le résultat

« Dix fois la même chose au téléphone » est devenu : une voix qui décroche à toute heure, prend le rendez-vous dans l'agenda pendant l'appel, transfère l'urgence, et envoie le résumé par SMS. Premier appel réel décroché le 15 mars 2026, deux jours après le premier fichier. Le silence avant sa réponse : 0,85 seconde, mesurée.