---
title: Détection d'activité vocale
description: >-
  La carte Voice activity, sous Advanced : un Mode prédéfini qui fixe le temps
  d'attente de l'agent avant de répondre, et les cinq seuils qui le
  sous-tendent.
---
<Badge variant="accent">Agents vocaux</Badge>

La détection d'activité vocale (VAD) écoute l'audio de l'appelant et repère le
début et la fin de la parole. Toutes les étapes en aval, la transcription, la
détection de tour de parole et les minuteurs de silence, s'appuient sur ces
repères. La carte **Voice activity** (activité vocale), sous **Advanced**
(avancé), les règle au moyen d'un **Mode** (préréglage), *le temps d'attente de
l'agent avant de répondre*, et expose les cinq seuils qui le sous-tendent sous
**Advanced**, dans la carte.

:::note[Les valeurs par défaut conviennent à la plupart des agents]
La description de la carte l'indique elle-même, et elle a raison. Modifiez une
valeur à la fois, testez avec **Call** (appeler) et conservez la version qui a
amélioré la transcription.
:::

![La carte Voice activity.](/media/build/voice-activity-card.webp)

## Configuration

1. Ouvrez l'agent et choisissez **Advanced** sous **Build** (créer).
2. Dans **Voice activity**, choisissez un **Mode**. Pour ajuster plutôt un seul
   seuil, ouvrez **Advanced** dans la carte, puis déplacez son curseur ou saisissez
   une valeur dans son champ.
3. **Save** (enregistrer).

## Modes

Un mode est un préréglage des cinq seuils. Le mode lui-même n'est enregistré nulle
part : la carte le déduit des valeurs. Toute modification manuelle d'un seuil
affiche donc le mode **Custom** (personnalisé), avec le message *The thresholds
below no longer match a preset.* (les seuils ci-dessous ne correspondent plus à un
préréglage). Un agent qui n'a jamais été ajusté apparaît en **Balanced**
(équilibré).

| Mode | Usage | Parole min. | Silence min. | Activation | Marge en amont | Fin de parole |
|---|---|---|---|---|---|---|
| **Fast** (rapide) | Échanges courts et vifs : répond dès que l'appelant marque une pause | 100 ms | 100 ms | 0,4 | 100 ms | 0 ms |
| **Balanced** | Le compromis recommandé entre réactivité et risque d'interrompre | 100 ms | 200 ms | 0,5 | 200 ms | 100 ms |
| **Patient** (patient) | Appelants qui réfléchissent en cours de phrase : attend plus longtemps avant de répondre | 200 ms | 600 ms | 0,6 | 300 ms | 500 ms |

## Référence

| Champ | Valeur par défaut | Unité | Plage | Rôle |
|---|---|---|---|---|
| **Min speech duration** (durée minimale de parole) | 100 | ms | 100 à 3000, pas de 100 | Son le plus court considéré comme de la parole. Plus bas = plus réactif |
| **Min Silence Duration** (durée minimale de silence) | 200 | ms | 100 à 3000, pas de 100 | Silence requis pour considérer que l'utilisateur a fini de parler |
| **Activation threshold** (seuil d'activation) | 0,5 | | 0,1 à 0,9, pas de 0,1 | Niveau sonore ou caractère vocal requis pour compter comme de la parole. Plus bas = plus sensible, davantage de faux positifs |
| **Prefix Padding Duration** (durée de marge en amont) | 200 | ms | 100 à 3000, pas de 100 | Audio ajouté avant la parole détectée, afin que la première syllabe ne soit pas coupée |
| **End-of-speech timeout** (délai de fin de parole) | 100 | ms | 0 à 3000, pas de 100 | Silence requis avant de considérer le tour de parole comme terminé |

## Ce que chaque réglage modifie

- **Min speech duration** filtre les clics et les toux. Augmentez-la si l'agent
  réagit au bruit ; abaissez-la s'il manque les « oui » et les « non ».
- **Min Silence Duration** est la pause qui met fin à la prise de parole d'un
  appelant. Augmentez-la pour les appelants qui marquent des pauses entre les
  phrases ; abaissez-la pour des réponses plus rapides.
- **Activation threshold** correspond à la sensibilité. Augmentez-le sur les
  lignes bruyantes, ou activez d'abord la
  [réduction de bruit](/fr/build/voice-and-audio/noise-suppression) et n'y touchez
  pas.
- **Prefix Padding Duration** préserve le début des mots. Nécessite rarement un
  ajustement ; augmentez-la si les transcriptions perdent les premières syllabes.
- **End-of-speech timeout** s'ajoute après le silence avant que le tour de parole
  ne soit transmis. Avec **Min Silence Duration**, il fixe le plancher du temps de
  réponse de l'agent.

## Comportement et limites

- La latence de réponse est au minimum égale à **Min Silence Duration** plus
  **End-of-speech timeout**, plus le temps propre au modèle. Avec les valeurs par
  défaut, ces deux réglages représentent 300 ms.
- La [détection de tour de parole](/fr/build/speech-pipeline/turn-detection) peut
  retarder un tour au-delà de ce que la VAD a décidé, mais jamais le raccourcir.
- Le minuteur **Max silence** (silence maximal), sous **Reminders** (relances),
  compte le temps pendant lequel la VAD n'a entendu aucune parole ; un seuil réglé
  trop haut peut faire passer un appelant qui parle pour silencieux.
- Ces réglages s'appliquent aussi au test **Call** dans le navigateur.

## Vérification

Démarrez un appel sous **Testing** (test), **Call**, prononcez des mots courts et
des phrases longues, et observez la transcription : chaque énoncé doit apparaître
une seule fois, complet, et l'agent doit répondre après une pause naturelle.

## Dépannage

- **L'agent répond avant que j'aie terminé.** Passez le **Mode** sur **Patient**,
  ou augmentez **Min Silence Duration** par paliers de 200 ms ; activez ensuite la
  détection de tour de parole.
- **L'agent met du temps à répondre.** Passez le **Mode** sur **Fast**, ou abaissez
  d'abord **End-of-speech timeout**, puis **Min Silence Duration**.
- **Le bruit de fond déclenche l'agent.** Activez le débruitage, puis augmentez
  **Activation threshold** de 0,1.

## Voir aussi

- [Détection de tour de parole](/fr/build/speech-pipeline/turn-detection)
- [Suppression de bruit](/fr/build/voice-and-audio/noise-suppression)
- [Silence, relances et durée d'appel](/fr/build/speech-pipeline/silence-reminders-and-call-duration)
- [Métriques de qualité d'appel](/fr/operate/call-quality-metrics)
