---
title: Évaluations
description: >-
  Écrivez des scénarios avec étapes et critères de réussite, faites-y passer
  l'agent, lisez le taux de réussite. La section Evaluation du workspace de
  l'agent.
---
**Evaluation** (évaluation) exécute votre agent sur des conversations scriptées et vous
indique lesquelles il a réussies. Un **scenario** (scénario) définit ce que dit un
testeur et ce qui constitue une réussite ; un **run** (exécution) joue un ou plusieurs
scénarios face à l'agent et attribue une note à chacun. Utilisez cette section pour
détecter les régressions après une modification du prompt, et pour satisfaire la
vérification **At least one test scenario** (au moins un scénario de test) de la
[Checklist de lancement](/fr/test-and-improve/launch-checklist).

:::tip[Quand l'utiliser]
Les tests dans le navigateur décrits dans [Tester dans le navigateur](/fr/test-and-improve/testing-in-the-browser)
servent à explorer. Les évaluations servent à répéter : les mêmes 5 scénarios après
chaque modification, avec un chiffre que vous pouvez comparer à la révision précédente.
:::

## Fonctionnement

La section s'ouvre sur un bref résumé : exécuter l'agent sur des scénarios de test et
examiner comment il les a traités. **Add scenario** (ajouter un scénario) et **Run all**
(tout exécuter) se trouvent en haut, et deux onglets figurent en dessous.

| Onglet | Contenu |
|---|---|
| **Scenarios** | Les scénarios que vous avez rédigés. Sélectionnez-en ici pour n'exécuter que ceux-là. |
| **Runs** | Chaque exécution, avec ses résultats. |

Une exécution rejoue les étapes de chaque scénario en simulant un utilisateur, puis
évalue la transcription au regard des critères de réussite du scénario. Un scénario est
réussi ou échoué ; le taux de réussite de l'exécution correspond à la part de scénarios
réussis.

![La section Evaluation, avec Add scenario et Run all en haut et un scénario listé.](/media/test-and-improve/evaluation-scenarios.webp)

## Rédiger un scénario

1. **Ouvrir le formulaire**

    Sous **Testing** (tests), choisissez **Evaluation**, puis **Add scenario** en haut.
    Le formulaire **Create New Scenario** (créer un nouveau scénario) s'ouvre.

2. **Le nommer**

    **Scenario Name** (nom du scénario) est ce que le rapport d'exécution affiche :
    nommez donc le comportement testé, `Booking request with missing date of birth`
    plutôt que `Test 3`.

3. **Rédiger les étapes de test**

    Chaque étape sous **Test Steps** (étapes de test) est une instruction adressée au
    testeur simulé, à la deuxième personne : `You should say 'I need to move my
    appointment.'`, puis `You should wait for the agent's response`. **Add Step**
    (ajouter une étape) ajoute une ligne ; **Remove** (supprimer) en retire une.
    Alternez une étape de parole et une étape d'attente afin que l'agent puisse prendre
    son tour. Une dernière étape telle que `You should wait 5 seconds and verify no
    further response is given` vérifie que l'agent s'est bien arrêté au bon moment.

4. **Rédiger les critères de réussite**

    **Success Criteria** (critères de réussite) est la phrase que lit l'évaluateur.
    Indiquez ce qui doit avoir eu lieu : `The agent asks for the caller's full name and
    date of birth before offering any slot, and reads the chosen slot back.` Nommez un
    outil si le test porte sur un outil : `The agent must invoke the end_call tool and
    send no further message.`

5. **L'enregistrer**

    **Save** (enregistrer) devient actif dès que le nom, au moins une étape et les
    critères sont renseignés. Le scénario rejoint la liste de l'onglet **Scenarios**
    avec son nombre d'étapes ; appuyez dessus pour déployer les étapes et les critères,
    ou utilisez **Edit** (modifier) et **Delete** (supprimer) à côté.

<video src="/media/test-and-improve/create-scenario.mp4" autoplay loop muted playsinline></video>

*Création d'un scénario : nom, étapes et critères de réussite.*

### AI Generate

**AI Generate** (génération par IA), sous **Quick Start** (démarrage rapide) en haut du
formulaire, lit le prompt et les outils de l'agent et remplit l'intégralité du
formulaire : un nom, une série d'étapes de parole et d'attente, et une phrase de
critères de réussite. Cela prend quelques secondes. Modifiez le résultat avant de créer
le scénario ; les étapes générées sont volontairement génériques, et l'intérêt réside
dans le remplacement d'une ligne par le cas qui vous importe.

![Un scénario rédigé par AI Generate, prêt à être modifié.](/media/test-and-improve/ai-generate-scenario.webp)

## Exécuter les scénarios

**Run all**, en haut de la section, exécute tous les scénarios en un clic. Pour n'en
exécuter que certains, ouvrez **Scenarios**, sélectionnez-les, puis choisissez
**Run selected** (exécuter la sélection), qui en indique le nombre. **Clear selection**
(effacer la sélection) permet de recommencer.

Il n'y a aucun formulaire à remplir. L'exécution est nommée **Evaluation** suivi de
l'heure, la section affiche **Executing** (en cours d'exécution) avec le nombre de
scénarios pendant le traitement, et les résultats apparaissent d'eux-mêmes une fois
l'exécution terminée. Chaque scénario est une véritable conversation avec l'agent : une
exécution comportant plusieurs scénarios prend donc quelques minutes.

<video src="/media/test-and-improve/run-scenario.mp4" autoplay loop muted playsinline></video>

*Exécution de tous les scénarios avec Run all.*

## Lire les résultats

**Runs** liste chaque exécution sous **Test Runs** (exécutions de test), avec un badge
qui la résume (**Completed**, terminée, une fois qu'elle est achevée ; **Needs
attention**, attention requise, lorsque des scénarios ont échoué), le nombre de
scénarios, sa date de création et sa dernière date d'exécution. **Run again** (relancer)
rejoue une exécution face à l'agent dans son état actuel ; utilisez cette action après
un correctif, afin que la comparaison porte sur les mêmes scénarios. **Insights**
(analyses) ouvre l'analyse de l'exécution.

Déployez une exécution pour voir son **Success Rate** (taux de réussite), le nombre de
scénarios **passed** (réussis) et **failed** (échoués), et **Scenario Results**
(résultats des scénarios) avec une ligne par scénario. Un scénario échoué explique
quelle partie des critères de réussite n'a pas été satisfaite, et **Conversation
Transcript** (transcription de la conversation), en dessous, montre l'appel simulé tour
par tour.

![Une exécution déployée : taux de réussite, décompte et résultats des scénarios.](/media/test-and-improve/test-run-results.webp)

## Comportement et limites

- Les exécutions utilisent la dernière version enregistrée de l'agent, la même que celle
  employée par les tests dans le navigateur.
- Les scénarios sont rédigés par agent. Un scénario créé pour un agent n'est pas visible
  sur un autre.
- Les conversations d'une exécution sont simulées ; elles n'utilisent pas de numéro de
  téléphone et n'apparaissent pas dans **Call Logs** (journaux d'appels).

## Voir aussi

- [Checklist de lancement](/fr/test-and-improve/launch-checklist)
- [Tester dans le navigateur](/fr/test-and-improve/testing-in-the-browser)
- [Versions](/fr/test-and-improve/versions)
- [Guide de prompting](/fr/build/prompting/prompting-guide)
