Évaluations
Écrivez des scénarios avec étapes et critères de réussite, faites-y passer l'agent, lisez le taux de réussite. La section Evaluation du workspace de l'agent.
Evaluation (évaluation) exécute votre agent sur des conversations scriptées et vous indique lesquelles il a réussies. Un scenario (scénario) définit ce que dit un testeur et ce qui constitue une réussite ; un run (exécution) joue un ou plusieurs scénarios face à l’agent et attribue une note à chacun. Utilisez cette section pour détecter les régressions après une modification du prompt, et pour satisfaire la vérification At least one test scenario (au moins un scénario de test) de la Checklist de lancement.
Fonctionnement
La section s’ouvre sur un bref résumé : exécuter l’agent sur des scénarios de test et examiner comment il les a traités. Add scenario (ajouter un scénario) et Run all (tout exécuter) se trouvent en haut, et deux onglets figurent en dessous.
| Onglet | Contenu |
|---|---|
| Scenarios | Les scénarios que vous avez rédigés. Sélectionnez-en ici pour n’exécuter que ceux-là. |
| Runs | Chaque exécution, avec ses résultats. |
Une exécution rejoue les étapes de chaque scénario en simulant un utilisateur, puis évalue la transcription au regard des critères de réussite du scénario. Un scénario est réussi ou échoué ; le taux de réussite de l’exécution correspond à la part de scénarios réussis.

Rédiger un scénario
Ouvrir le formulaire
Sous Testing (tests), choisissez Evaluation, puis Add scenario en haut. Le formulaire Create New Scenario (créer un nouveau scénario) s’ouvre.
Le nommer
Scenario Name (nom du scénario) est ce que le rapport d’exécution affiche :
nommez donc le comportement testé, Booking request with missing date of birth
plutôt que Test 3.
Rédiger les étapes de test
Chaque étape sous Test Steps (étapes de test) est une instruction adressée au
testeur simulé, à la deuxième personne : You should say 'I need to move my appointment.', puis You should wait for the agent's response. Add Step
(ajouter une étape) ajoute une ligne ; Remove (supprimer) en retire une.
Alternez une étape de parole et une étape d’attente afin que l’agent puisse prendre
son tour. Une dernière étape telle que You should wait 5 seconds and verify no further response is given vérifie que l’agent s’est bien arrêté au bon moment.
Rédiger les critères de réussite
Success Criteria (critères de réussite) est la phrase que lit l’évaluateur.
Indiquez ce qui doit avoir eu lieu : The agent asks for the caller's full name and date of birth before offering any slot, and reads the chosen slot back. Nommez un
outil si le test porte sur un outil : The agent must invoke the end_call tool and send no further message.
L'enregistrer
Save (enregistrer) devient actif dès que le nom, au moins une étape et les critères sont renseignés. Le scénario rejoint la liste de l’onglet Scenarios avec son nombre d’étapes ; appuyez dessus pour déployer les étapes et les critères, ou utilisez Edit (modifier) et Delete (supprimer) à côté.
AI Generate
AI Generate (génération par IA), sous Quick Start (démarrage rapide) en haut du formulaire, lit le prompt et les outils de l’agent et remplit l’intégralité du formulaire : un nom, une série d’étapes de parole et d’attente, et une phrase de critères de réussite. Cela prend quelques secondes. Modifiez le résultat avant de créer le scénario ; les étapes générées sont volontairement génériques, et l’intérêt réside dans le remplacement d’une ligne par le cas qui vous importe.

Exécuter les scénarios
Run all, en haut de la section, exécute tous les scénarios en un clic. Pour n’en exécuter que certains, ouvrez Scenarios, sélectionnez-les, puis choisissez Run selected (exécuter la sélection), qui en indique le nombre. Clear selection (effacer la sélection) permet de recommencer.
Il n’y a aucun formulaire à remplir. L’exécution est nommée Evaluation suivi de l’heure, la section affiche Executing (en cours d’exécution) avec le nombre de scénarios pendant le traitement, et les résultats apparaissent d’eux-mêmes une fois l’exécution terminée. Chaque scénario est une véritable conversation avec l’agent : une exécution comportant plusieurs scénarios prend donc quelques minutes.
Lire les résultats
Runs liste chaque exécution sous Test Runs (exécutions de test), avec un badge qui la résume (Completed, terminée, une fois qu’elle est achevée ; Needs attention, attention requise, lorsque des scénarios ont échoué), le nombre de scénarios, sa date de création et sa dernière date d’exécution. Run again (relancer) rejoue une exécution face à l’agent dans son état actuel ; utilisez cette action après un correctif, afin que la comparaison porte sur les mêmes scénarios. Insights (analyses) ouvre l’analyse de l’exécution.
Déployez une exécution pour voir son Success Rate (taux de réussite), le nombre de scénarios passed (réussis) et failed (échoués), et Scenario Results (résultats des scénarios) avec une ligne par scénario. Un scénario échoué explique quelle partie des critères de réussite n’a pas été satisfaite, et Conversation Transcript (transcription de la conversation), en dessous, montre l’appel simulé tour par tour.

Comportement et limites
- Les exécutions utilisent la dernière version enregistrée de l’agent, la même que celle employée par les tests dans le navigateur.
- Les scénarios sont rédigés par agent. Un scénario créé pour un agent n’est pas visible sur un autre.
- Les conversations d’une exécution sont simulées ; elles n’utilisent pas de numéro de téléphone et n’apparaissent pas dans Call Logs (journaux d’appels).