Galaris

Le Lab : comparer sur vos cas de travail

Capturez des situations réelles, comparez des candidats et confrontez les scores à une revue humaine. Chaque campagne conserve son contexte et ses résultats.

Vous envisagez de changer de modèle ou de harnais ? Le Lab aide à mesurer les écarts sur vos cas de travail. Comparez les modèles et les configurations des mécanismes à contexte comparable, puis vérifiez le comportement du moteur retenu en situation. Ces évaluations ne remplacent pas un essai complet des outils et des effets externes. Choisir les modèles et les harnais.

Onze mécanismes à examiner séparément

Famille Mécanismes
Préparer le travail Dispatcher, Briefing, Planner
Organiser et apprendre Détection des sujets, extraction mémoire, apprentissage
Suivre Suivi de Goal
Exécuter Exécuteur de tâches, conversationnel, vocal
Diagnostiquer Analyse de tâches

Le journal d’incidents est une surface distincte. Le Briefing reste testable et consultable dans les historiques ; sa présence dans le Lab ne prouve pas son emploi dans chaque parcours courant.

Les mécanismes du laboratoire — Les bancs d’essai du dispatcher, du planner, de la mémoire et des exécuteurs.
Les mécanismes du laboratoire — Les bancs d’essai du dispatcher, du planner, de la mémoire et des exécuteurs.C43

Construire un jeu qui répond à une question

Créez des cas propres au mécanisme, avec variable testée, contexte et attendu. Une tâche, un round ou un tour vocal peut être capturé avec sa provenance. Les écarts entre configuration source et paramètres du jeu sont visibles avant import.

Séparez les jeux de travail, de validation et de réserve. Classez les cas : nominal, ambiguïté, contexte incomplet, multilingue, robustesse, incident réel ou alternative valide. Un cas incomplet reste brouillon. Un attendu proposé par modèle demande une revue.

Exécuter puis juger

Le candidat et le juge sont sélectionnés séparément. Le lancement fige cas, paramètres et modèles. La première passe produit les sorties et contrôles objectifs ; la seconde les juge. Le candidat ne reçoit jamais l’attendu.

Les scores par dimension, justifications, échecs critiques et cas non jugés restent consultables. Une campagne terminée n’est pas nécessairement réussie ; une panne du juge laisse une note absente.

Mesurer la stabilité et reprendre une campagne

Répétez chaque item de 1 à 20 fois pour comparer taux de réussite, moyenne, extrêmes et dispersion. Annulez en conservant les résultats publiés, reprenez les items restants avec le snapshot ou rejugez les sorties sans rappeler le candidat.

Un budget optionnel couvre candidat et juges pour l’admission des nouvelles étapes. Les répétitions mesurent la stabilité sur ces cas, pas toutes les situations futures.

Ajouter un regard humain indépendant

La revue peut masquer modèle et notes automatiques. Chaque personne note et justifie sa décision avant révélation ; les désaccords deviennent visibles. Une revue révélée est figée, un rejugement ouvre une autre campagne.

La revue humaine du laboratoire — Une sortie enregistrée est présentée pour une évaluation humaine à l’aveugle ; aucun avis n’a été soumis.
La revue humaine du laboratoire — Une sortie enregistrée est présentée pour une évaluation humaine à l’aveugle ; aucun avis n’a été soumis.C52

Transformer un incident en cas de contrôle

Analysez le dossier d’une tâche avec du contexte humain, sans rejouer son exécution. Capturez ce diagnostic si vous voulez évaluer le mécanisme lui-même.

Les outils simulés ne prouvent pas un effet externe. Le Lab vocal travaille sur une transcription et ne mesure pas la qualité acoustique du STT/TTS. Les incidents et leur suivi complètent cette évaluation.

Évaluer les choix réellement autorisés

Le Lab Dispatcher examine les modes permis par le harnais et conserve les décisions déterministes ainsi que leurs motifs. Briefing reste testable ici tout en étant désactivé dans les politiques courantes des tâches. Les onze mécanismes évaluables du Lab sont distincts des douze mécanismes de fond de Dream.