Équipes techniques · Exploitation

Supervision et exploitation

Le tableau de bord donne la tendance. Activité donne le détail. Les journaux spécialisés permettent ensuite de remonter jusqu’à l’appel, au Process ou à la livraison concernés.

Une vue mensuelle de l’instance

Le tableau de bord agrège tâches, taux de succès, appels LLM, tokens, coûts, latence et incidents. Les répartitions par agent et par modèle aident à repérer une évolution ; l’activité en direct permet d’ouvrir le travail concerné.

Le tableau de bord — Consommation mensuelle, appels, missions et répartition quotidienne par modèle.
Le tableau de bord — Consommation mensuelle, appels, missions et répartition quotidienne par modèle.C39

Ces métriques décrivent l’usage connu de Galaris. Elles ne calculent pas automatiquement le retour sur investissement métier et ne remplacent pas la facturation du fournisseur.

Activité rassemble cinq lectures

  • Conversations textuelles ;
  • appels téléphoniques et sessions Voice ;
  • tâches et sous-tâches ;
  • activité LLM ;
  • Process et exécutions externes.
L’activité des modèles — Appels corrélés aux conversations, aux missions et à Dream, avec modèles, états, tokens et coûts.
L’activité des modèles — Appels corrélés aux conversations, aux missions et à Dream, avec modèles, états, tokens et coûts.C28

Journaux, incidents et Console

Le Journal des mails suit les livraisons, statuts et erreurs lorsque le bridge Mail est disponible. Les incidents donnent une sortie terminale interprétable. Les réglages de logs organisent diagnostic, rétention et purge selon les privilèges.

Le journal des mails — File d’approbation vide et historique des messages déjà envoyés. Contenus de démonstration substitués aux données privées ; états historiques conservés.
Le journal des mails — File d’approbation vide et historique des messages déjà envoyés. Contenus de démonstration substitués aux données privées ; états historiques conservés.C40

La Console peut ouvrir des sessions SSH contrôlées ou un exécuteur embarqué lorsque le service correspondant est disponible. Elle reste une capacité autorisée, avec périmètre et identité ; ce n’est pas un shell universel donné à tous les agents.

Le chemin de diagnostic

Résultat → tâche ou Process → run → appel ou outil → événement externe → journal
Une erreur visible dans le chat — L’erreur de connexion au modèle et l’échange réussi après changement de profil de l’agent.
Une erreur visible dans le chat — L’erreur de connexion au modèle et l’échange réussi après changement de profil de l’agent.C53

Traiter les incidents par famille

Recherchez catégorie, phase, gravité et objets corrélés. Une famille regroupe les occurrences similaires et distingue erreur initiale, retries et récupération. La revue conserve diagnostic, cause, remédiation, commit correctif et test de régression lorsqu’ils sont renseignés.

Vérifier l’exploitation au-delà du tableau de bord

Les sondes distinguent service joignable, processus vivant et readiness des composants critiques. Logfire/OpenTelemetry complète les traces persistées lorsqu’il est configuré. Les politiques de rétention séparent journaux et objets métier.

La qualification locale du produit peut vérifier un instantané isolé avec make validate, sans commit ni déploiement. Les tests, la couverture et les répétitions de restauration servent à vérifier un périmètre donné ; ils ne certifient pas tous les fournisseurs. Hébergement et données détaille les éléments à préserver.

Relier inférences, tentatives et télémétrie

Les inférences durables conservent leurs demandes et résultats, tandis que les vues d’exécution distinguent temps de traitement, attente et pause. La progression publique reste distincte du résultat final. L’export Logfire/OpenTelemetry se règle dans les préférences Système avec un jeton chiffré ; son ajout, remplacement ou retrait s’applique sans redémarrage. Sans jeton, aucun export distant n’est activé.