Confiance · Observabilité

Observabilité et preuves d’exécution

Une mission n’est maîtrisable que si l’on peut relier la demande, les décisions d’exécution, les effets externes, le coût et le livrable final.

Une chronologie causale, pas un mur de logs

Galaris relie mission, tâche, tentative, run, appel de modèle, outil, processus, message et livrable. Les tokens de streaming restent éphémères ; les événements utiles — démarrage, outil, checkpoint, avertissement, résultat — forment une chronologie plus compacte et exploitable.

Un résultat doit être attesté

Le texte « le fichier a été envoyé » ne suffit pas. Galaris distingue la ressource produite, l’artefact final, sa destination et le reçu du transport. Un résultat attendu ne doit pas être considéré comme terminé si sa preuve manque.

Le coût doit éclairer une décision

Chaque appel peut conserver son usage, son coût d’inférence comparable et le coût facturé lorsqu’il est fourni. La consommation devient ainsi lisible par agent, modèle, surface conversationnelle ou harnais de tâche — et peut être rapportée au résultat utile, pas seulement au nombre de tokens.

Le détail d’une mission terminée — Un calcul terminé avec son résultat, les appels d’outils et les traces d’exécution.
Le détail d’une mission terminée — Un calcul terminé avec son résultat, les appels d’outils et les traces d’exécution.C07
L’activité des modèles — Appels corrélés aux conversations, aux missions et à Dream, avec modèles, états, tokens et coûts.
L’activité des modèles — Appels corrélés aux conversations, aux missions et à Dream, avec modèles, états, tokens et coûts.C28
Examiner une sortie de benchmark — Une sortie historique du dispatcher et l’état incomplet de son évaluation. Contenus de démonstration substitués aux données privées ; états historiques conservés.
Examiner une sortie de benchmark — Une sortie historique du dispatcher et l’état incomplet de son évaluation. Contenus de démonstration substitués aux données privées ; états historiques conservés.C29
Les opérations Dream du pilote — Le journal distingue classement thématique, extraction de mémoire, résultats et coûts.
Les opérations Dream du pilote — Le journal distingue classement thématique, extraction de mémoire, résultats et coûts.C21

Les indicateurs à relever pour votre essai

  • Délai jusqu’au résultat utile, et non durée totale de présence dans l’interface.
  • Taux d’acceptation sans reconstruction, avec les corrections réellement apportées.
  • Coût par résultat, en séparant estimation d’inférence et montant facturé.
  • Part des reprises et validations humaines, pour calibrer l’autonomie au lieu de la masquer.

Lire le coût avec sa qualification

Le suivi distingue modèle demandé et effectif, effort, tokens d’entrée/sortie/cache lorsqu’ils sont fournis, durée et premier token. Les montants peuvent être connus, estimés, partiels ou liés à un abonnement. Une donnée absente ne prouve pas un coût nul.

Les traces montrent les messages de progression et les blocs effectivement transmis par le runtime, avec expurgation selon les droits. Elles ne donnent pas accès à un raisonnement privé non publié.

Faire du problème un dossier suivi

Les incidents regroupent les occurrences proches par famille et conservent première et dernière occurrence, compteur et état de revue. Le diagnostic peut documenter cause, remédiation et test de régression. Une tâche ou un round peut ensuite devenir un cas du Lab.

Lire le temps et les coûts conservés

Les vues distinguent traitement, attente, pause et délai avant reprise. Les coûts s’appuient sur les appels persistés, y compris préparation et routage, sans recompter un appel lors d’une finalisation répétée. Une inférence relie requête, tentatives et appels physiques ; relire son résultat ne relance pas le modèle.