Aller au contenu principal

Alerting : recevez un webhook quand un service tombe

Un nouveau module Alerting boucle la boucle sur la santé des services : quand un groupe, un service ou un niveau passe dans un mauvais état et y reste, avuru-obs déclenche un webhook — vers Slack, PagerDuty, Opsgenie, Alertmanager, ou tout point de terminaison qui en accepte un. C'est dérivé de la santé que vous calculez déjà : aucune sonde, aucun nouveau signal.

Santé réseau sur la carte des services : RTT et échecs de connexion par arête

La carte des services affiche désormais la santé au niveau des connexions sur ses arêtes : le RTT TCP et les connexions échouées/réinitialisées par arête, mesurés dans le noyau par OBI — sans traces, sans SDK, sans modification applicative. Un lien lent ou qui refuse les connexions est maintenant visible sur la topologie que vous surveillez déjà.

Santé des services : regroupez vos services et consolidez leur état

Un nouveau tableau Santé des services consolide la santé RED de chaque service en un état de groupe — avec des niveaux de criticité et une règle : un service ne peut pas être au vert tant qu'une dépendance critique est au rouge. Le tout est dérivé des traces que vous envoyez déjà : aucun health check, aucune sonde, aucun stockage supplémentaire.

Suivi des erreurs : les exceptions deviennent des problèmes triables

Un nouveau module Suivi des erreurs transforme les exceptions qui circulent déjà dans avuru-obs — événements d'exception de span, spans en erreur et logs ERROR/FATAL — en problèmes de premier plan : dédupliqués par empreinte, chacun avec une stack trace, une chronologie d'occurrences, un lien vers une trace représentative et un cycle de triage. Aucune modification de code requise.

Profilage CPU continu : des flame graphs, en permanence

L'écran Profiling est disponible : des flame graphs CPU à l'échelle du cluster, échantillonnés par eBPF sans changement applicatif et stockés dans le même ClickHouse que vos traces, logs et métriques. Expérimental et opt-in en v0.1 (sensor.profiler.enabled=true) — le chargeur alpha upstream ne prend pas encore en charge tous les noyaux.