View a markdown version of this page

SageMaker Tableau de bord AI Insights - Amazon CloudWatch

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

SageMaker Tableau de bord AI Insights

Le tableau de bord SageMaker AI Insights est organisé en trois onglets : performance, capacité et fiabilité. Chaque onglet fournit une vue ciblée de l'état de votre point de terminaison d'inférence.

Présentation du tableau de bord

Barre de résumé

La barre récapitulative en haut du tableau de bord indique les totaux pour l'ensemble de la flotte.

SageMaker En-tête du tableau de bord AI Insights avec barre de résumé indiquant les invocations, les instances, les composants d'inférence et Avg AZ Skew.
MétriqueDescription
InvocationsNombre total d'appels sur tous les points de terminaison dans la plage de temps sélectionnée
instancesNombre total d'instances fournissant actuellement du trafic
Composants d'inférenceNombre total de composants d'inférence sur tous les points de terminaison
Ag AZ SkewDéséquilibre moyen de distribution des zones de disponibilité (0 % = parfaitement équilibré)

Panneau de filtres

FiltreDescription
EndpointSélectionnez un point de terminaison spécifique ou tous les points de terminaison pour la vue du parc
InstanceSélectionnez une instance spécifique (nécessite la sélection préalable d'un point de terminaison)
Composant d'inférenceSélectionnez un circuit intégré spécifique pour le filtrage granulaire

Drill-down

SageMaker AI Insights prend en charge l'analyse progressive.

  1. Niveau du parc (par défaut) : tous les points de terminaison sont visibles, statistiques récapitulatives agrégées

  2. Niveau du point de terminaison : sélectionnez un point de terminaison dans le panneau des filtres ou choisissez un lien de point de terminaison dans n'importe quel tableau

  3. Niveau du circuit intégré : sélectionnez un composant d'inférence dans le panneau de filtres

Cross-linking avec la console SageMaker AI

  • Choisissez un nom de point de terminaison pour ouvrir la page détaillée du point de terminaison dans la console SageMaker AI.

  • Choisissez Afficher les journaux pour ouvrir les CloudWatch journaux filtrés sur ce point de terminaison ou ce circuit intégré.

  • Dans la console SageMaker AI, choisissez Afficher dans SageMaker AI Insights ou Metrics pour une ligne par IC.

Accès au tableau de bord

Vous pouvez accéder au tableau de bord SageMaker AI Insights depuis plusieurs emplacements dans la console.

  • Sur la page de liste des points de terminaison : choisissez Afficher dans SageMaker AI Insights pour ouvrir le tableau de bord au niveau de la flotte sans qu'aucun filtre ne soit appliqué.

    Page de liste des points de terminaison affichant le bouton Afficher dans SageMaker AI Insights.
  • Sur la page détaillée du point de terminaison : choisissez Afficher dans SageMaker AI Insights pour ouvrir le tableau de bord filtré en fonction de ce point de terminaison.

    Page détaillée du point de terminaison affichant le bouton Afficher dans SageMaker AI Insights.
  • Sur la page détaillée du composant d'inférence : choisissez Afficher dans SageMaker AI Insights pour ouvrir le tableau de bord filtré en fonction de ce point de terminaison et de ce composant d'inférence.

    Page détaillée du composant d'inférence affichant le bouton Afficher dans SageMaker AI Insights.
  • Navigation directe : CloudWatch console → Surveillance de l'infrastructureSageMaker AI Insights.

onglet Performances

L'onglet Performances répond à la question « est-ce sain ? » et « pourquoi est-ce lent ? » , allant de l'état de santé de l'ensemble de la flotte en haut aux diagnostics péri-IC en bas.

Santé des performances

Des nids d'abeilles regroupés par AZ indiquent l'état des alarmes pour les instances, les copies de circuits intégrés et les terminaux en un coup d'œil.

Nids d'abeilles performants et sains indiquant l'état d'alarme par AZ.
Tableau des performances de l'instance

Répartition par instance indiquant le TTFT (P50/P99), le TPS en sortie (), les demandes simultanées (avg/max) et l'utilisation du live/max cache KV.

Tableau des performances de l'instance indiquant le TTFT, le TPS de sortie, les demandes simultanées et le cache KV.
Streaming de jetons

Graphique chronologique montrant le TTFT et la latence entre jetons (ITL) avec une P50/P99 bascule, ventilés par framework.

Graphique de streaming de jetons montrant le TTFT et l'ITL P50/P99 au fil du temps.
Débit de jetons

Jetons d'entrée et de sortie par seconde par framework, avec des options pour Input/Output, percentiles et par instance.

Graphique du débit de jetons indiquant les jetons d'entrée et de sortie par seconde.
Moteur et pression requise

Utilisation du cache KV (%), demandes en cours et demandes en attente au fil du temps : principaux signaux de saturation pour le moteur d'inférence.

Panneau de pression du moteur et des demandes indiquant le cache KV, les demandes en cours et les demandes en attente.
Répartition du trafic

Tableau par instance ou par copie électronique indiquant le nombre d'appels par minute, le taux de 4XX et le taux de 5XX pour identifier les déséquilibres de routage.

Tableau de distribution du trafic indiquant le nombre d'appels par minute, le taux 4XX et le débit 5XX par instance.
Mélange d'erreurs au fil du temps

Graphique linéaire montrant les taux d'erreur 4XX, 5XX et intermédiaires au fil du temps par circuit intégré.

Tableau chronologique de la combinaison des erreurs montrant les erreurs 4XX, 5XX et en cours de cycle.
Répartition de la latence dans le temps

Graphique à aires empilées avec onglets pour Invoke (latence du modèle + latence de surcharge) et Streaming (premier modèle de bloc + premier segment de surcharge), avec une bascule. P50/P90

Répartition de la latence dans le temps : graphique à aires empilées indiquant la latence du modèle et la latence de surcharge.

Onglet Capacité

L'onglet Capacité répond à la question « Est-ce que j'ai de la marge de manœuvre ? » et « est-ce que mon matériel est en bon état ? » —indiquant l'utilisation réelle par rapport à la capacité réservée.

Santé des capacités

La même visualisation alvéolaire que l'onglet Performance, qui montre l'état des alarmes pour les instances, les copies de circuits intégrés et les points de terminaison.

Capacité : santé, nids d'abeilles indiquant l'état d'alarme par AZ.
Tableau des capacités des instances

Barres d'utilisation par instance pour le GPU, la mémoire du GPU, le processeur, la mémoire et le disque.

Tableau de capacité de l'instance indiquant le GPU, la mémoire du GPU, le processeur, la mémoire et l'utilisation du disque.
Utilisation de la flotte

Séries chronologiques indiquant l'utilisation du processeur, du GPU, de la mémoire du processeur graphique, de la mémoire et du disque par instance, avec des boutons pour les vues Instance, IC Copies et Endpoint.

Tableau d'utilisation du parc indiquant l'utilisation du processeur, du processeur graphique, de la mémoire du processeur graphique, de la mémoire et du disque par instance au fil du temps.

Onglet Fiabilité

L'onglet Fiabilité répond à la question « est-ce résilient ? » et « pourquoi la mise à l'échelle a-t-elle échoué ? » : couvrant la distribution AZ, le comportement de dimensionnement et les événements de provisionnement.

Distribution par zone de disponibilité

Diagramme à barres indiquant le nombre de copies d'instances ou de circuits intégrés par AZ pour valider la conformité à la haute disponibilité (HA).

Diagramme à barres de distribution des zones de disponibilité indiquant le nombre d'instances par zone de disponibilité.
Anatomie du démarrage à froid

Barre horizontale empilée indiquant la répartition du temps de provisionnement en fonction du téléchargement du modèle, de la charge du GPU, du démarrage du conteneur et de la surcharge de plate-forme (points de terminaison du circuit intégré uniquement).

Anatomie du démarrage à froid indiquant le téléchargement du modèle, la charge du GPU, le démarrage du conteneur et la surcharge de la plate-forme.
Diagnostic ICE

Nombre d'erreurs de capacité insuffisante (ICE) au fil du temps avec un tableau des événements indiquant l'heure, le point de terminaison, le type d'instance défaillante et l'AZ défaillant. Les valeurs non nulles indiquent des contraintes de capacité.

Panneau de diagnostic ICE indiquant le nombre d'ICE au fil du temps et un tableau des événements.