Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
SageMaker Tableau de bord AI Insights
Le tableau de bord SageMaker AI Insights est organisé en trois onglets : performance, capacité et fiabilité. Chaque onglet fournit une vue ciblée de l'état de votre point de terminaison d'inférence.
Présentation du tableau de bord
Barre de résumé
La barre récapitulative en haut du tableau de bord indique les totaux pour l'ensemble de la flotte.
| Métrique | Description |
|---|---|
| Invocations | Nombre total d'appels sur tous les points de terminaison dans la plage de temps sélectionnée |
| instances | Nombre total d'instances fournissant actuellement du trafic |
| Composants d'inférence | Nombre total de composants d'inférence sur tous les points de terminaison |
| Ag AZ Skew | Déséquilibre moyen de distribution des zones de disponibilité (0 % = parfaitement équilibré) |
Panneau de filtres
| Filtre | Description |
|---|---|
| Endpoint | Sélectionnez un point de terminaison spécifique ou tous les points de terminaison pour la vue du parc |
| Instance | Sélectionnez une instance spécifique (nécessite la sélection préalable d'un point de terminaison) |
| Composant d'inférence | Sélectionnez un circuit intégré spécifique pour le filtrage granulaire |
Drill-down
SageMaker AI Insights prend en charge l'analyse progressive.
Niveau du parc (par défaut) : tous les points de terminaison sont visibles, statistiques récapitulatives agrégées
Niveau du point de terminaison : sélectionnez un point de terminaison dans le panneau des filtres ou choisissez un lien de point de terminaison dans n'importe quel tableau
Niveau du circuit intégré : sélectionnez un composant d'inférence dans le panneau de filtres
Cross-linking avec la console SageMaker AI
Choisissez un nom de point de terminaison pour ouvrir la page détaillée du point de terminaison dans la console SageMaker AI.
Choisissez Afficher les journaux pour ouvrir les CloudWatch journaux filtrés sur ce point de terminaison ou ce circuit intégré.
Dans la console SageMaker AI, choisissez Afficher dans SageMaker AI Insights ou Metrics pour une ligne par IC.
Accès au tableau de bord
Vous pouvez accéder au tableau de bord SageMaker AI Insights depuis plusieurs emplacements dans la console.
-
Sur la page de liste des points de terminaison : choisissez Afficher dans SageMaker AI Insights pour ouvrir le tableau de bord au niveau de la flotte sans qu'aucun filtre ne soit appliqué.
-
Sur la page détaillée du point de terminaison : choisissez Afficher dans SageMaker AI Insights pour ouvrir le tableau de bord filtré en fonction de ce point de terminaison.
-
Sur la page détaillée du composant d'inférence : choisissez Afficher dans SageMaker AI Insights pour ouvrir le tableau de bord filtré en fonction de ce point de terminaison et de ce composant d'inférence.
Navigation directe : CloudWatch console → Surveillance de l'infrastructure → SageMaker AI Insights.
onglet Performances
L'onglet Performances répond à la question « est-ce sain ? » et « pourquoi est-ce lent ? » , allant de l'état de santé de l'ensemble de la flotte en haut aux diagnostics péri-IC en bas.
- Santé des performances
-
Des nids d'abeilles regroupés par AZ indiquent l'état des alarmes pour les instances, les copies de circuits intégrés et les terminaux en un coup d'œil.
- Tableau des performances de l'instance
-
Répartition par instance indiquant le TTFT (P50/P99), le TPS en sortie (), les demandes simultanées (avg/max) et l'utilisation du live/max cache KV.
- Streaming de jetons
-
Graphique chronologique montrant le TTFT et la latence entre jetons (ITL) avec une P50/P99 bascule, ventilés par framework.
- Débit de jetons
-
Jetons d'entrée et de sortie par seconde par framework, avec des options pour Input/Output, percentiles et par instance.
- Moteur et pression requise
-
Utilisation du cache KV (%), demandes en cours et demandes en attente au fil du temps : principaux signaux de saturation pour le moteur d'inférence.
- Répartition du trafic
-
Tableau par instance ou par copie électronique indiquant le nombre d'appels par minute, le taux de 4XX et le taux de 5XX pour identifier les déséquilibres de routage.
- Mélange d'erreurs au fil du temps
-
Graphique linéaire montrant les taux d'erreur 4XX, 5XX et intermédiaires au fil du temps par circuit intégré.
- Répartition de la latence dans le temps
-
Graphique à aires empilées avec onglets pour Invoke (latence du modèle + latence de surcharge) et Streaming (premier modèle de bloc + premier segment de surcharge), avec une bascule. P50/P90
Onglet Capacité
L'onglet Capacité répond à la question « Est-ce que j'ai de la marge de manœuvre ? » et « est-ce que mon matériel est en bon état ? » —indiquant l'utilisation réelle par rapport à la capacité réservée.
- Santé des capacités
-
La même visualisation alvéolaire que l'onglet Performance, qui montre l'état des alarmes pour les instances, les copies de circuits intégrés et les points de terminaison.
- Tableau des capacités des instances
-
Barres d'utilisation par instance pour le GPU, la mémoire du GPU, le processeur, la mémoire et le disque.
- Utilisation de la flotte
-
Séries chronologiques indiquant l'utilisation du processeur, du GPU, de la mémoire du processeur graphique, de la mémoire et du disque par instance, avec des boutons pour les vues Instance, IC Copies et Endpoint.
Onglet Fiabilité
L'onglet Fiabilité répond à la question « est-ce résilient ? » et « pourquoi la mise à l'échelle a-t-elle échoué ? » : couvrant la distribution AZ, le comportement de dimensionnement et les événements de provisionnement.
- Distribution par zone de disponibilité
-
Diagramme à barres indiquant le nombre de copies d'instances ou de circuits intégrés par AZ pour valider la conformité à la haute disponibilité (HA).
- Anatomie du démarrage à froid
-
Barre horizontale empilée indiquant la répartition du temps de provisionnement en fonction du téléchargement du modèle, de la charge du GPU, du démarrage du conteneur et de la surcharge de plate-forme (points de terminaison du circuit intégré uniquement).
- Diagnostic ICE
-
Nombre d'erreurs de capacité insuffisante (ICE) au fil du temps avec un tableau des événements indiquant l'heure, le point de terminaison, le type d'instance défaillante et l'AZ défaillant. Les valeurs non nulles indiquent des contraintes de capacité.