View a markdown version of this page

AWS GPU AMI PyTorch 2.4 con apprendimento approfondito (Ubuntu 22.04) - AWS Deep Learning AMIs

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

AWS GPU AMI PyTorch 2.4 con apprendimento approfondito (Ubuntu 22.04)

Per informazioni su come iniziare, consulta. Guida introduttiva a DLAMI

Formato del nome AMI

  • GPU AMI Nvidia Driver OSS con apprendimento approfondito 2.4 PyTorch . $ {PATCH_VERSION} (Ubuntu 22.04) $ {} YYYY-MM-DD

Istanze EC2 supportate

  • Consulta la sezione Modifiche importanti a DLAMI.

  • Deep Learning con OSS Il driver Nvidia supporta G4dn, G5, G6, Gr6, P4, P4de, P5, P5e, P5en.

L'AMI include quanto segue:

  • AWS Servizio supportato: EC2

  • Sistema operativo: Ubuntu 22.04

  • Architettura di calcolo: x86

  • Python:///opt/condaenvs/pytorchbin/python

  • Driver NVIDIA:

    • Driver del sistema operativo Nvidia: 550.144.03

  • CUDA12.1 Pila NVIDIA:

    • Percorso di installazione di CUDA, NCCL e cuDDN://cuda-12.4/ usr/local

    • CUDA predefinito: 12.4

      • usr/localPATH/usr/local/cuda punta a//cuda-12.4/

      • Aggiornato di seguito le variabili di ambiente:

        • LD_LIBRARY_PATH da avere/://cuda/lib:/usr/local/cuda:/ /x86_64- usr/local cuda/lib64 usr/local usr/local cuda/targets linux/lib

        • PERCORSO da avere usr/local/cuda/bin/:/usr/local/cuda/include/

    • Versione NCCL del sistema compilato presente inusr/local//cuda/: 2.21.5

    • PyTorch Versione NCCL compilata dall'ambiente conda: 2.20.5 PyTorch

  • Luogo dei test NCCL:

    • all_reduce, all_gather e reduce_scatter://cuda-xx. usr/local x/efa/test-cuda-xx.x/

    • Per eseguire i test NCCL, LD_LIBRARY_PATH è già aggiornato con i percorsi necessari.

      • I PATH comuni sono già stati aggiunti a LD_LIBRARY_PATH:

        • /opt/amazon/efa/lib:/opt/amazon/openmpi/lib:/opt/aws-ofi-nccl/lib:/usr/local/lib:/usr/lib

    • LD_LIBRARY_PATH viene aggiornato con i percorsi della versione CUDA

      • /://cuda/lib:/usr/local/cuda://usr/local/x86_64- cuda/lib64 usr/local usr/local cud/targets linux/lib

  • Programma di installazione EFA: 1.34.0

  • Nvidia GDRCopy: 2.4.1

  • Motore Nvidia Transformer: v1.11.0

  • AWS Plugin OFI NCCL: viene installato come parte di EFA Installer-aws

    • Percorso di installazione:. /opt/aws-ofi-nccl/ /opt/aws-ofi-nccl/libIl percorso viene aggiunto a LD_LIBRARY_PATH.

    • Verifica il percorso per ring, message_transfer: /opt/aws-ofi-nccl/tests

    • Nota: il PyTorch pacchetto include anche il plug-in AWS OFI NCCL collegato dinamicamente come pacchetto conda e PyTorch utilizzerà quel aws-ofi-nccl-dlc pacchetto invece del sistema OFI NCCL. AWS

  • AWS CLI v2 come e v1 come aws2AWS CLI aws

  • Tipo di volume EBS: gp3

  • Versione Python: 3.11

  • Interrogazione AMI-ID con parametro SSM (la regione di esempio è us-east-1):

    • Driver OSS Nvidia:

      aws ssm get-parameter --region us-east-1 \ --name /aws/service/deeplearning/ami/x86_64/oss-nvidia-driver-gpu-pytorch-2.4-ubuntu-22.04/latest/ami-id \ --query "Parameter.Value" \ --output text
  • Interrogazione AMI-ID con AWSCLI (la regione di esempio è us-east-1):

    • Driver OSS Nvidia:

      aws ec2 describe-images --region us-east-1 \ --owners amazon \ --filters 'Name=name,Values=Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.? (Ubuntu 22.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text

Note

P5/P5e istanze
  • DeviceIndex è unico per ciascuna NetworkCard e deve essere un numero intero non negativo inferiore al limite di ENI per. NetworkCard In P5, il numero di ENI per NetworkCard è 2, il che significa che gli unici valori validi per DeviceIndex sono 0 o 1. Di seguito è riportato l'esempio del comando di avvio dell'istanza EC2 P5 che utilizza awscli visualizzato NetworkCardIndex dal numero 0-31 e DeviceIndex come 0 per la prima interfaccia e come 1 per le restanti 31 interfacce. DeviceIndex

aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=31,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"

Data di rilascio: 2025-02-17

Nome AMI: Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20250216

Aggiornato

Data di rilascio: 2025-01-21

Nome AMI: Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20250119

Aggiornato

Data di rilascio: 2024-11-18

Nome AMI: Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20241116

Fixed
  • A causa di una modifica nel kernel Ubuntu per correggere un difetto nella funzionalità Kernel Address Space Layout Randomization (KASLR), le istanze non sono in grado di inizializzare correttamente CUDA sul driver OSS Nvidia. G4Dn/G5 Per mitigare questo problema, questo DLAMI include funzionalità che caricano dinamicamente il driver proprietario per le istanze G4Dn e G5. Attendi un breve periodo di inizializzazione per questo caricamento per garantire che le istanze siano in grado di funzionare correttamente.

    • Per verificare lo stato e l'integrità di questo servizio, puoi utilizzare i seguenti comandi:

sudo systemctl is-active dynamic_driver_load.service active

Data di rilascio: 2024-10-16

Nome AMI: Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20241016

Aggiunto

Data di rilascio: 2024-09-30

Nome AMI: Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20240929

Aggiornato
  • Nvidia Container Toolkit è stato aggiornato dalla versione 1.16.1 alla 1.16.2, risolvendo la vulnerabilità di sicurezza. CVE-2024-0133

Data di rilascio: 2024-09-26

Nome AMI: Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20240925

Aggiunto
  • Versione iniziale della serie Deep Learning AMI GPU PyTorch 2.4.1 (Ubuntu 22.04). Include un pytorch in ambiente conda abbinato a NVIDIA Driver R550, CUDA=12.4.1, cuDNN=8.9.7, NCCL=2.20.5 ed EFA=1.34.0. PyTorch