py-smi: Monitor de GPU NVIDIA em Python

py-smi: Monitor de GPU NVIDIA em Python

py-smilink image 6

Aviso: Este post foi traduzido para o português usando um modelo de tradução automática. Por favor, me avise se encontrar algum erro.

Queres poder usar nvidia-smi desde Python? Aqui tens uma biblioteca para fazê-lo.

Instalaçãolink image 7

Para poder instalá-la execute:

pip install python-smi
      

Usolink image 8

Importamos a biblioteca

	
< > Input
Python
from py_smi import NVML
Copied

Criamos um objeto de pynvml (a biblioteca por trás de nvidia-smi)

	
< > Input
Python
nv = NVML()
Copied

Obtemos a versão do driver e do CUDA

	
< > Input
Python
nv.driver_version, nv.cuda_version
Copied
>_ Output
			
('560.35.03', '12.6')

Como no meu caso tenho duas GPUs, crio uma variável com o número de GPUs

	
< > Input
Python
num_gpus = 2
Copied

Obtenho a memória de cada GPU

	
< > Input
Python
[nv.mem(i) for i in range(num_gpus)]
Copied
>_ Output
			
[_Memory(free=24136.6875, total=24576.0, used=439.3125),
_Memory(free=23509.0, total=24576.0, used=1067.0)]

A utilização

	
< > Input
Python
[nv.utilization() for i in range(num_gpus)]
Copied
>_ Output
			
[_Utilization(gpu=0, memory=0, enc=0, dec=0),
_Utilization(gpu=0, memory=0, enc=0, dec=0)]

A potência usada

Isso me dá muito jeito, porque quando eu treinava um modelo e tinha as duas GPUs cheias, às vezes o meu computador desligava, e vendo a potência, vejo que a segunda consome muito, por isso pode ser o que eu já suspeitava, que era por alimentação.

	
< > Input
Python
[nv.power(i) for i in range(num_gpus)]
Copied
>_ Output
			
[_Power(usage=15.382, limit=350.0), _Power(usage=40.573, limit=350.0)]

Os relógios de cada GPU

	
< > Input
Python
[nv.clocks(i) for i in range(num_gpus)]
Copied
>_ Output
			
[_Clocks(graphics=0, sm=0, mem=405), _Clocks(graphics=540, sm=540, mem=810)]

Dados do PCI

	
< > Input
Python
[nv.pcie_throughput(i) for i in range(num_gpus)]
Copied
>_ Output
			
[_PCIeThroughput(rx=0.0, tx=0.0),
_PCIeThroughput(rx=0.1630859375, tx=0.0234375)]

E os processos (agora não estou executando nada)

	
< > Input
Python
[nv.processes(i) for i in range(num_gpus)]
Copied
>_ Output
			
[[], []]

Perguntas frequentes

Como obter em Python a versão do driver, a do CUDA e a memória de cada GPU, sem precisar analisar a saída do nvidia-smi?

Instale a biblioteca com pip install python-smi, importe com from py_smi import NVML e crie nv = NVML() (que envolve o pynvml, a biblioteca por trás do nvidia-smi). nv.driver_version, nv.cuda_version retorna algo como ('560.35.03', '12.6'), e [nv.mem(i) for i in range(num_gpus)] retorna objetos _Memory(free=..., total=..., used=...) em MiB para cada GPU.

Como usar o py-smi para diagnosticar por que o computador desliga ao treinar com duas GPUs ao mesmo tempo?

nv.power(i) retorna um _Power(usage, limit) por GPU (no exemplo, _Power(usage=15.382, limit=350.0) para uma e _Power(usage=40.573, limit=350.0) para a outra). O autor usou exatamente esse dado para confirmar que uma das duas GPUs consumia muito mais energia que a outra, apontando para um problema na fonte de alimentação como causa dos desligamentos ao treinar com as duas em carga máxima.

Continuar lendo

Últimos posts -->

Você viu esses projetos?

Gymnasia

Gymnasia Gymnasia
Expo
React Native
TypeScript
OpenAI
Anthropic

App de fitness com dois agentes que são executados integralmente no dispositivo, sem backend, de forma que os dados do usuário nunca saem do celular. Um coach conversacional BYOK com tools locais e system prompt remoto com fallback offline, e um estimador de refeições que tira os macronutrientes de uma foto do prato, com leitura de códigos de barras contra o OpenFoodFacts.

LangGraph Deep Researcher

LangGraph Deep Researcher LangGraph Deep Researcher
Python
LangGraph
FastAPI
React
TypeScript
Docker

Sistema multiagente de pesquisa construído com LangGraph. Um supervisor decompõe sua pergunta em tópicos e lança subagentes de busca em paralelo; cada um comprime seus achados antes de repassá-los a um agente redator que escreve o relatório final em markdown com suas fontes. Streaming ao vivo por WebSockets, modelo configurável por papel e chaves de API próprias que nunca são armazenadas no servidor.

Tau

Tau Tau
Python
LangChain

Sistema multiagente de tutoria para estudantes do ensino médio, com um agente por disciplina e material de curso elaborado e validado por uma equipe de professores. Chegou a ser usado com alunos reais em um colégio privado na Espanha e em uma escola de ensino médio na Colômbia.

Ver todos os projetos -->
>_ Disponível para projetos

Tem um projeto com IA?

Vamos conversar.

maximofn@gmail.com

Especialista em Machine Learning e Inteligência Artificial. Desenvolvo soluções com IA generativa, agentes inteligentes e modelos personalizados.

Quer assistir alguma palestra?

Últimas palestras -->

Quer melhorar com essas dicas?

Últimos tips -->

Use isso localmente

Os espaços do Hugging Face nos permitem executar modelos com demos muito simples, mas e se a demo quebrar? Ou se o usuário a deletar? Por isso, criei contêineres docker com alguns espaços interessantes, para poder usá-los localmente, aconteça o que acontecer. Na verdade, se você clicar em qualquer botão de visualização de projeto, ele pode levá-lo a um espaço que não funciona.

Flow edit

Flow edit Flow edit

Edite imagens com este modelo de Flow. Baseado em SD3 ou FLUX, você pode editar qualquer imagem e gerar novas

FLUX.1-RealismLora

FLUX.1-RealismLora FLUX.1-RealismLora
Ver todos os contêineres -->
>_ Disponível para projetos

Tem um projeto com IA?

Vamos conversar.

maximofn@gmail.com

Especialista em Machine Learning e Inteligência Artificial. Desenvolvo soluções com IA generativa, agentes inteligentes e modelos personalizados.

Você quer treinar seu modelo com esses datasets?

short-jokes-dataset

HuggingFace

Dataset com piadas em inglês

Uso: Fine-tuning de modelos de geração de texto humorístico

231K linhas 2 colunas 45 MB
Ver no HuggingFace →

opus100

HuggingFace

Dataset com traduções de inglês para espanhol

Uso: Treinamento de modelos de tradução inglês-espanhol

1M linhas 2 colunas 210 MB
Ver no HuggingFace →

netflix_titles

HuggingFace

Dataset com filmes e séries da Netflix

Uso: Análise de catálogo Netflix e sistemas de recomendação

8.8K linhas 12 colunas 3.5 MB
Ver no HuggingFace →
Ver mais datasets -->