Heavy V · feita para IA

PC para IA — workstation Heavy V

Potência de sobra para treinar modelos, gerar conteúdo e rodar IA na sua rede — com Threadripper PRO na CPU e RTX PRO 6000 na GPU. Configure a Heavy V e receba pronta para usar.

IA exige mais que um PC comum.

Um PC para inteligência artificial combina GPU com VRAM generosa, CPU multithread, RAM de sistema proporcional e armazenamento NVMe rápido — dimensionados para treino, fine-tuning, inferência e pipelines RAG sem depender exclusivamente de cloud. A Heavy V IA é a referência Rocketz: Threadripper PRO Zen 5 na CPU e até 4× NVIDIA RTX PRO 6000 Blackwell (96 GB GDDR7 ECC) ou RTX 6000 Ada (48 GB ECC) na GPU — montada, testada sob carga de IA e entregue com suporte no Brasil.

PC para IA não é sinônimo de PC gamer de alto nível: placas GeForce priorizam picos curtos de consumo e drivers voltados a jogos; workloads de machine learning exigem VRAM ECC, drivers workstation estáveis, largura de banda PCIe 5.0 e dissipação dimensionada para carga contínua 24/7. Os números de performance abaixo são estimativas baseadas em benchmarks públicos (MLPerf, Hugging Face Open LLM Leaderboard) e variam conforme configuração, versão de driver e software.

Processador · Threadripper PRO

Potência para apoiar tudo o que a GPU faz

A CPU gerencia data loading, pré-processamento de datasets, tokenização, descompressão de checkpoints, orquestração de jobs Docker/Kubernetes e serviços auxiliares (embeddings, APIs RAG, ETL) enquanto a GPU executa matmul e kernels CUDA. Para treinos multi-GPU, CPUs com 24+ núcleos físicos — como o Threadripper PRO 7995WX (96 núcleos / 192 threads) ou 9995WX — evitam gargalo de feeding das GPUs, mantendo utilização acima de 90% em dataloaders agressivos com PyTorch num_workers elevado.

  • Arquitetura Zen 5: até 96 núcleos e 192 threads — ideal para pipelines Python paralelos, RAPIDS (cuDF/cuML) e compilação de dependências nativas.
  • Memória: oito canais DDR5 ECC RDIMM — a RAM de sistema deve ser no mínimo 2× a VRAM total da GPU; para Heavy V com 96 GB de VRAM, recomenda-se 256 GB+ para caching de datasets e prefetching sem thrashing.
  • I/O: 128 lanes PCIe 5.0 — suporta NVMe Gen5 (até ~14.000 MB/s de leitura) e múltiplas GPUs workstation sem gargalo de bandwidth entre CPU e aceleradores.
  • Workloads híbridos: CPU livre para LangChain/LlamaIndex, vector databases (FAISS, ChromaDB, Milvus) e feature engineering enquanto a GPU concentra treino e inferência pesada.

Threadripper PRO Zen 5 na Heavy V elimina o cenário em que a GPU fica ociosa esperando batches — o gargalo mais comum em workstations mal dimensionadas para deep learning.

Placa de vídeo · RTX PRO / RTX Ada

Memória de sobra para modelos que não cabem em placa comum

A GPU é o componente mais crítico em um PC para IA. Para fine-tuning de Llama 3 8B com LoRA, 24 GB de VRAM é o mínimo viável; para Llama 3 70B em FP16, recomenda-se no mínimo 96 GB de VRAM total. A RTX PRO 6000 Blackwell entrega 96 GB de GDDR7 ECC a ~1.792 GB/s de bandwidth — reduzindo latência de geração de tokens (TTFT) em cargas memory-bound comparado a GDDR6 de gerações anteriores. A RTX 6000 Ada (48 GB GDDR6 ECC) permanece referência sólida para LoRA/QLoRA, SDXL e inferência com quantização INT8/INT4.

  • Tensor Cores: aceleram FP16, FP8, INT8 e operações de mixed precision em PyTorch, TensorRT-LLM, vLLM e frameworks Hugging Face (Transformers, PEFT, TRL).
  • ECC: memória com correção de erro reduz risco de corrupção de pesos em treinos longos — relevante para fine-tuning de dias e checkpoints de alto valor.
  • Multi-GPU: Heavy V suporta até 4× RTX PRO 6000 com NVLink/PCIe 5.0 — data parallelism (DeepSpeed, FSDP), tensor parallelism ou pipeline parallelism para modelos acima de 100B parâmetros.
  • Stack certificada: CUDA Toolkit, cuDNN, NCCL, NVIDIA Container Toolkit, TensorRT, Triton Inference Server e NGC containers — drivers workstation estáveis para produção on-premise.

VRAM ECC de workstation — 48 GB (Ada) ou 96 GB (Blackwell) — é o que separa um PC para rodar LLM local de forma confiável de uma placa gamer que estoura memória na primeira semana de projeto.

Memória · DDR5 ECC

Capacidade generosa, na medida certa

A RAM de sistema armazena pesos offloaded (quantização agressiva), índices vetoriais, datasets em cache e processos paralelos. Regra prática: mínimo 2× a VRAM total da GPU; workloads RAG + LLM simultâneos pedem 256 GB+ na Heavy V.

Armazenamento · NVMe

Dados carregam rápido, a GPU não fica esperando

Datasets de imagem/vídeo em NVMe Gen5 (~14.000 MB/s) reduzem tempo de carregamento de batches em 5–10× vs. SATA SSD — eliminando gargalo de I/O que pode manter a GPU abaixo de 60% de utilização em treinos intensivos.

Fonte · dimensionada

Energia estável para trabalho contínuo

Workstations com múltiplas GPUs de 600 W exigem fontes de 1.600 W a 2.200 W, certificação 80 Plus Titanium ou Platinum, com cabos PCIe 5.0 (12V-2x6) dedicados por placa — a Heavy V inclui dimensionamento no configurador.

Qual configuração combina com você?

Do primeiro projeto ao uso profissional intenso — compare níveis e encontre o ponto de partida ideal. Valores são faixas estimadas; consulte o configurador para preços atuais.

Nível GPU (VRAM) CPU RAM Storage PSU Perfil
Entry RTX 4070 Ti / 5070 (12–16 GB) Ryzen 9 / Core Ultra 9 64 GB DDR5 2 TB NVMe Gen4 850 W 80+ Gold Ollama, Llama 3 8B Q4, SD 1.5, aprendizado hands-on
Intermediário RTX 5080 / 5090 (16–32 GB) Threadripper / Ryzen 9 128 GB DDR5 4 TB NVMe Gen4/5 1.000 W 80+ Platinum LoRA, SDXL/FLUX, Mistral 7B FP16, RAG local
Profissional RTX 6000 Ada (48 GB ECC) Threadripper PRO 9000 WX 256 GB DDR5 ECC 8 TB NVMe Gen5 RAID 1.600 W 80+ Titanium Fine-tuning QLoRA, Mixtral, visão computacional batch
Enterprise 1–4× RTX PRO 6000 Blackwell (96 GB ECC) Threadripper PRO 9995WX 512 GB+ DDR5 ECC 16 TB+ NVMe Gen5 2.200 W redundante Llama 3 70B FP16, multi-GPU, serving vLLM/Triton, LGPD on-premise

A linha Heavy V cobre os níveis profissional e enterprise — referência Rocketz para PC para treinar IA e workstation GPU para IA em escala.

Quanto de memória de vídeo cada modelo pede

Modelo FP16 INT8 INT4 (GGUF/GPTQ) Notas
Llama 3 8B ~16 GB ~10 GB ~6 GB Inferência local viável com 12–16 GB; fine-tuning LoRA pede 24 GB+
Mistral 7B / Gemma 7B ~14 GB ~8 GB ~5 GB Ollama/llama.cpp rodam confortavelmente em GPUs de 16 GB com Q4
Mixtral 8×7B (MoE) ~90 GB ~48 GB ~26 GB MoE ativa ~13B por forward pass; Q4 cabe em RTX 6000 Ada
Llama 3 70B ~140 GB ~70 GB ~40 GB 70B Q4 em 48 GB com offload parcial; FP16 exige 96 GB+ (RTX PRO 6000)
Stable Diffusion XL ~8 GB ~6 GB ComfyUI/Automatic1111: 12 GB confortável; 24 GB+ para ControlNet + upscalers
FLUX.1 dev ~24 GB ~16 GB Diffusion transformer; 24 GB mínimo recomendado para produção local
Whisper large-v3 ~6 GB ~4 GB STT em batch; CPU-only possível, GPU acelera 10–20×

Na sua mesa ou na nuvem?

Critério Heavy V on-premise Cloud (ex.: p4d/H100)
Latência de inferência <50 ms TTFT local (rede zero-hop) 100–500 ms + variabilidade de rede
Privacidade / LGPD Dados nunca saem da rede corporativa Exige DPA, criptografia e auditoria de provedor
Disponibilidade 100% sob seu controle; manutenção local SLA 99,9%; filas e spot instances podem interromper jobs
Iteração de fine-tuning Sem limite de sessão; hardware dedicado seu Cobrança por hora; ideal para picos esporádicos

Softwares que rodam na Heavy V

PyTorch, Ollama, ComfyUI e dezenas de ferramentas do ecossistema de IA — no Linux, Windows ou WSL2.

  • PyTorch · TensorFlow · JAX · Keras
  • CUDA Toolkit · cuDNN · cuBLAS · NCCL · Tensor Cores
  • Hugging Face Transformers · Diffusers · Accelerate · PEFT · TRL
  • vLLM · TensorRT-LLM · Triton Inference Server · Ollama · llama.cpp · LM Studio
  • Stable Diffusion WebUI · ComfyUI · Automatic1111
  • DeepSpeed · Megatron-LM · FSDP · ONNX Runtime
  • RAPIDS (cuDF · cuML) · LangChain · LlamaIndex
  • Docker · NVIDIA Container Toolkit · Kubernetes · WSL2
  • ChromaDB · FAISS · Milvus · Weaviate · Qdrant

Quem usa

Feita para quem leva IA a sério

Startups, estúdios, times de TI e pesquisadores que precisam de controle, privacidade e performance previsível — sem depender só da nuvem ou de um notebook de demonstração.

Chatbots e modelos locais

IA conversacional rodando na sua rede, com privacidade e resposta rápida

Desafio: iterar projetos de IA sem custo recorrente de nuvem.
Com a Heavy V: memória de vídeo profissional para personalizar modelos localmente.
O que muda: muito menos gasto com nuvem; resultados em horas, não dias.

Personalizar modelos

Adapte a IA aos seus dados e ao seu domínio de negócio

Desafio: treinar modelos com bases de dados grandes e proprietárias.
Com a Heavy V: processador forte, memória ampla e armazenamento rápido.
O que muda: experimentos que levavam dias na nuvem rodam em horas na bancada.

Visão e análise de imagens

Inspeção, reconhecimento e vídeo com processamento estável

Desafio: pipelines de dados lentos demais no dia a dia.
Com a Heavy V: GPU + CPU trabalhando juntas em volumes grandes.
O que muda: tarefas que demoravam horas passam a levar minutos.

Produtos com IA

Prototipe, teste e valide antes de investir em infraestrutura na nuvem

Desafio: lançar um produto de IA com custo sob controle.
Com a Heavy V: ambiente local para desenvolver e demonstrar.
O que muda: MVP em poucas semanas, com decisões baseadas em testes reais.

Criação com IA

Imagens e vídeos gerados na sua máquina, sem fila e sem cobrança por render

Desafio: produzir conteúdo visual em volume sem depender de serviços online.
Com a Heavy V: placa de vídeo com memória para projetos em alta resolução.
O que muda: iteração livre, sem custo por imagem ou por minuto.

Dados protegidos

IA dentro da empresa — nada sensível precisa sair da sua rede

Desafio: usar IA com dados regulados ou confidenciais.
Com a Heavy V: workstation na empresa, sob seu controle.
O que muda: conformidade mais simples e risco de vazamento reduzido.

Aprender fazendo

Estude e experimente com IA no seu ritmo, sem limite de sessão

Desafio: ferramentas gratuitas com fila, timeout e instabilidade.
Com a Heavy V: ambiente próprio, disponível quando você precisar.
O que muda: aprendizado contínuo, do básico ao avançado, na mesma máquina.

Para quem quer ir além do básico

Quantização: FP16 preserva qualidade máxima; FP8/INT8 reduzem VRAM ~50% com perda mínima em inferência; INT4 (GPTQ, AWQ, GGUF) permite rodar Llama 3 70B em 48 GB com trade-off de perplexidade. Use QLoRA para fine-tuning em VRAM limitada.

RAG local: pipeline embeddings (sentence-transformers) → vector DB (FAISS/ChromaDB) → LLM (vLLM/Ollama) → framework (LangChain/LlamaIndex). A CPU Threadripper indexa documentos enquanto a GPU serve inferência.

Inference serving: Ollama/llama.cpp para simplicidade; vLLM para throughput alto (continuous batching); TensorRT-LLM para latência mínima; Triton para produção multi-modelo com MIG.

Multi-GPU: data parallelism (DeepSpeed ZeRO) replica modelo por GPU; tensor parallelism divide camadas; pipeline parallelism divide estágios. NVLink (900 GB/s bidirecional na Blackwell) supera PCIe 5.0 para comunicação inter-GPU intensiva.

Monitoramento: nvidia-smi, nvtop, DCGM e Prometheus + Grafana para utilização, temperatura, power limit e memória — essencial em serving 24/7.

Containerização: Docker + NVIDIA Container Toolkit garante reprodutibilidade; NGC containers pré-configurados para PyTorch, TensorRT e RAPIDS aceleram setup em horas.

Antes de comprar, confira isto

  • VRAM total ≥ requisito do maior modelo que você pretende rodar (consulte tabela acima)
  • RAM de sistema ≥ 2× VRAM total; ECC recomendado para treinos longos
  • Slots PCIe x16 suficientes para GPUs planejadas + NVLink quando aplicável
  • Fonte com wattagem 20% acima do TDP combinado; cabos 12V-2x6 por GPU
  • NVMe Gen4/Gen5 para dataset e checkpoints; evite HDD como volume primário de treino
  • Refrigeração dimensionada para carga contínua — water cooling recomendado em 2+ GPUs workstation
  • Sistema operacional: Ubuntu 22.04/24.04 LTS ou Windows + WSL2 com driver NVIDIA atualizado
  • Compatibilidade CUDA: verifique versão suportada pela sua stack (PyTorch 2.x → CUDA 12.x)

Escolha processador, placa de vídeo, memória e armazenamento no configurador da Heavy V — montagem, teste, frete grátis e suporte Rocketz no Brasil.

Configurar Heavy V IA

Dúvidas mais comuns

Por que escolher a Heavy V para IA?

Para treino, fine-tuning e inferência local em escala, a Heavy V IA combina Threadripper PRO Zen 5 (até 96 núcleos) na CPU com RTX PRO 6000 Blackwell (96 GB GDDR7 ECC) ou RTX 6000 Ada (48 GB ECC) na GPU. A GPU é o componente mais crítico; a CPU evita gargalo de dataloaders; RAM ECC e NVMe Gen5 completam o pipeline. Você configura no site e recebe workstation montada, testada sob carga de IA e com suporte Rocketz.

Quanta memória de vídeo preciso?

Llama 3 8B em INT4 (GGUF) roda em 6–8 GB; em FP16, ~16 GB. Mistral 7B segue perfil similar. Mixtral 8×7B pede ~26 GB quantizado ou ~90 GB FP16. Llama 3 70B em Q4 cabe em ~40 GB com offload parcial; FP16 exige 96 GB+ (RTX PRO 6000 Blackwell). Fine-tuning LoRA de 8B pede mínimo 24 GB de VRAM.

Quanta memória RAM preciso?

Regra prática: RAM ≥ 2× a VRAM total da GPU. Para Heavy V com 96 GB de VRAM, recomenda-se 256 GB DDR5 ECC; workloads RAG + LLM + ETL simultâneos podem exigir 512 GB. Menos que isso causa thrashing e subutilização da GPU.

Preciso de mais de uma placa de vídeo?

Uma GPU basta para inferência e fine-tuning LoRA/QLoRA de modelos até ~13B (FP16) ou ~70B (Q4). Multi-GPU (2–4× RTX PRO 6000) faz sentido para Llama 3 70B FP16, treino distribuído (DeepSpeed, FSDP), serving multi-modelo com MIG ou throughput de inferência acima de ~200 tokens/s em batch.

Qual processador é o ideal?

Para workstation desktop, Threadripper PRO Zen 5 (Heavy V) oferece mais núcleos por watt e 128 lanes PCIe 5.0 — ideal para multi-GPU e dataloaders agressivos. Intel Xeon W compete em single-thread e ecossistema corporativo; para ML local com PyTorch, Threadripper PRO 9995WX lidera benchmarks multi-thread relevantes para data loading.

Preciso de SSD super rápido?

NVMe Gen4 (~7.000 MB/s) é suficiente para datasets médios e inferência. Gen5 (~14.000 MB/s) reduz gargalo de I/O em treinos com imagem/vídeo de alta resolução — pode elevar utilização da GPU de ~60% para 90%+. Evite SATA SSD como volume primário de treino.

Qual fonte de energia usar?

RTX PRO 6000 Blackwell consome até 600 W TDP. Sistema com 1× GPU + Threadripper PRO: fonte mínima 1.000 W, 80 Plus Platinum. 2× GPU: 1.600 W; 4× GPU: 2.200 W com cabos 12V-2x6 dedicados. A Heavy V dimensiona no configurador.

Preciso de water cooler?

Air cooling adequado sustenta 1× GPU workstation em carga contínua. Com 2+ GPUs de 600 W ou treinos 24/7, water cooling (AIO ou custom loop) mantém temperaturas abaixo do thermal throttle — essencial para estabilidade de treinos longos.

Threadripper ou Ryzen comum?

Ryzen 9 ou Core Ultra bastam para IA leve com GeForce e Q4 (Heavy I/II). Com RTX PRO 6000 ou RTX 6000 Ada, quantizações Q8/FP16 empurram pesos para RAM do sistema — dual-channel vira gargalo. Threadripper PRO Zen 5 na Heavy V: oito canais DDR5 ECC, 128 lanes PCIe 5.0, até 4× GPU sem gargalo.

Funciona no Windows?

Ambos funcionam. Linux (Ubuntu 22.04/24.04 LTS) é referência para PyTorch, CUDA e Docker em produção. Windows 11 + WSL2 cobre 95% dos fluxos de desenvolvimento; Ollama, ComfyUI e LM Studio rodam nativamente no Windows. Para serving enterprise (Triton, Kubernetes), prefira Linux.

WSL2 resolve para desenvolvimento?

Sim, para desenvolvimento e experimentação. WSL2 expõe GPU NVIDIA via CUDA com performance próxima ao Linux nativo (~95%). Limitações: I/O de disco cross-filesystem e networking avançado para clusters. Para treino multi-GPU intensivo, Linux nativo ou dual-boot é preferível.

Ollama roda na minha placa NVIDIA?

Sim, em GPUs com compute capability ≥ 7.0 (GTX 1660+). Performance escala com VRAM e bandwidth. RTX PRO 6000 Blackwell entrega ~2–3× tokens/s vs. RTX 4070 Ti em Llama 3 8B Q4 (estimativa; varia por driver e build).

Qual a diferença para um PC gamer?

PC gamer: GeForce com 16–32 GB, drivers Game Ready, picos de consumo, sem ECC. PC para IA: GPU workstation (RTX PRO/RTX Ada) com 48–96 GB ECC, drivers ISV estáveis, dissipação 24/7, CPU multichannel, RAM ECC e PSU dimensionada para carga contínua.

Qual o prazo de entrega e frete?

Frete gratuito para todo o Brasil com transportadora especializada e seguro. Produção: até 15 dias úteis dias úteis após confirmação de pagamento. Transporte: até 3 dias úteis (capitais) ou 7 dias (interior).

Qual a garantia?

2 anos em todos os componentes, 3 anos em processador e placa de vídeo, suporte técnico vitalício.