DeepSeek V4 Flash em um único AMD MI300X

Desenvolvedores estão experimentando rodar o grande modelo de linguagem DeepSeek V4 Flash em uma única GPU AMD MI300X, explorando se hardware de datacenter de ponta pode tornar a inferência auto-hospedada viável economicamente e tecnicamente. Os comentaristas ponderam os trade-offs entre APIs em nuvem e possuir ou alugar GPUs, destacando fatores como preço por token, utilização, privacidade, limites de janela de contexto e disponibilidade de hardware. A conversa também situa essas escolhas no contexto do boom mais amplo de investimento em IA, questionando se os gastos atuais com infraestrutura e os preços subsidiados são sustentáveis.

Disponibilidade de hardware e formatos

  • Unidades únicas de MI300X são difíceis/caras de obter; geralmente são vendidas em caixas com 8 GPUs por cerca de ~€250k.
  • Alguns afirmam que é possível encontrar módulos OAM individuais em mercados secundários, mas sem backplanes/adaptadores eles são impraticáveis.
  • O MI350P é destacado como uma opção PCIe mais acessível (144 GB HBM), mas ainda é voltada para servidores: refrigeração passiva, alto consumo, exige fluxo de ar sério ou refrigeração personalizada.
  • A discussão observa a realidade térmica de aceleradores de 600W+: eles se comportam como aquecedores e podem aquecer significativamente uma sala.

Bolha de IA, demanda e financiamento

  • Debate sobre se o investimento atual em IA é uma bolha.
  • Um lado: trilhões em capex de IA financiados por dívida (~$3T citados de um artigo), com juros possivelmente excedendo a receita atual de IA → insustentável, a menos que a IA substitua grande मात्रा de trabalho ou leve a uma mudança social radical.
  • Contra-argumentos: a demanda é “real e não vai desaparecer”; previsões anteriores de “a bolha vai estourar em breve” estavam erradas; receitas e uso teriam disparado.
  • Alguns distinguem entre demanda real e demanda dependente de preços subsidiados; há preocupação de que a demanda possa cair se o capital barato secar.

Economia de inferência e preços da DeepSeek

  • O aluguel em nuvem de MI300X a cerca de ~$2/h é discutido como possivelmente a forma mais barata de rodar DeepSeek V4 Flash com os pesos originais, mas cálculos detalhados sugerem margens apertadas ou negativas em comparação com simplesmente usar a API.
  • A modelagem de custo por token mostra que tokens em cache são extremamente baratos de atender se implementados bem; os preços baixos da DeepSeek são em parte justificados pelo forte reaproveitamento de cache em cargas agentic.
  • Há discordância sobre se os laboratórios de fronteira estão obtendo lucro significativo: alguns argumentam que a inferência via API é lucrativa com margens brutas positivas; outros duvidam que isso cubra totalmente os custos de P&D e treinamento.
  • Assume-se que a DeepSeek opere próximo do custo e monetize dados de usuários para treinamento futuro.

Auto-hospedagem vs uso da API

  • Vários argumentam que, considerando eletricidade, depreciação e throughput, auto-hospedagem raramente sai mais barata do que acesso via API para indivíduos.
  • Outros enfatizam motivos não relacionados a custo: privacidade, restrições regulatórias, proteção de IP, decodificação personalizada/controle de atenção e latência e qualidade mais estáveis em comparação com endpoints comerciais fortemente batchados.
  • Para equipes, um único MI300X ou um pequeno cluster pode atender múltiplos agentes de codificação e workloads em lote com fortes garantias de privacidade.

Desempenho e otimização

  • O throughput relatado do MI300X para DeepSeek V4 Flash (150–800+ tok/s) é visto como bom, mas ainda abaixo do throughput reportado para H800 no paper DSpark da própria DeepSeek (15k tok/s/GPU).
  • Observa-se que setups multi-GPU, bem conectados em rede e com amplo paralelismo alcançam escalonamento superlinear de throughput, então números de GPU única não são diretamente comparáveis.
  • Alguns apontam que stacks baseadas em NVIDIA (por exemplo, usando sglang/dynamo) podem alcançar taxas de tokens muito maiores por GPU; stacks AMD ainda têm espaço para otimização.

Tamanho do modelo, MoE e janela de contexto

  • DeepSeek V4 Flash tem ~284B parâmetros totais (MoE) com quantização MXFP4; outros modelos de fronteira chineses são listados na faixa de 1.6T–2.8T.
  • Rumores sobre tamanhos de modelos de fronteira dos EUA variam de 5T a 100T, com os comentaristas concordando que os números reais não estão claros.
  • Servir V4 Flash em especificação completa (1M de contexto, múltiplos usuários) parece exceder o que uma única placa de 144 GB consegue suportar; alguns sugerem pelo menos dois MI350Ps.
  • Um trade-off de 256k de contexto no MI300X é visto como prático; alguns usuários relatam que 1M de contexto é exagero e que a perda de qualidade em 256k é modesta.

Stack de software, dados e trabalho anterior

  • ROCm é confirmado como utilizável para inferência de fronteira e, segundo relatos, usado por grandes laboratórios; alguns demonstram interesse em contornar stacks de nível mais alto e falar diretamente com buffers de comandos de hardware.
  • Dados de interações de usuários (especialmente traços de agentes, bases de código, sentimento do usuário) são considerados extremamente valiosos para treinamento e fine-tuning por RL, mesmo que ruidosos.
  • Trabalhos anteriores como DwarfStar são mencionados como atingindo modelos semelhantes com menos memória, mas ainda não ajustados para MI300X, o que explica sua ausência na seção de “trabalho anterior” do repositório.