Como rodar o Qwen3.8-Flash-Next (125B) no seu PC gamer com o Strata

O Strata coloca um modelo de 125 bilhões de parâmetros para rodar localmente em um PC gamer compatível. Veja como instalar, conectar ao Claude Code e interpretar corretamente os números de desempenho.

LinkedInWhatsApp

Antes de tudo: a pegadinha

O Strata é um projeto open source (licença MIT, 12.499 estrelas no GitHub em 05/10/2026, criado em 24/09/2026) que roda o Qwen3.8-Flash-Next, modelo de 125 bilhões de parâmetros do time Qwen, num PC comum com placa de vídeo de 12 GB ou mais. Segundo o README, ele conversa, escreve código, lê imagens e funciona com seus apps e agentes de código, e nada sai do seu PC.

Antes de tudo, a pegadinha: o post que viralizou no Hacker News diz "RTX 4090 a 100 tokens/s". O README não mede 4090 nem cita 100 tokens/s. O que ele mede é isto:

PC medido no README Tamanho Escreve (tokens/s) Lê o prompt (tokens/s)
RTX 5070 (12 GB), Ryzen 5 7600, 64 GB RAM Q2_0 94 2.650
IQ2_XS 79 2.090
IQ3_XXS 62 1.750
IQ3_S 53 1.620
Coder 55 2.180
RX 9070 XT (16 GB), Ryzen 9 3900X, 47 GB RAM Q2_0 60 1.160
IQ2_XS 52 1.110
Coder 44 1.420

Um token é cerca de ¾ de uma palavra. O README estima (não mediu) que uma RTX 3090 de 24 GB escreveria algo como 100 a 140 tokens/s.

Como cabe num PC (a cozinha)

O próprio README usa a imagem de uma cozinha: o que você usa toda hora fica na bancada, o resto espera na despensa.

  • O modelo é um time de 24.576 especialistas ("experts"). Cada palavra usa só 10.
  • A placa de vídeo guarda os poucos milhares mais usados (a bancada). A RAM guarda todos (a despensa). O processador trabalha no resto ao mesmo tempo. O SSD guarda uma tabela de consulta grande.
  • Chuta e confere: um modelo pequeno adivinha as próximas palavras e o grande confere todas de uma vez. Mesma resposta, 1,6 a 1,8x mais rápido.

Pré-requisitos

Mínimo
Placa de vídeo NVIDIA GeForce RTX 20, 30, 40 ou 50, ou AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, RX 9060 XT, RX 9070/9070 XT, Radeon AI PRO R9700 ou RX 6800/6900. 12 GB de VRAM ou mais.
RAM 32 GB ou mais (64 GB roda todos os tamanhos).
Disco ~80 GB livres, de preferência SSD (o primeiro start fica bem mais rápido).
Sistema Windows 10/11 ou Linux, com driver de vídeo atual da NVIDIA ou da AMD.

O instalador cuida do resto. Placas mais antigas, Intel Arc e processadores sem AVX2 são experimentais (veja docs/OLDER_GPUS.md, docs/INTEL_ARC.md e docs/INSTALL.md no repositório).

Qual tamanho escolher (a RAM decide)

Sua RAM Pegue Por quê
32 GB Coder cabe em 32 GB e é feito para código (com placa de 24 GB, Q2_0 e IQ2_XS também rodam)
48 GB IQ2_XS (ou Q2_0, o mais rápido) os maiores não cabem
64 GB IQ2_XS (recomendado), ou IQ3_XXS / IQ3_S todos cabem; IQ3_S é o melhor e o mais lento
96 GB ou mais IQ3_S, ou o UD-IQ4_XS da Unsloth (~4 bits) espaço para os maiores com tudo aberto

O instalador já recomenda um para a sua RAM.

Instalação

Opção A: deixar a sua IA instalar

Se você usa Claude Code, Cursor, Codex ou GitHub Copilot, cole isto nele:

Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.

Ele confere placa, RAM e disco, escolhe o modelo que cabe, instala, inicia e diz como conectar seus apps.

Opção B: Windows

  1. Baixe o ZIP e descompacte: https://github.com/Niko1221/Strata/archive/refs/heads/main.zip (ou clone com git):

powershell git clone https://github.com/Niko1221/Strata.git cd Strata

  1. Dê duplo clique em START-HERE.bat (ou rode no terminal):

powershell .\START-HERE.bat

Opção B: Linux

git clone https://github.com/Niko1221/Strata.git
cd Strata
./setup.sh

O que o instalador pergunta

Os passos são os mesmos para NVIDIA e AMD: ele detecta a placa e monta o motor certo. Depois pergunta:

  1. qual modelo e qual tamanho;
  2. quanto contexto (quanto texto o modelo guarda na cabeça);
  3. se ele deve ler imagens.

Aperte Enter em cada uma para a resposta recomendada. Ele baixa o modelo (~70 GB) e inicia. Se o download parar, rode de novo: ele continua de onde parou. No fim, o navegador abre o app em:

http://127.0.0.1:8080

Atenção: enquanto o modelo carrega, o PC pode ficar lento ou parar de responder por 1 a 3 minutos (mais na primeira vez). O Strata carrega 35 a 55 GB na RAM. É normal: espere e não feche a janela.

Próximas vezes: rode START-HERE.bat (ou ./setup.sh) de novo; ele inicia direto e não baixa nada duas vezes. Feche a janela dele para parar o modelo.

Conectar no Claude Code, no Codex e em outros apps

Claude Code

O Strata expõe a API da Anthropic em http://127.0.0.1:8080/v1/messages. No Claude Code, basta apontar a base URL.

Linux (bash):

export ANTHROPIC_BASE_URL=http://127.0.0.1:8080
claude

Windows (PowerShell):

$env:ANTHROPIC_BASE_URL = "http://127.0.0.1:8080"
claude

Apps compatíveis com OpenAI (Cursor, extensões, scripts)

Adicione um provedor "OpenAI-compatible" com a base URL abaixo. Qualquer chave e qualquer nome de modelo funcionam.

http://127.0.0.1:8080/v1

Codex CLI

O Codex e outros apps que usam a OpenAI Responses API falam com /v1/responses. A configuração completa está em docs/DETAILS.md (seção "The Responses API and Codex CLI") no repositório.

MCP

Ferramentas de IA também podem instalar, iniciar e parar o Strata pelo servidor MCP dele (docs/MCP_SERVER.md).

Verificar se está funcionando

  1. Abra http://127.0.0.1:8080 no navegador. O app tem as abas Chat, Monitor (modelo e uso de GPU/CPU/RAM ao vivo) e About (configurações e endereços).
  2. Mande uma mensagem no Chat. Se responder, o modelo está de pé.
  3. Abra o Claude Code com a ANTHROPIC_BASE_URL configurada, peça algo e acompanhe o Monitor: GPU e RAM devem mexer enquanto ele responde.

Dica: o nível de raciocínio (off, low, medium, high) muda no menu do chat ou no "reasoning effort" do seu app. Off é o mais rápido; high é melhor para pergunta difícil.

Problemas comuns

  • O PC travou no primeiro start. É normal enquanto carrega o modelo. Espere e não feche a janela. Travado depois de 10 minutos? Reinicie o PC, feche outros programas e tente de novo, ou escolha um tamanho menor.
  • Parou no meio do download ou da instalação. Rode START-HERE.bat (ou ./setup.sh) de novo. Ele continua de onde parou.
  • Muito lento, luz do disco piscando sem parar, ou "the engine stopped unexpectedly". Falta RAM livre. Feche programas (navegador gasta muito) ou escolha um tamanho menor (Q2_0 ou IQ2_XS).
  • "Port 8080 is already in use". O Strata já está rodando. Procure a janela dele.
  • Primeira mensagem demora com prompt longo. O Strata lê a primeira mensagem do chat inteira, cerca de 1 minuto a cada 30 mil tokens. As seguintes começam em segundos.
  • Ainda travado? Abra uma issue em https://github.com/Niko1221/Strata/issues e anexe o strata-<modelo>.log da pasta do Strata. Mais correções em docs/TROUBLESHOOTING.md.

Outros comandos úteis

Atualizar sem iniciar:

.\UPDATE.bat
./update.sh

Adicionar outro modelo depois:

.\SETUP.bat
./setup.sh --setup

Acessar do celular ou de outro PC (sempre defina uma chave):

.\START-HERE.bat --setup --host 0.0.0.0 --api-key <sua-chave-secreta>

Atender mais de um pedido ao mesmo tempo: configure "parallel": 2 (veja docs/BATCHING.md). Numa placa de 12 GB, cada resposta fica mais lenta.

Limites (o lado fraco)

  • O número viral não é o do README. O título do Hacker News fala RTX 4090 e 100 tokens/s; o README mediu RTX 5070 e 94 tokens/s, no tamanho mais rápido (Q2_0) e com 64 GB de RAM.
  • Pede PC parrudo: 12 GB de VRAM, 32 GB de RAM no mínimo (64 GB para todos os tamanhos) e ~80 GB de disco.
  • Primeiro start trava o PC por 1 a 3 minutos enquanto carrega 35 a 55 GB na RAM.
  • Um pedido por vez por padrão; parallel: 2 deixa cada resposta mais lenta numa placa de 12 GB.
  • Coder: metade dos especialistas removida; chega a 91% da nota do modelo completo no SWE-bench Verified, medido pelos próprios autores (sem reprodução independente), e é mais fraco fora de código, incluindo chinês e outros textos CJK.
  • Não há medição independente de qualidade dos tamanhos comprimidos até 05/10/2026.
  • O tamanho mais fiel é lento: o UD-Q4_K_XL (experimental) escreve só 7 a 8,5 tokens/s num PC com 64 GB, porque lê boa parte do SSD.
  • AMD no Windows ainda não lê imagens (no Linux lê pelo processador).
  • Licença: o Strata é MIT, mas algumas partes e cada modelo têm licença própria (o Hugging Face marca o Qwen3.8-Flash-Next como "other"). Confira antes de uso comercial.

Créditos

Modelo: Qwen3.8-Flash-Next, do time Qwen. Compressões: ISTA-DASLab, UkisAI (Swift 1.5) e Unsloth. O Strata usa partes do llama.cpp / ggml. Repositório: https://github.com/Niko1221/Strata

Quer o repositório e o passo a passo?

Comente STRATA no post para receber o link do Strata e este guia completo no direct.

Falar com a Rafique AI
Strata: rode o Qwen3.8-Flash-Next no PC | rafiqueAI