Antes de tudo: a pegadinha
O Strata é um projeto open source (licença MIT, 12.499 estrelas no GitHub em 05/10/2026, criado em 24/09/2026) que roda o Qwen3.8-Flash-Next, modelo de 125 bilhões de parâmetros do time Qwen, num PC comum com placa de vídeo de 12 GB ou mais. Segundo o README, ele conversa, escreve código, lê imagens e funciona com seus apps e agentes de código, e nada sai do seu PC.
Antes de tudo, a pegadinha: o post que viralizou no Hacker News diz "RTX 4090 a 100 tokens/s". O README não mede 4090 nem cita 100 tokens/s. O que ele mede é isto:
| PC medido no README | Tamanho | Escreve (tokens/s) | Lê o prompt (tokens/s) |
|---|---|---|---|
| RTX 5070 (12 GB), Ryzen 5 7600, 64 GB RAM | Q2_0 | 94 | 2.650 |
| IQ2_XS | 79 | 2.090 | |
| IQ3_XXS | 62 | 1.750 | |
| IQ3_S | 53 | 1.620 | |
| Coder | 55 | 2.180 | |
| RX 9070 XT (16 GB), Ryzen 9 3900X, 47 GB RAM | Q2_0 | 60 | 1.160 |
| IQ2_XS | 52 | 1.110 | |
| Coder | 44 | 1.420 |
Um token é cerca de ¾ de uma palavra. O README estima (não mediu) que uma RTX 3090 de 24 GB escreveria algo como 100 a 140 tokens/s.
Como cabe num PC (a cozinha)
O próprio README usa a imagem de uma cozinha: o que você usa toda hora fica na bancada, o resto espera na despensa.
- O modelo é um time de 24.576 especialistas ("experts"). Cada palavra usa só 10.
- A placa de vídeo guarda os poucos milhares mais usados (a bancada). A RAM guarda todos (a despensa). O processador trabalha no resto ao mesmo tempo. O SSD guarda uma tabela de consulta grande.
- Chuta e confere: um modelo pequeno adivinha as próximas palavras e o grande confere todas de uma vez. Mesma resposta, 1,6 a 1,8x mais rápido.
Pré-requisitos
| Mínimo | |
|---|---|
| Placa de vídeo | NVIDIA GeForce RTX 20, 30, 40 ou 50, ou AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, RX 9060 XT, RX 9070/9070 XT, Radeon AI PRO R9700 ou RX 6800/6900. 12 GB de VRAM ou mais. |
| RAM | 32 GB ou mais (64 GB roda todos os tamanhos). |
| Disco | ~80 GB livres, de preferência SSD (o primeiro start fica bem mais rápido). |
| Sistema | Windows 10/11 ou Linux, com driver de vídeo atual da NVIDIA ou da AMD. |
O instalador cuida do resto. Placas mais antigas, Intel Arc e processadores sem AVX2 são experimentais (veja docs/OLDER_GPUS.md, docs/INTEL_ARC.md e docs/INSTALL.md no repositório).
Qual tamanho escolher (a RAM decide)
| Sua RAM | Pegue | Por quê |
|---|---|---|
| 32 GB | Coder | cabe em 32 GB e é feito para código (com placa de 24 GB, Q2_0 e IQ2_XS também rodam) |
| 48 GB | IQ2_XS (ou Q2_0, o mais rápido) | os maiores não cabem |
| 64 GB | IQ2_XS (recomendado), ou IQ3_XXS / IQ3_S | todos cabem; IQ3_S é o melhor e o mais lento |
| 96 GB ou mais | IQ3_S, ou o UD-IQ4_XS da Unsloth (~4 bits) | espaço para os maiores com tudo aberto |
O instalador já recomenda um para a sua RAM.
Instalação
Opção A: deixar a sua IA instalar
Se você usa Claude Code, Cursor, Codex ou GitHub Copilot, cole isto nele:
Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.
Ele confere placa, RAM e disco, escolhe o modelo que cabe, instala, inicia e diz como conectar seus apps.
Opção B: Windows
- Baixe o ZIP e descompacte: https://github.com/Niko1221/Strata/archive/refs/heads/main.zip (ou clone com git):
powershell
git clone https://github.com/Niko1221/Strata.git
cd Strata
- Dê duplo clique em
START-HERE.bat(ou rode no terminal):
powershell
.\START-HERE.bat
Opção B: Linux
git clone https://github.com/Niko1221/Strata.git
cd Strata
./setup.sh
O que o instalador pergunta
Os passos são os mesmos para NVIDIA e AMD: ele detecta a placa e monta o motor certo. Depois pergunta:
- qual modelo e qual tamanho;
- quanto contexto (quanto texto o modelo guarda na cabeça);
- se ele deve ler imagens.
Aperte Enter em cada uma para a resposta recomendada. Ele baixa o modelo (~70 GB) e inicia. Se o download parar, rode de novo: ele continua de onde parou. No fim, o navegador abre o app em:
http://127.0.0.1:8080
Atenção: enquanto o modelo carrega, o PC pode ficar lento ou parar de responder por 1 a 3 minutos (mais na primeira vez). O Strata carrega 35 a 55 GB na RAM. É normal: espere e não feche a janela.
Próximas vezes: rode START-HERE.bat (ou ./setup.sh) de novo; ele inicia direto e não baixa nada duas vezes. Feche a janela dele para parar o modelo.
Conectar no Claude Code, no Codex e em outros apps
Claude Code
O Strata expõe a API da Anthropic em http://127.0.0.1:8080/v1/messages. No Claude Code, basta apontar a base URL.
Linux (bash):
export ANTHROPIC_BASE_URL=http://127.0.0.1:8080
claude
Windows (PowerShell):
$env:ANTHROPIC_BASE_URL = "http://127.0.0.1:8080"
claude
Apps compatíveis com OpenAI (Cursor, extensões, scripts)
Adicione um provedor "OpenAI-compatible" com a base URL abaixo. Qualquer chave e qualquer nome de modelo funcionam.
http://127.0.0.1:8080/v1
Codex CLI
O Codex e outros apps que usam a OpenAI Responses API falam com /v1/responses. A configuração completa está em docs/DETAILS.md (seção "The Responses API and Codex CLI") no repositório.
MCP
Ferramentas de IA também podem instalar, iniciar e parar o Strata pelo servidor MCP dele (docs/MCP_SERVER.md).
Verificar se está funcionando
- Abra
http://127.0.0.1:8080no navegador. O app tem as abas Chat, Monitor (modelo e uso de GPU/CPU/RAM ao vivo) e About (configurações e endereços). - Mande uma mensagem no Chat. Se responder, o modelo está de pé.
- Abra o Claude Code com a
ANTHROPIC_BASE_URLconfigurada, peça algo e acompanhe o Monitor: GPU e RAM devem mexer enquanto ele responde.
Dica: o nível de raciocínio (off, low, medium, high) muda no menu do chat ou no "reasoning effort" do seu app. Off é o mais rápido; high é melhor para pergunta difícil.
Problemas comuns
- O PC travou no primeiro start. É normal enquanto carrega o modelo. Espere e não feche a janela. Travado depois de 10 minutos? Reinicie o PC, feche outros programas e tente de novo, ou escolha um tamanho menor.
- Parou no meio do download ou da instalação. Rode
START-HERE.bat(ou./setup.sh) de novo. Ele continua de onde parou. - Muito lento, luz do disco piscando sem parar, ou "the engine stopped unexpectedly". Falta RAM livre. Feche programas (navegador gasta muito) ou escolha um tamanho menor (Q2_0 ou IQ2_XS).
- "Port 8080 is already in use". O Strata já está rodando. Procure a janela dele.
- Primeira mensagem demora com prompt longo. O Strata lê a primeira mensagem do chat inteira, cerca de 1 minuto a cada 30 mil tokens. As seguintes começam em segundos.
- Ainda travado? Abra uma issue em https://github.com/Niko1221/Strata/issues e anexe o
strata-<modelo>.logda pasta do Strata. Mais correções emdocs/TROUBLESHOOTING.md.
Outros comandos úteis
Atualizar sem iniciar:
.\UPDATE.bat
./update.sh
Adicionar outro modelo depois:
.\SETUP.bat
./setup.sh --setup
Acessar do celular ou de outro PC (sempre defina uma chave):
.\START-HERE.bat --setup --host 0.0.0.0 --api-key <sua-chave-secreta>
Atender mais de um pedido ao mesmo tempo: configure "parallel": 2 (veja docs/BATCHING.md). Numa placa de 12 GB, cada resposta fica mais lenta.
Limites (o lado fraco)
- O número viral não é o do README. O título do Hacker News fala RTX 4090 e 100 tokens/s; o README mediu RTX 5070 e 94 tokens/s, no tamanho mais rápido (Q2_0) e com 64 GB de RAM.
- Pede PC parrudo: 12 GB de VRAM, 32 GB de RAM no mínimo (64 GB para todos os tamanhos) e ~80 GB de disco.
- Primeiro start trava o PC por 1 a 3 minutos enquanto carrega 35 a 55 GB na RAM.
- Um pedido por vez por padrão;
parallel: 2deixa cada resposta mais lenta numa placa de 12 GB. - Coder: metade dos especialistas removida; chega a 91% da nota do modelo completo no SWE-bench Verified, medido pelos próprios autores (sem reprodução independente), e é mais fraco fora de código, incluindo chinês e outros textos CJK.
- Não há medição independente de qualidade dos tamanhos comprimidos até 05/10/2026.
- O tamanho mais fiel é lento: o UD-Q4_K_XL (experimental) escreve só 7 a 8,5 tokens/s num PC com 64 GB, porque lê boa parte do SSD.
- AMD no Windows ainda não lê imagens (no Linux lê pelo processador).
- Licença: o Strata é MIT, mas algumas partes e cada modelo têm licença própria (o Hugging Face marca o Qwen3.8-Flash-Next como "other"). Confira antes de uso comercial.
Créditos
Modelo: Qwen3.8-Flash-Next, do time Qwen. Compressões: ISTA-DASLab, UkisAI (Swift 1.5) e Unsloth. O Strata usa partes do llama.cpp / ggml. Repositório: https://github.com/Niko1221/Strata
Quer o repositório e o passo a passo?
Comente STRATA no post para receber o link do Strata e este guia completo no direct.
Veja também
Todos os artigos →Text-to-CAD: como gerar peças 3D com Claude Code, Codex e Cursor
O text-to-cad transforma pedidos em linguagem natural ou imagens em peças 3D e exporta o resultado para STEP, STL, 3MF e GLB. Veja como instalar o plugin, fazer o primeiro pedido e contornar o bloqueio do Windows 11.
Caveman: como reduzir tokens no Claude Code, Codex e Cursor
O Caveman combina uma skill que encurta as respostas do agente com um proxy que comprime o que ele lê. Veja como instalar, medir na sua própria sessão, revisar a telemetria e decidir se a economia faz sentido para o seu uso.
DeepSeek Harness: o que é, como usar e os riscos que você precisa conhecer
O DeepSeek Harness é um agente open source em que tudo funciona como plugin e agora tem aplicativo para Windows e macOS. Veja como testar pelo navegador, onde ele roda e por que a segurança precisa vir antes da primeira execução.