Qwen3.8-27B: uma GPU de 24GB de consumo frente à tabela de código do Opus 4.6

Denso 27.78B Apache-2.0. Q4 ~17GB cabe em 24GB de consumo. Listing principal OpenRouter $0.45/$3.20. Tabela Qwen (autoavaliação): SWE-bench Pro 61.7 vs 53.4 importado do Opus 4.6 Max; Terminal-Bench 73.0 vs 78.2. 100K+20K: local ~$0, hosted ~$0.11, Opus $1.00. Não é benchmark independente.

Tabela de lançamento Qwen: 3.8-27B vs 3.6-27B, 3.7-Plus, Opus 4.6 Max Ampliar imagem
Autoavaliação. A célula Opus de SWE-Pro é nota oficial importada, não uma repetição no mesmo harness.

O que é, e por que esta tabela importa

Qwen3.8-27B são pesos densos multimodais Apache-2.0 de 2026-08-14: 27.781.427.952 parâmetros, contexto nativo 262K. Não é Qwen3-8B nem o API-only Qwen3.8-Max.

O choque é o limiar. Um Q4_K_M de terceiros (~17,1GB) cabe numa GPU de 24GB de consumo: um agente de código esta noite, na secretária. O comparador é Claude Opus 4.6: listing principal OpenRouter $5/$25, sem pesos para download.

As quatro barras vêm da tabela da Qwen. 3.8-27B supera Opus 4.6 Max em SWE-Pro, LiveCodeBench e OSWorld; perde 5,2 em Terminal-Bench. É marketing, não reprodução independente — e continua a ser a comparação a pregar.

Tabela de especificações

Primeiro os números verificáveis. As quatro colunas vêm do catálogo e do listing principal do OpenRouter (`qwen/qwen3.8-27b` agora a $0.45/$3.20).

3.8-27B 3.6-27B 3.8-Max Opus 4.6
Released 2026-08-14 (HF) catalog first_seen 2026-06-22 catalog first_seen 2026-08-04 in catalog
Params 27.78B dense ~27.8B dense flagship 3.8 API frontier API
Weights Apache-2.0 download Apache-2.0 + API API only API only
Context 262K native / 1M YaRN 262K Melhor nesta comparação 1M Melhor nesta comparação 1M
Modality text+image+video→text text+image+video→text text+image+video→text multimodal API
OpenRouter $/1M $0.45 / $3.20 Melhor nesta comparação $0.289 / $2.40 $2.00 / $6.00 $5.00 / $25.00

O decoder publicado de 3.8-27B e 3.6-27B é quase o mesmo (64 camadas híbridas, hidden 5120). O salto de código é treino, não um esqueleto novo. Max e Opus são outra linha: 1M alojado, pago por token, os pesos nunca ficam consigo. 3.8-27B tem os dois: download local ou API alojada com os mesmos pesos.

O mesmo trabalho: local ~$0, hosted ~$0.11, Opus $1

Custo em USD de 100K entrada + 20K saída Ampliar imagem
Listing principal OpenRouter. Local 3.8-27B: só eletricidade; hosted mesmos pesos ~$0.11.

Cenário fixo 100K+20K. Não é capacidade: é a quem pagas o mesmo trabalho de tokens.

Model In $/1M Out $/1M 100K+20K Role
3.8-27B local Melhor nesta comparação ~$0 (electricity) 24GB Q4 desk
Qwen3 Coder 30B A3B Melhor nesta comparação $0.07 Melhor nesta comparação $0.27 $0.012 cheap code API
Qwen3 Coder 480B $0.30 $1.00 $0.050 hosted code flagship
Qwen3.6-27B API $0.289 $2.40 $0.077 same-size predecessor
Qwen3.8-27B API $0.45 $3.20 $0.109 same weights, hosted
Qwen3.8-Max $2.00 $6.00 $0.32 same-gen cloud flagship
Claude Opus 4.6 $5.00 $25.00 $1.00 frontier coding API
GPT-5.6 Sol $5.00 $30.00 $1.10 OpenAI coding flagship

Opus 4.6 e GPT-5.6 Sol: ~$1. Max da mesma geração: ~$0.32. 3.8-27B hosted: ~$0.11 (um pouco acima do predecessor 3.6-27B a $0.077). Coder carro-chefe alojado: ~$0.05. Os mesmos pesos na tua GPU de 24GB: sticker de token zero — pagas luz e depreciação. DeepSeek V4 Flash 0731 é o outro extremo: MoE 284B a $0.09/$0.18, barato, não cabe numa GPU de consumo.

Coding: contra o Opus 4.6, não só contra a família

A tabela de lançamento da Qwen põe 3.8-27B, o predecessor 3.6-27B, o Plus alojado e Claude Opus 4.6 Max na mesma folha. Autoavaliação; várias linhas com Claude Code; a célula Opus de SWE-Pro é oficial importada (*); QwenSWEBench é interno.

Benchmark 3.8-27B 3.6-27B 3.7-Plus Opus 4.6 Max
Terminal-Bench 2.1 73.0 63.4 64.0 Melhor nesta comparação 78.2
SWE-bench Pro* Melhor nesta comparação 61.7 53.5 57.6 53.4
LiveCodeBench v6 Melhor nesta comparação 90.3 83.9 89.6 88.8
OSWorld-Verified Melhor nesta comparação 84.3 63.9 73.3 72.7
QwenSWEBench Melhor nesta comparação 79.0 49.3 59.2 63.8
DeepSWE 1.1 Melhor nesta comparação 42.2 13.3 14.2
NL2Repo-Bench 42.3 36.2 41.1 Melhor nesta comparação 47.6
GPQA Diamond 89.2 87.8 90.3 Melhor nesta comparação 91.3

Leitura frente à primeira linha: vs Opus 4.6, o 27B ganha ou empata por cima em SWE-Pro, LiveCodeBench, OSWorld e QwenSWEBench; perde Terminal-Bench, NL2Repo e GPQA. Vs 3.6-27B o salto de agente é um corte (DeepSWE 13.3→42.2). Vs Plus, o denso 27B não cai na maioria das linhas de código — e o Plus paga-se por token.

Não está Coder 480B nem GPT-5.6 Sol no mesmo harness. Não transforme 61.7 em «ganhou toda a fronteira». Decida: UI com capturas e repo privado → 3.8-27B em 24GB finalmente parece quase primeira linha. SLA e 1M alojado → continue a pagar Opus / Sol / Max.

Hardware de entrada: esta noite, não «um dia»

Pegada de pesos vs a linha de 24GB de consumo Ampliar imagem
Só pesos. KV à parte. Q4 é Unsloth de terceiros. ~149GB do V4 Flash é o serving público.

«Consegue correr» é pouco. A frase exacta: uma GPU de 24GB de consumo (classe 4090) carrega um 4bit de terceiros esta noite e serve de agente de código a 8K–32K. O Opus 4.6 não se «carrega»: não te dá os pesos. Coder 480B / V4 Flash não cabem nessa caixa.

Rig Fits Context to start What you get What you give up
24GB consumer GPU Q4_K_M ~17.1GB* 8K–32K Coding agent tonight Opus never leaves the API
32–48GB workstation FP8 30.9GB 32K–64K Less quant damage Still no download for Opus
80GB-class card BF16 55.6GB native 262K is tight Need KV budget (~16GiB @262K) API still simpler
No local GPU n/a 262K–1M hosted Pay OpenRouter 3.8-27B $0.45/$3.20; Max $2/$6; Opus $5/$25

Não solde «cabe em 17GB» com «suporta 262K». O KV de atenção plena a 262K BF16 baixa ~16GiB (só 16 camadas). A 24GB, a janela cheia mata VRAM antes da capacidade. Protocolo de entrada: 8K–32K, sem YaRN 1M, os mesmos testes de reparação de repo. Confortável: FP8 em 48GB. BF16 a 262K cheio: classe 80GB.

É este o limiar baixo: o API de primeira linha custa $5/$25 e nunca se descarrega. Este 27B senta-se numa GPU de jogos. A quantização fere o reasoning — o choque é poder começar, não igualar o Opus.

Ranking do site: proxy, não esta tabela de código

O ranking composto do site premia contexto longo e preço baixo, não SWE. Neste snapshot 3.8-27B (já com $0.45/$3.20), 3.6-27B, 3.8-Max e Opus 4.6 não sobem por «codificar bem»: 262K a preço médio não ganha o slot Flash de 1M.

On-site unified slot Model Why it ranks
#21 Qwen3.7-Flash 1M ctx + $0.03/$0.13
#93 Qwen3.5-Flash 1M + cheap
#97 Qwen3 Coder Flash 1M code API, still cheap
#100 Qwen3.7-Plus 1M, $0.32/$1.28
not on board 3.8-27B / Opus 4.6 listing ≠ 1M-cheap Flash slot / frontier sticker

HF Hot mantém Qwen3.6-27B oficial em sort_index=45 (~6.895.121 downloads). 3.8-27B não está. O composto não sobe por um 61.7 de SWE. Não é um benchmark de capacidade.

Quando escolher o 27B e quando continuar a pagar o Opus

Escolha 3.8-27B: tem uma GPU de 24GB, o repo não sai, precisa de ver ecrãs, aceita a tabela do vendor. Contraste com 3.6-27B nos mesmos testes; meça o Q4. Sem GPU, use OpenRouter `qwen/qwen3.8-27b` ($0.45/$3.20, ~$0.11 o mesmo job) — uma ordem de magnitude mais barato que Opus, ainda mais caro que Coder pequeno.

Continue a pagar Opus 4.6 / GPT-5.6 Sol: SLA, 1M alojado, sem GPU, sem engolir o risco de notas importadas. Pague Max: carro-chefe Qwen da mesma geração mais barato que Opus ($2/$6 vs $5/$25). Pague Coder 480B: só texto e API 262K pronta.

Não o tome como «o 27B API mais barato» — o predecessor 3.6-27B e Coder 30B são mais baratos. Não transforme o arranque de 24GB em 262K cheio. Decida com Token, compare e a página do modelo.

Insights