Qwen3.8-27B: uma GPU de 24GB de consumo frente à tabela de código do Opus 4.6
Denso 27.78B Apache-2.0. Q4 ~17GB cabe em 24GB de consumo. Listing principal OpenRouter $0.45/$3.20. Tabela Qwen (autoavaliação): SWE-bench Pro 61.7 vs 53.4 importado do Opus 4.6 Max; Terminal-Bench 73.0 vs 78.2. 100K+20K: local ~$0, hosted ~$0.11, Opus $1.00. Não é benchmark independente.
Ampliar imagem O que é, e por que esta tabela importa
Qwen3.8-27B são pesos densos multimodais Apache-2.0 de 2026-08-14: 27.781.427.952 parâmetros, contexto nativo 262K. Não é Qwen3-8B nem o API-only Qwen3.8-Max.
O choque é o limiar. Um Q4_K_M de terceiros (~17,1GB) cabe numa GPU de 24GB de consumo: um agente de código esta noite, na secretária. O comparador é Claude Opus 4.6: listing principal OpenRouter $5/$25, sem pesos para download.
As quatro barras vêm da tabela da Qwen. 3.8-27B supera Opus 4.6 Max em SWE-Pro, LiveCodeBench e OSWorld; perde 5,2 em Terminal-Bench. É marketing, não reprodução independente — e continua a ser a comparação a pregar.
Tabela de especificações
Primeiro os números verificáveis. As quatro colunas vêm do catálogo e do listing principal do OpenRouter (`qwen/qwen3.8-27b` agora a $0.45/$3.20).
| 3.8-27B | 3.6-27B | 3.8-Max | Opus 4.6 | |
|---|---|---|---|---|
| Released | 2026-08-14 (HF) | catalog first_seen 2026-06-22 | catalog first_seen 2026-08-04 | in catalog |
| Params | 27.78B dense | ~27.8B dense | flagship 3.8 API | frontier API |
| Weights | Apache-2.0 download | Apache-2.0 + API | API only | API only |
| Context | 262K native / 1M YaRN | 262K | Melhor nesta comparação 1M | Melhor nesta comparação 1M |
| Modality | text+image+video→text | text+image+video→text | text+image+video→text | multimodal API |
| OpenRouter $/1M | $0.45 / $3.20 | Melhor nesta comparação $0.289 / $2.40 | $2.00 / $6.00 | $5.00 / $25.00 |
O decoder publicado de 3.8-27B e 3.6-27B é quase o mesmo (64 camadas híbridas, hidden 5120). O salto de código é treino, não um esqueleto novo. Max e Opus são outra linha: 1M alojado, pago por token, os pesos nunca ficam consigo. 3.8-27B tem os dois: download local ou API alojada com os mesmos pesos.
O mesmo trabalho: local ~$0, hosted ~$0.11, Opus $1
Ampliar imagem Cenário fixo 100K+20K. Não é capacidade: é a quem pagas o mesmo trabalho de tokens.
| Model | In $/1M | Out $/1M | 100K+20K | Role |
|---|---|---|---|---|
| 3.8-27B local | — | — | Melhor nesta comparação ~$0 (electricity) | 24GB Q4 desk |
| Qwen3 Coder 30B A3B | Melhor nesta comparação $0.07 | Melhor nesta comparação $0.27 | $0.012 | cheap code API |
| Qwen3 Coder 480B | $0.30 | $1.00 | $0.050 | hosted code flagship |
| Qwen3.6-27B API | $0.289 | $2.40 | $0.077 | same-size predecessor |
| Qwen3.8-27B API | $0.45 | $3.20 | $0.109 | same weights, hosted |
| Qwen3.8-Max | $2.00 | $6.00 | $0.32 | same-gen cloud flagship |
| Claude Opus 4.6 | $5.00 | $25.00 | $1.00 | frontier coding API |
| GPT-5.6 Sol | $5.00 | $30.00 | $1.10 | OpenAI coding flagship |
Opus 4.6 e GPT-5.6 Sol: ~$1. Max da mesma geração: ~$0.32. 3.8-27B hosted: ~$0.11 (um pouco acima do predecessor 3.6-27B a $0.077). Coder carro-chefe alojado: ~$0.05. Os mesmos pesos na tua GPU de 24GB: sticker de token zero — pagas luz e depreciação. DeepSeek V4 Flash 0731 é o outro extremo: MoE 284B a $0.09/$0.18, barato, não cabe numa GPU de consumo.
Coding: contra o Opus 4.6, não só contra a família
A tabela de lançamento da Qwen põe 3.8-27B, o predecessor 3.6-27B, o Plus alojado e Claude Opus 4.6 Max na mesma folha. Autoavaliação; várias linhas com Claude Code; a célula Opus de SWE-Pro é oficial importada (*); QwenSWEBench é interno.
| Benchmark | 3.8-27B | 3.6-27B | 3.7-Plus | Opus 4.6 Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 73.0 | 63.4 | 64.0 | Melhor nesta comparação 78.2 |
| SWE-bench Pro* | Melhor nesta comparação 61.7 | 53.5 | 57.6 | 53.4 |
| LiveCodeBench v6 | Melhor nesta comparação 90.3 | 83.9 | 89.6 | 88.8 |
| OSWorld-Verified | Melhor nesta comparação 84.3 | 63.9 | 73.3 | 72.7 |
| QwenSWEBench | Melhor nesta comparação 79.0 | 49.3 | 59.2 | 63.8 |
| DeepSWE 1.1 | Melhor nesta comparação 42.2 | 13.3 | 14.2 | — |
| NL2Repo-Bench | 42.3 | 36.2 | 41.1 | Melhor nesta comparação 47.6 |
| GPQA Diamond | 89.2 | 87.8 | 90.3 | Melhor nesta comparação 91.3 |
Leitura frente à primeira linha: vs Opus 4.6, o 27B ganha ou empata por cima em SWE-Pro, LiveCodeBench, OSWorld e QwenSWEBench; perde Terminal-Bench, NL2Repo e GPQA. Vs 3.6-27B o salto de agente é um corte (DeepSWE 13.3→42.2). Vs Plus, o denso 27B não cai na maioria das linhas de código — e o Plus paga-se por token.
Não está Coder 480B nem GPT-5.6 Sol no mesmo harness. Não transforme 61.7 em «ganhou toda a fronteira». Decida: UI com capturas e repo privado → 3.8-27B em 24GB finalmente parece quase primeira linha. SLA e 1M alojado → continue a pagar Opus / Sol / Max.
Hardware de entrada: esta noite, não «um dia»
Ampliar imagem «Consegue correr» é pouco. A frase exacta: uma GPU de 24GB de consumo (classe 4090) carrega um 4bit de terceiros esta noite e serve de agente de código a 8K–32K. O Opus 4.6 não se «carrega»: não te dá os pesos. Coder 480B / V4 Flash não cabem nessa caixa.
| Rig | Fits | Context to start | What you get | What you give up |
|---|---|---|---|---|
| 24GB consumer GPU | Q4_K_M ~17.1GB* | 8K–32K | Coding agent tonight | Opus never leaves the API |
| 32–48GB workstation | FP8 30.9GB | 32K–64K | Less quant damage | Still no download for Opus |
| 80GB-class card | BF16 55.6GB | native 262K is tight | Need KV budget (~16GiB @262K) | API still simpler |
| No local GPU | n/a | 262K–1M hosted | Pay OpenRouter | 3.8-27B $0.45/$3.20; Max $2/$6; Opus $5/$25 |
Não solde «cabe em 17GB» com «suporta 262K». O KV de atenção plena a 262K BF16 baixa ~16GiB (só 16 camadas). A 24GB, a janela cheia mata VRAM antes da capacidade. Protocolo de entrada: 8K–32K, sem YaRN 1M, os mesmos testes de reparação de repo. Confortável: FP8 em 48GB. BF16 a 262K cheio: classe 80GB.
É este o limiar baixo: o API de primeira linha custa $5/$25 e nunca se descarrega. Este 27B senta-se numa GPU de jogos. A quantização fere o reasoning — o choque é poder começar, não igualar o Opus.
Ranking do site: proxy, não esta tabela de código
O ranking composto do site premia contexto longo e preço baixo, não SWE. Neste snapshot 3.8-27B (já com $0.45/$3.20), 3.6-27B, 3.8-Max e Opus 4.6 não sobem por «codificar bem»: 262K a preço médio não ganha o slot Flash de 1M.
| On-site unified slot | Model | Why it ranks |
|---|---|---|
| #21 | Qwen3.7-Flash | 1M ctx + $0.03/$0.13 |
| #93 | Qwen3.5-Flash | 1M + cheap |
| #97 | Qwen3 Coder Flash | 1M code API, still cheap |
| #100 | Qwen3.7-Plus | 1M, $0.32/$1.28 |
| not on board | 3.8-27B / Opus 4.6 | listing ≠ 1M-cheap Flash slot / frontier sticker |
HF Hot mantém Qwen3.6-27B oficial em sort_index=45 (~6.895.121 downloads). 3.8-27B não está. O composto não sobe por um 61.7 de SWE. Não é um benchmark de capacidade.
Quando escolher o 27B e quando continuar a pagar o Opus
Escolha 3.8-27B: tem uma GPU de 24GB, o repo não sai, precisa de ver ecrãs, aceita a tabela do vendor. Contraste com 3.6-27B nos mesmos testes; meça o Q4. Sem GPU, use OpenRouter `qwen/qwen3.8-27b` ($0.45/$3.20, ~$0.11 o mesmo job) — uma ordem de magnitude mais barato que Opus, ainda mais caro que Coder pequeno.
Continue a pagar Opus 4.6 / GPT-5.6 Sol: SLA, 1M alojado, sem GPU, sem engolir o risco de notas importadas. Pague Max: carro-chefe Qwen da mesma geração mais barato que Opus ($2/$6 vs $5/$25). Pague Coder 480B: só texto e API 262K pronta.
Não o tome como «o 27B API mais barato» — o predecessor 3.6-27B e Coder 30B são mais baratos. Não transforme o arranque de 24GB em 262K cheio. Decida com Token, compare e a página do modelo.