←© 2026 Blainer Costa

Pedi a mesma interface para três gerações do Claude.

Mesmo prompt, zero referência visual, zero mão no design. Sonnet 4.6, Opus 4.8 e Fable 5 dentro do Pencil. Depois, uma auditoria de UI

Jun 11, 2026 · 5 min read

Ontem a Anthropic lançou o Claude Fable 5.

Hoje eu fiz o teste estressando as 3 versões: enviei o mesmo prompt de interface para três gerações do modelo, sem referência de tela, sem direção de arte, sem intervenção. Um app de streaming de games, gerado dentro do Pencil.

Sonnet 4.6 primeiro. Opus 4.8 depois. Fable 5 por último.

O que saiu disso diz mais sobre a evolução dos modelos do que qualquer gráfico da Anthropic de ontem.

Sonnet 4.6: um kit de componentes vestido de produto

O resultado do 4.6 é o que eu chamaria de competência genérica. Dark mode, acento roxo, cards arredondados, tabs com underline no estado ativo. Tudo no lugar onde um design system de mercado mandaria colocar.

A estrutura segue grid. Os espaçamentos respeitam múltiplos consistentes. A linha de stats do torneio, com times, premiação e dias restantes, é um padrão limpo e bem executado.

Minha a auditoria encontra o problema que sempre na abordagem genérica… Os dados.

O card de campeão mostra NightWolf com 12.400 pontos. A lista logo abaixo coloca ThunderBolt em primeiro com os mesmos 12.400, e NightWolf em segundo com 11.820. O herói da tela contradiz o ranking da própria tela. Bem zoado digamos…

Tem mais. As pílulas de pontuação estouram a margem direita e cortam o texto. Os avatares são círculos vazios, sem tratamento, escancarando o placeholder. E a cor codifica a mesma informação de dois jeitos: pontos em amarelo no card de destaque, pontos em roxo na lista.

Cor é uma função relevante para UI Design. Quando o mesmo dado muda de cor sem motivo, o sistema mente.

Meu veredito do 4.6: Ele monta componentes, não monta um produto.

Opus 4.8: ambição visual, execução que tropeça

O 4.8 dá um salto que ninguém esperaria de uma versão pontual: ele cria coisas relevantes e significativamente melhor que o 4.6.

O jogo fictício ganha ilustração própria, direção de cor coerente, identidade cyberpunk. A tela de stream abandona o layout de app convencional e simula um HUD de gameplay, com barras de vida no topo e chat sobreposto à cena. É uma decisão conceitual, zero relevância.

Mas conforme a ambição sobe, a precisão cai.

O campo de comentário atropela os números do HUD e a informação de bateria, três camadas de texto disputando o mesmo espaço. O chat branco sobre o cenário roxo claro falha contraste em metade das mensagens. O botão de play do card principal aparece cortado pela composição.

E os anéis coloridos nos avatares de quem está ao vivo, um roxo, um vermelho, um verde, não significam nada. O feed também mistura duas linguagens: o destaque é ilustrado, os cards de trending são fotográficos. Duas estéticas convivendo sem hierarquia que justifique.

Veredito do 4.8: pensa como diretor de arte, executa como estagiário com pressa. A visão está lá. O rigor sistêmico, não.

Fable 5: o primeiro que entrega um produto, não uma tela qualquer.

A diferença do Fable 5 não está em nenhum pixel isolado. Está no que conecta os pixels.

A tela de descoberta tem arquitetura de informação completa: saudação contextual, busca, filtros, destaque ao vivo, grid de lives, top players, próximas partidas. Não é uma tela bonita. É um fluxo de descoberta inteiro, mesmo sem contexto nenhum.

E aqui está o ponto que separa essa geração das anteriores: o modelo de conteúdo.

Handles reais (@NovaStrike, @PixelFox). Selo de verificado. Contagem de seguidores. Métricas de sessão com viewers, tempo de live e likes na mesma linha de stats, repetindo o padrão com consistência. Tags funcionais de FPS, ranked, idioma e interatividade.

O Fable 5 não desenhou uma interface. Ele simulou um produto que existe, com as entranhas de dados que um produto real teria.

Mas minha auditoria não passa pano.

Dois CTAs primários com cores diferentes na mesma tela: Follow em roxo, Watch Stream em rosa. Dá para defender que o rosa codifica “ao vivo”, já que acompanha o badge de live.

O chat entrega o placeholder mais revelador dos três testes: Jacob Jones, Brooklyn Simmons, Kristin Watson. Nomes civis de kit do Figma dentro de um universo onde todo mundo se chama NovaStrike. O modelo construiu um mundo coerente e deixou três turistas entrarem.

E um card truncado no meio da frase, sem tratamento de overflow.

Veredito do Fable 5: o primeiro resultado que sobreviveria a uma reunião de produto. Com ressalvas em ata.

Benchmark table titled Mythos 5 & Fable 5, comparing Claude Mythos 5 and Fable 5 against Claude Mythos Preview, Claude Opus 4.8, GPT 5.5, and Gemini 3.1 Pro.

Porém, um ponto final:

É caro pra cacete! Hahahaha. Ainda assim, evoluiu absurdamente e está cada vez melhor. Para uma necessidade global, onde o conceito de belo na mente das pessoas não é tão refinado quanto na mente de um UI Designer, está perfeito.

O padrão entre as três gerações

Coloca os três lado a lado e a evolução fica nítida. E ela não é somente estética.

O 4.6 entende componentes. O 4.8 entende atmosfera. O Fable 5 entende contexto: como as telas se relacionam, que dados habitam cada elemento, qual história o produto conta.

A régua que subiu foi a de coerência sistêmica. Exatamente a camada que não aparece em screenshot e que separa um shot de Dribbble de um produto real.

Mas tem um segundo padrão, e esse é desconfortável.

Os três erram nas mesmas categorias: dados inventados que se contradizem, placeholders que vazam, cor sem função consistente. Diminuiu a frequência, não mudou a natureza. O Fable 5 erra menos vezes o mesmo tipo de erro.

O que isso muda para quem desenha

A leitura preguiçosa desse teste é “o Design acabou”. Não é o que os prints mostram.

O que os prints mostram é o Designer mudando de posição na linha. Antes da geração, escrevendo o prompt e o contexto. Depois da geração, auditando o que a máquina não enxerga: contradição de dados, função da cor, estados, contraste, conteúdo que quebra o universo.

O Fable 5 entrega 80% em minutos. Mas os 20% restantes são exatamente os que separam demo de produto. E na real… Ninguém paga por demo.

Quem vai auditar o que ele desenha quando todo mundo estiver gerando interface em escala? Este é uma dor que já enfrentamos na operação e que talvez você Designer do Futuro também vai enfrentar (Mais rápido do que você imagina).

Mas essa é outra conversa, e merece um artigo próprio.


Teste feito no Pencil com Claude Sonnet 4.6, Opus 4.8 e Fable 5, lançado ontem pela Anthropic. Anúncio oficial: anthropic.com/news/claude-fable-5-mythos-5

Get the next article by email

Originally published onSubstack →