Claude Haiku 5.5: o que muda e como ler seus benchmarks

Redação ConverteArq · Conteúdo elaborado com assistência de IA. Sínteses em português e comentário editorial próprio, com fontes identificadas. Método editorial.

Modelos de IA · Anúncio em 7 de outubro de 2026

Novo modelo da Anthropic, anunciado em 7 de outubro. Veja o recorte do OSWorld 2.1 e um roteiro para avaliar o impacto na sua tarefa.

Claude Haiku 5.5. O anúncio, o teste e a decisão são etapas diferentes.
Esquema conceitual criado para esta matéria; não é uma fotografia nem uma tela do produto. Crédito: ConverteArq · Ilustração original.

O lançamento em português

A Anthropic apresentou o Claude Haiku 5.5 em 7 de outubro de 2026, direcionado a tarefas de alto volume e sensíveis a custo. O identificador anunciado na API é claude-haiku-5-5. Esta matéria traduz o essencial do anúncio e comenta seus usos; não executamos o modelo. A fonte oficial está ao final.

O que os números abaixo mostram

Escolhemos uma única linha da tabela oficial: OSWorld 2.1, no subconjunto offline. Os três resultados vêm da mesma apresentação da Anthropic. Esse recorte evita juntar números de versões distintas, mas não transforma a divulgação de um fabricante em verificação independente. É uma fotografia do anúncio, não um ranking universal de inteligência.

Uma avaliação que você pode reproduzir

Nossa proposta é começar com dez pedidos fictícios de escopo pequeno. Por exemplo: classificar um texto, localizar uma data explícita e listar campos ausentes. Guarde uma resposta esperada antes de abrir o serviço. Faça o mesmo pedido mais de uma vez, porque uma resposta isolada pode esconder variação. Não considere a aparência da resposta como sinal de acerto.

  • Registre a versão exata do modelo e a configuração escolhida.
  • Separe tempo de geração de tempo de correção.
  • Conte respostas incorretas e pedidos em que o modelo deveria ter admitido incerteza.
  • Anote custo observado e tamanho das entradas, sem projetar um caso pequeno para todos os usos.

Quando uma troca de modelo faz sentido

Pense em uma fila de tarefas como um conjunto de decisões, cada uma com um custo de erro. Um título de rascunho pode tolerar ajustes; um campo que aciona uma operação merece um critério mais rigoroso. Defina primeiro o que acontece quando a resposta falha. Uma opção é encaminhar casos ambíguos para revisão em vez de forçar uma classificação. Este roteiro é uma sugestão do ConverteArq e não uma capacidade adicional anunciada pelo fornecedor.

Benchmark com contexto

OSWorld · 2.1 — subconjunto offline — Subconjunto offline indicado na tabela do anúncio de 7 de outubro de 2026.

Origem: Anthropic, no anúncio do Haiku 5.5. Resultados reportados pelo fabricante; não são testes independentes do ConverteArq.

OSWorld 2.1 — subconjunto offline — Taxa de sucesso (%); maior é melhor neste teste
ModeloResultado reportado
Claude Haiku 5.572,4%
Claude Haiku 4.515,7%
GPT-6 Luna48,9%

Os números foram transcritos da divulgação da Anthropic. Não misture este subconjunto com resultados do OSWorld completo nem com outra versão do teste. Confira o relatório e a metodologia.

Como interpretar benchmarks sem misturar escalas e versões.

Comentário do ConverteArq

Nossa leitura é que a oportunidade interessante está em diminuir o trabalho de tarefas bem delimitadas. Para avaliar isso, recomendamos calcular o custo por resultado aceito, incluindo revisão. Se dois modelos respondem a cem pedidos, mas um exige corrigir vinte respostas e o outro cinco, o preço por token sozinho não descreve o esforço. Esse raciocínio não permite prever a qualidade do Haiku no seu caso; ele ajuda a construir um teste que responde à pergunta certa antes de mudar o fluxo.

Também evitaríamos usar o gráfico como um placar entre marcas. O modelo com maior resultado neste recorte pode ter uma combinação de custo, acesso e configuração diferente. A decisão prática deve considerar o que você precisa entregar em português e quais erros consegue detectar. O ganho útil aparece quando a tarefa termina com menos esforço total e resultado conferível, não quando uma única barra fica maior.

Fontes consultadas

Conferência em 9 de outubro de 2026. Os links sustentam os fatos; a seção de comentário apresenta nossa interpretação. Nomes de modelos e de testes são mantidos no original para facilitar a conferência.