Publicado em 07 de outubro de 2026· 4 min de leitura

    Anthropic lança Claude Haiku 5.5 na AWS com custo 75% menor que o Haiku 4.5

    Capa do post sobre o lançamento do Claude Haiku 5.5 na AWS, com o título em branco sobre fundo navy e uma malha de nós conectados em tons de dourado

    Claude Haiku 5.5 chega ao Amazon Bedrock e ao Claude Platform on AWS custando, segundo a Anthropic, cerca de 75% menos que o Haiku 4.5 na maioria das tarefas. A AWS o apresenta como o modelo mais rápido e eficiente da família Claude 5.5, direcionado a subagentes e cargas de alto volume sensíveis a custo.

    O anúncio combina duas formas de consumo dentro da AWS, mas elas não são equivalentes. O Amazon Bedrock integra o modelo à infraestrutura e aos controles da nuvem, enquanto o Claude Platform on AWS oferece a experiência nativa da Anthropic com autenticação e cobrança unificadas pela AWS.

    O que muda no Haiku 5.5

    O Haiku 5.5 é o primeiro modelo da linha Haiku com controles de esforço. Em vez de escolher uma configuração única para toda a aplicação, a equipe pode ajustar o equilíbrio entre custo e capacidade de raciocínio conforme cada tarefa.

    De acordo com o anúncio da AWS, o modelo evoluiu em programação, uso de ferramentas, interação com computadores e tarefas agênticas. Também aceita imagens de alta resolução e pode executar alterações pequenas e específicas em múltiplos arquivos.

    A AWS posiciona o modelo para classificação, sumarização, geração de texto, consulta rápida a bases de conhecimento e extração de informações de documentos pequenos e médios. Outro uso proposto é como subagente para rotear solicitações, revisar código ou executar tarefas repetitivas em navegador e desktop.

    Interpretação editorial: o avanço mais relevante para arquitetura não é apenas um modelo mais barato. O controle de esforço permite tratar inferência como uma decisão por operação: solicitações simples podem usar menos computação, enquanto etapas com maior ambiguidade recebem mais capacidade.

    Bedrock ou plataforma nativa

    No Amazon Bedrock, os dados permanecem na infraestrutura da AWS, com residência regional. O serviço funciona com IAM para acesso, AWS CloudTrail para auditoria, Amazon CloudWatch para monitoramento e Amazon Bedrock Guardrails. O consumo aparece na própria fatura da AWS.

    Já o Claude Platform on AWS fornece acesso à experiência nativa da Anthropic pelo AWS Management Console. Segundo a AWS, são as mesmas APIs, funcionalidades e experiência de console oferecidas diretamente pela Anthropic, mas integradas à autenticação e ao faturamento da AWS.

    Na prática, o Bedrock tende a reduzir o número de integrações de segurança e observabilidade em ambientes que já usam esses controles. A plataforma nativa, por sua vez, preserva a interface da Anthropic. A escolha deve considerar governança, portabilidade e operação, não apenas a capacidade do modelo.

    Como chamar pelo Bedrock

    O Haiku 5.5 pode ser usado pelo Playground do Amazon Bedrock ou programaticamente pelas APIs InvokeModel e Converse. A AWS também permite chamar a Anthropic Messages API contra o bedrock-runtime.

    Este é o exemplo oficial reduzido com Boto3:

    import boto3
    import json
    
    bedrock_runtime = boto3.client(
        service_name="bedrock-runtime",
        region_name="us-east-1"
    )
    
    response = bedrock_runtime.invoke_model(
        modelId="global.anthropic.claude-haiku-5-5",
        contentType="application/json",
        accept="application/json",
        body=json.dumps({
            "anthropic_version": "bedrock-2023-05-31",
            "max_tokens": 4096,
            "messages": [{
                "role": "user",
                "content": "Can you explain the features of Amazon Bedrock?"
            }]
        })
    )
    
    result = json.loads(response["body"].read())
    print(next(
        block["text"]
        for block in result["content"]
        if block["type"] == "text"
    ))
    

    A seleção por tipo é importante porque o modelo pode devolver um bloco de raciocínio antes do bloco de texto. Código que pressupõe a resposta textual em uma posição fixa do array pode extrair o conteúdo errado ou falhar.

    Os pré-requisitos informados incluem conta AWS com acesso ao Bedrock, Boto3, AWS CLI configurada e as permissões bedrock:InvokeModel e bedrock:InvokeModelWithResponseStream.

    Custo exige medição própria

    A redução de 75% é apresentada pela AWS como válida para a maioria das tarefas, mas o comunicado não fornece uma tabela completa de preços do Bedrock. Portanto, esse percentual não deve ser convertido diretamente em uma previsão de fatura sem considerar tokens, esforço e padrão de uso.

    Em uma análise independente, Simon Willison relata preços da plataforma de US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de saída até 100 mil tokens. Acima desse limite, os valores informados sobem cinco vezes, para US$ 0,50 e US$ 2,50. Esses números não devem ser tratados automaticamente como preços do Amazon Bedrock.

    Willison também mediu aproximadamente 1,25 vez mais tokens para o mesmo prompt em comparação com o Haiku 4.5. É um teste independente, não uma garantia geral, mas expõe uma limitação importante: preço nominal por token não determina sozinho o custo por tarefa.

    Onde o modelo faz sentido

    A arquitetura sugerida pela AWS coloca Claude Opus 5.5 no planejamento e nas decisões difíceis, enquanto o Haiku 5.5 executa tarefas bem definidas em paralelo. Isso pode reduzir custo e latência, mas exige decomposição clara, critérios de aceite e controle sobre o volume de subagentes.

    Recomendação prática: antes da migração, rode um conjunto representativo de prompts e registre qualidade, latência, tokens de entrada e saída, nível de esforço e custo total. Inclua documentos próximos do limite operacional e valide o tratamento de múltiplos blocos na resposta.

    O Haiku 5.5 faz sentido para classificação, sumarização, roteamento e mudanças pequenas de código em escala. Não é uma substituição automática para modelos maiores quando a tarefa depende de julgamento complexo, análise longa ou revisão de segurança: nesses casos, o modelo rápido funciona melhor como camada executora do que como único decisor.

    Compartilhar:

    Leia também

    Fontes

    Maxwell Diniz
    Maxwell Diniz

    Fundador da DEVDINIZ

    Software em produção

    51 ferramentas gratuitas, direto no navegador

    Utilitários para CPF, CNPJ, JWT, JSON, regex, cores e mais. Processamento local, sem cadastro e sem conta — a mesma engenharia que sustenta o que escrevemos aqui.