A IA ficou 14 vezes mais rápida esta semana. Por que isso vale mais que ficar mais inteligente

17 de agosto de 2026 · 5 min de leitura · por Pyxia

Em 13 de agosto de 2026, a Cerebras anunciou que passou a rodar o GPT-5.6 Sol, o modelo mais capaz da OpenAI, a até 750 tokens de saída por segundo. Segundo o próprio anúncio, isso é até 14 vezes mais rápido que o processamento padrão do mesmo modelo. Mesma inteligência, mesma resposta, catorze vezes menos espera.

Não foi o único anúncio da semana com esse cheiro. No mesmo dia, o Google lançou o Gemini 3.7 Flash cobrando metade do preço da versão anterior. Nenhum dos dois vendeu "o modelo mais inteligente do mundo". Os dois venderam velocidade e custo.

Para quem toca uma empresa, essa mudança de assunto é a notícia. Ela diz que a indústria parou de brigar por benchmark e começou a brigar pela variável que aparece no seu caixa.

O que foi anunciado, em dois dias

OpenAI e Cerebras, 13 de agosto. Um novo nível de serviço chamado Ultrafast, disponível primeiro na API e por enquanto em prévia limitada para um grupo selecionado de clientes. Nos números divulgados pelas duas empresas, um teste com 2.500 perguntas de um benchmark difícil (o Humanity's Last Exam) caiu de 78 horas para pouco mais de 11 horas. Preço: não divulgado. Data de abertura geral: também não.

Google, 13 de agosto. O Gemini 3.7 Flash entrou a US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de saída, metade do valor do 3.6 Flash, lançado apenas três semanas antes. Tem letra miúda: o preço promocional vale até 31 de dezembro de 2026 e dobra em janeiro de 2027. Junto vieram ganhos de desempenho em código e leitura de documentos densos.

DeepSeek. O V4-Pro chegou com níveis ajustáveis de "raciocínio" e preços até 50% menores fora dos horários de pico. Esse último dado apareceu em fonte única no nosso levantamento, então trate como relato, não como tabela fechada.

Vale registrar quem foi convidado a testar o Ultrafast primeiro. A lista citada no anúncio inclui uma mesa proprietária de investimentos, uma empresa de análise financeira e a Podium, que faz justamente gestão de mensagens para negócios locais. Não é uma lista de laboratórios de pesquisa. É uma lista de gente que perde dinheiro quando a resposta demora.

Por que a disputa mudou de assunto

Existe um limite prático que quem vende software conhece bem: acima de alguns segundos de espera, o usuário sai. Não importa se a resposta que ia chegar era excelente.

Enquanto a IA era usada para tarefas de bancada (escrever um texto, analisar um relatório, gerar um relatório à noite), a lentidão era tolerável. Você mandava e ia tomar café. Agora a IA está sendo colocada dentro de conversas ao vivo, dentro de fluxos de atendimento, dentro de agentes que executam vários passos seguidos. E aí o cálculo inverte.

Um agente que dá dez passos para resolver um pedido não gasta o tempo de uma resposta. Gasta dez. Se cada passo leva oito segundos, o cliente esperou mais de um minuto olhando "digitando...". Se cada passo leva um segundo, ele nem percebeu que havia dez passos.

Há um sinal de mercado na mesma direção. Um levantamento de consumo corporativo de IA divulgado em agosto (o Ramp AI Index, que vimos citado em uma fonte só, então fica como indício) mostra empresas concentrando gasto nos modelos de melhor relação entre custo e escala, não nos de inteligência máxima. Quem paga a fatura já está escolhendo o suficiente e rápido em vez do brilhante e lento.

O que isso significa para o seu negócio

1. Tempo de resposta é variável comercial, não detalhe técnico. Se você atende por WhatsApp, o número que decide venda não é a nota do modelo em prova de matemática. É quantos segundos o cliente espera. No atendente que operamos em produção, o custo fica em torno de R$ 0,39 por conversa, e o que converte não é o custo: é responder na hora, inclusive às 22h de um sábado. Coloque tempo de resposta no seu painel, ao lado de custo por conversa. Se ninguém mede, ninguém melhora.

2. Modelo caro para tudo é desperdício em dobro. Responder "que horas vocês abrem" com o modelo mais poderoso disponível é lento e caro ao mesmo tempo. A arquitetura que funciona usa modelo barato e rápido para o volume (classificar mensagem, responder dúvida simples, consultar agenda) e reserva o modelo pesado para o que é raro e delicado (analisar um contrato, escrever uma proposta). Quem faz essa separação normalmente derruba tanto a fatura quanto a espera.

3. Preço promocional tem data de validade. Coloque no calendário. O Gemini 3.7 Flash dobra de preço em janeiro de 2027. Se você dimensionar uma automação com o preço de agosto de 2026 e não olhar mais, vai levar um susto na virada do ano. Anote a data de reajuste de cada serviço que você usa e, mais importante, construa de um jeito que permita trocar o modelo sem refazer o sistema.

4. Prévia limitada não é produto. O Ultrafast está em preview fechado, sem preço público e sem data. Isso é normal e é a fase certa para acompanhar de longe. Enquanto isso, a velocidade que você pode ter hoje vem de escolhas mais chatas e mais eficazes: modelo adequado à tarefa, menos idas e voltas no fluxo, respostas curtas em vez de textões, e dados internos organizados para a IA não precisar procurar.

Nossa opinião

A parte boa dessa virada é que ela empurra a indústria para o lado que interessa a quem tem loja, clínica ou escritório para tocar. Inteligência de modelo, no patamar atual, já resolve a esmagadora maioria das tarefas de uma PME. O que ainda estraga a experiência é a espera, e é isso que ficou barato de resolver nesta semana.

A parte que continua igual: nada disso funciona sem processo. Um atendimento que responde em um segundo com a informação errada perde o cliente mais rápido do que antes. Velocidade multiplica o que já existe, para o bem e para o mal.

Na Pyxia a gente mede tempo de resposta e custo por conversa desde o primeiro dia no ar, porque esses dois números contam a mesma história por ângulos diferentes. Se você está avaliando IA no seu negócio, comece por eles em vez de comparar tabelas de benchmark. A tabela muda toda semana. O cliente impaciente é o mesmo desde sempre.

Quer isso funcionando no seu negócio?

Diagnóstico gratuito de 30 minutos: a gente olha seu processo e aponta onde IA e automação dão retorno primeiro, sem compromisso.

Falar com a Pyxia no WhatsApp

← Voltar para o blog