A próxima disputa da inteligência artificial pode ser decidida menos pelo modelo e mais pelo computador que consegue executá-lo. Em uma matéria publicada em 30 de setembro, o TechCrunch destacou a participação de Andrew Feldman, cofundador e CEO da Cerebras Systems, em uma discussão sobre os limites da escalabilidade da IA. O ponto central não é uma nova função para o usuário final, mas uma questão que já afeta desenvolvedores, equipes de produto e empresas brasileiras: quanto de computação, energia e infraestrutura será necessário para manter modelos cada vez mais capazes?
A pauta pode parecer distante porque envolve chips e data centers. Na prática, porém, ela determina preço, velocidade, disponibilidade e até quais recursos chegam a aplicativos de texto, voz, imagem e programação. Quando uma empresa oferece uma IA mais rápida ou com contexto maior, existe uma cadeia física por trás: processadores, memória, redes de alta velocidade, refrigeração, espaço, eletricidade e capacidade de fabricação.
O gargalo não está apenas no modelo
O debate público costuma tratar a evolução da IA como uma corrida de versões. Um modelo novo aparece, supera um benchmark e promete resolver tarefas mais complexas. Esse avanço exige mais operações matemáticas e, muitas vezes, mais tempo de treinamento. Depois, o modelo precisa ser servido a milhões de pessoas, o que exige processar cada pedido com baixa latência e custo controlado.
Treinamento e inferência são etapas diferentes. Treinar é ajustar os parâmetros do modelo usando grandes volumes de dados e repetidas operações. Inferência é o momento em que o sistema responde ao usuário ou executa uma tarefa. Um provedor pode ter um modelo excelente, mas ainda assim enfrentar filas, limites de uso ou preços altos se não tiver hardware suficiente para a inferência.
O TechCrunch coloca essa tensão no centro da conversa com a Cerebras. O avanço dos modelos pressiona a infraestrutura, e a infraestrutura precisa crescer sem transformar cada ganho de capacidade em um salto insustentável de energia e investimento operacional. Para quem constrói um produto com IA, essa relação é importante porque a escolha do modelo não pode ser separada da capacidade de mantê-lo disponível.
O que significa computação em escala de wafer
A Cerebras tenta desafiar o desenho tradicional de aceleradores de IA com computação em escala de wafer. Um wafer é uma grande lâmina de silício usada na fabricação de chips. Em vez de cortar toda a lâmina em unidades menores e conectar muitos processadores separados, a empresa criou uma arquitetura que usa uma área muito maior como um único sistema de processamento.
O ganho pretendido é reduzir parte da comunicação entre chips. Em sistemas distribuídos, dados e resultados precisam viajar entre vários componentes por redes internas. Esse movimento pode consumir tempo e energia, além de aumentar a complexidade de programação e operação. Uma área de processamento maior pode oferecer mais memória próxima e caminhos mais largos para os dados, características úteis em cargas de trabalho de inteligência artificial.
Isso não significa que um processador em escala de wafer seja automaticamente melhor para qualquer aplicação. Arquiteturas convencionais têm ecossistemas maduros, ferramentas conhecidas e grande disponibilidade. Uma alternativa precisa funcionar com bibliotecas, frameworks e serviços que as equipes já usam. Também precisa caber em data centers, ser resfriada e receber manutenção. A inovação de hardware só se transforma em vantagem real quando o sistema completo é mais eficiente ou mais simples de operar.
Por que memória e comunicação importam
Modelos de linguagem não passam o tempo todo realizando cálculos isolados. Eles movimentam pesos, ativações e dados entre unidades de memória. Quanto maior o modelo ou a janela de contexto, maior a pressão sobre memória e interconexão. Se o processador passa boa parte do tempo esperando dados, aumentar a quantidade de unidades de cálculo não resolve o problema sozinho.
Essa é uma das razões pelas quais projetos de IA avaliam largura de banda, latência, memória disponível e eficiência energética, além de contar quantas operações por segundo um chip consegue executar. O número mais alto da ficha técnica não garante uma resposta mais rápida. O resultado depende do modelo, do software, do lote de solicitações e da forma como a carga é distribuída.
Mais computação significa mais infraestrutura física
O próprio material do TechCrunch ressalta que processadores mais poderosos não resolvem sozinhos o desafio de escala. Eles precisam de data centers, eletricidade, sistemas de refrigeração e capacidade de fabricação. Cada um desses itens pode se tornar o limite antes do chip.
Data centers de IA usam muita energia e liberam calor. A refrigeração a ar pode não ser suficiente para determinadas densidades, o que leva a sistemas líquidos ou a projetos com distribuição térmica mais sofisticada. A rede elétrica também precisa suportar cargas grandes e estáveis. Em cidades ou regiões com pouca capacidade, um projeto pode demorar mesmo quando existe dinheiro para comprar aceleradores.
Para o Brasil, o impacto aparece em duas frentes. Provedores locais e empresas que usam nuvem precisam acompanhar onde os dados são processados e quanto custa manter uma carga de IA ativa. Ao mesmo tempo, usuários de serviços globais podem perceber que alguns recursos chegam primeiro a regiões com mais capacidade de data center. Latência, localização dos dados e preço podem influenciar a experiência tanto quanto o modelo escolhido.
O que muda para desenvolvedores
O limite físico recomenda uma arquitetura mais cuidadosa. Nem toda tarefa precisa do maior modelo disponível. Um classificador pequeno pode filtrar pedidos antes que eles cheguem a um modelo caro. Cache, processamento em lote, respostas parciais e roteamento entre modelos podem reduzir o custo e melhorar a disponibilidade. Também vale separar tarefas de alto valor, como planejamento complexo, de operações repetitivas, como classificação e extração de campos.
O desenvolvedor deve medir o caminho completo. Latência média pode esconder picos que prejudicam uma interface. Custo por resposta pode mudar quando o tamanho do contexto aumenta. A taxa de erro pode crescer quando a aplicação tenta economizar usando um modelo menor. Métricas de produto, como conclusão de tarefa e abandono, precisam ser analisadas junto com métricas de infraestrutura.
Evitar dependência de um único fornecedor
Uma infraestrutura de IA madura também precisa lidar com portabilidade. Se uma aplicação depende de um acelerador ou de uma API específica, uma mudança de preço, disponibilidade ou política pode afetar o produto inteiro. Camadas de abstração, testes de equivalência e modelos alternativos não eliminam o trabalho, mas reduzem o risco de ficar preso a uma única combinação de hardware e software.
Isso vale inclusive para empresas pequenas. O objetivo não é operar data centers próprios, e sim saber quais partes da aplicação estão amarradas ao provedor. Uma equipe que registra métricas, controla o tamanho do contexto e define limites de uso consegue negociar melhor e trocar componentes com menos urgência quando o cenário muda.
A escalabilidade terá de ser medida como sistema
A discussão sobre Cerebras é um lembrete de que a corrida da IA não termina no lançamento de um modelo. O futuro depende de uma combinação de arquitetura de chips, memória, software, redes, energia, refrigeração e fabricação. Uma solução pode ganhar em uma dimensão e perder em outra. O que importa é o comportamento do sistema completo diante de cargas reais.
Para profissionais digitais, a lição é prática: ao avaliar uma ferramenta de IA, pergunte onde ela roda, qual é o custo quando o uso cresce, que dados atravessam a rede e como a aplicação se comporta quando o provedor está congestionado. A próxima grande vantagem pode não ser apenas responder melhor. Pode ser responder com consistência, em escala e sem transformar cada chamada em um problema de infraestrutura.
Fonte e leitura original: Cerebras Systems’ Andrew Feldman on whether AI can keep scaling at TechCrunch Disrupt 2026, no TechCrunch. Imagem: TechCrunch/Cerebras Systems.



