Google lança TPU 8t e TPU 8i, processadores de IA com foco em treinamento e inferência separados
O Google anunciou nesta quarta-feira (22) os processadores TPU 8t e TPU 8i, voltados para treinamento e inferência de inteligência artificial, respectivamente. Os chips, parte da oitava geração de Unidades de Processamento Tensorial (TPU), prometem desempenho até três vezes superior ao da geração anterior e estarão disponíveis ainda em 2026. A separação das tarefas visa otimizar o desenvolvimento de modelos e agentes de IA.
Diferenciais dos novos processadores
Os chips TPU 8t e TPU 8i foram projetados para atender demandas distintas no ecossistema de IA. A TPU 8t é focada em treinamento de modelos avançados, reduzindo o ciclo de desenvolvimento de meses para semanas. Segundo o Google, um único processador da nova geração equivale a 9.600 chips da série anterior, com 2 petabytes de memória compartilhada de alta largura de banda. A arquitetura oferece 121 exaflops de capacidade computacional e acesso a armazenamento dez vezes mais rápido, garantindo escalabilidade para modelos complexos. Já a TPU 8i é direcionada para inferência e trabalho colaborativo de agentes de IA. O chip combina 288 GB de memória de alta largura de banda com 384 MB de SRAM integrada, triplicando a capacidade em relação à geração passada. A largura de banda da interconexão foi dobrada para 19,2 Tb/s em modelos específicos, e o número de CPUs físicas por servidor também foi duplicado.
Impacto no mercado de IA
A separação entre treinamento e inferência em chips distintos representa uma estratégia do Google para oferecer hardware personalizado conforme as necessidades dos clientes. A TPU 8t, por exemplo, promete equilibrar taxa de transferência, memória compartilhada e largura de banda, acelerando fluxos de trabalho. A empresa destaca que os novos processadores são alternativas competitivas ao hardware da Nvidia, líder no segmento. Os chips serão integrados aos supercomputadores do Google e poderão ser utilizados por desenvolvedores e empresas que buscam otimizar o desempenho de modelos de IA, agentes especializados e cargas de trabalho massivas.