Imagem gerada digitalmente
O foco atual da IA migra de apenas ampliar modelos para arquiteturas que cortem custos de inferência sem perder desempenho
Foto: Angnaont / Shutterstock / Modificada com IA
O Google DeepMind Gemma 4 usa Mixture of Experts para ativar apenas subpartes conforme a tarefa, reduzindo carga computacional e memória sem sacrificar performance
Foto: krungchingpixs / Shutterstock / Modificada com IA
Já o DeepSeek (DSpark) aplica speculative decoding e eleva a velocidade de geração (60–85%) sem hardware novo
Foto: Melinda Nagy / Shutterstock / Modificada com IA
A Nvidia propõe difusão para texto (Nemotron-Labs-Diffusion) e gera tokens em paralelo, refinando sequências inteiras
A redução de recursos por token democratiza IA, diminui custos operacionais e amplia adoção sem depender apenas de modelos gigantes
Imagem gerada digitalmente