Penúltimo dia de AWS re:Invent 2025, e hoje tivemos o keynote para falar de Infraestrutura com Peter DeSantis e Dave Brown.
Sem delongas, o anúncio que achei mais interessante foi o Graviton5
Chegamos a quinta geração do processador custom (ARM) da AWS que chegou com números que impressionam:
- 192 cores em um único pacote - maior densidade de CPU do EC2
- Cache L3 5x maior que o Graviton4
- Até 25% melhor performance que a geração anterior
- Até 30% mais rápido para bancos de dados e 35% para workloads de ML
Tenho clientes da CloudFaster Tecnologia que migramos para Graviton e estão tendo melhoria de performence e otimização de custo, se você ainda não usa, considere testar!
As novas instâncias M9G já estão disponíveis em preview. A Amazon Web Services (AWS) trouxe alguns numeros do mercado: 98% dos top 1.000 clientes EC2 já usam Graviton, incluindo Adobe, Airbnb, SAP, Epic Games e a Formula 1.
Em especial tivemos a Apple, que inclusive subiu no palco e compartilhou que conseguiu 40% de aumento de performance e 30% de redução de custos migrando serviços para Swift no Graviton.
Demais anúncios relevantes do keynote
Trainium 3 UltraServer
- Primeiro chip de IA da AWS em 3nm
- 144 chips Trainium3 por UltraServer (306 petaflops!)
- 4.4x mais performance e 4x mais eficiência energética vs Trainium2
- UltraClusters 3.0 agora suportam até 1 milhão de chips (10x mais que antes)
Novidade para desenvolvedores: Trainium agora é PyTorch nativo. Para migrar código de GPU, basta trocar to('cuda') para to('neuron'). O NIKU (Neuron Kernel Interface) vai ser open-source no Q1 2025.
Qual a mensagem aqui, estamos prontos para suportar demanda de treinamentos de modelo em infraestrutura propria.
Amazon S3 Vectors agora em GA com melhorias
- Agora suporta até 2 bilhões de vetores por índice (40x mais que o preview)
- Latência sub-100ms para queries frequentes
- Redução de até 90% no custo vs vector databases especializadas
- Integração nativa com Bedrock Knowledge Bases e OpenSearch
Em 4 meses de preview: mais de 250.000 índices criados e 40 bilhões de vetores ingeridos. Os números mostram a demanda reprimida por uma solução de vetores com custo de S3.
E vamos falar sério, dependendo da necessidade, as vezes poderia sair caro subir um OpenSearch somente para uma base de conhecimento pequena no Bedrock, então fica a dia, considera o S3 Vectors.
Nova Multimodal Embeddings Model
Modelo de embeddings que suporta texto, documentos, imagens, vídeo e áudio em um espaço vetorial unificado. Resolve o problema de precisar de modelos diferentes para cada tipo de dado quando você quer fazer busca semântica em dados não-estruturados.
Alguns outros lançamentos mencionados
- Lambda Managed Instances para rodar funções em instâncias EC2 dedicadas (anunciado anteriormente)
- Instâncias P6e-GB300 com NVIDIA GB300 NVL72
- Neuron Explorer para profiling de código no Trainium
- Direct-to-silicon cooling no Graviton (reduz 33% do consumo de ventilação)
O que fica desse keynote
A mensagem central foi clara e isso eu gosto bastante, quem é aluno sabe: os fundamentos da cloud (segurança, disponibilidade, elasticidade, custo e agilidade) continuam sendo o foco, e são ainda mais importantes para workloads de IA.
O ciclo de inovação em custom silicon da AWS (Nitro → Graviton → Trainium) está maduro e entregando resultados reais. Não é mais promessa, são clientes em produção com ganhos de 30-50% em custo e performance.
Para quem trabalha com IA na AWS, vale prestar atenção especial no Trainium3 e no S3 Vectors. A combinação de custo menor e integração nativa com Bedrock pode mudar a conta de muitos projetos.
Acompanhe também os highlights que a comunidade está fazendo, segue nosso AWS User Group Goiânia para resumos diários e me siga no instagram para um POV do dia a dia direto aqui de Las Vegas @ odanrezende.
Me conta: você já está atualizando suas cargas de trabalho para rodar em processadores Graviton? Se precisar de ajuda com isso, o time da CloudFaster pode ajudar é só chamar!