FinOps Prático: Otimizando Custos de IA Generativa no GCP Vertex AI
Com a adoção massiva de modelos de linguagem (LLMs) em processos de negócios, as contas de nuvem pública (AWS, GCP, Azure) começaram a inflar rapidamente devido ao custo de chamadas de APIs baseadas em tokens (input/output). O papel do profissional de infraestrutura é habilitar a inovação tecnológica garantindo que haja eficiência financeira rígida (FinOps).
Neste artigo, mostro como estruturei limites e governança financeira para a equipe de IA testar prompts e desenvolver agentes no GCP Vertex AI sem estourar o orçamento.
1. Monitoramento de Custos de Tokens
Implementamos filtros de faturamento consolidados no GCP Billing, divididos por rotulagem de chaves (labels) ligadas a cada projeto. Dessa forma, conseguimos mensurar exatamente qual modelo de IA (como Gemini 1.5 Pro ou Flash) estava consumindo mais recursos financeiros no pipeline de RAG.
2. Quotas e Limites de Requisições
Ao invés de deixar as APIs de chat abertas sem restrições em ambientes de teste de desenvolvimento, aplicamos quotas estritas de chamadas por minuto (RPM) e chamadas por dia (RPD) dentro do GCP Quota Manager.3. Gemini Flash vs Pro
Uma das ações de FinOps mais eficientes foi direcionar fluxos de pré-processamento de dados e classificação simples para o modelo Gemini Flash, deixando o mais caro Gemini Pro focado exclusivamente na fase final de síntese e raciocínio de RAG complexo.Comandos de cota e rótulo
O controle diário não fica no console. Quota e billing por label mostram qual modelo estourou o Opex.
gcloud services quota list \
--service=aiplatform.googleapis.com \
--consumer=projects/PROJECT_ID
gcloud billing budgets list --billing-account=BILLING_ACCOUNT_ID
Na chamada, o label vai no request para o billing separar Flash de Pro:
curl -s -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json" \
"https://us-central1-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/us-central1/publishers/google/models/gemini-2.0-flash:generateContent" \
-d '{"contents":[{"role":"user","parts":[{"text":"Classifique este chamado: disco em 90%."}]}],"labels":{"workload":"triage"}}'
Classificação e pré-processamento ficam no Flash. Síntese de RAG fica no Pro.
Conclusão
Esta divisão de responsabilidade de modelos e controle de quotas reduziu as projeções mensais de custo de desenvolvimento de IA em mais de 60%, demonstrando que a agilidade tecnológica pode e deve andar de mãos dadas com a saúde financeira (Opex).Artigos Relacionados
Migração de Infraestrutura Local para Microsoft 365: Estratégia e Compliance
Um guia de como planejar e executar migrações de e-mail e arquivos locais de servidores tradicionais Windows/Exchange para o Microsoft 365, garantindo integridade e conformidade ISO.
Multicloud para bancos: como separar core, dados e trilha de auditoria
Arquitetura multicloud para bancos: região travada, core isolado do ambiente de teste e trilha de auditoria que ninguém apaga. Comandos de SCP, CloudTrail e Object Lock.