Cosmos Operations Center — realtime, predictive, AI-driven
O dashboard de DBA que te diz o que consertar antes do cliente ligar. Charts realtime com detecção de anomalia, click em qualquer spike para drill num walk de root cause AI-narrado, ETAs preditivos que avisam antes de saturação, políticas configuráveis que disparam automaticamente — e timeline gravável completa para que você possa fazer post-mortem do incidente de ontem em 30 segundos.
O que ele te mostra, no momento que você abre
4 charts realtime (tick de 1s)
RU/s consumido · Eventos de Throttle 429 · Latência p99 · Contagem de erros. Todos os quatro atualizando a cada segundo do ring buffer Query Cost. Última hora em memória.
Pontos vermelhos = anomalias, clicáveis
O detector de anomalia flagga throttle storms, saturação RU, spikes de latência, partition skew no momento em que acontecem. Cada anomalia é um ponto vermelho fixado em seu timestamp exato.
Banner de alertas preditivos
Regressão linear sobre os últimos 3 min te diz "RU vai saturar em ~14 min se a tendência continuar" — acionável ANTES da breach, não depois.
Toggle de gravação (history-store)
Um clique e todo snapshot é persistido na mesma instância MongoDB management que você configurou para mongostat/mongotop. Job Manager mostra junto com os outros.
Todo ponto vermelho abre um Walk de Root Cause AI-narrado
Click na anomalia → uma side drawer desliza com três stops, cada um respaldado por contexto determinístico (Query Cost ring buffer + caches cross-scanner) + narração AI opcional na sua linguagem.
O QUE aconteceu
Timestamp exato, valor da métrica, severidade, top query shape rodando naquele minuto, estado de partição do cache do scanner. Determinístico — custo AI zero.
POR QUÊ (causa mais provável)
AI olha o contexto estruturado e escreve a única root cause mais provável + a evidência nos dados que suporta. Fala a linguagem do DBA. Cached por assinatura.
COMO consertar
Mitigation rápido (5min) + fix permanente (esta semana), cada um linkado ao pane do scanner que possui o comando apply. Um click e você está no lugar certo.
O DBA escolhe o modelo AI por análise
Incidente rotineiro de custo? Use gpt-4o-mini ($0.001). Outage de produção alta severidade? Troque para Claude Sonnet ($0.018) para o mesmo incidente. Picker de provider fica dentro do drawer — custo mostrado upfront, sem surpresas.
├ OpenAI gpt-4o-mini ($0.001)
├ Anthropic Claude Sonnet ($0.018) ✓
├ Google Gemini ($0.001)
├ Groq Llama ($0.002)
└ Ollama (local · free)
Resultados cached por assinatura de incidente × provider × locale (TTL de 4h) — mesmo incidente clicado duas vezes = re-charge zero.
Previsões que avisam ANTES da breach
Regressão linear sobre os últimos 3 minutos de telemetria — R²-tagged para confiança, severidade-escalada por ETA.
ru-saturation-eta~14 minRU/s crescendo a 8.2/s — vai saturar em ~14 min se a tendência continuar
throttle-trending-upem andamentoEventos de Throttle subindo — 23 nos últimos 5min, taxa +0.04/s²
partition-skew-growing~3.2 horasShare da top partition crescendo (agora 52%) — vai cruzar 70% em ~3.2 horas
storage-saturation-eta12 diasStorage em 78% — extrapolado para chegar a 90% em 12 dias com crescimento atual
Políticas que o DBA define — disparam automaticamente
Cada conexão Cosmos tem suas próprias políticas. Triggers (threshold + duração + pattern de ns) ligados a ações (notify in-app, webhook Slack, webhook genérico, pre-stage scale-up, pre-stage path exclusion, AI analyze).
Throttle storm — 5/min
Quando eventos de throttle > 5/min sustentados por 2min, dispara notificação in-app + pre-stage de scale-up +50% (requer aprovação DBA).
Saturação RU — 85%
Quando RU/s cruza 85% do ceiling observado por 5min, notifica com sugestão de switch para autoscale.
Latência p99 — 500ms
Quando p99 excede 500ms por 1min, notifica + dispara análise AI no path da slow query.
Partition skew — top > 50%
Quando uma partição contém > 50% dos docs, pre-stages um plano de re-partition (aprovação obrigatória).
Todo fire é deduped por (policy × ns × bucket de 5min) — sem fadiga de alerta. Snooze de 1h com um click. Audit log preserva todo fire com o valor da métrica, a policy que disparou, e qual ação foi enfileirada.
Post-mortem do incidente de ontem em 30 segundos
Um clique em "Start recording" → todo snapshot persiste para a mesma conexão MongoDB management que mongostat/mongotop já usam. Abra Job Manager → click em qualquer job "Rec Cosmos Ops" → o scrubber Timeline unificado deixa você replay o comportamento do cluster ao lado das gravações MongoDB da mesma janela.
Ninguém mais correlaciona Cosmos + MongoDB num único scrubber.
Por que isto é incopiável por Datadog / Grafana / Azure Monitor
| Capacidade | Operations Center | Datadog | Grafana | Azure Monitor |
|---|---|---|---|---|
| Charts de cluster realtime | ✅ | ✅ | ✅ | ✅ |
| Click no spike → walk de root cause | ✅ | ⚠ só link | ❌ | ⚠ só link |
| Narração AI na sua linguagem | ✅ BYO LLM | ⚠ AI fechado | ❌ | ⚠ AI fechado |
| Escolha modelo AI por incidente | ✅ | ❌ | ❌ | ❌ |
| Comando Apply pre-staged + Shadow-validated | ✅ | ❌ | ❌ | ❌ |
| Cosmos $indexStats / GetPartitionStats correlacionados | ✅ | ❌ | ❌ | ⚠ |
| Cross-correlate com monitoramento MongoDB | ✅ | ❌ | ⚠ se ambos ingested | ❌ |
| Preço | $99-499/mo | $15+/host/mo | self-host | por GB ingested |
Pare de procurar templates. Abra o Operations Center e veja.
NoSqlStudio para Cosmos DB é gratuito para experimentar — sem cartão, sem cadastro. Abra qualquer conexão Cosmos, clique em Operations Center, veja os charts ganharem vida.