Cosmos Operations Center — realtime, predictive, AI-driven
在客户致电之前告诉您要修复什么的 DBA dashboard。带异常检测的实时图表、点击任意 spike 钻取 AI 叙述的根本原因 walk、在饱和前警告的预测性 ETAs、自动触发的可配置策略 — 以及完整的可录制时间线,让您可以在 30 秒内对昨天的事件进行事后分析。
打开它的那一刻向您显示的内容
4 个 realtime 图表(1s tick)
消耗的 RU/s · Throttle 429 事件 · 延迟 p99 · 错误计数。所有四个每秒从 Query Cost ring buffer 更新。最后一小时在内存中。
红点 = 异常,可点击
异常检测器在 throttle storms、RU 饱和、延迟 spikes、分区偏斜发生的那一刻标记它们。每个异常都是固定在其确切 timestamp 的红点。
预测性告警 banner
最近 3 分钟的线性回归告诉您 "如果趋势继续,RU 将在 ~14 分钟内饱和" — 在违规之前可操作,而非之后。
录制切换(history-store)
一键,每个快照都持久化到您为 mongostat/mongotop 配置的同一 MongoDB 管理实例。Job Manager 将它与其他一起显示。
每个红点打开一个 AI 叙述的根本原因 Walk
点击异常 → 侧抽屉滑入,带三个 stops,每个由确定性上下文(Query Cost ring buffer + 跨扫描器缓存)+ 您语言的可选 AI 叙述支持。
发生了什么
精确 timestamp、指标值、严重性、该分钟运行的顶部查询形状、来自扫描器缓存的分区状态。确定性 — 零 AI 成本。
为什么(最可能的原因)
AI 查看结构化上下文并写出单一最可能的根本原因 + 支持它的数据证据。说 DBA 的语言。按签名缓存。
如何修复
快速缓解(5min)+ 永久修复(本周),每个都链接到拥有 apply 命令的扫描器 pane。一键即在正确位置。
DBA 按分析选择 AI 模型
常规成本事件?使用 gpt-4o-mini($0.001)。高严重性生产中断?为同一事件切换到 Claude Sonnet($0.018)。提供商选择器在抽屉内 — 成本预先显示,无惊喜。
├ OpenAI gpt-4o-mini ($0.001)
├ Anthropic Claude Sonnet ($0.018) ✓
├ Google Gemini ($0.001)
├ Groq Llama ($0.002)
└ Ollama(本地 · 免费)
结果按 incident 签名 × 提供商 × locale 缓存(4h TTL)— 同一事件点击两次 = 零重新收费。
在违规之前警告的预测
最近 3 分钟遥测的线性回归 — 带 R² 标记的置信度,按 ETA 缩放的严重性。
ru-saturation-eta~14 分钟RU/s 以 8.2/s 增长 — 如果趋势继续将在 ~14 分钟内饱和
throttle-trending-up进行中Throttle 事件攀升中 — 最近 5min 内 23 个,速率 +0.04/s²
partition-skew-growing~3.2 小时顶部分区份额增长(现在 52%)— 将在 ~3.2 小时内越过 70%
storage-saturation-eta12 天存储 78% — 按当前增长外推 12 天内达到 90%
DBA 定义的策略 — 自动触发
每个 Cosmos 连接都有自己的策略。触发器(阈值 + 持续时间 + ns 模式)绑定到操作(应用内通知、Slack webhook、通用 webhook、预暂存扩展、预暂存路径排除、AI 分析)。
Throttle storm — 5/min
当 throttle 事件 > 5/min 持续 2min 时,触发应用内通知 + 预暂存 +50% 扩展(需要 DBA 批准)。
RU 饱和 — 85%
当 RU/s 在 5min 内越过观察到的上限的 85% 时,通知建议切换到 autoscale。
延迟 p99 — 500ms
当 p99 在 1min 内超过 500ms 时,通知 + 在慢查询路径上触发 AI 分析。
Partition skew — top > 50%
当一个分区持有 > 50% 文档时,预暂存重新分区计划(需要批准)。
每次触发按(策略 × ns × 5min 桶)去重 — 无告警疲劳。一键 snooze 1h。审计日志保留每次触发,带指标值、触发的策略和排队的操作。
30 秒内对昨天事件进行事后分析
一键 "Start recording" → 每个快照持久化到 mongostat/mongotop 已使用的同一 MongoDB 管理连接。打开 Job Manager → 点击任意 "Rec Cosmos Ops" job → 统一的 Timeline scrubber 让您将 cluster 行为与同一窗口的 MongoDB 录制并排重放。
没有其他人在一个 scrubber 上关联 Cosmos + MongoDB。
为什么 Datadog / Grafana / Azure Monitor 无法复制这个
| 能力 | Operations Center | Datadog | Grafana | Azure Monitor |
|---|---|---|---|---|
| Realtime cluster 图表 | ✅ | ✅ | ✅ | ✅ |
| 点击 spike → 根本原因 walk | ✅ | ⚠ 仅链接 | ❌ | ⚠ 仅链接 |
| 您语言的 AI 叙述 | ✅ BYO LLM | ⚠ 封闭 AI | ❌ | ⚠ 封闭 AI |
| 按事件选择 AI 模型 | ✅ | ❌ | ❌ | ❌ |
| Apply 命令预暂存 + Shadow-validated | ✅ | ❌ | ❌ | ❌ |
| Cosmos $indexStats / GetPartitionStats 关联 | ✅ | ❌ | ❌ | ⚠ |
| 与 MongoDB 监控交叉关联 | ✅ | ❌ | ⚠ 如果两者都已摄取 | ❌ |
| 价格 | $99-499/月 | $15+/主机/月 | 自托管 | 按 GB 摄取 |