跳转到内容
🎯 市场上独一无二
Killer 功能

Cosmos Operations Center — realtime, predictive, AI-driven

在客户致电之前告诉您要修复什么的 DBA dashboard。带异常检测的实时图表、点击任意 spike 钻取 AI 叙述的根本原因 walk、在饱和前警告的预测性 ETAs、自动触发的可配置策略 — 以及完整的可录制时间线,让您可以在 30 秒内对昨天的事件进行事后分析。

打开它的那一刻向您显示的内容

4 个 realtime 图表(1s tick)

消耗的 RU/s · Throttle 429 事件 · 延迟 p99 · 错误计数。所有四个每秒从 Query Cost ring buffer 更新。最后一小时在内存中。

红点 = 异常,可点击

异常检测器在 throttle storms、RU 饱和、延迟 spikes、分区偏斜发生的那一刻标记它们。每个异常都是固定在其确切 timestamp 的红点。

预测性告警 banner

最近 3 分钟的线性回归告诉您 "如果趋势继续,RU 将在 ~14 分钟内饱和" — 在违规之前可操作,而非之后。

录制切换(history-store)

一键,每个快照都持久化到您为 mongostat/mongotop 配置的同一 MongoDB 管理实例。Job Manager 将它与其他一起显示。

点击 → 钻取 → 修复

每个红点打开一个 AI 叙述的根本原因 Walk

点击异常 → 侧抽屉滑入,带三个 stops,每个由确定性上下文(Query Cost ring buffer + 跨扫描器缓存)+ 您语言的可选 AI 叙述支持。

1

发生了什么

精确 timestamp、指标值、严重性、该分钟运行的顶部查询形状、来自扫描器缓存的分区状态。确定性 — 零 AI 成本。

2

为什么(最可能的原因)

AI 查看结构化上下文并写出单一最可能的根本原因 + 支持它的数据证据。说 DBA 的语言。按签名缓存。

3

如何修复

快速缓解(5min)+ 永久修复(本周),每个都链接到拥有 apply 命令的扫描器 pane。一键即在正确位置。

BYO LLM — 按事件选择

DBA 按分析选择 AI 模型

常规成本事件?使用 gpt-4o-mini($0.001)。高严重性生产中断?为同一事件切换到 Claude Sonnet($0.018)。提供商选择器在抽屉内 — 成本预先显示,无惊喜。

// Incident Drawer 内部
分析方式: [ Anthropic Claude Sonnet ▼ ] $0.018
├ OpenAI gpt-4o ($0.012)
├ OpenAI gpt-4o-mini ($0.001)
├ Anthropic Claude Sonnet ($0.018) ✓
├ Google Gemini ($0.001)
├ Groq Llama ($0.002)
└ Ollama(本地 · 免费)
[ 运行分析($0.018)→ ]

结果按 incident 签名 × 提供商 × locale 缓存(4h TTL)— 同一事件点击两次 = 零重新收费。

Predictive

在违规之前警告的预测

最近 3 分钟遥测的线性回归 — 带 R² 标记的置信度,按 ETA 缩放的严重性。

ru-saturation-eta~14 分钟

RU/s 以 8.2/s 增长 — 如果趋势继续将在 ~14 分钟内饱和

throttle-trending-up进行中

Throttle 事件攀升中 — 最近 5min 内 23 个,速率 +0.04/s²

partition-skew-growing~3.2 小时

顶部分区份额增长(现在 52%)— 将在 ~3.2 小时内越过 70%

storage-saturation-eta12 天

存储 78% — 按当前增长外推 12 天内达到 90%

Per-instance 可配置

DBA 定义的策略 — 自动触发

每个 Cosmos 连接都有自己的策略。触发器(阈值 + 持续时间 + ns 模式)绑定到操作(应用内通知、Slack webhook、通用 webhook、预暂存扩展、预暂存路径排除、AI 分析)。

Throttle storm — 5/min

当 throttle 事件 > 5/min 持续 2min 时,触发应用内通知 + 预暂存 +50% 扩展(需要 DBA 批准)。

RU 饱和 — 85%

当 RU/s 在 5min 内越过观察到的上限的 85% 时,通知建议切换到 autoscale。

延迟 p99 — 500ms

当 p99 在 1min 内超过 500ms 时,通知 + 在慢查询路径上触发 AI 分析。

Partition skew — top > 50%

当一个分区持有 > 50% 文档时,预暂存重新分区计划(需要批准)。

每次触发按(策略 × ns × 5min 桶)去重 — 无告警疲劳。一键 snooze 1h。审计日志保留每次触发,带指标值、触发的策略和排队的操作。

可录制

30 秒内对昨天事件进行事后分析

一键 "Start recording" → 每个快照持久化到 mongostat/mongotop 已使用的同一 MongoDB 管理连接。打开 Job Manager → 点击任意 "Rec Cosmos Ops" job → 统一的 Timeline scrubber 让您将 cluster 行为与同一窗口的 MongoDB 录制并排重放。

Timeline Replay · 2026-05-26 14:00 → 15:30
[|—————————●———————————————|] 14:23 ← scrubber
Cosmos RU/s ▁▂▃▄▅█▆▅▃▂▁▂ ← peak @ 14:23 ⚠
Cosmos 429s ▁▁▁▁▁█▁▁▁▁
MongoStat ops ▃▄▅▄▅▄█▅▄▃▄ ← spike @ 14:23(correlated)
CurrentOp ▁▁▂▃▆█▇▆▃▂ ← 长时间运行的查询
AI 洞察 @ 14:23:"Throttle storm 与 prod-mongo replicaset 上 MongoTop collScan spike 同时发生。failover 测试期间相同的查询路径针对两个 clusters 运行。"

没有其他人在一个 scrubber 上关联 Cosmos + MongoDB。

为什么 Datadog / Grafana / Azure Monitor 无法复制这个

能力Operations CenterDatadogGrafanaAzure Monitor
Realtime cluster 图表
点击 spike → 根本原因 walk⚠ 仅链接⚠ 仅链接
您语言的 AI 叙述✅ BYO LLM⚠ 封闭 AI⚠ 封闭 AI
按事件选择 AI 模型
Apply 命令预暂存 + Shadow-validated
Cosmos $indexStats / GetPartitionStats 关联
与 MongoDB 监控交叉关联⚠ 如果两者都已摄取
价格$99-499/月$15+/主机/月自托管按 GB 摄取

停止搜索 templates。打开 Operations Center 并查看

NoSqlStudio for Cosmos DB 免费试用 — 无需信用卡,无需注册。打开任意 Cosmos 连接,点击 Operations Center,观看图表生动起来。