Datadog 案例:从监控工具到云原生观察平台
开场:系统越复杂,越需要看见 Datadog 的机会来自一个很现实的变化:软件系统从几台服务器,变成云服务、容器、微服务、数据库、队列、第三方 API 和全球部署。系统变强大了,也更难理解了。当用户说“网站慢了”时,问题可能在前端、后端、数据库、缓存、DNS、云厂商、网络、代码发布或某个外部服务。
tag
开场:系统越复杂,越需要看见 Datadog 的机会来自一个很现实的变化:软件系统从几台服务器,变成云服务、容器、微服务、数据库、队列、第三方 API 和全球部署。系统变强大了,也更难理解了。当用户说“网站慢了”时,问题可能在前端、后端、数据库、缓存、DNS、云厂商、网络、代码发布或某个外部服务。
系统介绍可观测性三大支柱(日志、指标、链路追踪)的工程实践,涵盖结构化日志、Prometheus/Grafana监控体系、OpenTelemetry统一采集、SLO/SLI定义及告警策略。
面向 2025 年的后端架构最佳实践,涵盖系统设计、数据库优化、容器编排、可观测性、安全认证与成本治理,助力构建简单、稳定、可演进的现代后端系统。
设计 Birdor 的可观测性和 SRE 计划,覆盖工具完成率、前端错误、API 延迟、AI 成本、任务队列、业务指标、告警、SLO 和发布回滚。
构建 Next.js 的完整错误处理与可观测性体系——从 Error Boundary、全局错误页、Server Action 错误处理,到 Sentry 集成、结构化日志与生产环境监控。
全面讲解如何在 Go 项目中集成 OpenTelemetry,实现 Tracing、Metrics、Logging 三大支柱的可观测性,覆盖自定义 Span、上下文传播、自动埋点、导出到 Jaeger/Tempo、Prometheus 集成和 Grafana 仪表盘