Todas las guías

Filtra por categoría, dificultad o texto libre para encontrar el material que encaja con tu equipo.

Metrics~45 min

Reducir picos de cardinalidad en Prometheus con límites de OpenTelemetry antes de quemar la TSDB

Creada: 28 de agosto de 2026 · Publicada: 28 de agosto de 2026

Aprende a localizar métricas que disparan cardinalidad, distinguir protección del SDK frente a coste real en Prometheus y aplicar mitigaciones seguras en instrumentación, Collector y scrape.

Linux
Avanzado
Leer guía
Metrics~45 min

Monitorizar controller-runtime sin fundir el API server de Kubernetes

Creada: 27 de agosto de 2026 · Publicada: 27 de agosto de 2026

Aprende a vigilar controladores Kubernetes hechos con controller-runtime usando Prometheus, métricas de workqueue, apiserver, informers, reglas promtool y validación canary.

LinuxDocker
Avanzado
Leer guía
Metrics~40 min

Corregir alertas de memoria en Kubernetes sin caer en la trampa de page cache

Creada: 26 de agosto de 2026 · Publicada: 26 de agosto de 2026

Aprende a rediseñar alertas de saturación de memoria en Kubernetes comparando usage, working set, RSS, cache, límites, OOMKilled y validaciones con promtool.

LinuxDocker
Intermedio
Leer guía
Logs~45 min

Depurar backpressure en Vector sin perder búsquedas de incidente

Creada: 24 de agosto de 2026 · Publicada: 24 de agosto de 2026

Aprende a diagnosticar pipelines de Vector cuando los logs llegan tarde, malformados o nunca aparecen, con métricas internas, VRL, buffers en disco, canaries y validación de búsquedas.

LinuxDocker
Intermedio
Leer guía
Metrics~40 min

Monitorizar TCPRoute y UDPRoute de Gateway API sin disparar la cardinalidad

Creada: 23 de agosto de 2026 · Publicada: 23 de agosto de 2026

Una guía para crear dashboards y alertas Prometheus/Grafana sobre TCPRoute y UDPRoute: inventario, PromQL, metric relabeling, canary y validación de que el tráfico L4 no queda ciego ni caro.

LinuxDocker
Intermedio
Leer guía
Tracing~45 min

Usar extensiones del agente Java de OpenTelemetry sin ocultar trazas de incidente

Creada: 22 de agosto de 2026 · Publicada: 22 de agosto de 2026

Una guía práctica para probar extensiones del agente Java de OpenTelemetry con guardrails: baseline, extensión mínima, canary, métricas del Collector y pruebas de que los errores siguen visibles.

LinuxDocker
Avanzado
Leer guía
OpenTelemetry~45 min

Reducir logs duplicados con OpenTelemetry Collector sin ocultar errores de incidente

Creada: 21 de agosto de 2026 · Publicada: 21 de agosto de 2026

Aprende a aplicar deduplicación de logs en OpenTelemetry Collector con límites claros, validación de búsquedas y rollback antes de tocar todo el pipeline.

Linux
Avanzado
Leer guía
Logs~45 min

Escalar shards online en OpenSearch sin disparar la latencia de búsqueda

Creada: 19 de agosto de 2026 · Publicada: 19 de agosto de 2026

Aprende a diagnosticar hot shards, decidir si necesitas cambiar el número de primaries y ejecutar una migración online en OpenSearch sin perder escrituras ni romper búsquedas.

LinuxDocker
Avanzado
Leer guía
Metrics~45 min

Evitar que el churn de targets y los gaps de scrape cieguen tus alertas de burn rate

Creada: 17 de agosto de 2026 · Publicada: 17 de agosto de 2026

Aprende a endurecer alertas SLO de burn rate frente a churn de pods, gaps de scrape, endpoints inestables y no-data en Prometheus, con PromQL, promtool y canaries medibles.

LinuxDocker
Avanzado
Leer guía
OpenTelemetry~45 min

Limitar cardinalidad de métricas OpenTelemetry antes de fundir Prometheus remote_write

Creada: 16 de agosto de 2026 · Publicada: 16 de agosto de 2026

Guía práctica para detectar y limitar cardinalidad de métricas OpenTelemetry con canaries, PromQL, límites de atributos, vistas del SDK y validación de remote_write.

LinuxDocker
Avanzado
Leer guía
Logs~40 min

Construir timelines de incidentes con eventos de entidad de OpenTelemetry sin inventarte la causa

Creada: 15 de agosto de 2026 · Publicada: 15 de agosto de 2026

Guía práctica para reconstruir incidentes usando OpenTelemetry entity events, contexto de request, trazas, logs y Prometheus sin depender de memoria humana ni dashboards sueltos.

LinuxDocker
Intermedio
Leer guía
Logs~45 min

Proteger búsquedas de incidentes en Loki de cardinalidad y fairness antes de que desaparezcan los logs

Creada: 14 de agosto de 2026 · Publicada: 14 de agosto de 2026

Guía práctica para reducir cardinalidad en Loki, ajustar límites de consulta e ingesta, y validar que las búsquedas críticas siguen funcionando.

LinuxDocker
Avanzado
Leer guía
Metrics~40 min

Reducir ruido de kube-state-metrics CustomResourceState sin romper alertas

Creada: 13 de agosto de 2026 · Publicada: 13 de agosto de 2026

Guía práctica para limpiar cardinalidad de kube-state-metrics y CustomResourceState con allowlists, metricRelabelings, PromQL de impacto y gates de rollback.

LinuxDocker
Intermedio
Leer guía
OpenTelemetry~45 min

Migrar OpenTelemetry Collector a queuebatch sin crear backpressure en los exporters

Creada: 12 de agosto de 2026 · Publicada: 12 de agosto de 2026

Guía avanzada para validar queuebatch en OpenTelemetry Collector con métricas de cola, memory_limiter, PromQL y gates de rollback antes de tocar toda la flota.

LinuxDocker
Avanzado
Leer guía
Metrics~40 min

Desplegar histogramas nativos de Prometheus sin dejar ciegos tus SLOs

Creada: 11 de agosto de 2026 · Publicada: 11 de agosto de 2026

Aprende a activar histogramas nativos con doble publicación, PromQL de paridad, límites de cardinalidad y guardrails de remote_write para que p95, p99 y burn alerts sigan siendo fiables.

LinuxDocker
Avanzado
Leer guía
Logs~40 min

Investigar picos de logs con PPL en OpenSearch sin que los hot shards te engañen

Creada: 10 de agosto de 2026 · Publicada: 10 de agosto de 2026

Aprende a combinar PPL, Dev Tools y métricas del clúster para investigar picos de errores sin confundir un problema de aplicación con sesgo de shards o presión de búsqueda.

LinuxDocker
Avanzado
Leer guía
Tracing~45 min

Probar almacenamiento en disco para tail sampling del OpenTelemetry Collector sin romper incidentes

Creada: 9 de agosto de 2026 · Publicada: 9 de agosto de 2026

Guía práctica para validar disk-backed tail sampling en el OpenTelemetry Collector cuando una ventana de decisión larga necesita más estado del que la memoria del pod puede aguantar.

Linux
Avanzado
Leer guía
Metrics~35 min

Investigar CrashLoopBackOff con PromQL antes de culpar a OOMKilled

Creada: 8 de agosto de 2026 · Publicada: 8 de agosto de 2026

Aprende a pasar de una alerta CrashLoopBackOff a una hipótesis OOMKilled verificable con PromQL, kubectl y reglas de validación que evitan falsas páginas.

LinuxDocker
Intermedio
Leer guía
OpenTelemetry~45 min

Desplegar configuración del OpenTelemetry Collector con OpAMP sin romper pipelines

Creada: 6 de agosto de 2026 · Publicada: 6 de agosto de 2026

Aprende a tratar OpAMP como un plano de control seguro para flotas de OpenTelemetry Collector: validación local, canaries, métricas de cola, rollback y pruebas de ingestión antes del despliegue global.

Linux
Avanzado
Leer guía
Metrics~35 min

Gestionar dashboards de golden signals como código sin confiar en paneles con drift

Creada: 5 de agosto de 2026 · Publicada: 5 de agosto de 2026

Convierte dashboards críticos en artefactos revisables: Terraform, pruebas promtool, consultas Prometheus acotadas y canary visual antes de producción.

Linux
Intermedio
Leer guía
Logs~35 min

Depurar backpressure en pipelines Vector sin perder logs por el camino

Creada: 4 de agosto de 2026 · Publicada: 4 de agosto de 2026

Aprende a detectar dónde se retrasan o pierden eventos en Vector, cómo separar errores de parsing de presión de sink, y qué checklist usar antes de tocar producción.

LinuxDocker
Intermedio
Leer guía
Logs~45 min

Validar señales KEDA desde OpenSearch sin que hot shards te mientan

Creada: 3 de agosto de 2026 · Publicada: 3 de agosto de 2026

Guía práctica para validar métricas externas de KEDA basadas en OpenSearch antes de escalar servicios con señales sesgadas por hot shards, ventanas ruidosas o backend saturado.

Avanzado
Leer guía
OpenTelemetry~40 min

Validar filtros OTTL del Collector sin soltar telemetría por contexto ambiguo

Creada: 2 de agosto de 2026 · Publicada: 2 de agosto de 2026

Aprende a desplegar filtros OTTL del OpenTelemetry Collector con canary, métricas internas y consultas de paridad para evitar pérdidas silenciosas de telemetría.

Linux
Avanzado
Leer guía
Metrics~45 min

Controlar la cardinalidad de rutas HTTP en Prometheus antes de que las golden signals mientan

Creada: 1 de agosto de 2026 · Publicada: 1 de agosto de 2026

Aprende a detectar labels explosivas en métricas HTTP, normalizar rutas, proteger remote_write y validar paneles/alertas antes de publicar golden signals de APIs en Kubernetes.

Avanzado
Leer guía
OpenTelemetry~38 min

Enriquecer telemetría con lookup processor en OpenTelemetry sin disparar cardinalidad ni backpressure

Creada: 31 de julio de 2026 · Publicada: 31 de julio de 2026

Aprende a usar lookups en OpenTelemetry Collector sin convertir el pipeline en una fuente de latencia, colas o atributos explosivos.

Linux
Avanzado
Leer guía
Metrics~40 min

Golden signals para controller-runtime: detectar caché lenta antes de culpar al API server

Creada: 30 de julio de 2026 · Publicada: 30 de julio de 2026

Aprende a instrumentar y diagnosticar controladores Kubernetes con métricas de controller-runtime, workqueue, caché y cliente REST antes de tocar concurrencia o reiniciar pods a ciegas.

Linux
Avanzado
Leer guía
Reliability~35 min

Triaje de alertas SLO burn rate desde Prometheus hasta trazas sin inventar culpables

Creada: 30 de julio de 2026 · Publicada: 30 de julio de 2026

Aprende a diseñar alertas multi-window, validar salud de telemetría y pivotar de PromQL a trazas para investigar burn rate sin perseguir fantasmas.

Linux
Intermedio
Leer guía
OpenTelemetry~35 min

Validar métricas de hosts Linux con OpenTelemetry Collector antes de quedarte con dashboards vacíos

Creada: 28 de julio de 2026 · Publicada: 28 de julio de 2026

Aprende a validar un pipeline hostmetrics de OpenTelemetry Collector en Linux con systemd, self-telemetry, Prometheus y guardrails de rollout antes de confiar en dashboards que todavía no prueban nada.

LinuxDocker
Intermedio
Leer guía
Logs~45 min

Redactar PII en pipelines Vector sin perder evidencia de incidentes

Creada: 27 de julio de 2026 · Publicada: 27 de julio de 2026

Aprende a validar reglas VRL de redacción en Vector, medir fugas de PII y proteger la investigación de incidentes antes de enviar logs a OpenSearch o Loki.

LinuxDocker
Avanzado
Leer guía
OpenTelemetry~35 min

Activar logdedup en OpenTelemetry Collector sin ocultar incidentes

Creada: 26 de julio de 2026 · Publicada: 26 de julio de 2026

Una guía práctica para usar el procesador logdedup del OpenTelemetry Collector sin convertir la reducción de volumen en pérdida de evidencia durante incidentes.

LinuxDocker
Avanzado
Leer guía
Metrics~45 min

Controlar cardinalidad de métricas custom de Kubernetes antes de que HPA y remote_write mientan

Creada: 25 de julio de 2026 · Publicada: 25 de julio de 2026

Aprende a diseñar, auditar y desplegar exporters de métricas custom en Kubernetes con presupuestos de labels, pruebas PromQL, guardrails de remote_write y validación de HPA.

LinuxDocker
Avanzado
Leer guía
Logs~35 min

Construir timelines de incidentes en Kubernetes con señales OTel sin inventar la causa raíz

Creada: 24 de julio de 2026 · Publicada: 24 de julio de 2026

Aprende a reconstruir una línea temporal operativa con OpenTelemetry, Prometheus, logs y eventos de Kubernetes para separar causa, síntoma y mitigación sin depender de intuición.

Linux
Intermedio
Leer guía
Tracing~45 min

Evitar OOMKills en tail sampling de OpenTelemetry Collector sin perder trazas de incidente

Creada: 23 de julio de 2026 · Publicada: 23 de julio de 2026

Aprende a controlar la presión de memoria del tail sampling en OpenTelemetry Collector sin perder las trazas que necesitas durante un incidente.

Linux
Avanzado
Leer guía
Metrics~45 min

Autoescalar Kubernetes con señales de OpenSearch sin crear bucles de feedback

Creada: 22 de julio de 2026 · Publicada: 22 de julio de 2026

Aprende a convertir consultas de OpenSearch en métricas externas de KEDA sin provocar oscilación, queries caras ni autoscaling basado en ruido.

Linux
Avanzado
Leer guía
Metrics~40 min

Limpiar ruido de kube-state-metrics antes de que tus dashboards deriven

Creada: 21 de julio de 2026 · Publicada: 21 de julio de 2026

Aprende a auditar cardinalidad de kube-state-metrics, diseñar allowlists seguras, validar paridad de alertas y desplegar cambios sin romper dashboards de Kubernetes.

Linux
Intermedio
Leer guía
Logs~35 min

Corregir cardinalidad de labels en Loki antes de que desaparezcan logs de incidente

Creada: 12 de julio de 2026 · Publicada: 12 de julio de 2026

Aprende a detectar labels explosivos en Loki, mover contexto volátil fuera del índice y validar que los logs críticos siguen disponibles durante incidentes.

LinuxDocker
Avanzado
Leer guía
Reliability~45 min

Diseñar alertas SLO de burn rate multi-ventana sin despertar a nadie por ruido

Creada: 11 de julio de 2026 · Publicada: 11 de julio de 2026

Aprende a definir SLIs, budget, PromQL y pruebas promtool para alertas de burn rate que detectan incidentes rápidos sin convertir cada pico corto en una guardia rota.

Linux
Intermedio
Leer guía
OpenTelemetry~45 min

Detectar backpressure de ingesta entre OpenTelemetry, Data Prepper y OpenSearch antes de perder telemetría

Creada: 10 de julio de 2026 · Publicada: 10 de julio de 2026

Aprende a validar Collector, Data Prepper y OpenSearch con métricas de paridad, colas y rechazos para frenar drops de trazas, logs o métricas antes de que desaparezca la evidencia del incidente.

LinuxDocker
Avanzado
Leer guía
Logs~45 min

Depurar pipelines de Vector cuando los logs llegan tarde, rotos o nunca llegan

Creada: 9 de julio de 2026 · Publicada: 9 de julio de 2026

Aprende a validar una tubería de Vector con evidencias: config, VRL, tap, métricas internas, backpressure, canary y criterios de rollback.

LinuxDocker
Intermedio
Leer guía
Tracing~45 min

Ajustar sampling de OpenTelemetry sin perder trazas de incidente por wrappers mal diseñados

Creada: 8 de julio de 2026 · Publicada: 8 de julio de 2026

Aprende a detectar wrappers de instrumentación que ocultan atributos útiles, diseñar políticas de tail sampling y validar que las trazas importantes siguen llegando antes de reducir coste.

LinuxDocker
Avanzado
Leer guía
Metrics~40 min

Montar golden signals para APIs HTTP en Kubernetes sin disparar la cardinalidad

Creada: 7 de julio de 2026 · Publicada: 7 de julio de 2026

Define un contrato de labels, crea recording rules RED/USE, valida cardinalidad con promtool y despliega dashboards de APIs Kubernetes sin convertir cada ruta en una fábrica de series.

LinuxDocker
Intermedio
Leer guía
Logs~45 min

Diagnosticar hot shards de búsqueda vectorial en OpenSearch antes de disparar la latencia RAG

Creada: 6 de julio de 2026 · Publicada: 6 de julio de 2026

Aprende a detectar hot shards en índices vectoriales de OpenSearch, validar si afectan al RAG y aplicar mitigaciones seguras con Dev Tools, métricas y canaries.

LinuxDocker
Avanzado
Leer guía
Metrics~45 min

Blindar recording rules de Prometheus antes de que disparen la cardinalidad

Creada: 3 de julio de 2026 · Publicada: 3 de julio de 2026

Aprende a auditar recording rules de Prometheus, fijar un presupuesto de labels, validar con promtool y promocionar sin fundir remote write ni dashboards.

LinuxDocker
Avanzado
Leer guía
OpenTelemetry~50 min

Desplegar configuración declarativa de OpenTelemetry Collector sin perder telemetría

Creada: 2 de julio de 2026 · Publicada: 2 de julio de 2026

Aprende a pasar a configuración declarativa del OpenTelemetry Collector con dry-runs, canary, métricas de queue/exporter, pruebas PromQL y rollback preparado.

LinuxDocker
Avanzado
Leer guía
Logs~45 min

Reconstruir timelines de incidentes de búsqueda AI sin inventarte la película

Creada: 1 de julio de 2026 · Publicada: 1 de julio de 2026

Aprende a convertir señales dispersas en una línea temporal verificable: ventana del incidente, hipótesis falsables, trazas ancla, logs correlacionados, métricas de saturación y validación de mitigación.

LinuxDocker
Intermedio
Leer guía
Logs~45 min

Deduplicar logs con OpenTelemetry antes de que los límites de Loki oculten evidencias

Creada: 30 de junio de 2026 · Publicada: 30 de junio de 2026

Aprende a detectar duplicados, aplicar una política de deduplicación segura en OpenTelemetry Collector y validar que Loki deja de descartar muestras sin perder evidencias de incidentes.

Linux
Avanzado
Leer guía
Metrics~35 min

Controlar target churn de Kubernetes en Prometheus antes de que los scrape pools se atasquen

Creada: 29 de junio de 2026 · Publicada: 29 de junio de 2026

Una guía práctica para reducir churn de targets Kubernetes en Prometheus con PromQL, relabeling canary, promtool y guardrails de rollout.

LinuxDocker
Avanzado
Leer guía
OpenTelemetry~45 min

Diagnosticar backpressure en OpenTelemetry Collector antes de perder señales

Creada: 28 de junio de 2026 · Publicada: 28 de junio de 2026

Aprende a leer las métricas internas del OpenTelemetry Collector, aislar exporters lentos, probar un canary seguro y validar que las colas drenan sin ocultar spans, logs o métricas críticas.

Linux
Avanzado
Leer guía
Logs~45 min

Diagnosticar hot shards en OpenSearch antes de que las colas de indexación se disparen

Creada: 27 de junio de 2026 · Publicada: 27 de junio de 2026

Aprende a encontrar hot shards en OpenSearch con Dev Tools, métricas de colas y validación canary antes de que la latencia de búsqueda o los rechazos de bulk arruinen el día.

Linux
Avanzado
Leer guía
Metrics~35 min

Limpiar ruido de kube-state-metrics antes de que las métricas de dispositivos disparen la cardinalidad

Creada: 26 de junio de 2026 · Publicada: 26 de junio de 2026

Detecta qué métricas de kube-state-metrics inflan Prometheus, poda labels volátiles con allowlists y valida que alertas y dashboards sigan funcionando antes de desplegar el cambio.

Linux
Intermedio
Leer guía
Logs~45 min

Depurar backpressure en pipelines de Vector antes de perder logs

Creada: 25 de junio de 2026 · Publicada: 25 de junio de 2026

Aprende a diagnosticar retrasos y pérdidas en Vector con métricas internas, `vector top`, reglas PromQL, buffers de disco y un canary seguro antes de tocar producción.

LinuxDocker
Avanzado
Leer guía
Reliability~35 min

Diseñar alertas de burn rate con Kubernetes PSI antes de que la latencia despierte a nadie

Creada: 24 de junio de 2026 · Publicada: 24 de junio de 2026

Una guía práctica para convertir burn-rate alerts en señales accionables: SLO claro, ventanas múltiples, PSI como contexto, pruebas con promtool y despliegue gradual.

Linux
Intermedio
Leer guía
Metrics~35 min

Diagnosticar presión de WATCH/LIST en Kubernetes API antes de culpar a etcd

Creada: 23 de junio de 2026 · Publicada: 23 de junio de 2026

Una guía accionable para detectar presión de WATCH/LIST en Kubernetes API combinando métricas de API server, etcd, Prometheus y validaciones de clientes antes de que aparezcan timeouts.

Linux
Avanzado
Leer guía
Metrics~40 min

Enriquecer métricas en Prometheus con info() sin disparar la cardinalidad

Creada: 22 de junio de 2026 · Publicada: 22 de junio de 2026

Guía práctica para probar la función experimental info() de Prometheus, crear una allowlist de metadatos, medir el impacto en series y validar que alertas y SLOs siguen funcionando.

LinuxDocker
Intermedio
Leer guía
Tracing~45 min

Ajustar tail sampling de OTel para GenAI sin perder evidencia de incidentes

Creada: 21 de junio de 2026 · Publicada: 21 de junio de 2026

Guía práctica para desplegar tail sampling en OpenTelemetry Collector cuando las trazas de GenAI y RAG crecen rápido: políticas, canary, métricas de cola y validación de evidencia crítica.

Linux
Avanzado
Leer guía
Logs~40 min

Diagnosticar límites de ingestión y políticas de labels en Loki antes de perder logs

Creada: 20 de junio de 2026 · Publicada: 20 de junio de 2026

Aprende a investigar drops en Loki por políticas de labels, rate limits y exceso de streams, limpiar labels volátiles y validar que las búsquedas críticas siguen funcionando.

Linux
Avanzado
Leer guía
Logs~45 min

Controlar cardinalidad en Vector antes de que remote write y sinks hagan backpressure

Creada: 19 de junio de 2026 · Publicada: 19 de junio de 2026

Guía práctica para contener etiquetas explosivas en Vector 0.56, separar cardinalidad de retries/buffers y validar que Prometheus, logs y SLOs siguen contando la verdad.

Linux
Avanzado
Leer guía
OpenTelemetry~40 min

Usar OTTL context inference en el Filter Processor sin tirar telemetría crítica

Creada: 18 de junio de 2026 · Publicada: 18 de junio de 2026

Una guía práctica para filtrar logs, métricas y trazas ruidosas con OTTL context inference, validando que errores, señales SLO y evidencias de incidente siguen presentes.

Linux
Avanzado
Leer guía
OpenTelemetry~40 min

Validar OTel-Arrow sin perder telemetría cuando llegue la presión

Creada: 17 de junio de 2026 · Publicada: 17 de junio de 2026

OTel-Arrow promete pipelines más eficientes, pero el despliegue sano no se basa en una promesa de rendimiento: se basa en demostrar que la presión se ve, las colas drenan y no hay drops ocultos.

Linux
Avanzado
Leer guía
Tracing~35 min

Usar OBI header enrichment para acotar incidentes sin filtrar secretos

Creada: 16 de junio de 2026 · Publicada: 16 de junio de 2026

Configura OpenTelemetry eBPF Instrumentation para enriquecer trazas con headers útiles, obfuscar credenciales y validar que la respuesta a incidentes gana contexto sin exponer datos sensibles.

Linux
Avanzado
Leer guía
Logs~42 min

Evita que los picos de logs conviertan el rollover de OpenSearch en hot shards

Creada: 15 de junio de 2026 · Publicada: 15 de junio de 2026

Aprende a detectar cuándo un índice de logs en OpenSearch está creando hot shards durante picos de ingesta, corregir el rollover con alias e ISM, y validar la recuperación con señales reales.

LinuxDocker
Avanzado
Leer guía
Metrics~40 min

Depurar relabeling de Prometheus cuando desaparecen targets sin disparar cardinalidad

Creada: 14 de junio de 2026 · Publicada: 14 de junio de 2026

Aprende a corregir reglas de relabeling de Prometheus que eliminan targets útiles o conservan labels inestables, sin romper alertas ni inflar la TSDB.

Linux
Intermedio
Leer guía
OpenTelemetry~40 min

Deduplicar logs en OpenTelemetry Collector antes de que las colas empiecen a tirar señales

Creada: 13 de junio de 2026 · Publicada: 13 de junio de 2026

Aprende a detectar presión en pipelines de logs del OpenTelemetry Collector, aplicar logdedup con condiciones seguras y validar que las colas, memoria y exporters se estabilizan sin romper auditoría ni alertas.

LinuxDocker
Avanzado
Leer guía
Metrics~35 min

Usar métricas PSI de Kubernetes para detectar saturación real en APIs sin paginar por ruido

Creada: 12 de junio de 2026 · Publicada: 12 de junio de 2026

Guía práctica para añadir PSI a los dashboards de APIs en Kubernetes, correlacionar presión de CPU/memoria/IO con SLIs y diseñar alertas que paginen solo cuando hay impacto real.

Linux
Intermedio
Leer guía
Reliability~35 min

Diseñar alertas de burn rate SLO que paginen por impacto real, no por ruido

Creada: 11 de junio de 2026 · Publicada: 11 de junio de 2026

Aprende a definir un SLI útil, combinar ventanas multi-burn, controlar cardinalidad y validar que una alerta SLO despierta solo cuando hay impacto real.

Linux
Intermedio
Leer guía
Metrics~35 min

Limpiar ruido de kube-state-metrics antes de que tus dashboards y alertas mientan

Creada: 10 de junio de 2026 · Publicada: 10 de junio de 2026

kube-state-metrics puede convertir el estado de Kubernetes en una tormenta de series, labels y paneles que parecen precisos pero no ayudan. Esta guía muestra cómo medir el ruido, recortar labels inestables, mantener señales clave y validar Prometheus antes de tocar producción.

LinuxDocker
Intermedio
Leer guía
Logs~40 min

Construir timelines de incidentes con logs, métricas y trazas sin inventarte la película

Creada: 2 de mayo de 2026 · Publicada: 2 de mayo de 2026

Aprende a reconstruir un incidente real a partir de Prometheus, Loki y trazas distribuidas sin perderte en ruido, relojes desalineados ni teorías creativas.

LinuxDocker
Intermedio
Leer guía
Logs~40 min

Depurar pipelines de Vector antes de que retries y buffers tapen el cuello real

Creada: 1 de mayo de 2026 · Publicada: 1 de mayo de 2026

Una guía práctica para usar métricas internas de Vector, validación de configuración y pruebas de aislamiento cuando los logs llegan tarde, se reintentan demasiado o desaparecen.

LinuxDocker
Intermedio
Leer guía
Metrics~40 min

Reducir picos de cardinalidad en Prometheus sin dejar ciegas tus alertas

Creada: 30 de abril de 2026 · Publicada: 30 de abril de 2026

Una guía práctica para detectar cuándo Prometheus se infla por labels inestables, recortar la cardinalidad en el sitio correcto y validar que las alertas siguen cubriendo el incidente real.

LinuxDocker
Avanzado
Leer guía
Logs~40 min

Arreglar la explosión de labels en Loki sin romper las búsquedas que sí importan

Creada: 29 de abril de 2026 · Publicada: 29 de abril de 2026

Una guía práctica para identificar labels de alta cardinalidad en Loki, sacarlas de la ruta crítica y validar que las búsquedas sigan siendo útiles.

LinuxDocker
Avanzado
Leer guía
Tracing~45 min

Ajustar sampling distribuido sin quedarte ciego cuando llega el incidente

Creada: 28 de abril de 2026 · Publicada: 28 de abril de 2026

Una guía práctica para detectar sesgos de sampling, aplicar tail sampling útil y validar que sigues viendo justo las trazas que importan.

LinuxDocker
Avanzado
Leer guía
Logs~40 min

Diagnosticar hot shards en OpenSearch antes de que se disparen la latencia y las colas de indexación

Creada: 27 de abril de 2026 · Publicada: 27 de abril de 2026

Aprende a confirmar un hot shard en OpenSearch, localizar el índice y nodo problemáticos, corregir la causa y validar que la recuperación es real.

LinuxDocker
Avanzado
Leer guía
Metrics~40 min

Entender las métricas de memoria de Kubernetes sin disparar falsas alertas de OOM

Creada: 26 de abril de 2026 · Publicada: 26 de abril de 2026

Guía práctica para diagnosticar memoria de contenedores en Kubernetes con Prometheus y Grafana sin confundir usage, working set, RSS ni page cache recuperable.

LinuxDocker
Intermedio
Leer guía
Metrics~35 min

Montar golden signals útiles para APIs en Kubernetes sin disparar la cardinalidad de Prometheus

Creada: 26 de abril de 2026 · Publicada: 26 de abril de 2026

Una guía práctica para definir tráfico, latencia, errores y saturación en APIs sobre Kubernetes sin llenar Prometheus de series inútiles ni romper alertas.

LinuxDocker
Intermedio
Leer guía
OpenTelemetry~35 min

Diagnosticar backpressure en OpenTelemetry Collector antes de perder señales

Creada: 25 de abril de 2026 · Publicada: 25 de abril de 2026

Una guía de troubleshooting avanzada para aislar si el atasco está en el exporter, la red, el backend o el propio Collector antes de empezar a perder telemetría.

DockerLinux
Avanzado
Leer guía
Reliability~36 min

Diseñar alertas de burn rate que no despierten a nadie por gusto

Creada: 22 de abril de 2026 · Publicada: 22 de abril de 2026

Las releases recientes de Prometheus, OpenTelemetry Collector, Loki y Alloy dejan una lección bastante poco romántica: las alertas atadas a métricas crudas y labels frágiles se rompen o se vuelven ruidosas con facilidad. Esta guía muestra cómo aterrizar burn-rate alerts sobre recording rules estables, validarlas con promtool y desplegarlas sin convertir cada pico corto en una falsa urgencia.

LinuxDocker
Intermedio
Leer guía
Metrics~38 min

Limpiar ruido de kube-state-metrics para que tus dashboards vuelvan a decir algo

Creada: 20 de abril de 2026 · Publicada: 20 de abril de 2026

kube-state-metrics sigue siendo útil, pero en 2026 llega con más superficie, más métricas estables y cambios recientes como EndpointSlices por defecto. Si tus paneles se llenaron de series irrelevantes, joins frágiles o estados duplicados, esta guía te enseña a reducir ruido en la fuente, corregir consultas y validar que el recorte no rompe alertas ni troubleshooting.

LinuxDocker
Intermedio
Leer guía
Tracing~42 min

Ajustar sampling distribuido sin quedarte ciego cuando más duele

Creada: 19 de abril de 2026 · Publicada: 19 de abril de 2026

Las señales recientes del ecosistema apuntan al mismo problema: el sampling mal planteado sigue rompiendo diagnósticos justo en incidentes reales. Entre cambios recientes del OpenTelemetry Collector, nuevas validaciones más estrictas y backends de trazas todavía sensibles a series, colas y exemplars, esta guía propone un enfoque práctico para bajar coste sin perder las trazas que sí importan.

LinuxDocker
Avanzado
Leer guía
Logs~42 min

Construir timelines de incidentes con logs, métricas y trazas sin inventarte la película

Creada: 19 de abril de 2026 · Publicada: 19 de abril de 2026

Las señales recientes del ecosistema apuntan a lo mismo: más telemetría no garantiza mejores diagnósticos. Esta guía aterriza un método reproducible para construir timelines fiables con Prometheus, Loki y OpenTelemetry, evitando errores muy actuales como métricas de memoria mal interpretadas, labels ruidosos y trazas sin suficiente contexto de petición.

LinuxDocker
Intermedio
Leer guía
Logs~55 min

Resolver hot shards en OpenSearch antes de que el clúster empiece a arder

Creada: 19 de abril de 2026 · Publicada: 19 de abril de 2026

Guía avanzada para aislar hot shards en OpenSearch con señales de nodo, shard e ingesta, y aplicar mitigaciones reversibles antes de que aparezcan colas, timeouts y backlogs.

LinuxDocker
Avanzado
Leer guía
Logs~24 min

Depurar pipelines de Vector cuando los logs llegan tarde, mal o nunca

Creada: 17 de abril de 2026 · Publicada: 17 de abril de 2026

Cuando un pipeline de Vector empieza a retrasar, duplicar o perder eventos, el problema casi nunca se resuelve tocando parámetros al azar. Esta guía muestra cómo usar métricas internas, validación de configuración y señales del sink para encontrar el cuello real y corregirlo con cambios reversibles.

DockerLinux
Intermedio
Leer guía
Metrics~45 min

Golden signals prácticos para APIs en Kubernetes sin inflar el stack

Creada: 15 de abril de 2026 · Publicada: 15 de abril de 2026

Guía técnica para definir golden signals aplicables a APIs en Kubernetes: métricas Prometheus, consultas PromQL, paneles de Grafana, reglas de alerta y un flujo de troubleshooting para diagnosticar y validar mitigaciones sin añadir agentes innecesarios.

LinuxDocker
Intermedio
Leer guía
Logs~60 min

Qué hacer cuando Loki se hunde por labels con demasiada cardinalidad

Creada: 13 de abril de 2026 · Publicada: 13 de abril de 2026

Guía práctica para detectar y arreglar problemas de alta cardinalidad en labels que degradan o bloquean Loki: síntomas operativos, métricas y logs a revisar, cambios seguros en Promtail/ingest pipelines y comprobaciones de validación.

DockerLinux
Avanzado
Leer guía
Metrics~60 min

Reducir picos de cardinalidad en Prometheus sin romper alertas

Creada: 11 de abril de 2026 · Publicada: 11 de abril de 2026

Guía práctica para detectar fuentes de cardinalidad alta, aplicar relabeling y rollups seguros, y validar que las alertas críticas siguen siendo efectivas.

DockerLinux
Avanzado
Leer guía
OpenTelemetry~35 min

Diagnosticar backpressure en OpenTelemetry Collector antes de perder señales

Creada: 10 de abril de 2026 · Publicada: 10 de abril de 2026

Una guía de troubleshooting avanzada para aislar si el atasco está en el exporter, la red, el backend o el propio Collector antes de empezar a perder telemetría.

DockerLinux
Avanzado
Leer guía
Metrics~32 min

Downsampling de métricas con VictoriaMetrics en la versión gratuita

Creada: 10 de abril de 2026 · Publicada: 10 de abril de 2026

VictoriaMetrics Enterprise ofrece downsampling nativo en cluster. En la versión gratuita puedes aproximarlo con clusters separados, fan-out y `-dedup.minScrapeInterval`.

Avanzado
Leer guía
Logs~28 min

Dimensiona shards en OpenSearch con ingesta real

Creada: 9 de abril de 2026 · Publicada: 9 de abril de 2026

Guía avanzada para decidir `number_of_shards` y `max_size` a partir de la ingesta real del índice.

Avanzado
Leer guía
Dashboards~20 min

Grafana para unificar métricas, logs y trazas (multiplataforma)

Creada: 7 de abril de 2026 · Publicada: 7 de abril de 2026

Despliega Grafana, provisiona datasources y deja un espacio listo para explorar métricas, logs y correlación con trazas.

Docker
Intermedio
Leer guía
Logs~18 min

OpenSearch para centralizar logs (multiplataforma)

Creada: 6 de abril de 2026 · Publicada: 6 de abril de 2026

Configura OpenSearch y Dashboards, carga eventos iniciales y valida consultas operativas de logs en cualquier plataforma.

Docker
Principiante
Leer guía
Metrics~16 min

Prometheus para métricas del sistema (multiplataforma)

Creada: 5 de abril de 2026 · Publicada: 5 de abril de 2026

Configura Prometheus y verifica métricas operativas con un flujo reproducible, independientemente del sistema operativo del equipo.

Docker
Principiante
Leer guía
Tracing~10 min

Detectar regresiones tras un despliegue con trazas

Creada: 2 de abril de 2026 · Publicada: 2 de abril de 2026

Qué comparar, qué atributos segmentar y qué spans revisar cuando sospechas que un deploy ha introducido latencia o errores.

Intermedio
Leer guía
Reliability~12 min

Diseñar SLOs para equipos de plataforma

Creada: 30 de marzo de 2026 · Publicada: 30 de marzo de 2026

Un marco breve para escoger indicadores y objetivos que ayuden a negociar fiabilidad con producto y desarrollo.

Intermedio
Leer guía
OpenTelemetry~18 min

Fundamentos de observabilidad con OpenTelemetry

Creada: 21 de marzo de 2026 · Publicada: 21 de marzo de 2026

Una guía para pasar de instrumentar por moda a responder preguntas operativas reales con logs, métricas y trazas conectadas.

Principiante
Leer guía