Skip to content

Alerts

Resumen del dashboardSQL Server

Descripcion de la pagina

Esta pagina concentra la supervision operativa de alertas para SQL Server y Windows. Reune en una sola vista la cola de alertas activas de Grafana, indicadores de reinicio del sistema, espacio libre en disco, volumen de conexiones, crecimiento del log de transacciones, estado resumido de alertas SQL y la salud de entornos con Always On o instancias en clúster.

Su objetivo es acelerar el triaje tecnico. Combina paneles historicos para detectar cambios recientes con tablas e indicadores de estado para localizar rapidamente bloqueos, problemas de servicios, retrasos de sincronizacion y situaciones que pueden afectar disponibilidad, capacidad o cumplimiento de RPO y RTO.

Variables

VariableDescripcion
Rango temporalIntervalo aplicado a los paneles historicos de tendencia, como uptime, conexiones, log usado, failover y retraso de sincronizacion. Las tablas de estado muestran principalmente la situacion actual, pero siguen el contexto temporal general del dashboard.

Alertas activas

Esta parte abre el dashboard con la lista de alertas de Grafana que estan disparadas o pendientes. Sirve como punto de entrada para priorizar incidencias antes de revisar su detalle en el resto de paneles.

Active alerts

  • Descripcion: Lista las alertas activas del dashboard y muestra las que estan en estado de disparo, error o pendiente para facilitar una revision rapida de lo que requiere atencion inmediata.
  • Tipo de panel: alertlist

Recomendacion practica: Empieza por las alertas en estado firing y contrastalas con los paneles de detalle de esta misma pagina para validar alcance, criticidad y posible causa raiz.

Salud operativa del servidor

Esta seccion agrupa las alertas basicas de sistema y motor que suelen requerir una primera comprobacion operativa: reinicios recientes, capacidad de disco, presion por conexiones y crecimiento del log de transacciones.

System Up Time

  • Descripcion: Muestra el tiempo transcurrido desde el ultimo arranque del sistema por servidor. Una caida por debajo de 24 horas sugiere un reinicio reciente, ya sea por mantenimiento planificado, actualizaciones, incidencia de hardware o apagado inesperado.
  • Tipo de panel: timeseries
  • Unidades: Segundos (s)

Colores por valor:

ValorColorDescripcion
COYOTE-SQL02Serie del segundo servidor monitorizado en esta comparativa.
COYOTE-SQL01Serie del primer servidor monitorizado en esta comparativa.

Recomendacion practica: Si el valor cae de forma brusca, revisa en Windows los eventos 1074, 41, 6008 y 1001 alrededor del reinicio para distinguir entre mantenimiento, fallo electrico, bugcheck o reinicio no planificado.

Disk Free Space

  • Descripcion: Presenta el porcentaje de espacio libre por disco y servidor en formato de barra horizontal. Ayuda a detectar rapido las unidades con menos capacidad disponible y priorizar limpieza o ampliacion antes de que el crecimiento afecte a bases de datos, logs o copias de seguridad.
  • Tipo de panel: bargauge
  • Unidades: Porcentaje (%)

Umbrales:

ValorColorDescripcion
Resto de valoresEspacio libre critico, por debajo del nivel minimo recomendado.
> 10Espacio libre bajo; conviene planificar limpieza o crecimiento.
> 20Espacio libre en rango operativo comodo.

Recomendacion practica: Si una unidad cae por debajo del 20 %, revisa crecimiento de datos, logs, tempdb y carpetas de backup, y deja margen suficiente para autogrowth y operaciones de mantenimiento.

User Connections

  • Descripcion: Grafica el numero de conexiones de usuario activas por servidor. Un crecimiento sostenido por encima del umbral definido puede reflejar picos reales de carga, problemas de connection pooling o sesiones que no se reciclan correctamente.
  • Tipo de panel: timeseries
  • Unidades: Conteo de conexiones

Colores por valor:

ValorColorDescripcion
COYOTE-SQL01Serie del primer servidor monitorizado.
COYOTE-SQL02Serie del segundo servidor monitorizado.

Recomendacion practica: Si el volumen se mantiene muy alto, revisa connection pooling, sesiones en estado sleeping durante mucho tiempo y aplicaciones que abren conexiones sin cerrarlas con rapidez.

Used Log Size

  • Descripcion: Mide el tamano total usado por los logs de transaccion agregados por servidor. Cuando supera el umbral operativo previsto puede indicar transacciones largas, falta de backups de log o retrasos en tecnologias que impiden truncar el log.
  • Tipo de panel: timeseries
  • Unidades: Kilobytes (KB)

Colores por valor:

ValorColorDescripcion
COYOTE-SQL02Serie del segundo servidor monitorizado.
COYOTE-SQL01Serie del primer servidor monitorizado.

Recomendacion practica: Si el log crece con rapidez, valida la cadencia de backups de log, revisa log_reuse_wait_desc y busca transacciones largas, porque Microsoft recomienda backups frecuentes para truncar el log y reducir exposicion a perdida de trabajo.

Estado global de alertas SQL

Esta parte resume el estado general de alertas SQL por servidor y lo acompana con indicadores dedicados a capacidad, backups, bloqueos y servicios. Es la vista mas util para identificar de un vistazo si hay algun KO que exija profundizar en una incidencia concreta.

Estado global de alertas SQL

  • Descripcion: Tabla resumen por servidor que indica si existen sesiones bloqueadas, bloqueos prolongados, consultas largas y problemas en SQL Agent o SQL Mail. Facilita localizar rapidamente servidores con incidencias activas o servicios degradados.
  • Tipo de panel: table

Colores por valor:

ColumnaValorColorDescripcion
BlockedOKNo se detectan sesiones bloqueadas en ese momento.
KOHay bloqueos activos que requieren revision.
Long_BlockedOKNo hay bloqueos prolongados detectados.
KOExiste al menos un bloqueo prolongado.
Long QuerysOKNo se aprecian consultas largas en el criterio configurado.
KOHay consultas de larga duracion que conviene analizar.
SQL Agent StatusOKEl servicio de SQL Server Agent esta operativo.
KOSQL Server Agent presenta una incidencia o no esta disponible.
SQL Mail StatusOKDatabase Mail responde correctamente.
KOHay errores de envio o fallo del servicio de correo.

Recomendacion practica: Usa esta tabla como resumen inicial y profundiza primero en cualquier KO, dando prioridad a bloqueos prolongados, consultas largas y servicios caidos porque pueden afectar directamente a disponibilidad y operacion diaria.

Disk Free Space alert

  • Descripcion: Indicador auxiliar de alerta dedicado a reflejar si la condicion de poco espacio libre en disco esta activa dentro del dashboard.
  • Tipo de panel: timeseries

Recomendacion practica: Si este indicador se activa, revisa enseguida el panel detallado de espacio libre y confirma que existe margen para crecimiento de datos, logs y backups antes de que se produzcan fallos de escritura.

Backup State

  • Descripcion: Indicador auxiliar destinado a mostrar el estado de las alertas relacionadas con copias de seguridad y a advertir de posibles desviaciones en la estrategia de backup.
  • Tipo de panel: timeseries

Recomendacion practica: Verifica la fecha de la ultima copia Full, Differential y Log y ajusta la frecuencia para alinearla con el RPO comprometido.

Blocked Process > 5

  • Descripcion: Indicador de alerta orientado a detectar bloqueos que superan un umbral corto configurado en el dashboard, util para identificar rapidamente problemas de concurrencia antes de que escalen.
  • Tipo de panel: timeseries

Recomendacion practica: Si aparece actividad, identifica la cadena de bloqueo cuanto antes y revisa consultas, transacciones abiertas y posibles esperas por bloqueos repetitivos.

SQL Mail Error

  • Descripcion: Indicador auxiliar para alertar de errores en SQL Mail o Database Mail, relevantes porque pueden impedir el envio de notificaciones y resultados automatizados.
  • Tipo de panel: timeseries

Recomendacion practica: Comprueba el estado de Database Mail, la cola de mensajes fallidos y la conectividad SMTP para no perder avisos criticos.

Blocked Process > 30m

  • Descripcion: Indicador de alerta para bloqueos de larga duracion. Senala escenarios en los que una sesion bloqueante lleva demasiado tiempo afectando a otras operaciones.
  • Tipo de panel: timeseries

Recomendacion practica: Trata cualquier activacion prolongada como una incidencia prioritaria, porque un bloqueo sostenido suele terminar en timeouts, acumulacion de espera y degradacion visible en aplicaciones.

SQL Agent Status

  • Descripcion: Indicador auxiliar que ayuda a confirmar si SQL Server Agent se mantiene disponible para ejecutar jobs de mantenimiento, backup y automatizacion.
  • Tipo de panel: timeseries

Recomendacion practica: Si deja de estar disponible, revisa el servicio, su cuenta asociada y el historial reciente de jobs, porque la perdida de Agent suele afectar a backups y tareas programadas.

Alta disponibilidad

Esta seccion se centra en la salud de Always On y de entornos relacionados con failover. Permite validar que las replicas mantienen el rol esperado y que el retraso de sincronizacion no compromete tiempos de recuperacion ni lectura consistente en secundarias.

Roles de replicas Always On

  • Descripcion: Tabla que muestra por grupo de disponibilidad el servidor que aloja cada replica y el rol actual que esta desempenando. Es util para comprobar la configuracion esperada e identificar rapidamente que nodo esta actuando como PRIMARY y cuales permanecen como SECONDARY.
  • Tipo de panel: table

Recomendacion practica: Verifica tras cualquier mantenimiento o failover que el nodo esperado vuelve a quedar como PRIMARY y que las replicas secundarias visibles coinciden con el diseno del grupo.

Failover

  • Descripcion: Serie temporal del rol reportado por cada grupo o instancia agrupada, con estados como PRIMARY, SECONDARY o RESOLVING. Ayuda a detectar cambios de rol, transiciones no planificadas y periodos de inestabilidad en alta disponibilidad.
  • Tipo de panel: timeseries

Recomendacion practica: Si observas cambios de rol inesperados, correlacionalos con ventanas de mantenimiento, eventos del clúster y salud de replicas para confirmar que no se ha producido un failover no deseado.

Data Synchronization Lag

  • Descripcion: Muestra la cantidad de datos pendientes de rehacer en las replicas secundarias. Un crecimiento sostenido implica mayor retraso en la aplicacion de cambios, posible lectura desactualizada en secundarias y aumento del tiempo necesario para completar un failover.
  • Tipo de panel: timeseries
  • Unidades: Kilobytes (KB)

Colores por valor:

ValorColorDescripcion
COYOTE-AG:testSerie del primer grupo de disponibilidad destacado en el panel.
COYOTE-AG:WideWorldImportersSerie del segundo grupo de disponibilidad destacado en el panel.

Recomendacion practica: Si la cola crece de forma persistente, compara el valor con tu linea base de redo_rate, revisa saturacion de red o I/O y confirma que las consultas en secundarias no esten bloqueando el proceso de redo.

Data Synchronization Lag Time(Beta)

  • Descripcion: Estima en segundos el retraso temporal entre replicas. Complementa el panel anterior porque traduce la cola de sincronizacion a una medida mas directa del desfase que puede impactar en RPO y en la frescura de lecturas sobre secundarias.
  • Tipo de panel: timeseries
  • Unidades: Segundos (s)

Colores por valor:

ValorColorDescripcion
COYOTE-AG:testSerie del primer grupo de disponibilidad destacado en el panel.
COYOTE-AG:WideWorldImportersSerie del segundo grupo de disponibilidad destacado en el panel.

Recomendacion practica: Usa este panel como alerta temprana de perdida de frescura en secundarias y revisa la salud del grupo si el desfase temporal aumenta de forma sostenida durante carga normal.

Extra Alerts

Esta ultima parte reserva alertas adicionales orientadas a incidencias concretas de consultas. Actua como complemento del resumen SQL global para avisar de errores y ejecuciones anormalmente largas.

Error Query Alert

  • Descripcion: Indicador adicional pensado para avisar de consultas que terminan con error o que cumplen la condicion de alerta definida para fallos de ejecucion.
  • Tipo de panel: timeseries

Recomendacion practica: Si se activa, correlaciona el momento del error con el SQL Server Error Log, cambios recientes de despliegue y posibles fallos de conectividad o permisos.

Long Query Alert

  • Descripcion: Indicador adicional para consultas de larga duracion que merecen revision por su posible impacto en CPU, I/O, bloqueos y experiencia de usuario.
  • Tipo de panel: timeseries

Recomendacion practica: Revisa las consultas mas costosas del periodo, sus planes de ejecucion y las esperas dominantes antes de que deriven en bloqueos o degradacion sostenida.