Alertas (alerter)¶
O alerter é um serviço de notificações integrado. Ele monitora o estado dos fluxos, do hardware do nó, da recepção DVB e da gravação DVR, e gera alertas (incidentes) quando algo ultrapassa os limites definidos. A lista de alertas ativos é visível no painel de administração; em uma rede com a replicação em todo o domínio ativada, cada nó mostra um conjunto consolidado de alertas de todo o domínio.
O alerter também funciona em um nó isolado — o Meshwork só é necessário para a replicação de alertas em todo o domínio.
Como funciona um alerta¶
Cada incidente tem um identificador estável: a reincidência do mesmo problema é o mesmo incidente, não um novo.
Um incidente passa por estados: gerado (observado pela primeira vez), atualizado (observado novamente com uma alteração significativa), resolvido (o problema desapareceu). O conjunto ativo são os incidentes que ainda não foram resolvidos.
Cada alerta tem um nível de gravidade (em ordem crescente: informação, aviso, erro, crítico, requer ação do administrador), um código (o tipo numérico de incidente — veja o catálogo abaixo), uma fonte (fluxo, nó, armazenamento), um nó de origem (quem gerou o alerta) e um nome de objeto legível.
A maioria dos alertas é baseada em nível: o serviço reavalia periodicamente a condição e gera ou resolve o alerta por conta própria. Parte dos alertas que exigem ação do administrador é persistente — eles não se resolvem sozinhos enquanto a causa não for eliminada (são resolvidos manualmente, veja Visualização e resolução de alertas).
A lista de alertas ativos é mantida na memória e é apagada ao reiniciar o serviço.
Controle no nível do fluxo. Cada fluxo tem um interruptor que silencia totalmente seus alertas (juntamente com os alertas de suas entradas e saídas) e um atraso de alerta: uma fonte que se recupera dentro do tempo definido não gera alerta — isso suaviza as oscilações de curta duração.
Configurações do alerter¶
As configurações estão na seção de alertas e exigem o papel de administrador. Os campos exatos estão descritos na seção Interface web; abaixo, o que pode ser configurado.
Interruptor principal do serviço de notificações (ativado por padrão).
Replicação em todo o domínio (ativada por padrão): um nó compartilha seus alertas com os nós do mesmo domínio e recebe os deles — cada nó mostra um conjunto consolidado. Só tem efeito quando um domínio está definido.
Replicação de alertas do sistema (desativada por padrão): os alertas sobre o hardware do nó (CPU e memória do host, processo do streamer e transcodificadores, carga de rede e GPU, threads de trabalho e o frontend DVB — códigos 16–23 e 40–45) são locais por padrão; ative-a para que também sejam replicados em todo o domínio. Os alertas de armazenamento (códigos 24–25) permanecem sempre locais.
Limiares de fluxo: tempo limite de ausência de dados (padrão 15 s), taxa de bits mínima admissível (verificação desativada por padrão), limiar de erros do contador de continuidade em uma janela de 10 s (níveis de aviso e erro).
Limiares de recursos do nó — pares «aviso / erro» em porcentagem para o CPU e a memória do host, o processo do streamer e os transcodificadores, a carga da interface de rede e do GPU, bem como o preenchimento do armazenamento DVR. Os limiares do host são definidos mais altos que os do processo do streamer e dos transcodificadores, para que um componente individual avise antes que toda a máquina fique saturada. O valor 0 desativa o nível correspondente.
Limiares do frontend DVB — nível de sinal, SNR/qualidade, taxa de erros de bit e blocos não corrigidos; aplicados a um adaptador com captura de sinal (lock).
Limiares de gravação DVR — o número de gravações falhadas consecutivas, o multiplicador de estagnação da gravação, a proporção de não cobertura do arquivo e o tempo de leitura/gravação dos chunks no disco.
Catálogo de códigos de alerta¶
O código é o tipo numérico de incidente, conveniente para agrupamento e localização. A coluna «Replicação» indica se o alerta é replicado em todo o domínio (quando a replicação está ativada) ou permanece local ao nó.
Fluxos: estado e ciclo de trabalho (fonte — fluxo)
Código |
Evento |
Replicação |
|---|---|---|
1 |
uma entrada ou saída passou ao estado de erro |
em todo o domínio |
2 |
erro irrecuperável do ciclo de trabalho, é necessário reset manual (requer ação do administrador) |
em todo o domínio |
3 |
um fluxo em execução não fornece dados por mais tempo que o tempo limite |
em todo o domínio |
4 |
a taxa de bits do fluxo permanece abaixo do mínimo |
em todo o domínio |
13 |
o fluxo está pausado: não resta nenhuma entrada utilizável (requer ação do administrador) |
em todo o domínio |
14 |
uma entrada ou saída se autoestacionou e não se recupera na nova tentativa (requer ação do administrador) |
em todo o domínio |
27 |
o fluxo funciona na entrada de reserva — ocorreu uma comutação |
em todo o domínio |
39 |
carga alta de CPU pela thread de trabalho do fluxo |
em todo o domínio |
Conformidade do fluxo de transporte (analisador TR 101 290) (fonte — fluxo; todos replicados em todo o domínio)
Código |
Evento |
|---|---|
5 |
descontinuidades PCR repetidas (TR 101 290, 2.3) |
6 |
intervalo de repetição PCR maior que 40 ms (2.3a) |
7 |
intervalo de repetição PAT maior que 500 ms (1.3) |
8 |
intervalo de repetição PMT maior que 500 ms (1.5) |
9 |
intervalo de repetição PTS maior que 700 ms (2.5) |
10 |
precisão PCR pior que 500 ns (2.4) |
11 |
estouro ou subfluxo do buffer T-STD para vídeo (3.3) |
12 |
deriva PCR maior que 30 ppm (histórico: o alerta não é mais gerado, a deriva é exibida como métrica — Medições contínuas) |
15 |
erros do contador de continuidade acima do limiar em uma janela curta (1.4) |
46 |
erro de CRC nas tabelas PSI (2.2) |
47 |
o indicador transport_error_indicator está ativado (2.1) |
48 |
intervalo de repetição da tabela SI excedido (SDT / EIT / TDT / NIT) |
49 |
veredito geral: o fluxo não está em conformidade com a TR 101 290 |
Parte dos códigos do analisador aparece apenas quando as opções de análise estão ativadas (análise profunda, análise de descontinuidades PTS, análise do buffer T-STD) e aplica-se somente a fluxos de taxa de bits constante; o veredito geral (49) só é emitido para uma taxa de bits comprovadamente constante. Mais detalhes na seção Analisador.
Recursos e hardware do nó (fonte — sistema)
Código |
Evento |
|---|---|
16 |
carga de CPU do host acima do limiar |
17 |
uso de memória do host acima do limiar |
18 |
CPU do processo do streamer acima do limiar |
19 |
memória do processo do streamer acima do limiar |
20 |
CPU total dos transcodificadores acima do limiar |
21 |
memória total dos transcodificadores acima do limiar |
22 |
carga da interface de rede acima do limiar (por interface) |
23 |
carga de GPU acima do limiar (por dispositivo) |
24 |
preenchimento do armazenamento DVR acima do limiar (por armazenamento) |
25 |
o sistema de arquivos do armazenamento DVR está indisponível (requer ação do administrador) |
40 |
carga alta de CPU pela thread de trabalho do adaptador DVB |
41 |
o frontend DVB perdeu o sinal (lock) |
42 |
nível de sinal DVB abaixo do limiar |
43 |
SNR/qualidade do sinal DVB abaixo do limiar |
44 |
taxa de erros de bit (BER) DVB acima do limiar |
45 |
blocos não corrigidos DVB acima do limiar |
Todos os alertas deste grupo são locais por padrão. Os códigos 16–23 e 40–45 podem ser replicados em todo o domínio com o interruptor de replicação de alertas do sistema; os códigos 24–25 permanecem sempre locais. Os alertas de limiar do frontend DVB (42–45) são avaliados apenas em um adaptador com captura de sinal; o código 41 é gerado na perda do enganche (lock). O BER (44) está desativado por padrão, pois a escala bruta depende do receptor (veja Receptor DVB).
Meshwork e ciclo de vida (fonte — rede/sistema; local)
Código |
Evento |
|---|---|
26 |
um nó da rede ficou em silêncio — parou de confirmar a conexão |
28 |
o processo do streamer concluiu a inicialização (notificação de curta duração) |
37 |
dois nós com o mesmo nome em um mesmo domínio (requer ação do administrador) |
Saúde da gravação DVR (fonte — fluxo; local)
Código |
Evento |
|---|---|
29 |
as gravações de segmentos ou do índice DVR falham — o arquivo não está sendo gravado |
30 |
a gravação DVR estagnou: há entrada, mas um novo segmento não é salvo há muito tempo |
31 |
o arquivo DVR degradou — lacunas na cobertura recente |
32 |
o índice do arquivo DVR está corrompido (requer ação do administrador) |
50 |
tempo de leitura/gravação elevado dos chunks DVR no disco |
Configuração, transcodificadores, OTT e certificados (fonte — sistema/fluxo)
Código |
Evento |
Replicação |
|---|---|---|
33 |
a configuração principal não foi carregada na inicialização, o serviço iniciou com a de reserva (requer ação do administrador) |
em todo o domínio |
34 |
no modo low-latency HLS/DASH, as faixas de áudio em um codec não suportado foram descartadas (AAC e AC-3 são suportados) |
em todo o domínio |
35 |
não foi possível emitir ou renovar o certificado HTTPS por meio do cliente ACME integrado |
em todo o domínio |
36 |
um transcodificador configurado não foi carregado na inicialização — não há arquivo executável ou dispositivo (requer ação do administrador) |
em todo o domínio |
38 |
o fluxo requer um transcodificador (software, NVIDIA ou Intel VPL) indisponível neste nó (requer ação do administrador) |
local |
Módulo de acesso condicional (CI/CAM, EN 50221) (fonte — sistema; local)
Código |
Evento |
|---|---|
51 |
o módulo CAM foi removido (requer ação do administrador) |
52 |
sem assinatura: o módulo informa que o programa não está pago |
53 |
erro CI/CA — um erro irrecuperável de canal ou de acesso condicional |
Visualização e resolução de alertas¶
O painel de administração tem uma seção de alertas com uma lista de alertas. Ela pode ser filtrada por conjunto (apenas ativos / apenas resolvidos / todos), por nível de gravidade, por tipo e identificador da fonte, por código, por domínio e por tempo, e também é possível pesquisar pelo texto da mensagem. Por padrão são exibidos tanto os registros ativos quanto os recentemente resolvidos (o log de transições), por isso o número total de linhas pode exceder o número de incidentes ativos — para o conjunto ativo atual, escolha o modo «apenas ativos».
Não é necessário consultar o estado manualmente: o painel de administração recebe as alterações do conjunto ativo em tempo real e atualiza a lista por conta própria, assim que um alerta é gerado, atualizado ou resolvido.
Os alertas baseados em nível são resolvidos automaticamente quando a condição desaparece. Os alertas persistentes que exigem ação do administrador (por exemplo, um erro de carregamento da configuração, a indisponibilidade do armazenamento, um erro grave do ciclo de trabalho) não se resolvem sozinhos: após a eliminação da causa, tal incidente é resolvido (confirmado) manualmente. A resolução tem efeito no nó que gerou o alerta: se na rede você vir um incidente alheio (replicado em todo o domínio), deve resolvê-lo no nó de origem (ele é indicado na linha).
Replicação de alertas em todo o domínio¶
Com a replicação ativada e um domínio definido, cada nó mostra um conjunto ativo consolidado de todo o domínio: os alertas próprios do nó mais os alertas dos peers do mesmo domínio. Cada linha indica o nó de origem, de modo que se vê em qual nó exatamente o problema ocorreu.
Replicados em todo o domínio: os alertas de fluxo e os alertas de conformidade do fluxo de transporte, a comutação para a entrada de reserva, os erros de carregamento da configuração e do transcodificador, o descarte de áudio OTT, o erro de certificado ACME.
Permanecem locais: os alertas de recursos sobre hardware e armazenamento, «nó em silêncio», a colisão de nomes de nós, a notificação de inicialização do serviço, os alertas de saúde da gravação DVR e os alertas do módulo de acesso condicional. Os alertas do sistema sobre o hardware (códigos 16–23 e 40–45) podem ser passados para replicação com o interruptor de replicação de alertas do sistema.
Cada nó gera por conta própria o alerta «nó da rede em silêncio» sobre o peer que parou de responder — por isso, para um mesmo nó que caiu, seus peers gerarão tal alerta independentemente uns dos outros.
Entrega externa de alertas¶
Além da lista no navegador, os alertas podem ser entregues a um comando externo, a um chat do Telegram e por e-mail (SMTP). Cada canal é independente e está desativado por padrão, e realiza a entrega em sua própria thread em segundo plano, de modo que um destinatário lento ou inacessível não atrasa os demais canais nem o próprio serviço.
Cada canal tem um nível de gravidade mínimo para a entrega (aviso por padrão): é entregue cada alerta visível no nó (próprio ou replicado em todo o domínio) que não seja inferior a este nível, tanto na geração quanto na resolução. Os parâmetros de conexão de cada canal estão descritos na seção Interface web.
Problemas comuns¶
Os alertas dos peers não estão visíveis. Verifique se a replicação em todo o domínio está ativada nos nós e se há um domínio comum definido. Os alertas do sistema sobre o hardware são locais por padrão — ative a replicação de alertas do sistema se você também precisar vê-los em todo o domínio.
Um alerta persistente não desaparece após a eliminação da causa. Resolva-o manualmente no nó de origem.