logo

NJP

​​Prever Incidentes com AIOps​ - Health Log Analytics​

Import · Mar 19, 2021 · video

o Olá meu nome é Rafael verde eu sou consultor especialista e aí e aí ó fiz E aí tona ser final e dentro do contexto de prever e prevenir e automatizar 10 com layout eu queria trazer hoje sistema que a parte prevê incidentes utilizando o Health log Analytics mas antes de começar dando um contexto né a gente tem visto que a máxima performance dos aplicativos tem sido exigida alto tempo é o menor tempo de resposta possível acesso em qualquer lugar a experiência do usuário tem contado muito né que ele esteja disponível acessível e com a performance ótima todo tempo em qualquer lugar EA partir de qualquer dispositivo Mas por outro lado né tem sido muito ainda muito difícil de prever os problemas antes que ele aconteça seja por ruído das Ferramentas imunização em disponibilidade e devido a essa monitoração reativar é que ainda existem muitos dos ambientes e e me traz um alto tempo médio de resolução o famoso mttr Então eu tenho o meu serviço e rede indisponível muitas vezes impactado né que uma degradação da Performance em alguma parte do tempo e na dessa forma a gente entende que é necessário prevê-se nesses incidentes antes que eles problemas acontecer E para isso além das métricas efeitos que e-traces das aplicações de que estão sendo o gerado desde que a parte de Blocks é fundamental eu fazia preguição analisando e maneira inteligente o e senha que eu seja necessário configuração eu entenda e aprenda o que o a ocorrência dos vlogs para que eu possa fazer né Que proposta teus mecanismos E aí óptica trabalhando e me gerando teste porque se métricas operacionais dessa forma o que é o Health blog análise e a inteligência artificial aplicada a partir da análise de logs para prever e prevenir problemas incidentes no serviço hoje eu tô conversando um pouco mais aqui sua parte preferida como é que eu posso te ver e vai ser a base e em todo esse ambiente então a parte de gestão de logs a partir do momento que eu começo a fazer ingestão dos meus Logus eu começo analisar esses dados em tempo real eu consigo ter uma compreensão do comportamento eu consigo ter alertas E no caso de desvios com relacionamento com as anomalias e identificação precisa o que não mais está baseado e eventos que foram gerados de forma que eu vou prover ações e sites e aí sim prevence dente com base no comportamento histórico dessa forma né eu tenho a melhoria no experiência um fácil gestão de dados e inteligência e guiada por Analytics e sim né recebendo recomendações para a melhor experiência possível a partir de agora eu quero fazer uma rápida demonstração né destas capacidades como é que eu posso correlacionar o alerta de múltiplas Fontes inclusive aqui lockes lockes das minhas aplicações dos meus dos meus serviços meu servidores da infraestrutura da minha rede pode ser qualquer tipo de fonte ou uso e aí ó tá então e o começa né Toda essa experiência começa no Pereira dos Reis já conhecido onde é que eu tenho os meus serviços parar de Publicidade por o tipos de alerta por ocorrência posso fazer filtros coisa que vocês provavelmente já viram mas eu tenho aqui os meus serviços principais que é um é baby o evento um serviço crítico os mais críticos a companhia que ele está sendo afetado fortemente desse momento se eu clicar em cima dele para ver o sitemap eu visualizo que eu tenho o meu proxy aqui em cima da cadeia da entrada do meu da minhas aquisições do meu entry point e metade dos meus estão quietos que suportam esse serviço ser impactado vamos molhar um dos concretos aqui né você olhar Windows estão crédito primeiros do lado direito eu vou ver que eu tô tendo alta utilização de CPU ah e também que eu já entendi fico através da ingestão e análise de Padre os logs que eu tô tendo Descartes nas conexões eu já tenho um Bom índice aqui de problema é só também está tendo alto tempo de processamento e outras métricas associadas a esse logo esse esse equipamento ao outro Tomcat Eu também identifico que eu tô tendo transações dos meus usuários que não podem ser completada e E se eu procurar aqui embaixo também vou ver alto utilização de CPU olhando aqui upstream na cadeia né olhando o meu próprio que será que eu tô vendo no meu próprio eu vejo que ele já entendi que o proxy é o dos prováveis causas desses problemas todos estão ocorrendo no meu serviço onde a mensagem de erro tem sido encontrada no arquivo de configuração e um passo a lenha aqui né eu posso verificar do meu Alerta todas as informações sobre ele eu fiquei pertence esse serviço Quais são os itens de configuração que eu já tenho identificado o mamute causa aqui nós vamos falar um pouquinho sobre ela aqui na frente Quais são os alertas que estão sendo agrupados para dentro de si mesmo lute cause e aqui mais um ponto importante né vídeo de múltiplas Fontes sejam elas métricas e o percentual de uso do equipamento métricas como tempos de processamento não só mais ali os sinais vitais do sistema operacional Mais primeiro aqui olhando para métricas do tá aplicação e o relação com Pátio nos exclusiva do blog mas como que a solução entendeu que esse não é um erro né Se eu olhar aqui em metrics eu posso ver uma forma bem clara onde o número de erros encontrados no blog estava dentro de uma de um parâmetro baixo ele não determinado momento eles podem chegando a mais de 160 erros de configuração desse nesse arquivo em particular tipo de se definido aqui em cima e dá uma solução sem nenhuma configuração de strass show diz de parâmetros ela percebe que esse não é um comportamento do usual para aquele tipo de log então ele já gera uma anomalia eles a geram uma um alerta te avisando que eu tenho um problema aqui se eu for um pouco além né e olhar para o root cause que é do mesma forma que eu tinha visto aqui dos detalhes eu vejo que tenho uma chanche aberta para esse arquivo e repare né horário e tem sido gerado essa loja é muito antes do que os alarmes que foram começar acontecer de CPU de memória e de travamento das transações Então já tive isso aqui E esse problema e que esse serviço e iria ser afetado Então já poderia ter tido tempo de fazer uma reversão olhando até isso eu vejo a lógica mim e eu tenho Mackenzie aberta e ela está sendo execução que eu tenho todos os detalhes aqui já tudo sempre integrado né no clube de forma é Nativa do E aí TSM do seu tempo proferir uma única plataforma o único modelo de dados e o único sem beber todas as informações sempre uma forma muito fácil na ponta Lena da conta do mouse vamos dizer assim e eu tenho que as atingem Ela está um ruim ela está ainda em ocorrência Então já tô vendo todos os detalhes e realmente baixo com informação que eu tinha é que eu tava nessa eu já tinha coletado dos meus blogs Então eu tenho a real causa do meu problema e uma forma rápida precisa os alertas correlacionados de um único incidente de forma geral menor visível na operação que a operação possa trabalhar de maneira esse aí e indo E se eu olhar aqui no Egito assistir eu já tenho um artigo mas dentro da minha nora de países e me indica através da palavra achar das palavras que foram identificadas aqui em cima que foram geradas aqui em cima e quando né essa situação ocorre esse artigo pode ajudar já tem o número de visualizações já tenho que que ele Pode alegar elevar E como eu posso resolver dessa forma né se eu tenho todo esse tipo de informação eu poderia assim também ter um momento aqui para executar uma redação automatizada executar o holback na minha na minha Kenji e todos os detalhes né do meu do meu do meu objeto do meu objeto de monitoração que no caso é o meu serviço tá essa foi uma rápida demonstração meu objetivo era realmente e iniciais esse assunto eu o Galaxy novas discussões e novos contatos que vocês possam entender-se de momento isso aqui tá dentro da organização e é que eu faço um convite também né eu faço o convite para uma reflexão nos níveis de maturidade das operações e teve antes de encerrar né esse é uma uma fonte do garter quando ele fala dos quatro tipos de imaturidade desde o reativo passando pela responsivo inteligente para Telma o nível de operação automatizada É pensa aqui nível majoritariamente está organização de vocês ou os clientes nos pais vocês atendem né usualmente Vocês não vão encontrar uma empresa sem por cento no nível ela vai ela pode estar mais não tipo responsivo mas já ter algumas áreas os processos do nível inteligente ao mesmo tempo e ainda e em alguns poucos processo se mantém ativo Então quando vocês forem olhar procure se e a né pelo percentualde quanto da minha organização está dentro de um dos níveis E aí vocês vão poder fazer um plano para que para que a organização suba né de nível e ganhe em eficiência e forma que ela vai sempre ter conseguir prevenir prever as indisponibilidades através e algoritmos na e recebem feedback e trabalham por aprendizado e que garante uma maior eficiência nós estamos à disposição quiserem falar comigo procurem o também o representante ser sinal de vocês né e forma que a gente possa marcar um bate-papo de uma forma mais profunda desse desse assunto assunto muito bacanas têm muita material que ser muita informação que a gente conversar podemos aqui e e muito longe mas o objetivo desse curto vídeo era somente as ar introdução Muito obrigado pela atenção tenha um ótimo dia

View original source

https://www.youtube.com/watch?v=zCFePMAHFYM