logo

NJP

Evite Interrupções e Automatize Remediações com ServiceNow Predictive AIOps + Lightstep!

Import · Aug 04, 2022 · video

Olá [Música] meu nome é Victor perdi tudo eu sou executivo de vendas do portifólio de t-rex ele tá enroladinho workflows acerto final e junto aqui comigo estão Rafael gordinho espírito ganhei dois são pré-vendas especialistas do portfolio de tecnologia é o mais uma vez sejam todos muito bem vindos a gente vai começar e um minutinho só vou tomar uma né as diretrizes aqui né doebner é um formato de webinar Então se precisarem se vocês quiserem fazer perguntas durante a nossa apresentação favor fique à vontade utilizei um botãozinho ali do de perguntas e respostas né na no próprio aplicativo nos um e também se precisar falar alguma coisa utilize o chato a gente vai interagindo com vocês aqui durante nossa apresentação e fique à vontade pessoal então eu vou começar contextualizando um pouquinho né a gente tem uma série de web mais que a gente tem produzido nos últimos saiu um ou dois anos e esse aqui é um incremento né daquele do assunto de Heliópolis que a gente vem abordando vocês a gente vai passar por alguns conceitos né mas a ideia é que a gente faça a evolução do assunto eu vou deixar o tanto você quanto o gordinho Vou deixar um link do webnar anterior tá aqui nós conduzimos ali o o assunto e aí Ops como um pré-requisito vamos ver assim tá para dali a gente seguir adiante tá o assunto a evolução ganhar por isso aqui no serviço não tá é o que eu conceito principal ali né quando a gente fala de Areiópolis para as nossas operações né a gente faz um paralelo com o incêndio por exemplo que pode acontecer em uma residência então Acontece uma crise acontece um incêndio e a gente sabe que tá acontecendo problema por ter vários horas você nem compactados Ou seja a gente conseguiu entender né que tem fumaça na casa é a gente tem um alerta por exemplo um alarme tocando né ressoando ali né na casa como um todo né mas a gente não consegue identificar exatamente onde começou o incêndio Onde está o incêndio ambiente também não sabe precisa que alguém Ligue para por exemplo bombeiro que ligue para alguém vir até a residência apagar um incêndio tá o que quer dizer com isso né só que é uma operação tradicional sem o conceito Grey Opus né a gente sabe que tá acontecendo problema porque os olhos são serem praticados então ligando para a empresa é pedindo ajudou tentando acessar os sistemas e não tão conseguindo tá e tem uma em março a gente fala de Areiópolis o que acontece den de novo a mesma residência só que com olhar um pouco mais completo né Muito mais detalhado dessa residente sabe por sensores que a gente espalhou ao redor da casa é sensores que tentam capturar informações métricas daqueles componentes não esperar que o problema aconteça né então por exemplo a fiação elétrica está exposta ali pô tem escape de energia elétrica naquela naquela determinada tomada naquela determinada fiação então o sensor que já capturou aquilo vai acionar os bombeiros vai acionar os paramédicos caso tem algum problema que já tem acontecido né o projetar que algum problema aconteça e a energia daquela tomada já é cortada para evitar que tem algum problema para vittar que tem algum incêndio ou seja utilizando sensores a utilizando o métricas que eu capturei daquele componente eu consegui acionar para que ele é esse componente senão empate o restante do sistema não empate o restante da organização da mesma maneira eu posso e por exemplo no forno ali que a temperatura está um pouco mais alta do que o normal é o termostato ali não tem funcionado da maneira adequada então eu já vou acionar por exemplo fabricante do forno para vir resolver o problema né a fim de evitar de novo também o incêndio né eu posso ter por exemplo um sensor de umidade eu posso ter um sensor de nível de água em outro em outro lugar ali da da minha residência e também acionar não é um reparo não previamente ao invés de esperar que a coisa aconteça né E durante a noite por exemplo eu posso um sensor de movimento que capture né o movimento da dos cômodos ali o movimento dos móveis do escritório do Office a fim de evitar que algum assalto pode ser feita um roubo pode ser feito né então assim o que quer dizer quer deixar né de de exemplo aqui ou apps é o paralelo que eu tô fazendo aqui né são é um jeito da gente tentar descobrir problemas que muito promete pó a cena Nossa operação antes que eles aconteçam né antes que eles ocorram e tentar remediar sozinha né tentar remediar sem precisar de algum analista né de algum ser humano interagir a gente sabe que a resposta humana geralmente é mais demorada do que um um sinal né Por exemplo do robô né de um de uma ímpar de uma alta remédio ação Então como que a gente consegue transformar a experiência de t.i. Nesse contexto de negócio com aprendizado de máquina né usando esse conceito que o certo final tem the service operations com inteligência artificial então basicamente naquela nossa jornada clássica né de mapear todos os componentes todos os serviços de negócio todos os servidores equipamentos de rede aplicações bancos de dados né todos os ambientes que a gente tem hoje na nossa infraestrutura né da nossa arquitetura de soluções da nossa organização e quebrá-las né Por ambientes críticos de cereais ou essenciais para mim operação de maneira aqui essa categorização que eu queria o bebê vai fazer com que eu tenho crise não um uma situação em um determinado ambiente ao invés de outro né ou priorizar primeiro este depois aquele outra na melhor dizendo E eu vou conseguir capturar essas informações baseado né nas ferramentas que eu já tem hoje dá certo não Discovery service map e enriquecer os dados com outras fontes né nuvem é com monitoração de aplicações com base de dados e por aí vai né então eu enriqueço esse meu CNBB Com todas essas informações que vem tanto dos nossos original quanto de fora né a fim de ter um ponto único de verdade que é o nossos MTB para operação e de lá a gente vai capturar gás ferramentas de monitoração que vocês hoje já utilizam até da própria serve se não métricas eventos e até Lopes desse ambiente para conseguir via Mach Lane Neve agrupamento etc tirar o melhor de todos esses pedir todas as fontes de informação tentar tirar nessa porção de e a porção de métricas é insights para que eu sozinho né via servicenow conseguir alto remediar ou consiga talvez escrever que alguma coisa pode estar acontecendo Então a redução de ruído que é o que a gente sempre fala né no caso de opção os principais ganhos alicate obtém né uma solução inteligente de operações é basicamente reduzir o barulho mas a gente centenas e milhares de eventos na gerando excedentes entre as milhares de incidentes no meu SM ou passar até dezenas insights Para com esses sites conseguir chegar né a uma causa Raissa conseguir chegar uma remediação automática Então esse é o principal outros principais audicambra um dos principais resultados outro é utilizando anel próprio bidentado servicenow na utilizando o corpo analíticas do sexo anal ele tá juntando situações recorrentes né da minha operação para tentar tratar de maneira definitiva né não esperar que a coisa aconteça sempre e sempre tá é automaticamente até porque esses esses impactos são dotados né para todos os a esperança nos colaboradores E por aí vai né E além disso tentar detectar as anomalias né porque você preditivo você já ações automáticas que eu tome antes do problema acontecer nessa própria monitoração detectar acabam reduzindo acaba eliminando a paralisação não é o alto tajra né Então tá em tratá-la antes que ela quer problema aconteça a correlação ajuda muito também né quando a gente tá falando de centenas ingressos de eventos gente com a correlação automática né Não não é o usuário né agrupando os alertas mas a própria solução sugerindo agrupamentos acaba tornando a vida da operação mais fácil mas mas mais e análise de logs quando tô falando de detecção de anomalias muitas vezes a gente pega a Maria pela métrica nessa consumo da máquina consumo da do serviço né consumo da da capacidade computacional daquele daqueles equipamentos mas quando eu falo de blog a loja e pode também evidenciar coisa que nem começou a com e começou a resvalar na métrica ensina nem começou a consumir tanto da máquina se a logo e pode dar em sites muito ricos como por exemplo é falha de login e fala de acesso um erro né que pode acontecer na camada de aplicação isso né a gente pode trabalhar muito forte com lotes tá E os adicional também vou utilizar isso para Prevenção ou seja prevê problemas que nem a monitoração pegou né nem o usuário sentiu ainda mais nem a monitoração pegou através dos próprios Logos né e o alerta né como tem fala algumas vezes aqui né o alerta independente do jeito que a gente vai entregar um alerta seja por pela própria console do serviço final pelo virtual e né que é o nosso a gente virtual é usando bot usando o próprio canal de mensagem diria que a empresa eventualmente tenha né a gente vai acionar a as equipes para minimamente dizer que tá acontecendo alguma coisa que você acha já tá tratando né eventualmente se o serviço não não tratar Aí sim e com ele dois perguntam time mais especialista para tentar tratar o problema né então tentar prever que o que o problema está acontecendo ao prevê tentar prevenir né que é o segundo Pilar aqui do nosso o nosso rei Opus né evitar que o problema acontece a fim de reduzir mttr a fim de reduzir tem um Pedroso a fim de reduzir todos os indicadores ali principais da operação né e por último automatizar o máximo possível né ao prevenir eu tô entendendo que muitas muitas ações que o certo não vai fazer vai acabar reduzindo a chance daqui é o peixe acontecer tá então é a utilização de workflow utilização de recursos ali computacionais né das soluções que quiser estender se precisar expandir né o ambiente o profissional tem essa capacidade também de acionar scripts na remotamente nas soluções tá gente sabe que nem toda alteração é tão suscetível a a esse passo né de prevenção de automatização que está colocando aqui né no concerto do Heliópolis aí de dentro de uma organização melhor dizendo a gente tem níveis diferentes para cada aplicação para cada tecnologia às vezes para cada expande né então a gente tem condições né junto com vocês de definir Quais são as etapas de cada aplicação dessa e quais são as ações que se toma para passar do estágio do hospital de três por exemplo né então só passando rapidamente aqui né a parte reativa quando a gente tem muito processo manual muita troca de e-mail muita troca de planilhas né os dados eles estão segmentados fragmentado sem cílios nas áreas distintas né então a gente tem muita muito atrito aqui né muitas coisas acabam ficando no N1 em dois na cama construindo demais equipes e a gente não tem muito ganhou de compartilhamento da informação né gente não democratizou a informação o responsável consegue ser um pouco melhor né a gente tem ainda análise manual de muitos muitos muitas causas raíz mas a gente tem que o ultimamente colocar esse dentro de uma solução de colocar dentro do SSM né Consegui monitorar as etapas do processo propriamente dito né apesar de ainda está se fragmentada e tem condição de monitorar até aonde tá cada tarefa em cada lugar né a parte inteligente a gente começa o é o pistão então a gente consegue prever que alguns problemas comuns ocorrem a partir de recorrência né o próprio site se não consegue capturar essa informação o alerta ele acaba sendo mais proativo se a gente consegue elencar Quais equipes vão trabalhar e quais funções o fruto de trabalho consegue orquestrado e tradicao aquela começar a gente começa a tirar as tarefas das equipes né assim conseguirá automatizar algumas algumas ações né e a conciliação dos dados todas as informações ficam único lugar uma única plataforma é o lápis começa a trabalhar aqui e para o senhor to Remedy ação e aonde a gente vai falar bastante como que a gente consegue evitar você tem opções utilizando sinais ainda mais potente O que está sendo gerado no nosso ambiente tá E aí que é onde a gente quer chegar e como que a gente consegue fazer por exemplo uso de predição né usando o nosso objetivo é real porque é um produto recém-chegado aqui na nosso portfólio do ser sinal né mas a gente consegue aumentar ainda mais a petição usando o blog vai veja só eventos e métricas né imagina que ele tem lá os consolidadores de Love geralmente nessa que as empresas já tem algumas ferramentas como essa né Então as drogas acabam sendo inseridas dentro dessas bases você está vai conseguir dessas fontes de informações né capturar essas blog fazer o parte ali o filtro dessas logo que você começar a entender o contexto não só fazer o par sem filtro do texto enfim né mas o contexto daquelas Lopes né e começar a ter KP isso vai começar da Capes para que a gente consiga a minimamente saber Olha isso era normal que acontecia esse conjunto dia aqui por exemplo 10 15 erros por hora eram uma quantidade normal para aquela aquela aplicação né de repente pode até que seja né pode até que sejam a usuários de todas as errado é apresentou leve tudo bem isso é normal mas 1000 2000 né na próxima hora Poxa alguma coisa tá errada tá acontecendo tá então coisa desse tipo neoservice não vai conseguir capturar a partir disso né então desvios para cima ou para baixo ou esperado é um desejaram Maria capturado por logo aqui acesso não vai conseguir gerar um alerta eu tipo anomalia dentro do próprio a opção certo sinal né olha Mariante padrão para o padrão era esperado e não aconteceu né então textos conselho contextos né de padrões ali não aconteceram uma nova no mar encontrado esses um primeiro padrão foi observado pela primeira vez também é um modelo de Mach Lane que a gente tem implementado na solução e por fim obviamente ler e entender o texto né um termo uma frase alguma coisa que a gente consiga fazer o parte da informação identificar no Maria dessa frase e conseguir assim tratar esse esse evento e não tem que não necessariamente eu preciso ter uma regra nutrishow de e a própria log Israel e sumo para gente que a gente precisa né que o mecanismo Atila nem precisa para estar alguma coisa dentro do certo não tá E aí eu faço um paralelo com o que a gente tem hoje de soluções de iops versus o que a gente tem hoje Concert sinal usando o perito envelopes que basicamente não consigo ao em algumas soluções o relacionar enriquecer e aprimorar Alerta Geral único incidente nacional e ao invés de gerar para cada evento na monitoração um incidente na base da CSN é correlacionar alterações incidentes dentro do próprio servicenow né dentro do próprio TSM melhorar o r a reduzir o ruído que eu faço de duplicação correlação de eventos mas essa parte aqui de logs me ajuda Além disso né prever redução de incidente antes que o alerta seja enviado né para dentro do servicenow a gente tem uma beca aqui de 35% a topologia nos mapas dinâmicos dentro do sistema de bebê e automatizar altamente resolução temporal a fim de reduzir mttr Então nesse conceito aqui a gente acaba sendo mais pretty e mais as métricas por uso do nosso cmdb por uso da Integração Nativa de arton SSM e o print fiel tá aqui eu fiz um paralelo de quais são as soluções eu abrir todo o slide aqui de quais são as soluções que a gente vê né descentralização de log com relação de log e o que que o service Now adiciona né Além disso e quais são as diferenças né então dentro da monitoração de log né tem aqui a parte de coleta para processamento pesquisa do do termo que a gente quer ter a geração do alerta para Benedita né então ambas as soluções vão fazer né ação né gente pode inclusive consumir vocês tem uma solução que já faz né análise de logs em já pode consumir essa informação ao invés de fazer isso dos lugares mais natural que aconteceu isso é o armazenamento Prometida de logo a longo prazo esse não é o conceito tá do Heliópolis dentro do servicenow a gente pode utilizar de novo essa histórico de outra solução mas eu vou sair final vai utilizar um contexto mais de Fronteira Oi gente vai falar um pouquinho na nossa demo Tá o que que tá acontecendo no entorno né daquele daquele problema uma hora pra frente mora para trás todas as lojas que estão naquele período eu vou conseguir visualizar Além disso talvez não faça muito sentido para ela tá por isso que a gente não acaba não não consumindo todo o histórico de logs e armazenando dentro da base do tradicional Tá mas entendeu o texto de Lore encontrar padrões e prevê problemas em colocar uma regra um threshold previamente né esse uma capacidade Nativa tá do pedido xerox uma chinelada Inativo para fazer o Analytics né então relatórios 10 cursos Capes né criação de cafeína é tudo certo sinal isso é nativo também e todos os dados dos MDB permite a prevenção e resposta a incidentes eu tenho 1 cm de inativo e eu tenho print out trabalhando junto com seu bebê as coisas conversa muito bem entre si Então essa obra vai só as principais diferenças né do perder feroxe em relação às ferramentas de análise de logs padrões aí de mercado que foi por aí e eu queria falar também um pouquinho antes de abrir a demo sobre observabilidade dentro do servicenow a gente também incorporou no dentro do portfólio né uma solução nova de observabilidade Ou seja é juntar né algum do desenvolvimento tanto dos desenvolvedores com a operação hoje está muito forte né de serviço operação tratando leito a parte de SSM com a parte de Ayrton é de operações agora está indo um pouco além A gente tá trazendo o time de desenvolvimento para cá você já todos os SRS né que trabalha em formato está esse dia e etc trabalharem junto com a operação e ambos né times se beneficiarem das informações que a gente vai trazer de ambas as os mundos né gente tá de melhorar obviamente a experiência do cliente final né então a gente recentemente né aqueles aquisição de uma empresa chamada litestep faz acho que um ano ela sempre foi incorporada dentro do portfólio da série sinal que basicamente vai trazer um nível maior ali de observar habilidade para servir sinal né não sol o meio ambiente então acompanhar por exemplo que causou essa mudança né a gente tem um passo a mais ali né de quais foram as chances Quais foram os acidentes Quais foram as mudanças que feito aumente eventualmente aconteceram na infraestrutura prometido e agora a gente vai trazer a parte de aplicação também então depois que foram realizados no serviços posto de confirmação que pode ser captados a mudança para mim digitar no tipo de arte louro que tá acontecendo naquela aplicação ou alguma coisa aconteceu né dei uma versão que foi gerada naquela aplicação que quebrou a dependência né no ambiente multcloud e eventualmente isso pode ser o causador do problema né e na parte mudou né pode ter mudado o presente experiência do cliente pode ter mudado a saúde o desempenho do serviço obviamente alguma coisa que aconteceu que mudou né as características daquela aplicação de mandar o uma informação a pro lugar b e t e o consumo propriamente dito desses serviços né pode ter também sido afetado né então o que que a gente vê rezou e as empresas a gente vê aqui quando muda para nuvem acaba sendo muito serviço segmentado muitas equipes segmentadas e muitas vezes até organizações ilimitadas com um antes de pensar sinal a gente acaba entregando dentro da nossa suíte né de aplicações e módulos observabilidade possibilidade acessível para todas as equipes que hoje à toa dentro do certo não não só para operação observa servidores E se a gente consegue entregar a médica as três slogs totalmente unificados dentro da mesma aplicação A análise das transações também dos três na distribuídos foi assim a gente vai conseguir observar não só até o incidente tem o alerta que certa mas consigo observar o 3 que vem assim saber exatamente Quanto tempo demorou em cada passo naquela transação e um adicional né que que vai trabalhar muito próximo com o PT lembre é o alá step inclusive foi criada né por co-fundadores outro elemento então conceito é muito forte é tudo lá step tá para todas as que eu quero dizer com isso né todas as empresas que hoje já utilizam é o conserto do PT ametrina o que vão ser suportados pelo WhatsApp e além da própria você vai habilidade se a gente vai utilizar o service gráfico no WhatsApp você já estão um conector de sepse grave já desenvolvido pelo arquiteto servicegraf acho que você já já ouviram né o termo Mas é uma capacidade que tende dado a origem da informação né Por exemplo a cidade que eu consegui mapear todas as informações de cm de bebê do ponto de vista adjetivo de configuração né de gente de configuração para dentro sempre bebê e hoje com na estepe Como eu faço né observabilidade de micro serviços dependem de serviço na nuvem e todas as aplicações e bancos que tem né nessas nessas minhas aplicações tal de dente ver consigo trazer não só o concorrente assim como o relacionamento e colocar dentro do sempre bebê de sorte não tá então as duas coisas já estão trabalhando muito juntas não só não pode vista de saúde né da da parte de manipulação como também na parte de visibilidades MTB e e tudo mais tá bom então é isso a gente hoje então o foco tá demonstração eu e o gordinho vão tocar tá nessa parte mais avançada do peixe aí ó fiz tá HL a qual é o Analytics o nome da capacidade que habilita né o nosso pedido de RaioX e WhatsApp nessas duas nessa ordem pessoal é gordinho você quer assumir aí vou pegar a tela aqui já legal show Vitor Obrigado pessoal então a ideia hoje da da demo né não é fazer eu linkei aqui no chat para vocês a primeira parte na primeira demo que nós fizemos a fim a fim eu vou usar o mesmo exemplo só que eu vou passar de uma parte de um ponto eu e o Felipe vamos começar um ponto mais avançado né Nós vamos mostrar por trás o coco que está ocorrendo dentro da plataforma para focar no conceito de absorver habilidade então da primeira demo que nós fizemos que está nesse link nós falamos sobre o um problema que tava Oi gente ter uma aplicação a gente foi fazer o depósito de uma versão 22 V2 desse aplicação para uma parte dos nossos usuários que a gente chama de carne de creme e a partir daí eu introduzir o erro então a minha demo de hoje ela começa a partir daqui o erro já tá na aplicação a também eu gerei uma alta carga nessa aplicação ontem à noite para que eu tivesse ali né que ela gerou um problema pelo volume de transações e a partir daqui eu vou focar no que aconteceu né O que que chegou de dados desse conceito de observabilidade com as minhas metas com os meus blogs e com a parte da aplicação que o Felipe vai falar no Life step né então aqui eu tenho né A minha o meu apareceu que fez eu estou usando a mesma aplicação que alguns de vocês já podem ter visto o Felipe vai mostrar um pouquinho mais a navegação Oi tá com problema ela já tá sendo afetadas sabe aplicação mas eu vou começar pelo HL apelo realflow Analytics e o que que ele tá me trazendo de insights desses dessas ocorrências que foram sendo geradas na minha aplicação então eu tô vendo que minha ficação boot que ela tá crítica eu já consigo ver ela aqui eu já deixei ela aberta né uma série de alertas ocorrendo seu olhar o mapa dela eu tô vendo já alertas no cartaz aqui como crítica eu tô vendo alguns outros alertas em outros componentes da minha aplicação toda é toda essa aplicação ela está baseada em micro serviços no cluster kubernetes que tá rodando na WS então já é uma aplicação claudineide já tomou vendo né para o conceito de aplicação de modernas aplicações alto scalabis desses alertas aqui eu consigo ver algum né que foram uma nova classe aqui que vocês vão ver também que é o log Analytics né os eventos que são correlacionados por mochila o blog Já parece meio algum aqui então já apareceu eu falei esse esse evento aqui que é um grupo de alertas que um problemas identificados na minha Boutique onde eu tenho erros e volume de transações acontecendo fora do padrão o HIV entende né algumas mensagens então vai abrir essa aqui que é um erro né 13338 Quatro ele entendeu aqui que eu a conecta conexões foram recusados através do TCP Ele pega a mensagem da minha conexão ele entende que o padrão era Inativo net ficar mente inativo e de repente eu tive uma quantidade de alta dessas pessoas ocorrência aqui na parte de propriedades né quais são as propriedades relevantes dessa log eu consigo entender também quais são os meus componentes que foram afetados então eu tô em vários podes de corrente service foram afetados por essa falha Outro ponto interessante é que eu consigo ver as logs né do momento que tá que essa ocorrência aconteceu então se eu vi aqui em surround logs eu vou ver porque eu já ele já vem para é selecionado para um minuto entre a ocorrência eu já vejo tudo que estava ocorrendo e todas as minhas vlogs durante esse erro então eu consigo fazer uma identificação mais precisa do meu momento da minha ocorrência né eu tenho alguns outros aqui também que é bastante interessante Então aqui apresento a parte de eventos no meu produtos catálogo que serve caiu do minha linha do tempo normal que significa eu tive um problema na minha aplicação alta carga meu correio vai ficar aí eu não consegui transacionar então ele traz em relação ao bem Islaine né aquilo que ele tava aprendendo eu quero o comportamento normal eu vejo aqui que por um período de teve quase dez minutos eu tive um Spike aqui mas durante um quase dez minutos eu fiquei com a minha o meu serviço né num volume muito abaixo daquilo que era esperado todo esse contexto é o HD aprendendo a galinha vai aprendendo você vai dando o feedback né então aqui deixa eu pegar um alerta que tá interessante também para mostrar isso aqui é por exemplo o número de servidores conexões fora vamo esse aqui é interessante que eu posso né eu tive aqui ó uma por minuto normalmente não é o grande. Né na minha implementação da galhar é eu colocar e dá o feedback para o algoritmo é ele vai trabalhar de uma maneira semi-supervisionada e não é importante que você fale para ele nos primeiros semanas e é de operação se ele tá se assinou ocorrência são relevantes ou não e não és ocorrência aqui eu posso dizer aqui um rápido feedback se ela é significante ou se só que não tem relação com o que eu quero observar para o meu serviço muito desses alertas ele pode ter vindo de um erro de alguma coisa que o blog gera mas que não viram o impacto na aplicação então eu já estou mil ou não poxa isso aqui é relevante qualquer ocorrência desse aqui já é uma transação que eu quero né garantir que ela sempre vai alertar e quanto mais eu vou oferecendo esse mecanismo mais preciso o algoritmo vai ficando e como é que só tem ocorre por trás né que eu vou descer também um pouquinho mais nessa nessa nossa demo dentro da instância só que eu deixei aberto o meu 10 por principal do que tá acontecendo comer uma galinha Ah eu tenho a parte dos meus da tempos né que é o Peter eu ando log para mim aplicação seja logo e vindo diretamente do Egito quais collector seja Logos vindos de outros agentes nas minhas portas então eu posso pegar aqui no blog de um mais Kelly que eu tenho eu já apontei né Para onde eu tô jogando esse aqui tá vindo do Faial Beach Quais são os meus vlogs para onde que ele deve ser feito o passe dentro da minha da minha aplicação eu tenho uma série de tipos aqui só estou abrindo no rolê esses para você mas eu posso pegar direto de um banco PS3 dos Planck de um casca de uma receita equipe aí fazer uma porta TCP mandar né abrir uma conexão TCP para mandar direto no syslog o próprio aí gente vai collector and olhar WS Então eu tenho cloudwatch então tem uma série de mecanismos que eu posso ir fazer injeção direta dos logos dentro da plataforma naquele conceito do vidro comentou né de analisar e não seria uma histórias de longo de longo termo né Dylon e curtir para para armazenamento e dentro disso aqui o HIV a tem a capacidade de entender a estrutura eu vou abrir dois exemplos aqui também para vocês verem o que tá acontecendo Então os logs estão chegando ele tem a estrutura dele aqui deixa que tá chegando no meu Face ele é de um tipo de um dia aí som está vindo para mim a minha Instância eu já consigo ver aqui os meus últimos logs garantir que eu tenho a mensagem que eu quero aqui então posso falar com essa mensagem muito legal para fazer um par só posso pegar alguma outra mensagem que tá chegando e alterar aqui E aí a solução Ela já tem vários mecanismos de par se pré-definidos que você pode utilizar e mesmo com isso eu consigo ter meio fazer algumas melhorias para dar mais inteligência preci preci parte das minhas mensagens aqui eu tô usando um Jackson parse nativo Medical escrito você poderia ter colocado até mais algumas lógicas aqui e o que acontece quando a mensagem Entra daí eu tô vendo aqui o HIV faz o parse para jogar em variáveis internas dentro da solução algumas variáveis ele já vai alto sugerir outras você pode também sugerir para ele que Como por exemplo o que tá vindo do campo log dentro do parce que nós fizemos acima é o Messenger e todas essas outras variáveis ou elas vão ser informativas né por isso que eu tenho que univali O que significa que eu não tô pescando ela para nada vai fazer uma mensagem informativa ou ela vai trabalhar para ser um root cause analysis é para eu garantir que eu vou relacionar com outras mensagens do mesmo termo do mesmo serviço para que ele faça a redução de ruído o outro exemplo bacana que que eu peguei é o Reino de engates error né esse engenharia que só tem várias mensagens Chegamos aqui do blog ela já são pré-construídas eu não tinha um template preço óleo eu fiz um rápido escrito aqui o script bem simples que já vem com exemplo o que que eu fiz aqui uma expressão regular de fazer o parse de trabalhar para fazer o mete do que que eu vou colocar em cada uma das minhas variáveis e aqui eu simplesmente falei olha que vier aqui nessa variável Messi é o Messenger o que vier na variável é terror é o severe o time esteve para ele trabalhar e o root cause para ele correlacionar então isso aqui tudo fica pronto para vocês mas com a possibilidade de você ir trabalhando mesmo que você tem um log que seja totalmente diferente dos padrões que você fez tem na sua aplicação desenvolvida em casa que ou uma aplicação muito específica aquela gera um padrão de mensagem que não é comum você consegue formatar ele para que olhar começa a aprender jogar as mensagens dos Campos que façam sentido para mim aí para mim operação e com isso né aqui dentro depois eu volto eu consigo ter esse tipo de mensagem e né quando eu olho por exemplo aqui olha número de conexões então do http né dentro do minha conexão TCP eu tô saindo tudo que o menino para ensaios eu tô tendo conexão estão sendo usadas e isso aqui Oi viu para se Evi amostragem Além disso né o e os Home tá aqui também eu consigo ver o que tá acontecendo entender todos os meus modal time-range aqui por um período maior menor se eu quiser fazer e e cercando né minha mensagem de log para fazer uma análise bastante profunda do meu incidente Mas além disso eu tenho um outra situação que ocorreu aqui que é onde gerou né o todo o problema da minha aplicação a hora que eu fiz o depósito do V2 que a partir daqui que o Felipe vai seguir onde os meus alarmes eu já tenho já foi feito aqui não é um alerta crítico de transações não tão conseguindo ocorrer um associações entre alarmes que estão vindo do log Analytics que estão vindo do próprio então encher e poderiam tá vindo de outras ferramentas como apresenta usado o solarwinds e Oi Daiane Silvana Trace e aqui alertas que estão chegando do like estepe que está monitorando toda a transação toda a cadeia da onde a minha aplicação falhou depois do depósito daquele Kart G2 Então agora eu passo para o Felipe ele vai continuar a partir daqui a parte de dentro Felipe puxar tela vamos lá é puxar tava aqui então se eu fui rápido na transição estamos na mesma tela que eu vou só por dia estava é qualquer ideia aqui pessoal então o gordinho ele deu uns um em um desses aspectos do que a gente chama de parede que tiver altos que eu H Eliana né Agora nós vamos dar um zoom no que o Victor mencionou na segunda parte da apresentação dele que Alex tá então é nesse grupo de alertas que eu perguntava mostrando eu tenho logs do blog eu tenho alertas logo Analytics tenho do agente e tenho um alerta aqui se inscreveu do WhatsApp então vamo dar um nesse cara aqui para a gente entender melhor esse Alerta então é e o que que esse Alerta aqui também dizendo que o meu percentil 90 do tempo de resposta de uma operação específica que chamada Eddie tem no Car Service para cima do meu do meu traz show de estabelecido que é de 3 segundos e outras palavras né A minha operação de adicionar e itens no carrinho de compras está lento então nessa nesse webnar a gente trouxe um problema um pouquinho mais Sutil do que o do outro sabe nada então no outro se para quem participou para quem tiver curiosidade de assistir com o link que a gente deixou no chat para vocês a gente quebrou mesmo aplicação né então aplicação não funcionava Mais depois desse desse V2 né o que a gente fez dessa vez é o seguinte é eu tô na minha aplicação né imagina imagina que eu fui desenvolvedor fiz a versão dois esse aplicativo fiz o meu Deploy é fiz uns testes básicos aqui eu tô conseguindo aparentemente Navegar normalmente a aplicação né É E aí não entende o que eu posso ir para produção e faça o tempo em produção só que que tá acontecendo né apesar da navegação na minha aplicação está aparentemente normal quando eu clico no botão adicionar ao carrinho veja que demora tá vendo Então ele funciona né é o meu site está no ar só que um botão específico para adicionar itens ao carrinho e talento né então e isso é um dos casos de uso aonde o litestep consegue me ajudar que tipicamente com é só uma visão de detectar mudanças na configuração do aplicativo Eu não conseguiria pegar né então vamos ver um pouquinho do WhatsApp da onde que surgiu esse alarme para a gente entender melhor né então aqui através da Integração com a plataforma não eu tenho né esse Alerta chegando aqui chegando no mapa do serviço e eu tenho que já um botãozinho que vai abrir para mim em contexto a console do litestep com a origem desse Alerta tá Então veja Eu abrindo o contexto do meu quarto service adicionar item que é a minha operação dentro da aplicação que o identifique tá com problema né que tá um pouco mais lenta na linha do tempo o like chefe já coloca para mim Pino um alfinete aqui no momento que eu fiz o depósito para versão dois que foi 9:57 da manhã e aí eu vejo que exatamente o momento que eu fiz o upgrade para a versão dois é que a minha latência começou ou seja antes a minha latência tava aqui em 8 milissegundos e agora eu tô vendo que a minha latência tá batendo aqui entre 9 e 12 segundos né então o que que ele é que você consegue me ajudar que eu clico nesse Pinho e eu falo Mostra para mim sem ter que ficar processando fazendo um busca de texto é procurando horários né Mostra para mim a diferença entre agora e antes do último Deploy tá E aí o que que ele vai fazer ele vai gerar sempre dois duas colunas né a colando reflection que é um termo usado mais em desenvolvimento que quer dizer o problema gerado por uma igreja né e o base Line Então veja no meu regresso no meu período problemático aqui eu tenho tempos né altíssimos aqui 9 segundos o hino meu Brasil ele não o que que mudou né então algumas coisas aqui não dá no três atributos mandar mudou a versão do serviço mudou o Haiti da instância que é o novo contente subiu e mudou a porta então aqui de uma forma bem clara eu consigo ver aqui logo depois da mudança diversão e só para as requisições que estão caindo na versão dois a minha aplicação talento e aí eu consigo seguir na minha análise entender da onde que tá vendo essa lente não então eu tenho o meu serviço cargo service que depende de como a gente viu no no mapa que eu botei mostrou Depende de um serviço no redes Netinho clash Royale eu vejo que o Cash do Red está rápido a lentidão tá acontecendo dentro do micro serviço Card service Então não é do da infraestrutura do eles né então esse dashboard veja que é um dashboard totalmente dinâmico que eu não preciso com em diante mão né é um dashboard que ele é gerado quando eu peço para investigar um problema né então ele é um dashboard 100% investigativo daquele problema que eu tonalizando né E aí lá no final eu consigo pegar chegar no nível de transações individuais que estavam lentas né então você ficar em uma dessas transações eu consigo ver que o usuário na acessou o front-end ele deu uma olhada nos produtos o produto que Ele clicou foi o produto vintage vai coldplayer então lá na tela da Boutique esse os olhos especificamente clicou nesse cara aqui na vitrola né E quando ele foi adicionar a vitrola no carrinho de compra essa operação levou Oito Segundos e-mail para acontecer E aí eventualmente aqueles olhos pode ter desistido de fazer o check-out com a gente vê que a transação parou por aí aqueles olhos Oi gente vai fazer o check-out então eu consigo chegar no detalhe de com era o produto que aquele usuário tava clicando E aí a gente aumente até mandar uma mensagem para ele fala olha livros que você adicionou a vitrola o carrinho né você não quer fazer um check out agora com desconto para compensar o nosso problema no serviço enfim né É então a gente consegue fazer um grupo tão bem detalhado aqui mostrar mais alguns aspectos aqui do leite serve para vocês não me somente em contexto desse problema específico né então o Victor mencionou ali a questão do Open três se não tem telêmetro não é o que que é isso é uma biblioteca que o ensino nas minhas aplicações né Assim como eu ensino um logo e Ford para gerar logs eu insiro uma pergunta Elementary para gerar esses dados que vocês estão vendo aqui hoje né então ela vai biblioteca open source desenvolvido em conjunto entre os desenvolvedores que depois fundaram a light Ester e desenvolvedores da Google da Microsoft bom né É um grupo multidisciplinar que envolveu suas bibliotecas E aí eu tenho bibliotecas para Java para dot net pagou para noite e aí esse essa aplicação Ela é bem didático porque eu tenho aqui várias linguagens de programações Diferentes né E aí no final das contas para mim isso chega tudo de mão única forma né então o que é interessante ressaltar aqui eu tô Navegando em várias linguagens Diferentes né é vão pegar mais um exemplo aqui só para gente ilustrar isso então por exemplo eu tô aqui no meu front em ti e eu vejo que logo antes de começar latency na hora que eu fiz o meu Deploy eu tive alguns minutos aqui onde aplicação deu erro né É provavelmente devido ao processo de Deploy mesmo então a gente consegue fazer a mesma análise só que agora uma análise Diego Lucena onde ela tem aqui no card Service Oi e aí veja o que interessante é independente da linguagem de programação independente da infraestrutura em um momento que eu tô olhando para infraestrutura né tanto faz em qual container tá rodando se é a Amazon se é um prêmio Esse é web lógico a vestir eu tô olhando para aplicação né então o módulo aqui que roda em Gol dependia lá dos módulos java.net para ele vai e naquele momento do de pylon eu tive erros que vieram aqui de duas operações do adicionar itens ao carrinho e do fazer o jet no carrinho né receber os resultados do carrinho e aí da mesma forma consigo ver é um 13 específico aqui e ver da onde que tava vindo aquele erro né então qual era o produto que o usuário estava aplicando aonde que aquele usuário tava tava batendo então ele tava no Mozilla ele bateu no meu no meio ambiente da Amazon e eventualmente Aquele carrinho de compras é bom demais para na verdade eu não consegui adicionar o carrinho na hora é hora de adicionar o item no carrinho vai receber um erro 500 tá então esse é um pouquinho do que a gente consegue do que a gente consegue fazer com leite estepe aqui em termos de aqueles Light a bacana trazer junto à equipe de desenvolvimento EA equipe de operações determina para a gente identificar de uma forma mais clara como que as mudanças no código e inversões de código conseguem consegue não né mas impactam a minha operação do Meu sistema tá é eu vou usar aqui na verdade eu usei um dos botões aqui da minha do meu painel do serviço não para abrir o detalhe do WhatsApp agora que eu tenho certeza porque eu vi pelas evidências do WhatsApp que o meu problema estava na versão dos aplicativos eu como especialista como analista de e esse problema tem um segurança de que fazendo um robek da aplicação eu vou resolver aquele problema então eu consigo também via plataforma fazer o Roberto e clicar aqui no Robert e e fazer isso acontecer também usando aí são todos que a gente mostrar para vocês já no último no último a binária né É mas usando aqui o integrante um Hub é criar uma mudança emergência automaticamente no sistema e depois de criar essa mudança emergencial vou dar um fluxo lá no meu que você conhece que vai automaticamente fazer o holback dessa situação tá então como um resumo aqui do nosso fluxo é usar o PowerPoint aqui levemente só para gente recapitular né É cada vez mais eu tô munidos de informações aqui é cada vez mais eu tenho informações chegando de fontes distintas na minha plataforma então tenho alertas de ferramentas monitor o tradicionais eu tenho anomalia sendo detectadas vlogs para angariar eu tenho anomalia sendo editadas na aplicação com a Stephanie por exemplo não é a primeira coisa que eu preciso fazer aqui é reduzir esse ruído né eu vou reduzir se o ruído como usando análises temporais usando similaridade de texto usando principalmente a topologia do meus MDB para agrupar melhor as coisas antes de passar para querendo a lista é agrupei as coisas eu organizei as informações na tela gera o meu Alerta agrupado né com as evidências que aquele analista precisa para atuar naquele incidente E aí na mesma tela no meu aparelho o Face eu tenho ferramental para ter os ensaios necessários para colaborar com as demais aqui né gerar tarefas interagir com com as minhas outras equipes de t.i. e para eventualmente remediar o meu problema e usando o que a gente chama de self-healing aí através do Inter que eles são Ramos né com isso a gente espera obter alguns resultados em termos de operação detêm então é melhor a disponibilidade do meu serviço melhorar a satisfação do cliente e aí fazendo mais uma vez o vínculo com WhatsApp né no sfa gente tem 100 porcento das transações que ocorreram né então quando eu falo de satisfação do usuário final eu sei exatamente qual foi a experiência daquele usuário Ele clicou no na vitrola vitrola ficou no adicionar ao carrinho e aquilo demorou para acontecer e é no final das contas tem mais agilidade tem mais eficiência operacional é na hora de fazer um robec por exemplo de fazer um novo Deploy eu já rodar isso de forma automática na plataforma e não depender de abrir tarefas e interage com processos manuais e é voltando aqui na minha na minha plataforma que a gente espera aqui esse Alerta Vamos abrir aqui o mapa do serviço o meu mapa do serviço já vai estar atualizado E é assim que o pré-show de baixar o alerta ele fica dois minutos no ar né Então tá show dele demora um pouquinho para baixar mas a gente vê que o cara que serve esses dois já não existe aqui no mapa Ou seja eu já eliminei aquela aquela versão 2 do cargo service tava gerando o meu incidente e aqui seu navegar de novo na minha plataforma eu vejo que eu já consigo navegar e adicionar os itens no carrinho de uma forma bem mais rápida não posso Navegar aqui ó seu clicam adicionar ao carrinho eu já me segue aquele problema de lentidão tá gente Tom essa narrativa que a gente tinha para mostrar para vocês hoje um cenário aí no contexto aí agora temos aqui a normalização do alarme né É assim que outra show de O que é uma narrativa um pouquinho mais técnica mostrando um pouquinho aqui por trás da cortina como que a gente gera os alertas aqui tanto do do log Analytics né com orçamento de lotes quanto os insights aqui dentro das aplicações com o ex ep 1 é Aproveitar esses cinco minutos finais gente para pegar algumas perguntas aqui do que o Enem do chat dúvidas pessoal a gente tá está aqui com mais 5 minutinhos tiver alguma dúvida quiserem quente história alguma coisa chega uma dúvida aqui o planeta como eu fiz o perdão como é feita a instrumentação do litestep vou vou pegar sua pergunta aqui então como eu falei desistem bibliotecas a gente chama de roupa internet né existe um repositório público do Open telemetry é uma biblioteca pública outro é depois que eu terminar de responder aqui para vocês vou deixar o link um chat para vocês essas bibliotecas tem mais diversas tecnologias entre bancos de dados linguagem de programação eu adiciona a sua biblioteca do meu projeto depende do tipo de linguagem de programação Eu tenho um tutorialzinho na plataforma de como fazer qualquer cada um das linguagens de programação e depois de injetar dessa biblioteca no meu no meu projeto esses esses dados são gerados automaticamente já E aí eu consigo dentro do código também se eu quiser enriquecer esses dados com mais informações então por exemplo eu peguei ali para mostrar para vocês como exemplo o nome do produto que estava sendo clicado Então é isso usando essa biblioteca que eu ensino no meu projeto eu tenho acesso a trazer o nome do produto a trazer um identificador da transação algo que me permita é fazer essa interface de saber qual foi o cliente impactado o segmento ou o produto né então é sempre através das bibliotecas do outro elemento que o gordinho já deixou aí o link para gente no no chat perfeito quem gosta de achar que um sub link que é o registro do do PT lembro aonde a gente tem todas as todas as tecnologias Aline e as bibliotecas para cada uma delas legal Você Chegou outra pergunta aqui me lembra bastante a parte do é tão real ficam as facilidades de criação de cabelo conforme identificação de gaps e logo retention seria esse o mesmo caminho É sim na verdade o que a gente tá fazendo aqui né está enriquecendo cada vez mais ou Edson Health com insumos né com mais um site Então pensa naquele mesmo naquela mesma tela onde eu tenho alertas de ferramentas de mercado Já conhecidas aí né salve para nós três aqui não só tá Dog eu tenho agora mais fontes de anomalias de insights né com o Health logo Analytics e com o leque está que a gente trouxe para vocês hoje sem e é mais é importante também ressaltar né que geralmente quando você vai ter um problema né como você mostrou de de leite dão aí para ver um determinado a ação da aplicação né Muito dificilmente você vai ter uma piada todas as funções ou todos os passos né que uma aplicação da com uma ferramenta de instrumentação de aplicação isso que é legal do WhatsApp né quando você instrumentalizou vir ao peito Elementary né todo Independente de qual vai ser a é o lugar onde você está uma piada né você conseguir pegar tempo de resposta lá no males né É nas Lopes é só na instrumentalização que você fez aplicação aí se importare erros né e não só tem criações mas também mensagem de erro ele espeta né isso com o nosso cérebro acaba sendo bem prático e já tá dentro povo vai ter um Half como como pessoa que perguntou aqui é comido já tá dentro vai para o Health então toda todo lugar Sujinho com ele com ela e com o rei Opus né Que A Gente É sério Já tá pronto complementar aqui né e cada informação que chega do blog ou do estepe ele vira uma variável dentro da plataforma então isso ajuda a você enriquecer seja o seu cabelo ou seja suas ações então via parte eu posso pegar uma variável que veio do logo complementar com uma médica para tomar uma ação já a 100 porcento automatizado então isso vai sempre enriquecendo o seu processo dentro então refritã super dentro do que a pergunta e vamos legal pessoal tá gente chegou no final mais uma vez muito obrigado pela presença de todos a gente teve bastante participação aqui tá nesse web não é que eu quero agradecer aí a presença e atenção e vetou as dúvidas ou quiser entrar um pouco mais detalhe em algumas aplicações subsequentes aqui pode entrar em contato com a gente que a gente vai ser um prazer para falar com vocês tá bom Até a próxima obrigado um abraço essa Bros

View original source

https://www.youtube.com/watch?v=tgDLZFXmgkw