Observabilidade e AIOPS de verdade com a ServiceNow (ITOM + Cloud Observability)
[Música] sejam todos muito bem-vindos a mais um webinar aqui da service sinal Brasil Eu sou Vitor e executivo de vendas responsável pelo portfólio de tecnologia que da service sinal comigo tá o Felipe canhedo especialista aqui na solução que a gente vai abordar hoje de cloud observability e hoje a gente vai falar um pouquinho sobre eh E as novidades que estão chegando nesse mundo de observabilidade OP telemetry e eops tá aqui na service sinal e só um um um parênteses né esse aqui é um formato webinar Então quem quiser fazer pergunta interagir tem o nosso q& tem o chat então na medida do possível durante a apresentação nós vamos respondendo as perguntas né que vocês porventura tiverem e a gente vai deixar também o nosso canal eh do YouTube para quem quiser se inscrever para quem quiser ver os vídeos e anteriores e ficar sabendo aí das novidades que estão por vir tá então a gente vai começar a falar um pouquinho né sobre esses três temas né de grande importância observabilidade Opet eops temas de que as empresas vem utilizando para buscar eficiência maior agilidade no go marketing na Cloud né e o gter Por exemplo fala que 85% das empresas que adotaram né Cloud até 2025 não vão ser capazes de executar totalmente as digitais sem uso de arquiteturas modernas ou seja tecnologia Cloud Native né Toda empresa eh tá se tornando digital né tem essa tendência e desenvolvimento de aplicações em Cloud Native é uma principal né uma das principais maneiras de chegar lá né a ti tradicional que a gente conhece hoje ganha um papel também Fundamental e estratégico né nesse nessa história toda porque governar devops não é uma coisa trivial né e ainda mais estrutura descentralizada né e e e e toda a natureza né de de de ambientes descentralizados que o devops exige então a gente já sabe né que a grande maioria das empresas já implementou alguma coisa de devops né Eh no seu ciclo produtivo e precisa de ter esses desafios resolvidos né mas a maioria dessas empresas que hoje já tem o devops em alguma parte ali da da da operação ainda tem né os mesmos eh as mesmas estruturas né os mesmos Silos que a operação tradicional tem né então geralmente essas operações de ti ainda estão um pouco separadas ali da das equipes de desenvolvimento ainda tem falta ir rastra abilidade por conta do ferramental né atual e os dados estão em Silos ou seja as informações não são muito simples né de serem relacionadas entre si a gente tem pelo fato de ser Cloud Native pelo fato de ser uma uma operação descentralizada uma taxa altíssima né de mudanças nesse tipo de ambiente e é muito mais frequente né as tendes então a a governança né é muito importante nesse aspecto a gente sabe que nesses ambientes a governança não é tão boa assim né porque a gente quer dar autonomia a gente quer dar mais velocidade mais celeridade ali no processo e muitas vezes né a burocracia Acaba atrapalhando muito essa realidade e o risco né de indisponibilidade de crise com esse altíssimo overhead no trouble shooting porque como tem muitas muitos Silos muitas áreas diferentes a gente acaba tendo fricção entre esses Silos E aí a gente já sabe para onde tudo isso vai né Então baixa produtividade custo operacional mais alto do que era antes né O que vinha a resolver às vezes acaba sendo né efeito colateral mttr às vezes maior eh porque tem muito mais gente olhando fazendo turbo shooting e tentando buscar o que que aconteceu né a causa raiz né O que que o motivou aquela crise eh o atraso das inovações porque tem muita gente apagando incêndio e pouca gente pensando nas inovações nas estratégias novas da companhia e perda de receita de clientes porque quando a gente tem Impacto né muita indisponibilidade a gente acaba tendo né menos experiência positiva ali dos clientes bom Vitor mas eh como que a gente pode juntar os dois mundos ou seja como é que a gente consegue conviver melhor sem precisar desse tradeoff entre ou velocidade ou estabilidade dos meu serviço clud Native as operações modernas elas o desenvolvimento é muito paralelizado né Eh as as áreas são independentes a natureza das aplicações são distribuídas né os microsserviços os componentes serveres e tudo mais então a adotar essa estratégia né a necessidade de controle aumenta drasticamente mas como eu falei anteriormente né a gente não pode burocratizar porque afetaria diretamente a velocidade com que a gente busca né com essa abordagem de desenvolvimento eh de de devops né E imagina-se essas empresas que já estão bem avançadas em em né em desenvolvimento agem devops se elas tivessem né as estruturas tradicionais de ti as ferramentas que a gente conhece legadas né de monitoração e gestão de ti esquece né Essas essas duas imagens são bem antigas tá pessoal só para deixar claro elas não são assim hoje em dia mas só para mostrar meu ponto né Esquece porque independente do do do jeito como você monitora se você monitor asse cada ponto desse tivesse que fazer o controle a governança de cada ponto desse desse mapa né de de de de componentes né e relacion entre eles é impossível né a gente acabaria onerando muito né o processo e atrapalhando muito a o ciclo de inovação né então conectando os dois mundos agora a gente vai mostrar um pouquinho mais sobre como a service sinal endereça né Toda a problemática que a gente viu até aqui e o objetivo é muito claro né dar autonomia pras equipes de desenvolvimento e Sr e ao mesmo tempo garantindo que a gente ten os mesmos controles no mundo de operações tradicionais né que a gente tem com eops eh ou seja né reduzir a atrita entre as áreas melhorando a confiança né e a e a resiliência dos ambientes Cloud Nate vi aumentando assim a experiência do colaborador e do cliente para alavancar ainda mais transformação digital e exponenciar né Essa realidade de cloud Native que a gente sabe né que é uma realidade vai ser o futuro de todas as empresas e todas as operações de ti e aí usando um pouco né a a o paralelo com eh as operações tradicionais versus né o mundo Cloud Native eu eu faço uma analogia com uma casa imagina que a casa pega fogo o a gente sabe que o ambiente tá em crise por quê Porque tem fumaça né a gente sempre brinca na operação lá quando tem fumaça tem fogo então os clientes quando ligam né pra empresa ou quando reclamam que a a o ambiente tá lento ou que tá indisponível a gente sabe que tem um problema e as ferramentas de monitoração até pegam né o problema até até tem o sinal de que tá acontecendo alguma coisa é o sensor de fumaça né na casa ele apita mas não fala exatamente onde o incêndio tá onde o foco tá como aconteceu quando começou não avisa ninguém né só pita né já é alguma coisa mas isso numa operação Tradicional em operação Cloud Native a casa além de ser muito maior a gente tem uma série de componentes específicos pequenos que por si só já são complexos o suficiente para exigirem uma monitoração uma uma observabilidade maior então por exemplo a fiação de uma luminária nesse exemplo aqui né Eh esse poderia até ser monitorado e observado quando tivesse por exemplo uma exposição indevida né da Fiação ou um curto circuito enfim para que tivesse né preditiva um alerta pro bombeiro pro médico enfim para que a gente conseguisse atender rapidamente né né Caso haja de Fato né um curto circuito o início de incêndio ou até que a a energia poderia ser interrompida nesse ponto né Para que evitasse de uma vez por todas o incêndio né um foco de incêndio da mesma maneira por exemplo a temperatura de um forno né quando tivesse anômalo por exemplo que desligasse né o forno porque saberia que aquela temperatura né tá estranha né poderia ser também um foco de incêndio ou coisas diferentes né Por exemplo o nível de água uma banheira eh passou um determinado nível que geralmente é observado como normal eu já começo a entender que poderia ter eh uma um overflow né E aí eu poderia também chamar um técnico para avaliar por exemplo o nível da daquela banheira ou até o movimento estranho de de cadeira ou de imóveis da casa né através de de câmeras de segurança para evitar por exemplo um ataque uma intrusão né ou até uma uma uma brecha de vulnerabilidade sendo explorada naquele momento tá então a gente não tá falando aqui obviamente só de observabilidade né de infraestrutura ou de métricas como também de segurança Então esse paralelo é muito importante porque eh todas as métricas que estão sendo observadas aqui poderia ser um sinal que a Serv sinal poderia buscar nesse ambiente de microsserviço cloud Native para alertar por exemplo a operação que acontecia alguma coisa né então componentes são muito mais diversificados né as tecnologias são muito mais eh desafiadoras ali paraa gente obter né sensores enfim e serve também para mostrar que o detalhe que nós teremos para monitorar e observar o quão complexo vai ser essas essas aplicações daqui em diante Então somente com uma solução que entrega a visibilidade da aplicação em conjunto com a observabilidade em cima da plataforma de gestão de tei que acho que é talvez a maior o maior desafio né para todas as organizações que estão migrando para esse para essa natureza eh garantem a governança e a autonomia né das das equipes de desenvolvimento com controle e aí a gente tem uma redução drástica de mttr por a gente não tá mais com tantas áreas e recursos operacionais diferentes e importantes da companhia gastando tempo em apagar incêndio ao invés de trabalhar em inovação Então a gente vai começar a falar um pouquinho sobre o cloud observability do Service sinal integrado com a nossa solução de service operations né que é o eops do Service sinal tá eh como que funciona né o o a solução de de cloud observability né a gente tem sensores que capturam as métricas logs e traces utilizando a tecnologia Jump telemetry que a gente já explicou no vídeo anterior né foi uma solução que a a a empresa que a ser sinal adquiriu foi a criadora né foi o fundador da da do Open telemetry incase nesses nesses sinais de métricas logs e traces a gente tem um mecanismo aqui de de que é o cloud observability para monitorar todas as eh todos os pontos né de controle que a gente tem nas nossas aplicações validar né as mudanças que tiveram ao longo dos últimos x tempo para melhor identificar o Rot cause analises né o causador da crise e alertas acionáveis né que é nosso motor de de workflow parrudo de self Healing entra do motor aqui de event Management para prever problema para eh mitigar Impacto para auto resolver né com menor eh gasto humano possível e mais Eh mais rápido possível né usando machine learning e iops para ativar o nosso O nossos eh resultados de service operations ou seja com esses sinais eu tem uma fonte nova de informações para esse mundo complexo de cloud Native e vai utilizar alavancar todo o benefício que a gente tem já com o eops do Service sinal ou seja eh identificar né com as as Open telemetry também né todas as criações alterações ou deleções de workload nesse ambiente Cloud Native para que a gente tenha a maior visibilidade possível online real time né de todo o meu ambiente de todos os meus componentes de de de cloud Native desse ambiente e em cima disso os sinais de métricas logs E3 tá e eu vou ter o mesmos os mesmos né outcomes que eu tenho do aiops tá Ou seja eu monitoro e conecto né todos os aplicativos que eu tenho monitorado na Cloud Native e as equipes né de tecnologia tanto tradicionais quanto modernas né CRS e devops eu visualizo né todos os meus ambientes de ponta a ponta para ter um controle mais eh online do parque e quebro os Silos porque eu já tenho né a homogeneidade né a diversidade de toda a a minha informação né numa única plataforma no único sistema de registro numa única arquitetura tá eh e o que que é legal também né como eu falei né a visibilidade do ambiente vai ser fornecido para service sinal através dos sensores geop telet Ou seja eu não dependo daquela capacidade tradicional de discovery que a cada x tempo eu faço descoberta da do de um ambiente para Claud Native isso não faz nenhum sentido né porque as coisas são muito dinâmicas eh workload é é elástico né muitas vezes né em em momentos do dia a coisa muda né aumenta muito e depois eu tenho uma redução para evitar custos indevidos e tudo mais então por conta disso né uma maneira rápida de eu ter a detecção de causa raiz é que eu consiga manter esse mapa de dependência atualizado e de maneira eh real né de maneira factível tá então ainda assim né que eu tenho a visibilidade eu tenho também a dependência de todos esses componentes eu sei que o componente aqui por exemplo de shipping service ele vai ser um dos caras que atende por exemplo a minha aplicação crítica de negócio de maneira que se eu tiver um microsserviço que seja impactado nesse componente isso também impacta toda a minha cadeia de entrega de valor né e eu detecto proativamente os os impactos ou seja os sinais do Open telemetry também sensibilizam os ICS que são ah que são criados a partir do mesmo Open telemetry então eu tenho a junção dos dois mundos né a governança e a monitoração e isso é sensível né eu consigo obter as métricas ao longo do tempo de maneira que eu consiga entender aonde que aconteceu problema e quando aconteceu um problema né então eu sei que teve um comportamento anômalo nessa estrutura e qual é o comportamento anômalo né quais foram por exemplo as minhas operações por segundo antes 15 minutos antes eh como é que tá agora como é que tá né 15 minutos depois do início da crise saber quais são os atributos que mudaram né ao longo desse período e também fazer um drill Down aí muito mais detalhado que a gente vai mostrar já já na demonstração da solução tá então tem a informação de logs traces e métricas eh São cruciais e numa mesma estrutura entrega muito mais valor do que ter que ficar abrindo né outras telas outras interfaces e tudo mais E além disso né eu tenho integração também Nativa com soluções de devops Ou seja eu consigo utilizar né a o devops do Service sinal para automatizar as mudanças que eventualmente os meus SRS né os meus colaboradores né de de devops tenham né eu não vou precisar ter que obrigá-los a abrir o service sinal e criar uma mudança por por exemplo isso não faz sentido as pessoas têm que estar desenvolvendo não tem que est se preocupando né em criar mudança lá dentro do servic sinal somente para garantir que o controle seja feito né Então as próprias eh as próprias variáveis que eu tiver trabalhando dentro do devops vão ajudar as equipes a ter essa essa autonomia e ainda assim garantir o controle nesse ambiente para controlar né risco a segurança do ambiente garantir que a governança seja feita e Tratando as exceções somente não deixar que o o esse processo seja burocrático e por fim pessoal assim tem vários clientes que hoje já utilizam né o cloud observability e tiveram né estão tendo né eh reduções significativas não só em incidentes né sendo gerados porque já tem uma melhor eh observabilidade do ambiente mas redução do tempo para resolver incidente redução de mttr horas salvas né em mudanças porque eu tenho um controle muito melhor e muito menos burocrático né do meio ambiente eh tendo né um mttr mais rápido eu tenho serviços que são eh se a gente não consegue eh evitar que o problema aconteça né que rapidamente eu consiga restabelecer o serviço isso é muito importante ainda mais paraa estrutura complexa que a gente vai ter agora em operações modernas eh desempenho né para para aplicações que eu entrego para usuários finais e redução de indisponibilidade né quando eu tenho sinais quando eu tenho observabilidade eu tenho mais tempo para evitar que o problema AC tá então isso tudo é para Para Dizer para vocês né o quão importante é a observabilidade e o que é uma solução que vai me ajudar a garantir né resiliência e performance nesses ambientes novos que a gente tá vendo cada vez mais nas operações tá a gente vai mostrar um pouquinho de como a solução endereça isso com o fe Bom dia pessoal então vou roubar a tela do Vitão eh acho que vocês já estão vendo aí meu navegador Estamos vendo sim F então o que que eu queria mostrar para vocês aqui hoje né algumas coisas eh no último webinar que a gente fez na verdade tem tem dois webinares anteriores que a gente fez que estão relacionados a esse né que é bacana se vocês tiverem curiosidade se vocês não virem assistir um relacionado ao fluxo do eops como um todo aqui dentro da plataforma service sinal aqui dentro do do Service Operation workspace que é bacana vocês verem se vocês não conhecem ainda esse mundo aonde a gente recebe um alarme faz toda tratativa dele mostra o playbook mostra a resposta automática né n e todas as funcionalidades aqui do workspace e a gente também teve um explorando um pouquinho a questão da observabilidade e e e do antigo Light step que hoje a gente chama de cloud observability né Eh o que eu quero mostrar aqui para vocês hoje é um pouquinho diferente por eh eu tenho duas formas de montar esse mapa tá o mapa de uma aplicação que roda no mundo Cloud first tá ou no mundo Cloud Nate né seja kubernetes seja op shift seja docker seja eh qual for a a tecnologia de microserviços ou a tecnologia de de paz né hoje na C sinal eu posso instalar o plugin chamado cno que é o cloud Native operations tá que aí eu preciso colocar um agente dentro do kubernets ou dentro do P shift e esse agente associado ao mid server que é o a tecnologia de discovery da server sinal vai navegar dentro daquele kubernetes dentro daquele opens shift e vai coletar as informações que ele precisa para montar para montar um mapa como esse aqui tá eh ou n na verdade V vou pro mapa principal que vocês vão ter a visão geral ou você pode usar o open telemetry que é o que a gente vai mostrar aqui hoje então no último webinário eu mostrei a outra forma então eu mostrei com o cloud Native operations né indo de dentro do kubernetes ou de dentro do Open shift e mapeando o que tá ali dentro né Qual que é a a a os pró e contas de fazer com os dois com a versão que eu mostrei no outro webinar você precisa de ter habilitado no seu kubernetes ou no seu PR shift uma tecnologia chamada istil que é uma tecnologia de service MH né que é justamente quem vai me ajudar a fazer a mágica de detectar como que aqueles microsserviços que estão ali dentro do meu kubernetes do meu shift se comunicam ou seja o frontend fala com quem Ah o frontend fala com o serviço de e de de ads né de de de banners fala com serviço de checkout de recomendações Ah o serviço de checkout fala com quem ele fala com pagamentos fala com catálogo de produtos e fala com carrinho de compras né da onde que eu tiro essa informação de qual microsserviço fala com quem eu tenho duas opções ou eu uso um service meesh como o is por exemplo ou eu uso Open telemetry E aí o que eu trouxe para vocês hoje é a visão do Open telemetry que eu acho que o o Vittor usou bastante a palavra aí né Cloud flush Cloud flush ou Cloud Native né Eu só queria reforçar o seguinte Open telemeter o que que é bacana não importa a minha infraestrutura né então isso daqui pode estar em um prem pode estar num servidor físico pode estar emvm pode estar na WS no Google na Oracle no kubernetes local no no ou no openshift local eu vou eh ver o microsserviço de dentro da aplicação para fora então eu não eu não dependo nada de infraestrutura se você na na semana seguinte te tirar esse microsserviço do seu kubernetes de desenvolvimento que tá noem e passar para um kubernetes hospedado lá na Google esse mapa vai continuar funcionando de forma transparente e aí você não vai precisar instrumentar nada a mais em relação a isso tá E aí daqui a pouquinho vou falar um pouquinho para vocês sobre como que como que essa mágica acontece né ou seja como que a gente faz essa instrumentação que é uma instrumentação tão agnóstica a eh tecnologia ou a plataforma Tá mas eh antes disso né vamos vamos entender um pouquinho o que que tá acontecendo aqui então eu vejo aqui no meu no meu eh dashboard geral na minha visão geral da minha empresa que eu tenho alguns serviços aqui que estão vermelhos né tão tão críticos E se eu navego no mapa geral dessa aplicação eu vejo que a a minha ordem aqui de de impacto é o frontend tá crítico porque o checkout tá crítico e o checkout tá crítico porque o Card Services tá crtico crítico né Eh da onde que vem esse Alerta esse Alerta hoje vem aqui eh justamente do eh Cloud observability tá então eu tenho lá um tempo de resposta um alerta de tempo de resposta de uma função chamada adicionar item ao carrinho eh no meu no meu Cloud observability e aqui eu tenho até o o o link aqui para para esse Alerta que eu já deixei aberto aqui pra gente tá eh e aí a gente entra no Cloud observability tá e alguns diferenciais aqui do Cloud observability primeiro você vai ver que toda a a Organização das informações aqui dentro a gente faz por eh tecnologia tá então dnet Java go node Python JavaScript né E então a gente aqui no no nessa visão de observabilidade a gente não se preocupa mais com Plata forma então é uma mudança eh eh de paradigma importante que é a seguinte né quando a gente fala das das Ferramentas de observabilidade tradicionais aí né de do do dos últimos anos né Qual que é a primeira pergunta que eu tenho que fazer pro cliente quando eu vou implementar aquela plataforma de observabilidade qual é a sua plataforma né então eu tenho que perguntar para ele Ah um websphere tá bom é um websphere qual é a versão do seu websphere ah eu tenho um websphere 7 websphere 8 um websphere 10 então o que que eu vou ter que fazer vou ter que consultar a minha Matriz de compatibilidade para saber websphere 8 é suportado é suportado então tenho que ir lá naquele websphere 8 e instalar um agente de monitoração ali dentro né se eu migrar e daquele webs 8 para uma outra tecnologia Ah agora eu vou sair desse websphere eu vou para um Tonet ou eu vou mudar minha aplicação para um node aí eu tenho que de novo qual é o meu agente de monitoração para node Qual é o meu agente de monitoração para tonat eu tenho suporte eu não tenho suporte então aqui eh ao contrário Então aqui eu olho paraa aplicação de dentro Então o que que eu tenho que saber a minha o meu componente carrinho de compras ele é desenvolvido em dnet se ele é desenvolvido em dnet então eu vou colocar minha biblioteca para dnet se ele é desenvolvido em Java eu vou colocar minha biblioteca Java se ele é em Python eu vou colocar minha biblioteca Python então eu não eu inverto as minhas prioridades Eu não me preocupo mais com a plataforma onde ele tá feito o Deploy eu só me preocupo com eh como ele está desenvolvido E aí a minha vantagem é se eu fiz uma vez eu posso ter a observabilidade de fim a fim na minha esteira de devops então eu vou ter observabilidade do que tá acontecendo em desenvolvimento em homologação em pré-produção e em produção de forma transparente tá então aquele desenvolvedor que tá trabalhando num ambiente de desenvolvimento que tá trabalhando num ambiente de homologação ele não precisa se preocupar com eh coletores de de de monitoração ele não precisa se preocupar com com com infraestrutura para monitoração porque a monitoração ocorre dentro da aplicação Então a partir do momento que aquele desenvolvedor insere na esteira dele de devops a biblioteca do Open telemetry ele vai ter a observabilidade em todas as etapas do desenvolvimento então ele não vai precisar esperar entrar em produção para pegar um erro de um erro que que não necessariamente é um é um erro de desenvolvimento mas é algo que mudou o meu comportamento da minha aplicação de uma forma Inesperada tá Então qual que é a ideia aqui né a gente teve uma mudança no ambiente se eu voltar rapidamente a plataforma service sinal e eu e eu dar uma olhada nos eh nos registros relacionados a esse alarme que eu recebi eu eu consigo até ver que a mudança foi realizada no carrinho de compras né no card service e e gerou impacto em alguns serviços ok e a própria plataforma service sinal já sugere como possível causa raiz daquele problema a mudança queocorreu algumas horas atrás que foi justamente o canary deployment do card service V2 né então às vezes com a plataforma serval você não precisa nem investigar Tecnicamente ali o que aconteceu porque a a próprio controle de mudança do hsm já vai te entregar que eh Muito provavelmente esse seu novo problema ou esse seu novo alarme foi causado por aquela mudança que ocorreu na noite anterior né mas vamos supor que eu não tivesse isso integrado bonitinho ou que a plataforma Por algum motivo não me sugeriu aquela mudança eh como a causa raiz então eu teria que fazer uma investigação mais técnica aqui né então do ponto de vista de observabilidade Eu também consigo fazer essa investigação mais técnica né então eu vejo algumas coisas aqui já na plataforma que a versão atual do meu carrinho de compras é versão dois e eu na linha do tempo eu consigo ver exatamente então eu consigo ver um pininho um pino aqui no mapa né no no timeline que vai me dizer quando que eu fiz o Deploy da versão over 2 tá como que eu vejo isso eu vejo isso porque quando o o meu desenvolvedor ou o meu engenheiro de devops ou quem foi que rodou aquela Lira no no jenkins no Ed devops eh num gitlab no github tanto faz fe aquele Deploy eu comecei a receber transações com o atributo da versão do Tá então não necessariamente eu eu preciso ter a visão só da versão dois então eu consigo ver transações que estão na versão dois e na versão 1 ao mesmo tempo que é o famoso canary deployment tá para quem não sabe o que é o canary deployment o que que ele é é quando ele foi popularizado pela pela Netflix tá e pela e e e se não me engano pelo Spotify também que foram os pioneiros dessa tecnologia que é se eu vou fazer uma nova versão do meu produto eh em vez de eu passar essa nova versão do meu novo produto para todos os meus clientes eu coloco para 1% dos meus clientes ou para 0.1% dos meus clientes né então eu uso literalmente aqueles aquele 1% dos meus clientes como cobaia para saber se eu vou ter algum problema e se eu tiver algum problema eu não Impacto todos os meus clientes eu Impacto aquele 1% som ente e eu tenho essa visibilidade tá eh pra gente ver melhor o que tá acontecendo aqui no nosso laboratório eu fiz ao contrário né então eu eu fiz o Deploy para 90% dos clientes da versão do que é a versão problemática e eu deixei só 10% com as com a versão eh com a versão que não tem o problema no meu código tá pra gente poder ver a diferença aqui né então como é que eu faço a investigação eu posso clicar aqui no meu no meu gráfico que é um gráfico que eu tô vendo de latência que a latência subiu drasticamente logo log depois aqui do meu Deploy e eu peço uma comparação Então fala para mim o que que aconteceu Por exemplo comparando com uma hora antes do Deploy tá então ele vai fazer aqui para mim automaticamente duas janelas de tempo tá eh parecido com com os prints que o Vitor mostrou ali para vocês né então eu tenho a janela de tempo que eu tô investigando aqui em amarelo e eu tenho o meu baseline então eu tenho a minha referência né que tá em azul que é a minha referência de quando tava tudo bem Tá e aí sem precisar ficar olhando para todos os detalhes técnicos e todos os gráficos que eu ten na tela eu já posso bater o olho e falar aqui ó o que que mudou de atributos então aqui é a palavra chave tá atributos então o que que mudou na prática dentro da minha aplicação dentro do meu código que eh fez aquele tempo de resposta passar de de de zero quase zero aqui né alguns milisegundos para quase 10 segundos segundos então a única coisa que mudou foi a a versão do serviço cart service tá eh e a Instância do serviço a Instância mudou porque quando eu mudo a versão eu faço um redeploy lá do eh eh do meu pod né do meu do meu microserviço E aí obviamente o ID da instância Muda então o que que é interessante ele já faz um filtro para mim por qu eu tenho se eu olho aqui na minha na minha estrutura de fato da minha da minha transação Eu tenho um um diagrama de de das minhas chamadas que ele ele é maior do que só aquele Card service né se se eu olhar os meus traces aqui eu consigo ver isso né então eh uma chamada de adicionar o carrinho no card service ela é uma chamada que começa lá no frontend eh passa pelo microsserviço de catálogo de produtos né e e depois eu passo pelo adicionar item ao carrinho e depois eu vou lá num Cash num num num hats por exemplo né então ele é uma chamada que passa por vários microsserviços tá então o que é interessante daquela visão eu vou até voltar aqui pra visão anterior é aquela visão já olha para todo esse mapa e ele compara para mim o que que realmente mudou em tudo isso né no carrinho no frontend para que eu não fique correndo atrás do próprio rab e tendo que olhar para toda a minha aplicação né Então não preciso olhar pro frontend eu não preciso olhar pro catálogo de produtos eu vou olhar só pro microsserviço do card service que é o microsserviço que eu tô vendo tanto no meu diagrama quanto nos meus atributos quanto nos meus nas minhas logs e nos meus traces aqui que é o microsserviço que tá tendo lentidão tá eh então se eu vejo o lentidão aqui por exemplo no meu frontend eu posso pedir aqui um Trace do meu frontend mas ele vai me mostrar que eh a minha lentidão mesmo os meus 8 segundos aqui aqui estão vindo quando eu chamo o Card service tá eh e aí o que que é interessante dessa instrumentação que eu poderia que eu poderia mostrar aqui para vocês também né eu consigo inserir variáveis de negócio aqui dentro tá então por exemplo no meu carrinho de compras eh eu vejo que aquele cliente específico ele tentou adicionar um Um item no carrinho né Eh se eu Navegar aqui na minha na minha aplicação deixa eu entrar aqui na minha aplicação eh no meu no meu site né No me no meu carrinho de comp eu vejo que eu tenho alguns produtos diferentes né tenho aqui enfim uma câmera uma máquina de de de datilografar tá eh produtos vintage né Eh eu poderia estar curioso de entender Qual foi exatamente o produto que aquele meu cliente clicou na minha loja que deu essa lentidão de 8 segundos porque eu poderia ter tá tá fazendo essa análise diferencial né eh e aí eu vejo que o produto que o usuário ficou foi justamente o airplant tá que é um daqueles produtos aqui da loja né cadê airplant né então eu consigo fazer o drill Down na navegação daquele meu usuário e extrair todas as informações da navegação do usuário inclusive informações de negócio que eu consigo popular na instrumentação né Qual foi o produto que ele adicionou no carrinho qual foi o valor total do carrinho então eu consigo ter uma visão de impacto financeiro direto da monitoração né então se o produto que eu adicionei no carrinho é um produto de 12 e aqu usuário não conseguiu finalizar a compra eu sei que eu perdi 12 tá então eu consigo fazer o vínculo com o impacto do negócio inclusive com o impacto financeiro porque eu consigo inserir eh métricas de negócio aqui dentro tá eh e aí eu consigo fazer análise né então eu consigo fazer análise do tipo Tá bom então Mostra para mim todas as transações eh especificamente onde o catálogo do produto era o airplant né então eu consigo fazer queries e montar gráficos e televisões então eu consigo ver todos os clientes então que compraram o airplant tiveram lentidão não não necessariamente todos os clientes né Eh então eu consigo ter essas visões e e e e e isolar o meu a minha investigação então é uma investigação que pode descer no no ponto mais técnico que eu quiser chegar aqui né então eu consigo descer no nível de eh eh milissegundos aqui qual foi o IP do cliente Qual foi o hostname do pod ou do container que que rodou aquela transação Qual foi a linguagem de programação né eu consigo navegar entre linguagens diferentes aqui de forma transparente tá então aqui ó Eu comecei no Python que era o front end saí do Python que era o frontend fui pro catálogo de produtos que era eh vejamos aqui pro catálogo de produtos caring go tá cheguei no carrinho de compras que como a gente já viu anteriormente é dnet né E esse Trace é transparente eu não preciso fazer nada na minha instrumentação para que a plataforma consiga se comunicar entre linguagem de programação diferente tá eh então da onde que vem essa mágica tá Da onde que vem essa essa esse vínculo de traces que com a observabilidade tradicional baseada em agentes de monitoração é tão difícil da gente fazer tá eh vem dessa tecnologia aqui tá que é o open telemetry então como eu falei o open telemetry ele Abstrai completamente a infraestrutura então eu não preciso me preocupar se eu tô na nuvem ou se eu não tô se eu tô no kubernetes ou se eu não tô tá porque eu olho para linguagem de programação então é esse site é público tá posso até vou vou tirar o filtro aqui e vou compartilhar aqui no chat com vocês se vocês tiverem curiosidade de Navegar nesse site tá eh aonde os meus coletores são todos open source né então o que que é interessante aqui se eu tô por exemplo interessado em Eh vamos pegar aqui coletores aws Cloud watch por exemplo tá eh eu tenho acesso a todas as informações de como coletar aquilo e quem mantém cada um dos repositórios no de Hub são os próprios fornecedores então se eu tenho alguma coisa de aws a amazon É que mantém aquele coletor se eu tenho coletores de eh por exemplo de de de dnet aqui um azure monitor exporter isso está no repositório da azure Então quem mantém é a Microsoft tá então eu ganho numa escalabilidade muito grande porque eu não dependo da service sinal ficar criando coletores para n tecnologias e E por aí vai eu só preciso aqui que cada fabricante eh Siga os padrões do Open telemeter lógico a gente tem os nossos conectores que a gente desenvolve também eh por exemplo para cafca para Prometeus né então tem tem algumas coisas que foram desenvolvidas pela própria eh Light step Bars sinal e como parte do projeto Open telemetry né mas eu só tô deixando claro para vocês que ele é um projeto open source aonde eu tenho a participação de todos os principais eh eh fabricantes aí da das das principais tecnologias que hoje são usadas para desenvolvimento né Microsoft Amazon Oracle com Java eh E por aí vai então ele é algo que ele é mantido no mesmo eh no mesmo projeto que é mantido o o kubernetes e o opens shift então hoje ele é o segundo maior projeto open source do da fundação eh pública de nuvem então o primeiro projeto é o kubernetes o segundo maior projeto é o open telemetry então é uma tecnologia eh aonde eu eu vou ter eh algo agnóstico a eh ferramentas de monitoração Então eu tenho essa liberdade de pegar um Open telemetry E e ter acesso às informações dentro da service inal ou ter acesso às informações em outras ferramentas de observabilidade que que vocês eventualmente já têm no seu parque então você não fica mais preso ao agente de monitoração tá eh então era isso que eu queria mostrar aqui para vocês hoje eu acho que temos aí mais uns 15 minutinhos né Vitor eh a gente pode abrir aí para dúvida se vocês quiserem que eu navegue um pouquinho mais na plataforma eu consigo navegar um pouquinho mais e e e trazer mais alguns detalhes aí sobre essa tecnologia para vocês enquanto enquanto o pessoal vai postando as dúvidas aqui F eu vou mostrar o que que o que que a gente quis eh Demonstrar com essa sua apresentação né então Eh Quais são os diferenciais ali de observabilidade quando a gente tá falando service sinal todas as interfaces que o Felipe mostrou para vocês pessoal são Serv sinal né então Além de eu ter toda a visibilidade e o contexto da da de todas as minhas aplicações de ponta a ponta Cloud Native eu consegui unificar o gerenciamento de incidente e de eventos indiferente da natureza da dos ambientes seja ele tradicional ou seja ele né Cloud Native e o que que é legal né quando você tem esse essa unificação quando você tem essa eh ess eh similaridade né de gerenciamento de de ti né entre todas as equipes da tua companhia eh você consegue alavancar ainda mais né o compartilhamento das informações e melhorar a experiência do colaborador ou do cliente final porque você tá diminuindo mttr aumentando produtividade da equipe e integridade né de todos os equipamentos né de todos os elementos melhor dizendo do teu Parque dentro do cmdb Além disso né a governança e a conformidade estão lá né não tão mais dependendo né do desenvolvedor ou dependendo do quão eh eh detalhista é o time de desenvolvimento para inserir né as políticas de conformidade né e a parte de governança dentro da do desenvolvimento né dentro do do ciclo de desenvolvimento deles né o service não tá lá para ajudá-los a ter essa governança ter essa conformidade sem tirar autonomia e sem adicionar burocracia e por fim como eu já falei a colaboração entre todas as equipes né então eu tenho informações numa única plataforma tanto pro time de sre o time de devops o time de take tradicional tá então acho que essa demonstração do Felipe né mostrou ainda mais né que a service sinal tem todos esses componentes já dentro da plataforma integrados nativamente sempre precisar né da da atuação de ninguém para integrá-los e entrega muito mais valor do que somente a camada de afabilidade ou somente a camada de iops tá perfeito eh eu vou pegar duas perguntas aqui do do do chat mas antes delas eu queria só até fazer um comentário eh eh e e é uma brincadeira que eu faço às vezes né mas eh mas acaba sendo relevante acho que pra maioria de vocês eh creio que alguns de vocês estão vindo com viés mais de infraestrutura de operações de ti e alguns de vocês estão vindo com viés mais de devops né mais do lado Dev de devops e mais do lado Ops de devops então se eu apresento essa esse esse componente aqui para alguém que tá vindo com vi de infraestrutura né ou ou se eu tô falando de observabilidade no geral para alguém que tá com viag de infraestrutura e eu falo que eu vou instalar um agente na máquina ele fala tranquilo você vai instalar um ag gente aqui na minha máquina vai monitorar o que precisa e tá resolvido né Eh só que se eu falo isso pro desenvolvedor para alguém que tá com viés de Deb ele vai falar Puts eu dependo de instalar gente na máquina Então ferrou porque eu não tenho eu não tenho como instalar a gente em desenvolvimento eu não tenho como instalar a gente em pré-produção eh ou eu dependo da equipe x eu dependo da equipe Y eu dependo de vários permissionamento que eu não tenho acesso àquilo tá então isso pode ser considerado fácil para quem vem com vs de infraestrutura e difícil para quem vem com vs de Dev tá eh do outro lado quando eu falo do Open telemetry que é colocar uma biblioteca dentro eh inserida na minha esteira de devops né se eu falo para alguém que tá vindo conv de infraestrutura ele vai dar aquela reclamada então ele vai falar assim Putz então vou ter que pedir pro desenvolvedor colocar isso na esteira de devops né Eh eh mas se eu falo isso para alguém que já tá inserido nesse mundo de de de Dev secops ele vai falar tranquilo é uma biblioteca Eu vou colocar essa biblioteca assim como eu ten um firebase da Google por exemplo dentro do meu código né vou inserir um step adicional aqui no meu jenkins no meu a devops e tá resolvido eu consigo fazer isso eh tranquilamente aqui na minha esteira e eu consigo ter uma uma observabilidade o shift left né eu consigo ter uma uma observabilidade muito antes Aqui na minha visão tá eh deixa eu pegar uma uma dúvida que veio eh consigo fazer um robô para simular a navegação do usuário sim consegue tá Então imagina a sua aplicação tá instrumentada tá tanto faz se quem vai Executar a transação é um usuário real ou se é um robô então você pode usar qualquer tipo de robô que ele vai funcionar da mesma forma você pode usar Selenium pode usar blazemeter pode usar enfim load Runner tá que e que a instrumentação vai funcionar da mesma forma consigo ver a experiência do usuário consegue eh do ponto de vista da da transação que chega no backend tá então qualquer transação que chegue pelo menos em qualquer backend instrumentado em qualquer camada web instrumentada tá eh seja a minha o meu primeiro eh eh servidor web que é um proxy reverso ali que tá rodando num is por exemplo eu já vou ter visibilidade daquilo que tá acontecendo Então eu já vou ter o meu o IP do meu usuário se eu instrumentar eu vou ter o meu login do usuário ID de sessão e e tudo que eu preciso para ter a visibilidade da experiência do usuário tá eh vocês vão disponibilizar a gravação desse encontro eh Sim a gente tipicamente coloca o o o webinar no no nosso canal do YouTube acho que a a Rebeca Já postou o link do canal do YouTube aqui pra gente no chat eh tipicamente de um a um mês e meio depois do webinar a gente tá colocando esse a gravação no no YouTube tá gente Eu já respondi também em line O link tá f boa show de bola pessoal quem quiser saber sobre sobre licenciamento por favor chama chamem né as os os account executives que atendem vocês né ou podem até me procurar também se não tiverem meu contato me procurem no Linkedin tá a gente consegue fazer que nem o Felipe comentou né Estimativa de de licenciamento para vocês baseado na realidade de vocês tá se vocês já tiverem iton né se algum cliente aqui quiser expandir né o portfólio para ter essa capacidade associada na Instância e com o iton a gente até fica bem mais fácil da gente fazer esse assessment tá então procurem a gente pra gente conversar sobre sobre esse projeto eu não vejo mais dúvidas aqui Eu já respondi algumas também enquanto você foi eh respondendo ao vivo eu não vejo mais nenhuma tá então a gente vai encerrar por aqui pessoal Muito obrigado a todos os participantes a gente teve um volume altíssimo aqui de de participantes no webinar então agradeço a atenção de todos e qualquer dúvida estamos à disposição obrigado [Música] pessoal
https://www.youtube.com/watch?v=HqS7EI9iHmo