Na segunda parte desta série, vamos nos aprofundar no desenvolvimento de pipelines usando o SDK do Beam. Primeiro, vamos conferir um resumo dos conceitos do Apache Beam. Depois disso, falaremos sobre como processar dados de streaming usando janelas, marcas d’água e gatilhos. Em seguida, vamos ver as opções de origens e coletores para seus pipelines, além de esquemas para expressar seus dados estruturados e como fazer transformações com estado usando as APIs State e Timer. A próxima tarefa será conferir as práticas recomendadas para maximizar o desempenho do pipeline. No final do curso, apresentaremos as APIs SQL e Dataframes, que representam sua lógica de negócios no Beam. Além disso, veremos como desenvolver pipelines de maneira iterativa usando os notebooks do Beam.
Este é o primeiro de uma série de três cursos sobre processamento de dados sem servidor com o Dataflow. Nele, vamos relembrar o que é o Apache Beam e qual é a relação entre ele e o Dataflow. Depois, falaremos sobre a visão do Apache Beam e os benefícios do framework de portabilidade desse modelo de programação. Com esse processo, o desenvolvedor pode usar a linguagem de programação favorita com o back-end de execução que quiser. Em seguida, mostraremos como o Dataflow permite a separação entre a computação e o armazenamento para economizar dinheiro. Além disso, você vai aprender como as ferramentas de identidade, acesso e gerenciamento interagem com os pipelines do Dataflow. Por fim, vamos ver como implementar o modelo de segurança ideal para seu caso de uso no Dataflow.
Ganhe um selo de habilidade ao concluir o curso Compartilhe dados com o Google Data Cloud. Nele, você vai adquirir experiência prática com os parceiros do de compartilhamento de dados, que têm conjuntos de dados próprios que os clientes podem usar para casos de uso de análise. Os clientes assinam e consultam esses dados na própria plataforma, depois os aprimoram com os conjuntos de dados e usam ferramentas de visualização nos painéis voltados para o cliente.
Conquiste o selo de habilidade introdutório Preparar dados para APIs de ML no Google Cloud para demonstrar que você é capaz de: limpar dados com o Dataprep by Trifacta, executar pipelines de dados no Dataflow, criar clusters e executar jobs do Apache Spark no Managed Service for Apache Spark e chamar APIs de ML, incluindo as APIs Cloud Natural Language, Google Cloud Speech-to-Text e Video Intelligence.
Conclua o selo de habilidade avançado Implantação de arquiteturas multiagente para demonstrar que você é capaz de: construir sistemas multiagente com ADK, conectar agentes com o protocolo Agente-para-Agente (A2A, na sigla em inglês), integrar ferramentas externas usando o Protocolo de Contexto de Modelo (MCP, na sigla em inglês) e implementar uma solução multiagente completa no Agent Engine.
Ganhe um selo de habilidade ao concluir o curso Streaming de análises para o BigQuery, em que você usa o Pub/Sub, o Dataflow e o BigQuery juntos para transmitir dados para análise.
Conclua o selo de habilidade intermediário Criar um data warehouse com o BigQuery para mostrar que você sabe mesclar dados para criar novas tabelas; solucionar problemas de mesclagens; adicionar dados ao final com uniões; criar tabelas particionadas por data; além de trabalhar com JSON, matrizes e structs no BigQuery.
Ganhe um selo de habilidade ao concluir o curso Implantação e gerenciamento de aplicativos no Google App Engine, em que você aprende a usar o App Engine com Python, Go e PHP.
Ganhe um selo de habilidade ao concluir o curso Noções básicas do Google Cloud Compute, onde você aprende a trabalhar com máquinas virtuais (VMs), discos e servidores da Web usando o Compute Engine.