Postagens

Mostrando postagens com o rótulo Apache

Cloud Computing - AWS e Mercado 2015

Após algum tempo sem publicar no Blog, por necessidade de estudos para uma certificação e mudança de emprego, estou retornando a esta atividade, focando em Big Data e Cloud Computing.  Tentando ajudar aqueles que querem aprender um pouco mais sobre Cloud na prática, vamos falar sobre a oferta da Amazon (Amazon Web Services), que permite que você crie uma Conta na nuvem e dependendo do nível de uso dos recursos escolhidos você poderá passar até um ano sem ser tarifado.  Para saber em detalhes o que pode ser utilizado gratuitamente na Amazon, consulte a página http://aws.amazon.com/pt/free/ . Depois de criar a sua Conta na Amazon, você deverá logar no AWS Management Console, que é o produto que gerencia o acesso e uso dos recursos na infraestrutura em nuvem da Amazon. No passo seguinte você escolhe o sistema operacional que irá utilizar na sua instância.  Na AWS existem diversos “flavors” de Linux disponíveis e também uma versão de Windows.  O mais interes...

O que é o Spark ?

Imagem
Para realizar análises de grandes quantidades de dados, localizados em clusters com diversos nós, precisamos de recursos tradicionais de SQL e Datawarehouse ( Star schemas, drill down, etc ), assim como precisamos ter algorítimos e estruturas de dados para otimizar as consultas em caso de falhas em qualquer um dos nós envolvidos.  Outro ponto que observamos mais recentemente nestas análises massivas de dados é o uso de algorítimos chamados de “machine learning” (Page-Ranking, Clustering, Regression, etc), que fazem um reuso de dados muito frequente.  O framework MapReduce da plataforma Hadoop simplificou e automatizou bastante a análise de quantidades massivas de dados em clusters,  mas a medida que as análises passam a exigir um reuso de dados, a leitura e gravação para disco podem se tornar um problema.  Precisamos ressaltar que o Hadoop MapReduce não é um framework orientado para transações e análises que precisem de baixo tempo de resposta. ...

Importando e exportando dados com Sqoop

Imagem
A plataforma Hadoop consegue realizar o processamento distribuído de informações de origens diversas, que podem ser estruturadas ou não, possibilitando o desenvolvimento de novas aplicações e novas formas de analisar os negócios.  Atualmente grande parte das informações estruturadas das companhias está armazenada em bancos de dados relacionais e precisam ser integradas com informações não estruturadas no ambiente Hadoop. Para realizar a importação e exportação de dados entre bancos de dados relacionais e o Hadoop foi criada a ferramenta Sqoop (http://sqoop.apache.org), também da Fundação Apache. O pacote Sqoop obtido no site da Fundação Apache fornece conectores específicos para MySQL, PostGreSQL, Oracle, SQL Server e DB2, assim como tem também um conector genérico para JDBC (Java Database Connectivity), que pode ser usado para conexão com qualquer banco de dados ou ferramenta que suporte JDBC. Existem também no mercado outros conectores para Netezza, Teradata...

Montando o seu ambiente Big Data

Imagem
  Existem hoje no mercado diversas opções para montar um ambiente   para processamento de grandes quantidades de dados utilizando a plataforma Big Data (Hadoop, HDFS, Hive, HBASE, Pig, etc).      Uma das opções iniciais é montar seu próprio cluster com máquinas servidoras de baixo custo existentes no mercado,   fazer o download dos softwares do site da Fundação Apache, realizar as instalações e configurações necessárias para utilizá-lo da maneira mais rápida possível, sem pagamento de licenças ou mensalidades de manutenção de software. Caso não tenha os recursos necessários é possível com apenas uma máquina   configurar e testar o ambiente do Hadoop.     Normalmente este é o caminho utilizado durante o aprendizado ou por pequenas empresas,   que ainda não podem arcar com custos adicionais. Nestes casos o suporte e resolução de problemas é feito por buscas na internet, buscas em comunidades ou com o auxílio de profissi...

Hive, o que é ?

Imagem
Após uma semana voltada para a Jornada Mundial da Juventude no Rio de Janeiro, que foi bastante recompensadora, voltamos ao nosso dia a dia no mundo da tecnologia e falamos sobre o Hive.  O Hive é um framework para soluções de Data Warehousing, que executa no ambiente do Hadoop, construído inicialmente pelo time de desenvolvimento do Facebook em 2007.   Ele nasceu a partir da necessidade de gerenciar, analisar e aprender sobre o comportamento dos usuários a partir dos imensos volumes de dados gerados a cada dia no Facebook.  A escolha pelo Hadoop foi incentivada pelo baixo custo, escalabilidade e evitar a dependência sobre custos de licenças e manutenção anual que são comuns nos bancos de dados do mercado.  Outro ponto também que levou ao desenvolvimento do Hive foi o baixo desempenho das soluções de mercado para realizar operações de Full Scan em grandes volumes de dados.  O Hive foi criado também visando aproveitar os "skills" de uso do SQL...

O que é o Hadoop ?

Imagem
O Hadoop é um projeto de software livre desenvolvido pela Apache Software Foundation ( http://apache.org/ ), que é  uma plataforma de computação distribuida, com alta escalabilidade, grande confiabilidade e tolerância a falhas. A biblioteca de software Hadoop ( http://hadoop.apache.org/ ) é um framework que permite o processamento distribuído de grandes conjuntos de dados através de clusters de computadores usando modelos de programação simples. Ele é projetado para garantir larga escalabilidade partindo de um único servidor até um cluster com milhares de máquinas, cada uma oferecendo capacidade de computação e armazenamento local. Em vez de confiar em hardware para proporcionar maior disponibilidade, a própria biblioteca foi concebida para detectar e tratar falhas na camada de aplicação, de modo a fornecer um serviço com alta disponibilidade baseado em um grid de computadores. Além da biblioteca base escrita em Java, chamada Hadoop Common , temos o HDFS (H...