Postagens

Mostrando postagens com o rótulo Hive

Usando Shark na Nuvem da Amazon

Imagem
No último post falamos sobre utilização e benefícios de computação na nuvem e seus diversos modelos (IAAS, PAAS e SAAS). Neste post de hoje exemplificamos como podemos rapidamente criar um ambiente de Big Data na Nuvem usando o ambiente Hadoop. Em abril deste ano abordamos o Spark, que é um projeto que foi iniciado na UC Berkley, que permite realizar análises rápidas em quantidades massivas de dados, uma vez que estes são carregados para estruturas de memória compartilhadas integradas ao ambiente Hadoop.  Para executar estas análises rápidas sobre a plataforma Spark foi criado, também pela UC Berkley, o software Shark ( http://shark.cs.berkeley.edu/ ). O Shark é um motor de queries SQL baseado no ambiente Hadoop, que é compatível com o Apache Hive, permitindo assim o uso de instruções HiveQL para acessar e tratar os dados. Como o Shark usa dados que estão em memória os resultados podem ser até 30 vezes mais rápidos que os mesmos utilizando o Hive.   O Shark tamb...

O framework Cascading

Imagem
Nos posts anteriores vimos que um dos grandes diferenciais da plataforma Hadoop é a sua capacidade de armazenar e tratar enormes quantidades de dados estruturados e não estruturados, mas para que estes dados tenham valor precisam ser refinados e analisados de acordo com as necessidades da companhia. Como opções para processamento de dados nesta plataforma, já abordamos o MapReduce, o Hive, o HBase, etc, cada um tendo um perfil de uso específico e necessitando de competências diferenciadas por parte da equipe de desenvolvimento e suporte. No caso da utilização do MapReduce, muitas vezes existe um certo grau de dificuldade por parte dos desenvolvedores para traduzir os requisitos de negócios da empresa para programas em MapReduce, que trabalham tipicamente com chaves e valores e dois tipos básicos de lógica (mapear e reduzir). Visando criar um novo nível de abstração e facilitar o processamento de dados no ambiente Hadoop, foi criado o framework Cascading ( http://www.casc...

Usando o Cloudera Hadoop

Imagem
Uma das lacunas que existe na plataforma de software Hadoop, que também existe em outros softwares livres, está relacionada ao serviço de suporte e manutenção. A medida que as empresas passam a utilizar um software livre, muitas destas não dispõem de pessoas com competências técnicas para suportar este tipo de software e precisam de respostas rápidas para possíveis problemas que aconteçam no seu uso diário. De uma forma geral estas empresas não podem basear o suporte aos seus serviços em mensagens trocadas em grupos de usuários, o que pode representar um sério risco. Uma outra lacuna que também existe na plataforma Hadoop está relacionada às ferramentas para gerenciamento do ambiente como um todo. A partir destas necessidades do mercado, algumas empresas começaram a trabalhar a partir da distribuição Hadoop da Apache Foundation para gerar as suas próprias distribuições, com suporte e atualizações pagas, assim como também desenvolvendo ferramentas de administração que...