Postagens

Mostrando postagens com o rótulo HDFS

HAWQ

Imagem
O que é o HAWQ ( Pivotal )  ? As primeiras soluções de Big Data utilizavam basicamente o framework MapReduce, baseado em Java, mas logo foi verificado que existia um número muito maior de analistas, desenvolvedores e programadores com conhecimento de SQL que não conseguiam trabalhar com Java e com o MapReduce.  A partir desta demanda surgiu o Hive, que apesar de ser muito parecido com um ambiente de banco de dados tradicional, tinha uma série de restrições de performance, operações, transações, etc, mas que utiliza o ambiente de computação distribuída do Hadoop.. Se quiser saber mais sobre o Hive consulte o post anterior ( http://bigdatabrazil.blogspot.com.br/2013/07/hive.html ). Visando preencher este nicho de demanda, de computação distribuída, com suporte à transações que usassem SQL, grandes empresas de tecnologia, como por exemplo a Pivotal (EMC), começaram a desenvolver plataformas de softwares que atendessem a estes requisitos e utilizassem o ambiente Ha...

O framework Cascading

Imagem
Nos posts anteriores vimos que um dos grandes diferenciais da plataforma Hadoop é a sua capacidade de armazenar e tratar enormes quantidades de dados estruturados e não estruturados, mas para que estes dados tenham valor precisam ser refinados e analisados de acordo com as necessidades da companhia. Como opções para processamento de dados nesta plataforma, já abordamos o MapReduce, o Hive, o HBase, etc, cada um tendo um perfil de uso específico e necessitando de competências diferenciadas por parte da equipe de desenvolvimento e suporte. No caso da utilização do MapReduce, muitas vezes existe um certo grau de dificuldade por parte dos desenvolvedores para traduzir os requisitos de negócios da empresa para programas em MapReduce, que trabalham tipicamente com chaves e valores e dois tipos básicos de lógica (mapear e reduzir). Visando criar um novo nível de abstração e facilitar o processamento de dados no ambiente Hadoop, foi criado o framework Cascading ( http://www.casc...

Importando e exportando dados com Sqoop

Imagem
A plataforma Hadoop consegue realizar o processamento distribuído de informações de origens diversas, que podem ser estruturadas ou não, possibilitando o desenvolvimento de novas aplicações e novas formas de analisar os negócios.  Atualmente grande parte das informações estruturadas das companhias está armazenada em bancos de dados relacionais e precisam ser integradas com informações não estruturadas no ambiente Hadoop. Para realizar a importação e exportação de dados entre bancos de dados relacionais e o Hadoop foi criada a ferramenta Sqoop (http://sqoop.apache.org), também da Fundação Apache. O pacote Sqoop obtido no site da Fundação Apache fornece conectores específicos para MySQL, PostGreSQL, Oracle, SQL Server e DB2, assim como tem também um conector genérico para JDBC (Java Database Connectivity), que pode ser usado para conexão com qualquer banco de dados ou ferramenta que suporte JDBC. Existem também no mercado outros conectores para Netezza, Teradata...

Integrando Hadoop, BI e DW

Imagem
O relatório sobre integração do Hadoop com ambientes de Business Intelligence e Data Warehouse corporativos ( TDWI_BPReport_Q213_IntegratingHadoopBIDW_rev.pdf ), publicado pela TDWI ( www.tdwi.org ) no final do primeiro semestre de 2013, indica que a maioria das empresas consultadas veem o Hadoop e seu ecossistema de produtos e parceiros como uma oportunidade para complementar os seus ambientes de BI e Data Warehouse, possibilitando o desenvolvimento de novos tipos de relatórios analíticos,  originados de fontes não estruturadas, gerados por máquinas, navegação em servidores web, dados de sensores, RFID, georeferenciamento, etc.  Como já falamos em posts anteriores, o Hadoop tem como sistema de arquivos padrão o HDFS, que permite adicionar mais processamento e área de armazenamento ao cluster Hadoop a partir do uso de equipamentos de baixo custo e facilmente encontrados no mercado. Desta forma ao adicionar o Hadoop ao ambiente de BI e DW,  podemos utilizar...

Montando o seu ambiente Big Data

Imagem
  Existem hoje no mercado diversas opções para montar um ambiente   para processamento de grandes quantidades de dados utilizando a plataforma Big Data (Hadoop, HDFS, Hive, HBASE, Pig, etc).      Uma das opções iniciais é montar seu próprio cluster com máquinas servidoras de baixo custo existentes no mercado,   fazer o download dos softwares do site da Fundação Apache, realizar as instalações e configurações necessárias para utilizá-lo da maneira mais rápida possível, sem pagamento de licenças ou mensalidades de manutenção de software. Caso não tenha os recursos necessários é possível com apenas uma máquina   configurar e testar o ambiente do Hadoop.     Normalmente este é o caminho utilizado durante o aprendizado ou por pequenas empresas,   que ainda não podem arcar com custos adicionais. Nestes casos o suporte e resolução de problemas é feito por buscas na internet, buscas em comunidades ou com o auxílio de profissi...