Postagens

Mostrando postagens com o rótulo Hadoop

BI na Nuvem - Cloud BI

Imagem
No início da década passada a grande maioria das instalações de Business Intelligence eram bastante centralizadas e padronizadas na área de TI. Os projetos envolviam de uma forma geral a construção de grandes silos de informações, que possibilitavam a produção de relatórios que eram despachados para os usuários.  Para quem nesta época estudou os princípios da modelagem dimensional e datawarehouse, o livro “The Datawarehouse Toolkit” do Dr. Ralph Kimball, é um marco muito importante.    Nos últimos anos temos visto que as empresas estão mantendo estas plataformas, mas gradualmente adotando novas ferramentas que possibilitam a descoberta e a correlação de dados, de forma mais descentralizada, conseguindo disseminar estas análises por toda a organização. De certa forma esta é uma antiga visão das organizações de TI se realizando. À medida que as ferramentas se tornam mais simples e intuitivas fica mais fácil para que usuários consigam realizar as suas análises sem muita...

HAWQ

Imagem
O que é o HAWQ ( Pivotal )  ? As primeiras soluções de Big Data utilizavam basicamente o framework MapReduce, baseado em Java, mas logo foi verificado que existia um número muito maior de analistas, desenvolvedores e programadores com conhecimento de SQL que não conseguiam trabalhar com Java e com o MapReduce.  A partir desta demanda surgiu o Hive, que apesar de ser muito parecido com um ambiente de banco de dados tradicional, tinha uma série de restrições de performance, operações, transações, etc, mas que utiliza o ambiente de computação distribuída do Hadoop.. Se quiser saber mais sobre o Hive consulte o post anterior ( http://bigdatabrazil.blogspot.com.br/2013/07/hive.html ). Visando preencher este nicho de demanda, de computação distribuída, com suporte à transações que usassem SQL, grandes empresas de tecnologia, como por exemplo a Pivotal (EMC), começaram a desenvolver plataformas de softwares que atendessem a estes requisitos e utilizassem o ambiente Ha...

O que é o Spark ?

Imagem
Para realizar análises de grandes quantidades de dados, localizados em clusters com diversos nós, precisamos de recursos tradicionais de SQL e Datawarehouse ( Star schemas, drill down, etc ), assim como precisamos ter algorítimos e estruturas de dados para otimizar as consultas em caso de falhas em qualquer um dos nós envolvidos.  Outro ponto que observamos mais recentemente nestas análises massivas de dados é o uso de algorítimos chamados de “machine learning” (Page-Ranking, Clustering, Regression, etc), que fazem um reuso de dados muito frequente.  O framework MapReduce da plataforma Hadoop simplificou e automatizou bastante a análise de quantidades massivas de dados em clusters,  mas a medida que as análises passam a exigir um reuso de dados, a leitura e gravação para disco podem se tornar um problema.  Precisamos ressaltar que o Hadoop MapReduce não é um framework orientado para transações e análises que precisem de baixo tempo de resposta. ...