Usando Shark na Nuvem da Amazon
No último post falamos sobre utilização e benefícios de computação na nuvem e seus diversos modelos (IAAS, PAAS e SAAS). Neste post de hoje exemplificamos como podemos rapidamente criar um ambiente de Big Data na Nuvem usando o ambiente Hadoop. Em abril deste ano abordamos o Spark, que é um projeto que foi iniciado na UC Berkley, que permite realizar análises rápidas em quantidades massivas de dados, uma vez que estes são carregados para estruturas de memória compartilhadas integradas ao ambiente Hadoop. Para executar estas análises rápidas sobre a plataforma Spark foi criado, também pela UC Berkley, o software Shark ( http://shark.cs.berkeley.edu/ ). O Shark é um motor de queries SQL baseado no ambiente Hadoop, que é compatível com o Apache Hive, permitindo assim o uso de instruções HiveQL para acessar e tratar os dados. Como o Shark usa dados que estão em memória os resultados podem ser até 30 vezes mais rápidos que os mesmos utilizando o Hive. O Shark tamb...