Показ дописів із міткою Hadoop. Показати всі дописи
Показ дописів із міткою Hadoop. Показати всі дописи

вівторок, 2 лютого 2016 р.

Hadoop installation notes

Cluster planning:

  • Small cluster (2-10 nodes): Clusters of three or more machines typically use a dedicated NameNode/ResourceManager, and all other nodes are workers. 
  • Medium cluster (10-40 nodes): separate machines for master, usually dedicated edge node 
  • Large cluster (> 40 nodes): occupies multiple racks, requires individual planning

Storage layer for HDFS:

  • Cloud and virtualization solutions are very popular in the enterprise world 
  • With Hadoop, focus on using JDOD (just bunch of disks) instead of SAN (storage area network) 
  • Hadoop heterogeneous storage was introduced in Hadoop 2.5

Commodity hardware:

Balanced configuration for one worker recommended by vendors:

  • 2-4 8-cores CPU 
  • 128 GB RAM 
  • 12 hard drives (1 or 2 TB each)

HDFS Architecture


  • Individual machines are known as nodes 
  • A cluster can have as few as one node, as many as several thousands
  • Two types of nodes: NameNode and DataNode 
  • More nodes = better performance 
  • HDFS is a filesystem written in Java 
  • The NameNode daemon must be running at all times If the NameNode stops, the cluster becomes inaccessible 
  • The NameNode holds all of its metadata in RAM for fast access 
  • A separate daemon known as the Secondary NameNode takes care of some housekeeping tasks for the NameNode
  • Although files are split into 64MB or 128MB blocks
  • Blocks are stored as standard files on the DataNodes, in a set of directories specified in Hadoop’s configuration files 
  • Without the metadata on the NameNode, there is no way to access the files in the HDFS cluster
  • When a client application wants to read a file: It communicates with the NameNode to determine which blocks make up the file, and which DataNodes those blocks reside on. It then communicates directly with the DataNodes to read the data

понеділок, 18 травня 2015 р.

Hadoop в порівнянні з SQL

Итак, Hadoop - это каркас для обработки данных. Так чем же он лучше стандартных реляционных СУБД, являющихся рабочей лошадкой в современных приложениях для обработки данных? Одна из причин заключается в том, что SQL (структурированный язык запросов) по природе своей ориентирован на работу со структурированными данными. А многие приложения Hadoop имеют дело с неструктурированными данными, например текстовыми. С этой точки зрения, Hadoop предлагает более общую парадигму, чем SQL.

середа, 6 травня 2015 р.

Архитектура HDFS и типичный Hadoop кластер

HDFS подобна другим традиционным файловым системам: файлы хранятся в виде блоков, существует маппинг между блоками и именами файлов, поддерживается древовидная структура, поддерживается модель доступа к файлам основанная на правах и т. п.

Spark

Когда исследователи университета Беркли начинали разрабатывать Spark, они держали в голове уже сложившуюся к тому времени картину мира больших данных – принцип параллельных вычислений на кластере компьютеров, способном к расширению в ширину, позволял работать с большими объемами информации, но жертвовал скоростью работы в пользу горизонтальной масштабируемости и способности к быстрому восстановлению после системных ошибок. Здесь стоит вспомнить о нашумевшей (и до сих пор популярной) технологии MapReduce, которая примерно до февраля этого года была основной движущей силой экосистемы Apache Hadoop. Действительно эффективная для пакетной обработки данных, эта модель, однако, обладает существенными недостатками.

Cloudera

Поставщики Hadoop: Apache, Cloudera, Hortonworks, MapR

Cloudera. Ключевой продукт — CDH (Cloudera Distribution including Apache Hadoop) — связка наиболее популярных инструментов из инфраструктуры Hadoop под управлением Cloudera Manager. Менеджер берёт на себя ответсвенность за развёртывание кластера, установку всех компонентов и их дальнейший мониторинг. Кроме CDH компания развивает и другие свои продукты, например, Impala (об этом ниже). Отличительной чертой Cloudera также является стремление первыми предоставлять на рынке новые фичи, пусть даже и в ущерб стабильности. Ну и да, создатель Hadoop — Doug Cutting — работает в Cloudera.

Hadoop

 Hadoop - a software framework for storing, processing and analyzing "big data".
- is open source
- is a large ecosystem: Hue, Solr, Flume

вівторок, 5 травня 2015 р.

MapReduce

Это подход, алгоритм, ну или паттерн, тут уж как кто назовет, параллельной обработки больших объемов сырых данных, например результатов работы краулеров или логов веб запросов, вообще по статистике до 80% задач могут маппится на MapReduce, и именно MapReduce драйвит NoSQL. Существуют разные имплементации MapReduce. Достаточно известна и запатентована реализация этого алгоритма и подхода Google. Или как пример MySpace Qizmt — MySpace’s Open Source Mapreduce Framework, также используется в Hadoop, MongoDb и еще много разных примеров можно привести.

Hadoop: Pig

Pig - єто расширение Hadoop, призваное упростить програмирование за счет високоуровневого язика обработки данних.
Pig состоит из двух основних компонентов:
- язик обработки данних  Pig Latin
- компилятор

Oozie – диспетчер потоков работ для платформы Hadoop

Большие данные в необработанном виде редко соответствуют требованиям Hadoop-разработчика к данным, соблюдение которых необходимо для успешного выполнения задач обработки данных. Обычно перед выполнением любых реальных заданий по обработке данных необходимо применять различные ETL-операции (extract/transform/load - извлечение/преобразование/загрузка) и операции предварительной обработки. Oozie— это инфраструктура, которая помогает автоматизировать этот процесс. Она представляет эту работу в виде воспроизводимых единиц или потоков работ, которые впоследствии можно многократно использовать без написания какого-либо нового кода или новых процедур. В статье описывается применение Oozie при создании различных типов потоков работ.

More info is here