
Новые сообщения [новые:0]
Дайджест
Горячие темы
Избранное [новые:0]
Форумы
Пользователи
Статистика
Статистика нагрузки
Мод. лог
Поиск
|
|
15.01.2013, 08:26:24
|
|||
|---|---|---|---|
Вопрос к Leonidv и всем шарящим в Amazon WS. ) |
|||
|
#18+
Осваиваю EMR и Pipeline.. Задача для начала: сделать джоб для формирования ежемесячных отчетов по продажам. Данные по транзакциям хранятся в DynamoDB, отчеты предполагается складывать в S3. Отчет простенький: товар - всего продано - сумма ; товар - всего продано - сумма ; ... ; сумма итого. Вижу два пути решения задачи. Первый. На сайте Амазона есть пример создания Pipeline для экспорта данных из Динамы в S3.. Работает он, на сколько я смог понять, следующим образом: есть Hive-скрипт, которому в качестве параметров указывается имя таблицы и имя бакета в S3, и который запускается ихонным script-runner-ом. Соответственно это: s3://elasticmapreduce/libs/script-runner/script-runner.jar и s3://elasticmapreduce/libs/hive/dynamodb/exportDynamoDBTableToS3 К сожалению не могу найти исходников ни скрипта, ни раннера дабы посмотреть подходы к такой работе.. В документации никаких подробностей, увы. Отсюда просьба и вопрос: - Если знаете место, где взять исходники этого Hive-скрипта и раннера, дайте знать, пожалуйста. - Правильным ли будет вообще такой подход, когда в Hive-скрипте мы осуществляем не только выборку, но и обработку данных, калькуляцию? Второй. Нашел пример создания собственного EMR JobFlow на Java: http://java.dzone.com/articles/running-elastic-mapreduce-job Таким образом, я мог бы по аналогии создать свой EMR JobFlow и в Pipeline его запускать по расписанию. Этот путь видится мне более подходящим! Здесь мы реализуем всё в MapReduce. И по идее это нормально, когда на этапе Map мы осущесвляем выборку данных из Динамы, а на этапе Reduce их калькуляцию. Я прав? С нетерпением жду ваших каментов, советов, одобрений, осуждений.. ) ... |
|||
|
:
Нравится:
Не нравится:
|
|||
|
|
|
15.01.2013, 09:36:01
|
|||
|---|---|---|---|
Вопрос к Leonidv и всем шарящим в Amazon WS. ) |
|||
|
#18+
По второму подходу наверное всё же немного не так.. Выборка данных - ДО этапа Map. Потому как Map и Reduce - это у нас распределённые операции, так что им надо бы подсунуть уже подготовленный набор данных. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
|
|
|

start [/forum/topic.php?fid=59&tablet=1&tid=2130188]: |
0ms |
get settings: |
10ms |
get forum list: |
22ms |
check forum access: |
4ms |
check topic access: |
4ms |
track hit: |
42ms |
get topic data: |
12ms |
get forum data: |
4ms |
get page messages: |
64ms |
get tp. blocked users: |
2ms |
| others: | 281ms |
| total: | 445ms |

| 0 / 0 |
