|
|
|
Вопрос к Leonidv и всем шарящим в Amazon WS. )
|
|||
|---|---|---|---|
|
#18+
Осваиваю EMR и Pipeline.. Задача для начала: сделать джоб для формирования ежемесячных отчетов по продажам. Данные по транзакциям хранятся в DynamoDB, отчеты предполагается складывать в S3. Отчет простенький: товар - всего продано - сумма ; товар - всего продано - сумма ; ... ; сумма итого. Вижу два пути решения задачи. Первый. На сайте Амазона есть пример создания Pipeline для экспорта данных из Динамы в S3.. Работает он, на сколько я смог понять, следующим образом: есть Hive-скрипт, которому в качестве параметров указывается имя таблицы и имя бакета в S3, и который запускается ихонным script-runner-ом. Соответственно это: s3://elasticmapreduce/libs/script-runner/script-runner.jar и s3://elasticmapreduce/libs/hive/dynamodb/exportDynamoDBTableToS3 К сожалению не могу найти исходников ни скрипта, ни раннера дабы посмотреть подходы к такой работе.. В документации никаких подробностей, увы. Отсюда просьба и вопрос: - Если знаете место, где взять исходники этого Hive-скрипта и раннера, дайте знать, пожалуйста. - Правильным ли будет вообще такой подход, когда в Hive-скрипте мы осуществляем не только выборку, но и обработку данных, калькуляцию? Второй. Нашел пример создания собственного EMR JobFlow на Java: http://java.dzone.com/articles/running-elastic-mapreduce-job Таким образом, я мог бы по аналогии создать свой EMR JobFlow и в Pipeline его запускать по расписанию. Этот путь видится мне более подходящим! Здесь мы реализуем всё в MapReduce. И по идее это нормально, когда на этапе Map мы осущесвляем выборку данных из Динамы, а на этапе Reduce их калькуляцию. Я прав? С нетерпением жду ваших каментов, советов, одобрений, осуждений.. ) ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 15.01.2013, 08:26:24 |
|
||
|
Вопрос к Leonidv и всем шарящим в Amazon WS. )
|
|||
|---|---|---|---|
|
#18+
По второму подходу наверное всё же немного не так.. Выборка данных - ДО этапа Map. Потому как Map и Reduce - это у нас распределённые операции, так что им надо бы подсунуть уже подготовленный набор данных. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 15.01.2013, 09:36:01 |
|
||
|
|

start [/forum/topic.php?desktop=1&fid=59&tid=2130188]: |
0ms |
get settings: |
18ms |
get forum list: |
27ms |
check forum access: |
7ms |
check topic access: |
7ms |
track hit: |
67ms |
get topic data: |
21ms |
get forum data: |
5ms |
get page messages: |
74ms |
get tp. blocked users: |
3ms |
| others: | 367ms |
| total: | 596ms |

| 0 / 0 |
