powered by simpleCommunicator - 2.0.61     © 2026 Programmizd 02
Целевая тема:
Создать новую тему:
Автор:
Закрыть
Цитировать
Форумы / Java [игнор отключен] [закрыт для гостей] / Вопрос к Leonidv и всем шарящим в Amazon WS. )
2 сообщений из 2, страница 1 из 1
Вопрос к Leonidv и всем шарящим в Amazon WS. )
    #38110236
mesier
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Участник
Осваиваю EMR и Pipeline..
Задача для начала: сделать джоб для формирования ежемесячных отчетов по продажам.
Данные по транзакциям хранятся в DynamoDB, отчеты предполагается складывать в S3.
Отчет простенький: товар - всего продано - сумма ; товар - всего продано - сумма ; ... ; сумма итого.
Вижу два пути решения задачи.

Первый.
На сайте Амазона есть пример создания Pipeline для экспорта данных из Динамы в S3.. Работает он, на сколько я смог понять, следующим образом: есть Hive-скрипт, которому в качестве параметров указывается имя таблицы и имя бакета в S3, и который запускается ихонным script-runner-ом.
Соответственно это: s3://elasticmapreduce/libs/script-runner/script-runner.jar и s3://elasticmapreduce/libs/hive/dynamodb/exportDynamoDBTableToS3
К сожалению не могу найти исходников ни скрипта, ни раннера дабы посмотреть подходы к такой работе.. В документации никаких подробностей, увы.
Отсюда просьба и вопрос:
- Если знаете место, где взять исходники этого Hive-скрипта и раннера, дайте знать, пожалуйста.
- Правильным ли будет вообще такой подход, когда в Hive-скрипте мы осуществляем не только выборку, но и обработку данных, калькуляцию?

Второй.
Нашел пример создания собственного EMR JobFlow на Java: http://java.dzone.com/articles/running-elastic-mapreduce-job
Таким образом, я мог бы по аналогии создать свой EMR JobFlow и в Pipeline его запускать по расписанию.
Этот путь видится мне более подходящим! Здесь мы реализуем всё в MapReduce. И по идее это нормально, когда на этапе Map мы осущесвляем выборку данных из Динамы, а на этапе Reduce их калькуляцию.
Я прав?

С нетерпением жду ваших каментов, советов, одобрений, осуждений.. )
...
Рейтинг: 0 / 0
Вопрос к Leonidv и всем шарящим в Amazon WS. )
    #38110272
mesier
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Участник
По второму подходу наверное всё же немного не так..
Выборка данных - ДО этапа Map. Потому как Map и Reduce - это у нас распределённые операции, так что им надо бы подсунуть уже подготовленный набор данных.
...
Рейтинг: 0 / 0
2 сообщений из 2, страница 1 из 1
Форумы / Java [игнор отключен] [закрыт для гостей] / Вопрос к Leonidv и всем шарящим в Amazon WS. )
Найденые пользователи ...
Разблокировать пользователей ...
Читали форум (0):
Пользователи онлайн (0):
x
x
Закрыть


Просмотр
0 / 0
Close
Debug Console [Select Text]