|
|
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
Не знаю в какой топик отнести данный вопрос. Но интересует как работает сервис яндекса авто , там как я понял аккумулируется информация с различных автомобильных сайтов, но непонятно каким образом осуществляется к ним доступ, неужели у всех есть открытый апиай? ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 09.02.2012, 17:42:26 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
1) Скрапим страницу 2) Парсим ее 3) Впихиваем ее в свою БД 4) Отображаем на свое сайте Нет у них никаких API, разумеется. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 09.02.2012, 17:44:22 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
svenom2) Парсим ее Причем делает это, скорее всего, автоматически. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 11:05:59 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
svenom, А как отслеживается в таком случае актуальность объявления? Если человек уже удалил его из исходной базы ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 11:50:58 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
OOsalivan, у поисковиков кеш и роботы ходят _периодически_ cache:site.ru - дать страницу из кеша (если сайт недоступен) ______________________________________________ "Сделай настолько просто, насколько это возможно, но не проще". © А. Эйнштейн. AutoPOI.ru — ГИС-технологии для Oracle ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 12:03:41 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
Ну это сложный вопрос. Я ж не разработчик этой системы. Но вы будете смеяться - я сейчас делаю точно такой же проект, но по другой тематике. Точнее пока что проектирую, до разработки дело еще не дошло. Проблем возникает много - как поддерживать актуальность, как правильно инкрементально выгружать данные с сервера, как регулировать нагрузку, как вовремя заметить изменение верстки и т.д.. Это все интересно, но не просто (но с другой стороны и не rocket science ) Какие тут могут быть варианты? Самый простой - опрашивать страницы с какой-то периодичностью и смотреть на HTTP код. Получили 404 - значит объявы больше нет. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 12:08:22 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
svenomкак вовремя заметить изменение верстки и т.д.. Это все интересно, но не просто (но с другой стороны и не rocket science ) У вас ручной разбор планируется? Мы пытались так делать (только у нас задача в чем-то проще, в чем-то сложнее), в итоге не взлетело. Хотя тут от количества сайтов зависит - если речь о десятках, то прокатит и ручной разбор. У нас более 5000 сайтов в системе добавлено было, в итоге ручной разбор себя не оправдал. Мне кажется, сделать автоматический парсер для специфичной области должно быть не очень сложно. Хотя сам такого не делал, возможно задача окажется сложнее, чем кажется. Если у вас есть возможность выделить человека на направление авт. извлечения данных - я бы советовал его развивать. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 13:16:25 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
svenom, Кстати, вы какие библиотеки/фреймворки планируете использовать? ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 13:17:42 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
LeonidvУ вас ручной разбор планируется? Мы пытались так делать (только у нас задача в чем-то проще, в чем-то сложнее), в итоге не взлетело. Хотя тут от количества сайтов зависит - если речь о десятках, то прокатит и ручной разбор. У нас более 5000 сайтов в системе добавлено было, в итоге ручной разбор себя не оправдал.Не совсем понял, что значит ручной разбор. Если вы имеете ввиду "под каждый сайт свой парсер", то да - делаю так. Сайтов у нас не очень много, сейчас около 10, в перспективе не более 50. LeonidvМне кажется, сделать автоматический парсер для специфичной области должно быть не очень сложно. Хотя сам такого не делал, возможно задача окажется сложнее, чем кажется. Если у вас есть возможность выделить человека на направление авт. извлечения данных - я бы советовал его развивать.Ну тут как посмотреть. Проблема в том, что информация неструктурирована. То есть тут во-первых РСУБД не очень подходит, во вторых надо уметь извлекать кучу атрибутов из plain text. Например, написал кто-то в описании "цвет - металлик,2009гв,без докум.", и из этого надо понять, что продавец выставил ворованную тачку цвета металлик 2009 года выпуска Этот момент сейчас главная проблема для меня. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 13:21:19 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
Leonidvsvenom, Кстати, вы какие библиотеки/фреймворки планируете использовать?Да пока это все открытый вопрос. У меня в любом случае все будет закрыто своими интерфейсами, так как проект обещает быть крайне нагруженным, а потому и надо при необходимости суметь махнуть РСУБД, быстро поменять, скажем Хибер на iBatis или вообще мигрировать на NoSQL. Так что пока все вопросы по либам открыты. Отправная точка у меня такая: - парсинг HTML страниц делаю сам; сторонние решения есть, может быть приду постепенно к ним, но пока и руками нормально получается - достаточно быстро, производительность пока устраивает; - индексация - Lucene - БД бизнес-данных - пока Cassandra - анализ текста - ХЗ, пока что темный лес для меня ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 13:31:19 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
При создании веб-магазина я использовал похожий подход при автоматизации получения информации о стоимости доставки товара определенным автоперевозчиком. Предварительно я получил базу городов, куда каждый перевозчик доставляет товар, затем у каждого автоперевозчика на странице нашел механизм создания запроса (по габаритам, весу и заявленной сумме) и ответа на него. Ответ для каждого автоперевозчика парсил по своему алгоритму, зная где, в каком месте или по каким ключевым словам мне его надо вытащить. Сумму возвращал обратно на свой сайт как стоимость перевозки для данного автоперевозчика. Конечно, это значительно более примитивный пример, но принцип очень схож - автоматизация запросов к сторонним сайтам и разборка ответа. P.S. Принцип работы почти у всех схож, но была парочка, которые реально приходилось "ломать", чтобы сделать задуманное. Были и манипуляции с запросами, и использование веб-сервиса и еще какие-то затыки, уже слабо помню. Но работка была крайне интересной. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 14:02:22 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
off IDVsbruck, это магазин без своей доставки? А как там было? - выбрал товар - выбрал из ПарсераБД перезозчик-цена-его_контакты? И потом в магазин или самовывоз (магаз. ни при чём)? ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 14:12:57 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
svenomLeonidvУ вас ручной разбор планируется? Мы пытались так делать (только у нас задача в чем-то проще, в чем-то сложнее), в итоге не взлетело. Хотя тут от количества сайтов зависит - если речь о десятках, то прокатит и ручной разбор. У нас более 5000 сайтов в системе добавлено было, в итоге ручной разбор себя не оправдал.Не совсем понял, что значит ручной разбор. Если вы имеете ввиду "под каждый сайт свой парсер", то да - делаю так. Сайтов у нас не очень много, сейчас около 10, в перспективе не более 50. Ага, именно это. У вас парсеры в коде прошиты? У нас они хранились в СУБД и тех. персонал забивал данные. Но повторюсь, у нас объемы были другие. svenomНу тут как посмотреть. Проблема в том, что информация неструктурирована. То есть тут во-первых РСУБД не очень подходит, Вообще не подходит. Смотрите на lucene с точки зрения не структурированной, документ ориентированной СУБД. svenom во вторых надо уметь извлекать кучу атрибутов из plain text. Например, написал кто-то в описании "цвет - металлик,2009гв,без докум.", и из этого надо понять, что продавец выставил ворованную тачку цвета металлик 2009 года выпуска Этот момент сейчас главная проблема для меня. Насколько я понимаю, ничего умнее поиска слов рядом (т.е. смотри цвет - значит за этим идет цвет) не придумать. Плюс проверка, что данные лежат в нужном диапазоне. Еще на nutch и solr посмотрите. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 14:18:39 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
LeonidvsvenomНе совсем понял, что значит ручной разбор. Если вы имеете ввиду "под каждый сайт свой парсер", то да - делаю так. Сайтов у нас не очень много, сейчас около 10, в перспективе не более 50. Ага, именно это. У вас парсеры в коде прошиты? У нас они хранились в СУБД и тех. персонал забивал данные. Но повторюсь, у нас объемы были другие.Ну у меня там принцип такой. Работа с каждым сайтом - это отдельные процессы. Они конфигурируются через базу данных, эдакая metadata-driven система. Каждый процесс состоит из ряда активностей. Например, выгрузка обычного объявления это: [HTTP активность] -> [Parse-активность(и)] -> [Сохранить одну запись в БД] Если же надо получить страницу и выдрать из нее другие ссылки (ну т.е. мне надо, например, из форума Java получить ссылки на все топики), то это уже другой парсинг и другое сохранение в БД. Все это описывается в БД, у каждой активности свои конфиги то же в БД. Так что что-то вынесено в БД и конфигурируемо, что-то жестко вбито. Leonidvsvenom во вторых надо уметь извлекать кучу атрибутов из plain text. Например, написал кто-то в описании "цвет - металлик,2009гв,без докум.", и из этого надо понять, что продавец выставил ворованную тачку цвета металлик 2009 года выпуска Этот момент сейчас главная проблема для меня.Насколько я понимаю, ничего умнее поиска слов рядом (т.е. смотри цвет - значит за этим идет цвет) не придумать. Плюс проверка, что данные лежат в нужном диапазоне. Еще на nutch и solr посмотрите.Да средства есть - http://en.wikipedia.org/wiki/Information_extraction Вопрос в том - насколько качественно они будут работать с кириллицей. Ну еще не дошел я до этого места, так что пока не хочу забиваться себе голову всякими Марковскими моделями ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 14:33:48 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
svenom, Решать вам. Но я все же советую посмотреть Nutch. Код: plaintext ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 15:24:27 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
svenom, Т.е. в вашем проекте нужно прочекать каждое объявление с сайта. Допустим на примере сайта бибика - мы должны посылать запрос к серверу модифицируя юрл http://www.bibika.ru/card.php?gidcar=2516998&car=%C7%C0%C7+1102+used+car, чтобы он выдавал очередную машину. Какой алгоритм формирования очередного ЮРЛ , и когда мы должны остановиться, и получаеться что мы когда обнавляем свою базу должны выполнить тысячи запросов к исходному серверу откуд черпаем данные? ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 17:26:41 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
OOsalivan, Нет. Поисковый робот так не ходит. А у него немого сайтов и Ручной режим. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 17:58:42 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
OOsalivansvenom, Т.е. в вашем проекте нужно прочекать каждое объявление с сайта. Допустим на примере сайта бибика - мы должны посылать запрос к серверу модифицируя юрл http://www.bibika.ru/card.php?gidcar=2516998&car=%C7%C0%C7+1102+used+car, чтобы он выдавал очередную машину. Какой алгоритм формирования очередного ЮРЛ , и когда мы должны остановиться, и получаеться что мы когда обнавляем свою базу должны выполнить тысячи запросов к исходному серверу откуд черпаем данные?Да, все верно. Условно говоря - есть страницы с объявлениями, а есть страницы со ссылками на объявления. Я иду в цикле по таким страницам и выдираю из них ссылки, потом иду по ссылкам. Вопрос "как сформировать строку" - как нафантазируете. Я просто конкатенирую постоянные и изменяющиеся части. Как остановиться - тут однозначного ответа нет. Можно просто идти до тех пор, пока не встретится 404. Можно идти до тех пор, пока не достигните определенного количества выдранных ссылок, которые уже были у вас в базе. Можно идти вперед - из настоящего в прошлое, можно идти из прошлого в настоящее. В общем вариантов обработки масса - тут все зависит от ваших требований. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 18:19:05 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
Petro123OOsalivan, Нет. Поисковый робот так не ходит. А у него немого сайтов и Ручной режим.Ну тут как бэ поискового робота и нет. Такие штуки именуются scrapper'ами. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 18:23:31 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
svenomЯ иду в цикле по таким страницам и выдираю из них ссылки, потом иду по ссылкам. я думал ты ещё проще, раз 50 сайтов. - ставим задачу длинноногой барышне-секретарше - она заходит на сайт http://www.bibika.ru/card.php?gidcar=2516998&car=%C7%C0%C7+1102+used+car, - упрощает ссылку выкидывая всё лишнее http://www.bibika.ru/card.php?gidcar=2516999&car=%C7%C0%C7 - пробует, меняется ли авто при смене Id'a 2516999 заменить на 2516998 - если меняется, то забивает тебе в БД данную ссылку с флагом url параметра Это если сайтов немного :) Штук 50 за 2 дня забъёт ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 19:26:54 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
да, склеивать потом, конечно, до 404 можно ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 19:28:11 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
svenomPetro123OOsalivan, Нет. Поисковый робот так не ходит. А у него немого сайтов и Ручной режим.Ну тут как бэ поискового робота и нет. Такие штуки именуются scrapper'ами. про scrapper не знал. Это наверно Jav'овское.... А поисковик ходит в автомате по методу поиска якорей. Как найдёт <a href=" http://www.sql.ru/forum/actualpost.aspx?bid=38"> то и готово - конкатенировать ничего не нужно. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 19:38:57 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
Petro123off IDVsbruck, это магазин без своей доставки? А как там было? - выбрал товар - выбрал из ПарсераБД перезозчик-цена-его_контакты? И потом в магазин или самовывоз (магаз. ни при чём)? Сорри, я тебя не очень понял. Сделано так: переходим в корзину и оформляем заказ. На сайте есть характеристики всего товара, его вес, естественно стоимость и габариты стандартной тары. Если покупатель иногородний и он хочет, чтобы товар доставили ему на место, то он выбирает в списке свой город, для которого высвечиваются доступные перевозчики. Нажимая на перевозчика, он в "Стоимость доставки" видит сколько будет стоить доставить его заказ для данного автоперевозчика. Вроде все понятно ... P.S. Сорри за offtop ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 20:03:11 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
IDVsbruck, я о том, что если ты искал в веб перевозчиков и парсил. То они могли быть только справочные. Вон как svenom вычисляет ворованные. Договора с магазином не было? Т.к. данная БД, как и весь интернет - помойка. Т.е. юридическая сторона твоего магазина к данным в твоей БД по перевозчикам . Вот что я хотел спросить. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 20:35:05 |
|
||
|
как работает yandex авто ?
|
|||
|---|---|---|---|
|
#18+
Не совсем ... Если я захожу на сайт перевозчика, захожу в расчет доставки и меня просят ввести габариты, вес и цену. Я ввожу, нажимаю "рассчитать" и получаю стоимость доставки. Нигде не оговорено, что я обязан воспользоваться определнным браузером для входа на их сайт. Поэтому я могу сделать "прямой" запрос, в котором уже будут указаны параметры - вес, габариты и цена. И получу я фактически html-код. Где я что нарушаю? Где воровство? ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 10.02.2012, 20:58:00 |
|
||
|
|

start [/forum/topic.php?fid=59&msg=37655515&tid=2132585]: |
0ms |
get settings: |
19ms |
get forum list: |
66ms |
check forum access: |
6ms |
check topic access: |
6ms |
track hit: |
51ms |
get topic data: |
18ms |
get forum data: |
9ms |
get page messages: |
150ms |
get tp. blocked users: |
6ms |
| others: | 365ms |
| total: | 696ms |

| 0 / 0 |
