|
|
|
помогите с Solr
|
|||
|---|---|---|---|
|
#18+
привет solr 3.6.0 установлен в томкат как варка. меня больше всего интересует: - как сказать ему, чтобы он автоматически индексировал определенную директорию с поддиректориями - индексировать он должен не xml, а по-возможности все, где текст: doc, pdf, xls насколько я понял, за второе отвечает tika, и она должна быть интегрирована уже в solr (3.6) но я не нахожу там никаких джарок от tika и подозреваю, что это только с 4 версии, а она вроде как не готова еще опять же, насколько я понял, правильнее всего пользоваться ExtractingRequestHandler [1], так как RichDocumentHandler [2] весь депрекетед. вообще я первый раз вижу solr и lucene, и у меня много вопросов. во первых по умолчанию он должен индексировать xml, у которых есть схема. я эту схему описываю, где указываю, что будет являться id. но откуда возьмется id у моих произвольных файлов? читаю статью [3], но не могу понять, она про устаревшее или новье. я был бы доволен, если бы id стал кусок пути к файлу вместе с его названием. во вторых, где tika, надо ли качать отдельно и ее, и ExtractingRequestHandler, потому что в [1] сказаны странные слова типа "you must copy all libraries from example/solr/libs into a libs directory within your own solr directory". а у меня нет такой директории ну и вообще, может есть по шагам туториял про 3.6, ExtractingRequestHandler, tika и автоматическое индексирование всех файлов в директории. [1] http://wiki.apache.org/solr/ExtractingRequestHandler [2] http://wiki.apache.org/solr/UpdateRichDocuments [3] http://solr.pl/en/2011/04/04/indexing-files-like-doc-pdf-solr-and-tika-integration/ ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 18.05.2012, 15:52:02 |
|
||
|
помогите с Solr
|
|||
|---|---|---|---|
|
#18+
вообще нормально взять 1.4.0 или 1.4.1, хотя их нету на главной странице? ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 18.05.2012, 16:04:46 |
|
||
|
помогите с Solr
|
|||
|---|---|---|---|
|
#18+
аувввообще нормально взять 1.4.0 или 1.4.1, хотя их нету на главной странице?ой, плиз дискард. это вообще старьё ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 18.05.2012, 16:05:24 |
|
||
|
помогите с Solr
|
|||
|---|---|---|---|
|
#18+
аувв- как сказать ему, чтобы он автоматически индексировал определенную директорию с поддиректориями Solr точно так умеет? Мне всегда казалось, что это просто frontend к lucene - т.е. реализация инвертированного индекса. Скорее всего, я прав - поэтому пишите собственный парсер, которые будет передавать solr'у данные из обработки. А вот достать эти данные действительно может помочь tika. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 18.05.2012, 16:33:00 |
|
||
|
помогите с Solr
|
|||
|---|---|---|---|
|
#18+
аувв, Извиняюсь, что подымаю старую тему, но передо мной стоит та же задача - проиндексировать папку с doc и pdf документами только через Solr 4.0. Нашел мануалы только по старым версиям, примеры из которых воспроизвести на 4.0 не удается. 1. Может, кто подскажет, какими командами можно проиндексировать папку с документами, или хотя бы каждый из них в отдельности? Пробовал: java -Durl=http://localhost:8080/solr/update -jar post.jar Test.doc Сам файл находит, но далее выдает ошибку #400 Bad Request 2. Нужно ли менять что-либо в Solr-ких xml-ках, чтобы это заработало? Спасибо. ... |
|||
|
:
Нравится:
Не нравится:
|
|||
| 31.10.2012, 11:21:47 |
|
||
|
|

start [/forum/topic.php?fid=59&msg=38019762&tid=2130665]: |
0ms |
get settings: |
13ms |
get forum list: |
17ms |
check forum access: |
4ms |
check topic access: |
4ms |
track hit: |
55ms |
get topic data: |
14ms |
get forum data: |
4ms |
get page messages: |
44ms |
get tp. blocked users: |
1ms |
| others: | 282ms |
| total: | 438ms |

| 0 / 0 |
