Solr: Фасет считает, что индексы не могут быть строками? - PullRequest
4 голосов
/ 10 января 2012

При создании списка значений фасетов, у меня есть это в моей схеме:

<field name="contract_facet_sector_ids" type="text" indexed="true" stored="true" multiValued="true" required="false" />

Фасеты, которые я хочу сохранить, представляют собой строки, такие как "1_1", "2_43", "2_99" и т. Д. Однако, когда я просматриваю данные о фасете, возвращаемые данные, подчеркивание, кажется, было удалено:

[facet_fields] => Array
        (
            [contract_facet_sector_ids] => Array
                (
                    [11] => 0
                    [243] => 0
                    [299] => 0

Может кто-нибудь помочь мне с тем, где я иду не так? Определение типа поля «текст» выглядит следующим образом:

<fieldType name="text" class="solr.TextField" positionIncrementGap="100">
    <analyzer type="index">
        <tokenizer class="solr.WhitespaceTokenizerFactory" />
        <filter class="solr.StopFilterFactory"
            ignoreCase="true" words="stopwords.txt"
            enablePositionIncrements="true" />
        <filter class="solr.WordDelimiterFilterFactory" 
            generateWordParts="1" generateNumberParts="1" 
            catenateWords="1" catenateNumbers="1" 
            catenateAll="0" splitOnCaseChange="1" />
        <filter class="solr.LowerCaseFilterFactory" />
        <filter class="solr.SnowballPorterFilterFactory" language="English" protected="protwords.txt" />
    </analyzer>
    <analyzer type="query">
        <tokenizer class="solr.WhitespaceTokenizerFactory" />
        <filter class="solr.SynonymFilterFactory" synonyms="synonyms.txt" ignoreCase="true" expand="true" />
        <filter class="solr.StopFilterFactory"
            ignoreCase="true" words="stopwords.txt"
            enablePositionIncrements="true" />
        <filter class="solr.WordDelimiterFilterFactory" 
            generateWordParts="1" generateNumberParts="1" 
            catenateWords="0" catenateNumbers="0" 
            catenateAll="0" splitOnCaseChange="1" />
        <filter class="solr.LowerCaseFilterFactory" />
        <filter class="solr.SnowballPorterFilterFactory" language="English" protected="protwords.txt" />
    </analyzer>
</fieldType>

Заранее большое спасибо!

Себ

Ответы [ 2 ]

3 голосов
/ 10 января 2012

WordDelimiterFilterFactory вызывает удаление подчеркивания.Основано на следующем:

Разбивает слова на подслова и выполняет необязательные преобразования для групп подслов.По умолчанию слова разделяются на подслово по следующим правилам:

разделяется на внутрисловные разделители (все не алфавитно-цифровые символы).«Wi-Fi» -> «Wi», «Fi»

...

Основано на описании того, как вы используете это поле - "ГраниЯ хочу хранить строки ... ".Я бы посоветовал вам использовать fieldType string, как определено ниже (из примера Solr), если только вам не нужны дополнительные анализаторы.

<!-- The StrField type is not analyzed, but indexed/stored verbatim. -->
<fieldType name="string" class="solr.StrField" sortMissingLast="true" omitNorms="true"/>
1 голос
/ 10 января 2012

Страница анализа Solr покажет вам, как ваш текст анализируется на разных этапах

...