Examples of org.apache.lucene.analysis.ASCIIFoldingFilter

org.apache.lucene.analysis.ASCIIFoldingFilter
nicode.org/charts/PDF/U0080.pdf">http://www.unicode.org/charts/PDF/U0080.pdf
Latin Extended-A: http://www.unicode.org/charts/PDF/U0100.pdf
Latin Extended-B: http://www.unicode.org/charts/PDF/U0180.pdf
Latin Extended Additional: http://www.unicode.org/charts/PDF/U1E00.pdf
Latin Extended-C: http://www.unicode.org/charts/PDF/U2C60.pdf
Latin Extended-D: http://www.unicode.org/charts/PDF/UA720.pdf
IPA Extensions: http://www.unicode.org/charts/PDF/U0250.pdf
Phonetic Extensions: http://www.unicode.org/charts/PDF/U1D00.pdf
Phonetic Extensions Supplement: http://www.unicode.org/charts/PDF/U1D80.pdf
General Punctuation: http://www.unicode.org/charts/PDF/U2000.pdf
Superscripts and Subscripts: http://www.unicode.org/charts/PDF/U2070.pdf
Enclosed Alphanumerics: http://www.unicode.org/charts/PDF/U2460.pdf
Dingbats: http://www.unicode.org/charts/PDF/U2700.pdf
Supplemental Punctuation: http://www.unicode.org/charts/PDF/U2E00.pdf
Alphabetic Presentation Forms: http://www.unicode.org/charts/PDF/UFB00.pdf
Halfwidth and Fullwidth Forms: http://www.unicode.org/charts/PDF/UFF00.pdf

See: http://en.wikipedia.org/wiki/Latin_characters_in_Unicode The set of character conversions supported by this class is a superset of those supported by Lucene's {@link ISOLatin1AccentFilter} which stripsaccents from Latin1 characters. For example, 'à' will be replaced by 'a'.

  public void testInvalidOffset() throws Exception {
    Analyzer analyzer = new ReusableAnalyzerBase() {
      @Override
      protected TokenStreamComponents createComponents(String fieldName, Reader reader) {
        Tokenizer tokenizer = new MockTokenizer(reader, MockTokenizer.WHITESPACE, false);
        TokenFilter filters = new ASCIIFoldingFilter(tokenizer);
        filters = new WordTokenFilter(filters);
        return new TokenStreamComponents(tokenizer, filters);
      }
    };

View Full Code Here

  public void testInvalidOffsets() throws Exception {
    Analyzer analyzer = new ReusableAnalyzerBase() {
      @Override
      protected TokenStreamComponents createComponents(String fieldName, Reader reader) {
        Tokenizer tokenizer = new MockTokenizer(reader, MockTokenizer.WHITESPACE, false);
        TokenFilter filters = new ASCIIFoldingFilter(tokenizer);
        filters = new EdgeNGramTokenFilter(filters, EdgeNGramTokenFilter.Side.FRONT, 2, 15);
        return new TokenStreamComponents(tokenizer, filters);
      }
    };
    assertAnalyzesTo(analyzer, "mosfellsbær",

View Full Code Here

  public void testInvalidOffsets() throws Exception {
    Analyzer analyzer = new ReusableAnalyzerBase() {
      @Override
      protected TokenStreamComponents createComponents(String fieldName, Reader reader) {
        Tokenizer tokenizer = new MockTokenizer(reader, MockTokenizer.WHITESPACE, false);
        TokenFilter filters = new ASCIIFoldingFilter(tokenizer);
        filters = new NGramTokenFilter(filters, 2, 2);
        return new TokenStreamComponents(tokenizer, filters);
      }
    };
    assertAnalyzesTo(analyzer, "mosfellsbær",

View Full Code Here


    @Override
    public TokenStream tokenStream(String fieldName, Reader reader) {
        TokenStream result = super.tokenStream(fieldName, reader);
        // Ignore accents
        result = new ASCIIFoldingFilter(result);
        // French stemmer
        // result = new FrenchStemFilter(result);
        return result;
    }

View Full Code Here

  public void testInvalidOffsets() throws Exception {
    Analyzer analyzer = new ReusableAnalyzerBase() {
      @Override
      protected TokenStreamComponents createComponents(String fieldName, Reader reader) {
        Tokenizer tokenizer = new MockTokenizer(reader, MockTokenizer.WHITESPACE, false);
        TokenFilter filters = new ASCIIFoldingFilter(tokenizer);
        filters = new NGramTokenFilter(filters, 2, 2);
        return new TokenStreamComponents(tokenizer, filters);
      }
    };
    assertAnalyzesTo(analyzer, "mosfellsbær",

View Full Code Here

  public void testInvalidOffsets() throws Exception {
    Analyzer analyzer = new ReusableAnalyzerBase() {
      @Override
      protected TokenStreamComponents createComponents(String fieldName, Reader reader) {
        Tokenizer tokenizer = new MockTokenizer(reader, MockTokenizer.WHITESPACE, false);
        TokenFilter filters = new ASCIIFoldingFilter(tokenizer);
        filters = new EdgeNGramTokenFilter(filters, EdgeNGramTokenFilter.Side.FRONT, 2, 15);
        return new TokenStreamComponents(tokenizer, filters);
      }
    };
    assertAnalyzesTo(analyzer, "mosfellsbær",

View Full Code Here

0 1

TOP

Related Classes of org.apache.lucene.analysis.ASCIIFoldingFilter

com.flaptor.indextank.query.IndexEngineAnalyzer

com.gentics.cr.lucene.autocomplete.AutocompleteAnalyzer

helpers.search.LinkItAnalyzer

org.apache.lucene.analysis.cn.smart.TestSmartChineseAnalyzer

org.apache.lucene.analysis.ngram.EdgeNGramTokenFilterTest

org.apache.lucene.analysis.ngram.NGramTokenFilterTest

org.apache.lucene.queryParser.analyzing.ASCIIAnalyzer

org.apache.mahout.text.MailArchivesClusteringAnalyzer

org.apache.solr.analysis.ASCIIFoldingFilterFactory

org.elasticsearch.index.analysis.ASCIIFoldingTokenFilterFactory

All source code are property of their respective owners. Java is a trademark of Sun Microsystems, Inc and owned by ORACLE Inc. Contact coftware#gmail.com.