Skip to content

@lancedb/lancedbDocs


@lancedb/lancedb / TokenizeOptions

Interface: TokenizeOptions

Options for tokenizing a full-text search query without a table index.

Properties

asciiFolding?

optional asciiFolding: boolean;

Whether to fold ASCII characters.


baseTokenizer?

optional baseTokenizer: BaseTokenizer;

The tokenizer to use. The default is "simple".


language?

optional language: string;

Language for stemming and stop words.


lowercase?

optional lowercase: boolean;

Whether to lowercase tokens.


maxTokenLength?

optional maxTokenLength: number;

Maximum token length; tokens longer than this are ignored.


ngramMaxLength?

optional ngramMaxLength: number;

N-gram maximum length.


ngramMinLength?

optional ngramMinLength: number;

N-gram minimum length.


prefixOnly?

optional prefixOnly: boolean;

Whether to only emit token prefixes for the n-gram tokenizer.


removeStopWords?

optional removeStopWords: boolean;

Whether to remove stop words.


stem?

optional stem: boolean;

Whether to stem tokens.