Used by paimon-tantivy-tokenizer-test to compare cppjieba vs jieba-rs tokenization output.
golden_synthetic.txt — hand-written edge cases (mixed Chinese/English, digits, punctuation, emoji, whitespace, very long words, ...)golden_corpus.txt — short excerpts from public corpora (general knowledge, no copyright concerns)The test code (see src/paimon/global_index/tantivy/tantivy_tokenizer_test.cpp):
JiebaTokenizer::CutWithMode + Normalize to get token sequence Apaimon_tantivy_tokenizer_tokenize to get token sequence BTo add business query logs later, drop a new golden_business.txt in this directory; the test scans golden_*.txt automatically.