LangChain:基于SentenceTransformers分词器Token数的文本分割器SentenceTransformersTokenTextSplitter
SentenceTransformersTokenTextSplitter 按 SentenceTransformers 模型分词器计出的 token 数切分文本,使 chunk 长度与目标嵌入模型对齐;它不是按句子语义边界做分割。通过 model_name 指定预训练模型名称,从而使用该模型对应的分词器。
Splitting by token > SentenceTransformers,SentenceTransformersTokenTextSplitter