@
ffgrinder 首先我回答一下我觉得 tokenizer 不够精准的地方,尽管你我都已经适应并认同它叫做分词器。
就拿 compiler 的场景来说,tokenizer 切分的除了可以被视作「词」的 keyword 外,还有数字,符号等等。
所以从这个角度来看,我们已经认可的分词器也同样不够精确。进而我想表达的是,就翻译来说「词元」可能和「分词器」类似。
我在 PR 中和这个帖子中其中都表达过一个观点,就是大部中文母语认识在做 LLM 相关的交流时用的肯定是「 token 」,这点应该没有异议吧。
那么把一个大家已经适应的,习惯的,没问题的,甚至是全球几乎都这么用的词,强行地去翻译成一个本土词汇,我不觉得这是一个对各位有益的事情。而且这个词走进大家的视野里也有一段时间了,无论是支持它的人也好,反对它的人也好?有多少人真的在交流中弃用「 token 」而改用「词元」的吗?
然后我在这里顺便回复一下 @
Rorysky 的评论:
你的观点完全没错,但是你可能误解了我的意思。这个项目它本身就不是中文的,中文都是翻译来的。除了「令牌」这个错误翻译,肯定还有更多更加错误的翻译。但是他能 work ,而且这些错误的翻译大概使用者也能理解,开发资源应倾注到其他地方,所以我觉得它「没大碍」。
关于这个 PR ,我觉得既然都修了,那么就应该用一个大部分人都在真正使用的词,而不是造成眼睛看着「词元」,心里读着「 token 」的这种情况,这很令人不舒服。