不是故意迫害新浪微博,也不是对新浪微博不满,在这里指手画脚。我是一个过路人,秉承技术学习的态度,来和大家分析新浪微博搜索分词的不足。迭词是非常重要的测试元素,我们以阿里巴 巴作为测试词汇,去评测效果:效果是惊人的不令人满意。那么真实的测试阿里巴巴效果应该是这样子的:
同理,搜索阿里 巴巴效果也会很差,事实也证明如此:当然,他们这样分词也有自己的道理,那就是用户给定的空格,那一定是词与词的分隔符,或者他们自己分词用的分隔符就是空格。在以前可以这样解释,但是搜索在N年前就进入了语义时代,如果还保留以前思想,那一定会落伍。尤其是:你把这三个case放入到百度、360、搜狗搜索里面去,他们都能很好处理。让若你把QQ、Q Q放入新浪微博搜索,结果会更差。可见新浪微博的搜索非常依赖于词库,可是呢,往往是细节决定成败 !