必赢娱乐官网-必赢56net手机版-首页

必赢娱乐官网

行业资讯VIEWS

上海必赢56net手机版|上海金属软管|上海弹簧减震器尽在必赢娱乐官网官方网站

新浪微博搜索的分词技术不足

来源:新浪微博搜索的分词技术不足 发布于:2014-07-31 11:16   浏览:

不是故意迫害新浪微博,也不是对新浪微博不满,在这里指手画脚。我是*个过路人,秉承技术学习的态度,来和大家分析新浪微博搜索分词的不足。

迭词是非常重要的测试元素,大家以“阿里巴 巴”作为测试词汇,去评测效果:

效果是惊人的不令人满意。那么真实的测试“alibaba”效果应该是这样子的:

可见“阿里巴 巴”和“alibaba”这两个看似相同的词,但是在新浪微博的搜索中,差异竟然这么明显。其原因据我推测是:没有做全局分词。例如,“阿里巴 巴”*少应该分为三个词组,但是通过观察,它只用了名词词库。alibaba应该切分的5个词组“阿里”,“巴”,“巴”,“巴巴”“alibaba”。如果没有这样做,将会直接导致搜索“阿里巴 巴”效果非常差,几乎搜索不到“阿里巴 巴”相关词汇。

同理,搜索“阿里  巴巴”效果也会很差,事实也证明如此:

当然,他们这样分词也有自己的道理,那就是用户给定的空格,那*定是词与词的分隔符,或者他们自己分词用的分隔符就是空格。在以前可以这样说明,但是搜索在N年前就进入了语义时代,如果还保留以前思想,那*定会落伍。尤其是:你把这三个case放入到百度、360、搜狗搜索里面去,他们都能很好处理。让若你把“QQ”、“Q Q”放入新浪微博搜索,结果会更差。可见新浪微博的搜索非常依赖于词库,可是呢,往往是细节决定成败








最新推荐:
·慈溪金源广场项目饮用水必赢56net手机版合同 ·脱硫一级塔浆液循环泵橡胶膨胀节技术要求
·【上海天然气过江隧道】耐油必赢56net手机版合同 ·曹妃甸港海水淡化项目必赢56net手机版合同
·美国米其林四联动线冷却水循环系统PVC必赢56net手机版 ·有关某商业变压器空气减震器漏气问题分析报告
·KQJZ型空气减震器安装说明电子版 ·【山东盛阳金属节能改造循环水系统】必赢56net手机版合同
·【福建百宏聚纤年产20万吨工业涤纶长丝项目】必赢56net手机版 ·【本溪市华兴热电】金属软管合同
在线咨询

必赢娱乐官网|必赢56net手机版

XML 地图 | Sitemap 地图