我们讨论的分词算法可分为三大类:基于字典、词库匹配的分词办法;基于词频度统计的分词办法和基于字标注的分词办法。
第一类办法应用词典匹配、汉语词法或其它汉语语言知识举行分词,如:正向最大匹配法、逆向最大匹配法、最小匹配办法等。这类办法简单、分词效率较高,但汉语语言现象复杂丰富,词典的完备性、规则的一致性等问题使其难以适应开放的大规模文本的分词处理(比如未登录词)。

第二类基于统计的分词办法则基于字和词的统计信息,如把相邻字间的信息、词频及相应的共现信息等应用于分词,由于这些信息是通过调查真实语料而取得的,因而基于统计的分词办法具有较好的有用性。
第三类基于字标注的分词办法实际上是构词办法。即把分词过程视为字在字串中的标注问题。由于每个字在构造一个特定的词语时都占领着一个确定的构词位置(即词位),如果规定每个字最多惟独四个构词位置:即B(词首),M (词中),E(词尾)和S(单独成词),那么下面句子(甲)的分词结果就可以直接表示成如(乙)所示的逐字标注形式:
(甲)分词结果:/上海/计划/N/本/世纪/末/实现/人均/国内/生产/总值/五千美元/。
(乙)字标注形式:上/B海/E计/B划/E N/S 本/s世/B 纪/E 末/S 实/B 现/E 人/B 均/E 国/B 内/E生/B产/E总/B值/E 五/B千/M 美/M 元/E 。/S
首先需要说明,这里说德淠“字”不只限于汉字。考虑到中文真实文本中不可幸免地会包含一定数量的非汉字字符,本文所说的“字”,也包括外文字母、阿拉伯数字和标点符号等字符。所有这些字符都是构词的基本单元。固然,汉字依然是这个单元集合中数量最多的一类字符。
说说网站推广的基本策略都有什么?
标题(title):标题是网页优化中相当有分量,一般网页title主要包含一些关键词、网站名称等。











