正向最大匹配 和逆向最大匹配对比比较
正向最大匹配法 &逆向最大匹配法 原理對比
下面介紹的分詞算法中最簡單的正向最大匹配和反向最大匹配。
這種兩種方法都是機械分詞方法,它是按照一定的策略將待分析的漢字串與一個”充分大的”機器詞典中的詞條進行配,若在詞典中找到某個字符串,則匹配成功(識別出一個詞)。
按照掃描方向的不同,串匹配分詞方法可以分為正向匹配和逆向匹配;按照不同長度優先匹配的情況,可以分為最大(最長)匹配和最小(最短)匹配;按照是否與詞性標注過程相結合,又可以分為單純分詞方法和分詞與標注相結合的一體化方法。常用的幾種機械分詞方法如下:
1)正向最大匹配法(由左到右的方向);
2)逆向最大匹配法(由右到左的方向);
3)最少切分(使每一句中切出的詞數最小)。
還可以將上述各種方法相互組合,例如,可以將正向最大匹配方法和逆向最大匹配方法結合起來構成雙向匹配法。由于漢語單字成詞的特點,正向最小匹配和逆向最小匹配一般很少使用。一般說來,逆向匹配的切分精度略高于正向匹配,遇到的歧義現象也較少。統計結果表明,單純使用正向最大匹配的錯誤率為1/169,單純使用逆向最大匹配的錯誤率為1/245。但這種精度還遠遠不能滿足實際的需要。實際使用的分詞系統,都是把機械分詞作為一種初分手段,還需通過利用各種其它的語言信息來進一步提高切分的準確率。
一種方法是改進掃描方式,稱為特征掃描或標志切分,優先在待分析字符串中識別和切分出一些帶有明顯特征的詞,以這些詞作為斷點,可將原字符串分為較小的串再來進機械分詞,從而減少匹配的錯誤率。另一種方法是將分詞和詞類標注結合起來,利用豐富的詞類信息對分詞決策提供幫助,并且在標注過程中又反過來對分詞結果進行檢驗、調整,從而極大地提高切分的準確率
定義比較抽象,舉個例子來說明正向最大匹配和反向最大匹配。
例子:’今天來了許多新同事’
1.正向最大匹配方式,最大長度為5
今天來了許
今天來了
今天來
今天?
來了許多新
來了許多
來了許
來了
來?
了許多新同
了許多新
了許多
了許
了?
許多新同事
許多新同
許多新
許多 ====》得到一個詞– 許多
新同事
新同
新?
同事 ====》得到一個詞– 同事
最后正向最大匹配的結果是:
/今天/來/了/許多/新/同事/
2.反向最大匹配方式,最大長度為5
許多新同事
多新同事
新同事
同事 ====》得到一個詞– 同事
來了許多新
了許多新
許多新
多新
新?
天來了許多
來了許多
了許多
許多 ====》得到一個詞– 許多
今天來了
天來了
來了
了?
今天來
天來
來?
今天 ====》得到一個詞– 今天
最后反向最大匹配的結果是:
/今天/來/了/許多/新/同事/
正向最大匹配和反向最大匹配的結果并不一定相同
例子:’我一個人吃飯’
1.正向最大匹配方式,最大長度為5
我一個人吃
我一個人
我一個
我一
我?
一個人吃飯
一個人吃
一個人
一個 ====》得到一個詞– 一個
人吃飯
人吃
人 ====》得到一個詞– 人
吃飯 ====》得到一個詞– 吃飯
最后正向最大匹配的結果是:
/我/一個/人/吃飯/
2.反向最大匹配方式,最大長度為5
一個人吃飯
個人吃飯
人吃飯
吃飯 ====》得到一個詞– 吃飯
我一個人
一個人
個人 ====》得到一個詞– 個人
我一
一?
我?
最后反向最大匹配的結果是:
/我/一/個人/吃飯/
這次兩種方式的結果就不一致了。
總結
以上是生活随笔為你收集整理的正向最大匹配 和逆向最大匹配对比比较的全部內容,希望文章能夠幫你解決所遇到的問題。
- 上一篇: Apriori算法通俗详解_fpgrow
- 下一篇: 数学符号1