基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的

這篇文章給大家介紹基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的,內(nèi)容非常詳細(xì),感興趣的小伙伴們可以參考借鑒,希望對大家能有所幫助。

創(chuàng)新互聯(lián)堅(jiān)信:善待客戶,將會成為終身客戶。我們能堅(jiān)持多年,是因?yàn)槲覀円恢笨芍档眯刨嚒N覀儚牟缓鲇瞥踉L客戶,我們用心做好本職工作,不忘初心,方得始終。十多年網(wǎng)站建設(shè)經(jīng)驗(yàn)創(chuàng)新互聯(lián)是成都老牌網(wǎng)站營銷服務(wù)商,為您提供成都網(wǎng)站設(shè)計(jì)、成都網(wǎng)站制作、網(wǎng)站設(shè)計(jì)、H5場景定制、網(wǎng)站制作、高端網(wǎng)站設(shè)計(jì)小程序開發(fā)服務(wù),給眾多知名企業(yè)提供過好品質(zhì)的建站服務(wù)。

經(jīng)常聽到一些朋友說用CRF(conditional random field algorithm)做命名實(shí)體識別,但絕大多數(shù)都是調(diào)用CRF++包,然后自己只是構(gòu)造一些特征,然后就是幾個(gè)命令行執(zhí)行下而已,最近又有朋友經(jīng)常問CRF是如何命名實(shí)體識別的,今天我就結(jié)合實(shí)例把CRF預(yù)測的過程來進(jìn)行下解釋,有不對的地方歡迎拍磚,算是拋磚引玉吧。

本專題是建立在CRF模型已經(jīng)訓(xùn)練的基礎(chǔ)上的,如果有需要下個(gè)專題可以介紹下訓(xùn)練的原理及過程。

通常CRF的命名實(shí)體序列標(biāo)注任務(wù)中標(biāo)簽有B、E、M、S四種,本專題模板采用的是 :   U0:%x[-1,0]   U1:%x[0,0]  U2:%x[1,0]  U3:%x[-1,0]%x[0,0] 

                   U4:%x[0,0]%x[1,0]   U5:%x[-1,0]%x[1,0]

使用案例是“維斯塔斯風(fēng)車著火了”

首先對“維”進(jìn)行特征函數(shù)計(jì)算:

基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的

 可以看出當(dāng)前token是“維”,通過模板特征函數(shù)得到該矩陣,然后對該矩陣的各個(gè)列進(jìn)行求和結(jié)果如下:     

基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的

其他字符的特征計(jì)算過程都是一樣的,在此就忽略過程,矩陣DotMatrix結(jié)果如下(其中由于“維”字是開始字符所以不可能是E和M標(biāo)注,顧認(rèn)為設(shè)置為最小權(quán)重):

基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的

根據(jù)CRF計(jì)算過程,以上矩陣為點(diǎn)函數(shù)得分矩陣,我們還需要一個(gè)訓(xùn)練時(shí)得到的標(biāo)注轉(zhuǎn)移矩陣TransMatrix即:

基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的

通過DotMatrix和TransMatrix的結(jié)合可以推導(dǎo)出前后字符之間在各個(gè)標(biāo)注之前的最大轉(zhuǎn)移概率,公式如下:

基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的

其中score值的計(jì)算既是字符之間轉(zhuǎn)移概率的計(jì)算過程,from矩陣記錄的則是當(dāng)前節(jié)點(diǎn)標(biāo)注最大概率時(shí)前一個(gè)字符的標(biāo)注,可以認(rèn)為是最優(yōu)路徑的記錄矩陣,而net矩陣則是通過轉(zhuǎn)移計(jì)算過程得到的每個(gè)字符在BEMS標(biāo)注的概率值,如下:

基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的

from矩陣結(jié)果為:

基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的

我們此時(shí)是需要回溯出一條最優(yōu)路徑的,定位“了”字符,作為結(jié)尾字符,只可能是E或者S,我們看net[火][E]和net[火][S]的值,可以看出S標(biāo)注結(jié)果更大,因此“了”標(biāo)注為S,看from矩陣,from[了][S]=1,及“火”標(biāo)注為E,以此類推得到結(jié)果如下:

基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的

關(guān)于基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的就分享到這里了,希望以上內(nèi)容可以對大家有一定的幫助,可以學(xué)到更多知識。如果覺得文章不錯(cuò),可以把它分享出去讓更多的人看到。

文章題目:基于CRF的命名實(shí)體識別系統(tǒng)原理及實(shí)例剖析是怎樣的
分享地址:http://bm7419.com/article22/gijccc.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供域名注冊、ChatGPT、靜態(tài)網(wǎng)站、網(wǎng)站內(nèi)鏈、服務(wù)器托管

廣告

聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請盡快告知,我們將會在第一時(shí)間刪除。文章觀點(diǎn)不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時(shí)需注明來源: 創(chuàng)新互聯(lián)

成都定制網(wǎng)站建設(shè)