步驟:
成都創(chuàng)新互聯(lián)憑借在網(wǎng)站建設(shè)、網(wǎng)站推廣領(lǐng)域領(lǐng)先的技術(shù)能力和多年的行業(yè)經(jīng)驗(yàn),為客戶提供超值的營銷型網(wǎng)站建設(shè)服務(wù),我們始終認(rèn)為:好的營銷型網(wǎng)站就是好的業(yè)務(wù)員。我們已成功為企業(yè)單位、個(gè)人等客戶提供了成都做網(wǎng)站、成都網(wǎng)站制作服務(wù),以良好的商業(yè)信譽(yù),完善的服務(wù)及深厚的技術(shù)力量處于同行領(lǐng)先地位。
讀取三篇文檔1.txt,2.txt,3.txt,里邊的內(nèi)容分別為“this is php”,“this is html html”,“this is java”
分詞,并統(tǒng)計(jì)詞頻tf
計(jì)算文檔頻率df
計(jì)算每篇文檔的特征向量
計(jì)算搜索詞與文檔的夾角余弦值
<?php $_txts = array('1.txt','2.txt','3.txt'); $_len = count($_txts); for ($i = 0;$i < $_len;$i++){ $_contents[] = file_get_contents($_txts[$i]); //讀取內(nèi)容 } for ($i = 0;$i < $_len;$i++){ //分詞 $_words[] = explode(' ',trim($_contents[$i])); foreach ($_words[$i] as $_key=>$_value){ $_value = trim($_value); $_value = preg_replace('/[.|,|(|)|-|;]/','',$_value); $_words[$i][$_key]=strtolower($_value); } //統(tǒng)計(jì)文檔所有詞的長度,一般計(jì)算tf需要除以這個(gè)值,為了簡(jiǎn)便,本次試驗(yàn)省去這步 //$_words_count[]=count($_words[$i]); //詞頻tf $_tf[] = array_count_values($_words[$i]); //去重 $_words[$i]= array_unique($_words[$i]); } //合并 $_words_com = array_merge($_words[0],$_words[1],$_words[2]); //文檔頻率 $_df = array_count_values($_words_com); //特征向量 for ($i = 0;$i < $_len;$i++){ //初始化,與文檔頻率的維度相同 $_vsm[$i] = $_df; //把每個(gè)維度的值設(shè)置為0 foreach($_vsm[$i] as $_key=>$_value){ $_vsm[$i][$_key] = 0; } for ($j=0;$j<count($_words[$i]);$j++){ if (in_array($_words[$i][$j],$_words_com)){ $_vsm[$i][($_words[$i][$j])] = ($_tf[$i][($_words[$i][$j])])*(log($_len/$_df[($_words[$i][$j])])); } } } for($i = 0;$i < count($_vsm); $i++){ echo '第'.($i+1).'篇文檔的特征向量: ('. implode(",",$_vsm[$i]).')<br/>'; } //測(cè)試 $_query = 'java'; $_vsm_que = $_df; foreach($_vsm_que as $_key=>$_value){ $_vsm_que[$_key] = 0; } if (in_array($_query,$_vsm_que)){ $_vsm_que[$_query] = 1; } for ($i = 0; $i < count($_vsm); $i++){ foreach($_vsm_que as $_key=>$_value){ $_sim[$i] += ($_vsm[$i][$_key]) * ($_vsm_que[$_key]); $_w1 += pow($_vsm_que[$_key],2); $_w2 += pow($_vsm[$i][$_key],2); } //求夾角余弦值,相似度計(jì)算 $_cos[$i] = $_sim[$i]/(sqrt($_w1)*sqrt($_w2)); echo '<br/>'; echo '第'.($i+1).'篇文檔的相似度:'.$_cos[$i]; } arsort($_cos); foreach($_cos as $_key=>$_value){ echo '<br/><br/>'; echo '最符合的結(jié)果為第'.($_key+1).'篇文檔'; break; } ?>
在瀏覽器運(yùn)行的結(jié)果:
第1篇文檔的特征向量: (0,0,1.09861228867,0,0)
第2篇文檔的特征向量: (0,0,0,2.19722457734,0)
第3篇文檔的特征向量: (0,0,0,0,1.09861228867)
第1篇文檔的相似度:0
第2篇文檔的相似度:0
第3篇文檔的相似度:0.235702260396
最符合的結(jié)果為第3篇文檔
當(dāng)前名稱:使用tf*idf實(shí)現(xiàn)對(duì)文檔集合的檢索
文章路徑:http://bm7419.com/article40/jdepeo.html
成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供外貿(mào)網(wǎng)站建設(shè)、網(wǎng)站改版、ChatGPT、品牌網(wǎng)站制作、手機(jī)網(wǎng)站建設(shè)、企業(yè)建站
聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請(qǐng)盡快告知,我們將會(huì)在第一時(shí)間刪除。文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng),如需處理請(qǐng)聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時(shí)需注明來源: 創(chuàng)新互聯(lián)