<code id="6mcsu"></code>
<li id="6mcsu"></li>
<li id="6mcsu"><dl id="6mcsu"></dl></li>
  • <code id="6mcsu"><tr id="6mcsu"></tr></code>
    或者

    搜索引擎索引系統概述

    作者:聚擎 瀏覽:176 發布時間:2017-04-09
    分享 評論 0

      眾所周知,搜索引擎的主要工作過程包括:抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關的簡要過程。今天簡要介紹一下索引系統,以億為單位的網頁庫中查找特定的某些關鍵詞猶如大海里面撈針,也許一定的時間內可以完成查找,但是用戶等不起,從用戶體驗角度我們必須在毫秒級別給予用戶滿意的結果,否則用戶只能流失。怎樣才能達到這種要求呢?

      如果能知道用戶查找的關鍵詞(query切詞后)都出現在哪些頁面中,那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程:


      (1)頁面分析的過程實際上是將原始頁面的不同部分進行識別并標記,例如:title、keywords、content、link、anchor、評論、其他非重要區域等等;

      (2)分詞的過程實際上包括了切詞分詞同義詞轉換同義詞替換等等,以對某頁面title分詞為例,得到的將是這樣的數據:term文本、termid、詞類、詞性等等;

      (3)之前的準備工作完成后,接下來即是建立倒排索引,形成{termàdoc},可以粗略的理解為如下,為什么是【term->doc】,而不是直接應用【doc->term】呢?


    亚洲电影中文字幕| 亚洲AV无码久久寂寞少妇| 中文字幕无码精品三级在线电影| heyzo专区无码综合| 高清无码午夜福利在线观看| 免费无码一区二区| 亚洲AV无码精品色午夜在线观看| 最近中文字幕完整在线看一| 亚洲av无码成人精品国产| 无码精品国产VA在线观看DVD| 亚洲中文字幕视频国产| 日韩中文字幕视频| 欧美日韩久久中文字幕 | 最近的中文字幕在线看视频| 国产免费无码AV片在线观看不卡| 亚洲熟妇无码AV在线播放| 亚洲欧美日韩中文字幕二区| 色综合中文综合网| 中文字幕无码av激情不卡久久| 国产精品ⅴ无码大片在线看| 午夜福利无码不卡在线观看 | 在线高清无码A.| 亚洲国产综合精品中文字幕 | 国产综合无码一区二区辣椒| 中文在线√天堂| 亚洲av无码一区二区三区人妖 | 毛片免费全部无码播放| 精品久久久久久无码专区不卡| 亚洲AV无码专区在线播放中文| 国产成人无码一区二区三区在线 | 无码国内精品久久综合88| 韩国三级中文字幕hd久久精品| 中文字幕免费高清视频| 最近的中文字幕大全免费8| 最近中文字幕高清免费中文字幕mv| 日韩精品无码一区二区中文字幕| 久久精品aⅴ无码中文字字幕不卡| 亚洲天堂2017无码中文| 色婷婷综合久久久久中文一区二区| 人妻丝袜中文无码av影音先锋专区| 久久久久久久人妻无码中文字幕爆 |