<code id="6mcsu"></code>
<li id="6mcsu"></li>
<li id="6mcsu"><dl id="6mcsu"></dl></li>
  • <code id="6mcsu"><tr id="6mcsu"></tr></code>
    或者

    搜索引擎索引系統(tǒng)概述(一)

    作者:月光邊境 瀏覽:2690 發(fā)布時間:2017-04-29
    分享 評論 0

    眾所周知,搜索引擎的主要工作過程包括:抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關的簡要過程。今天簡要介紹一下索引系統(tǒng),以億為單位的網頁庫中查找特定的某些關鍵詞猶如大海里面撈針,也許一定的時間內可以完成查找,但是用戶等不起,從用戶體驗角度我們必須在毫秒級別給予用戶滿意的結果,否則用戶只能流失。怎樣才能達到這種要求呢?

      如果能知道用戶查找的關鍵詞(query切詞后)都出現在哪些頁面中,那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程:

      (1)頁面分析的過程實際上是將原始頁面的不同部分進行識別并標記,例如:title、keywords、content、link、anchor、評論、其他非重要區(qū)域等等;

      (2)分詞的過程實際上包括了切詞分詞同義詞轉換同義詞替換等等,以對某頁面title分詞為例,得到的將是這樣的數據:term文本、termid、詞類、詞性等等;

      (3)之前的準備工作完成后,接下來即是建立倒排索引,形成{termàdoc},可以粗略的理解為如下,為什么是【term->doc】,而不是直接應用【doc->term】呢?

      上述即是索引系統(tǒng)中的倒排索引過程,是搜索引擎實現毫秒級檢索非常重要的一個環(huán)節(jié)。

    亚洲精品无码专区2| 蜜桃臀无码内射一区二区三区| 国产综合无码一区二区辣椒 | 精品人妻大屁股白浆无码| 日韩乱码人妻无码中文字幕视频| 精品无码AV无码免费专区| 精品久久久无码21p发布| 久久精品aⅴ无码中文字字幕重口| 国产精品无码一区二区三级| 熟妇人妻系列aⅴ无码专区友真希| 亚洲中文字幕不卡无码| 日韩乱码人妻无码中文字幕视频| 精品无码免费专区毛片| 色综合久久中文色婷婷| 日韩av无码中文无码电影| 久久久久亚洲?V成人无码| 免费无码又爽又刺激高潮视频| 成人A片产无码免费视频在线观看| 国产成人三级经典中文| 亚洲色中文字幕无码AV| 亚洲AⅤ无码一区二区三区在线| 精品无码久久久久久尤物| 亚洲AV无码国产精品麻豆天美| 熟妇人妻系列av无码一区二区| 精品人妻V?出轨中文字幕| 在线中文字幕一区| 日韩国产中文字幕| 欧美日韩中文在线| 日本一区二区三区精品中文字幕 | 久久久噜噜噜久久中文福利| 亚洲AV无码成人精品区狼人影院| 91嫩草国产在线无码观看| 国产成人无码一区二区在线播放 | 激情无码人妻又粗又大中国人| 亚洲AV中文无码乱人伦在线观看| 国产丝袜无码一区二区三区视频| 中文字幕国产第一页首页| 人妻系列AV无码专区| 中文字幕无码无码专区| 亚洲av成人无码久久精品| 无码中文av有码中文a|