<code id="6mcsu"></code>
<li id="6mcsu"></li>
<li id="6mcsu"><dl id="6mcsu"></dl></li>
  • <code id="6mcsu"><tr id="6mcsu"></tr></code>
    或者

    搜索引擎索引系統(tǒng)概述

    作者:聚擎 瀏覽:176 發(fā)布時間:2017-04-09
    分享 評論 0

      眾所周知,搜索引擎的主要工作過程包括:抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關(guān)的簡要過程。今天簡要介紹一下索引系統(tǒng),以億為單位的網(wǎng)頁庫中查找特定的某些關(guān)鍵詞猶如大海里面撈針,也許一定的時間內(nèi)可以完成查找,但是用戶等不起,從用戶體驗(yàn)角度我們必須在毫秒級別給予用戶滿意的結(jié)果,否則用戶只能流失。怎樣才能達(dá)到這種要求呢?

      如果能知道用戶查找的關(guān)鍵詞(query切詞后)都出現(xiàn)在哪些頁面中,那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內(nèi)以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程:


      (1)頁面分析的過程實(shí)際上是將原始頁面的不同部分進(jìn)行識別并標(biāo)記,例如:title、keywords、content、link、anchor、評論、其他非重要區(qū)域等等;

      (2)分詞的過程實(shí)際上包括了切詞分詞同義詞轉(zhuǎn)換同義詞替換等等,以對某頁面title分詞為例,得到的將是這樣的數(shù)據(jù):term文本、termid、詞類、詞性等等;

      (3)之前的準(zhǔn)備工作完成后,接下來即是建立倒排索引,形成{termàdoc},可以粗略的理解為如下,為什么是【term->doc】,而不是直接應(yīng)用【doc->term】呢?


    国产亚洲美日韩AV中文字幕无码成人 | 中文字幕一区二区三区在线观看 | 国产高清无码毛片| 中文字幕天天躁日日躁狠狠躁免费| 国产色无码精品视频免费| 天堂资源中文最新版在线一区 | AV无码精品一区二区三区| 区三区激情福利综合中文字幕在线一区亚洲视频1 | 日韩精品无码人妻一区二区三区| 亚洲Av无码乱码在线znlu| 色综合久久无码中文字幕| 国产成人无码一区二区在线观看| 日本三级在线中文字幕在线|中文| 国产精品无码无片在线观看| 最新中文字幕av无码专区| 欧美在线中文字幕| 潮喷大喷水系列无码久久精品| 一本色道无码道DVD在线观看| 亚洲韩国—中文字幕| 中文字幕丰满伦子无码| 无码AV波多野结衣久久| 中文字幕在线免费看线人| 婷婷综合久久中文字幕蜜桃三电影| 亚洲一级特黄大片无码毛片 | 无码中文字幕日韩专区视频| 国产福利电影一区二区三区久久老子无码午夜伦不 | 无码精品第一页| A级毛片无码久久精品免费| 精品无码人妻一区二区三区品| 无码视频在线观看| 亚洲Av无码精品色午夜| 午夜福利av无码一区二区| 无码中文人妻在线一区二区三区 | 中文字幕无码AV波多野吉衣| 精品国产aⅴ无码一区二区| 无码精品A∨在线观看免费| 亚洲欧美在线一区中文字幕 | 亚洲VA中文字幕无码一二三区| 亚洲国产综合无码一区二区二三区 | 中文字幕日韩第十页在线观看 | 精品无码一区二区三区电影|