<code id="6mcsu"></code>
<li id="6mcsu"></li>
<li id="6mcsu"><dl id="6mcsu"></dl></li>
  • <code id="6mcsu"><tr id="6mcsu"></tr></code>
    或者

    搜索引擎索引系統(tǒng)概述(一)

    作者:月光邊境 瀏覽:2690 發(fā)布時間:2017-04-29
    分享 評論 0

    眾所周知,搜索引擎的主要工作過程包括:抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關(guān)的簡要過程。今天簡要介紹一下索引系統(tǒng),以億為單位的網(wǎng)頁庫中查找特定的某些關(guān)鍵詞猶如大海里面撈針,也許一定的時間內(nèi)可以完成查找,但是用戶等不起,從用戶體驗角度我們必須在毫秒級別給予用戶滿意的結(jié)果,否則用戶只能流失。怎樣才能達到這種要求呢?

      如果能知道用戶查找的關(guān)鍵詞(query切詞后)都出現(xiàn)在哪些頁面中,那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內(nèi)以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程:

      (1)頁面分析的過程實際上是將原始頁面的不同部分進行識別并標(biāo)記,例如:title、keywords、content、link、anchor、評論、其他非重要區(qū)域等等;

      (2)分詞的過程實際上包括了切詞分詞同義詞轉(zhuǎn)換同義詞替換等等,以對某頁面title分詞為例,得到的將是這樣的數(shù)據(jù):term文本、termid、詞類、詞性等等;

      (3)之前的準(zhǔn)備工作完成后,接下來即是建立倒排索引,形成{termàdoc},可以粗略的理解為如下,為什么是【term->doc】,而不是直接應(yīng)用【doc->term】呢?

      上述即是索引系統(tǒng)中的倒排索引過程,是搜索引擎實現(xiàn)毫秒級檢索非常重要的一個環(huán)節(jié)。

    国产品无码一区二区三区在线| 久久精品无码专区免费青青 | AV无码精品一区二区三区| 在线日韩中文字幕| 无码精品人妻一区| 无码人妻品一区二区三区精99| 青娱乐在线国产中文字幕免費資訊| AV成人午夜无码一区二区| 亚洲爆乳精品无码一区二区三区| 最近中文字幕无免费| 中文午夜乱理片无码| 少妇无码太爽了不卡视频在线看| 少妇无码AV无码专区线| 国产网红主播无码精品| 最近中文字幕完整版免费高清| 中文字幕AV中文字无码亚| 国产日韩精品无码区免费专区国产| 亚洲va中文字幕无码久久| 中文精品人人永久免费| 中文字幕AV一区中文字幕天堂| 免费A级毛片无码无遮挡| 国产激情无码视频在线播放性色| 亚洲中久无码永久在线观看同| 中文字幕1级在线| 中文字幕亚洲一区| 中文字幕日韩理论在线| 最近中文字幕完整在线看一| 最近2019免费中文字幕6| 日韩国产中文字幕| 亚洲激情中文字幕| 最近中文字幕完整在线看一| 精品久久久久久久久久中文字幕 | 日韩精品一区二区三区中文字幕| 无码精品A∨在线观看中文| 中文字幕乱码无码人妻系列蜜桃| 涩涩色中文综合亚洲| 在线天堂中文WWW官网| 亚洲一区中文字幕久久| 最近中文字幕免费2019| 日韩精品无码一区二区三区AV| 亚洲中文字幕无码中文字在线|