當(dāng)前位置:首頁(yè) >  站長(zhǎng) >  搜索優(yōu)化 >  正文

百度lee:搜索引擎索引系統(tǒng)概述(一)

 2013-10-21 17:23  來(lái)源: A5專欄   我來(lái)投稿 撤稿糾錯(cuò)

  域名預(yù)訂/競(jìng)價(jià),好“米”不錯(cuò)過(guò)

從上次8月份百度站長(zhǎng)平臺(tái)lee發(fā)布關(guān)于搜索引擎抓取信息后2個(gè)月已經(jīng)過(guò)去,這次lee繼續(xù)發(fā)布了搜索引擎索引系統(tǒng)的信息。不管怎么樣,木木SEO認(rèn)為百度官方的公告我們還是要了解和分析的。下面是百度官方公告:

眾所周知,搜索引擎的主要工作過(guò)程包括:抓取、存儲(chǔ)、頁(yè)面分析、索引、檢索等幾個(gè)主要過(guò)程。過(guò)去幾周給大家介紹了抓取相關(guān)的簡(jiǎn)要過(guò)程。今天簡(jiǎn)要介紹一下索引系統(tǒng),以億為單位的網(wǎng)頁(yè)庫(kù)中查找特定的某些關(guān)鍵詞猶如大海里面撈針,也許一定的時(shí)間內(nèi)可以完成查找,但是用戶等不起,從用戶體驗(yàn)角度我們必須在毫秒級(jí)別給予用戶滿意的結(jié)果,否則用戶只能流失。怎樣才能達(dá)到這種要求呢?

如果能知道用戶查找的關(guān)鍵詞(query切詞后)都出現(xiàn)在哪些頁(yè)面中,那么用戶檢索的處理過(guò)程即可以想象為包含了query中切詞后不同部分的頁(yè)面集合求交的過(guò)程,而檢索即變成了頁(yè)面名稱之間的比較、求交。這樣,在毫秒內(nèi)以億為單位的檢索成為了可能。這就是通常所說(shuō)的倒排索引及求交檢索的過(guò)程。如下為建立倒排索引的基本過(guò)程:

(1)頁(yè)面分析的過(guò)程實(shí)際上是將原始頁(yè)面的不同部分進(jìn)行識(shí)別并標(biāo)記,例如:title、keywords、content、link、anchor、評(píng)論、其他非重要區(qū)域等等;

(2)分詞的過(guò)程實(shí)際上包括了切詞、分詞、同義詞轉(zhuǎn)換、同義詞替換等等,以對(duì)某頁(yè)面title分詞為例,得到的將是這樣的數(shù)據(jù):term文本、termId、詞類、詞性等等;

(3)之前的準(zhǔn)備工作完成后,接下來(lái)即是建立倒排索引,形成{termàdoc},可以粗略的理解為如下,為什么是【term->doc】,而不是直接應(yīng)用【doc->term】呢?

上述即是索引系統(tǒng)中的倒排索引過(guò)程,是搜索引擎實(shí)現(xiàn)毫秒級(jí)檢索非常重要的一個(gè)環(huán)節(jié)。

好了,以上就百度發(fā)布的全文了,當(dāng)然是很簡(jiǎn)單的,想了解更多可以看木木SEO的《不懂搜索引擎原理就是在裸奔》,我想大家在里面可以了解得更詳細(xì)。另外上面文章里面的幾個(gè)詞可能大家不理解,簡(jiǎn)單的說(shuō)一下:term就是單詞文本,即關(guān)鍵詞;termID就是單詞標(biāo)識(shí)。

文章編輯自:木木SEO博客

申請(qǐng)創(chuàng)業(yè)報(bào)道,分享創(chuàng)業(yè)好點(diǎn)子。點(diǎn)擊此處,共同探討創(chuàng)業(yè)新機(jī)遇!

相關(guān)文章

  • 百度站長(zhǎng)平臺(tái):百度LEE漫談移動(dòng)化

    在3月19日的百度站長(zhǎng)平臺(tái)蝶變行動(dòng)專場(chǎng)沙龍現(xiàn)場(chǎng),百度LEE團(tuán)隊(duì)主要成員、移動(dòng)搜索產(chǎn)品負(fù)責(zé)人熊詠志老師針對(duì)現(xiàn)階段大熱的PC移動(dòng)化問(wèn)題闡述了自己的看法,值得同學(xué)們好好學(xué)習(xí)一下,匯總起來(lái)要點(diǎn)如下:?理清目標(biāo)用戶需求,切忌盲目移動(dòng)化?移動(dòng)適配要全面,以免流量流失?盡快在百度站長(zhǎng)平臺(tái)驗(yàn)證站點(diǎn),享受專項(xiàng)服務(wù)20

  • 百度站長(zhǎng)平臺(tái):搜索引擎索引系統(tǒng)概述

    眾所周知,搜索引擎的主要工作過(guò)程包括:抓取、存儲(chǔ)、頁(yè)面分析、索引、檢索等幾個(gè)主要過(guò)程。過(guò)去幾周給大家介紹了抓取相關(guān)的簡(jiǎn)要過(guò)程。今天簡(jiǎn)要介紹一下索引系統(tǒng),以億為單位的網(wǎng)頁(yè)庫(kù)中查找特定的某些關(guān)鍵詞猶如大海里面撈針,也許一定的時(shí)間內(nèi)可以完成查找,但是用戶等不起,從用戶體驗(yàn)角度我們必須在毫秒級(jí)別給予用戶滿意

  • 百度lee:搜索引擎索引系統(tǒng)概述(二)

    10月21日,百度lee簡(jiǎn)要介紹了搜索引擎索引系統(tǒng)概述(一),主要講的就是搜索引擎的倒排索引,還是先來(lái)百科一下:Query,是查詢的意思,為了在數(shù)據(jù)庫(kù)中尋找某一特定文件、網(wǎng)站、記錄或一系列記錄,由搜索引擎或數(shù)據(jù)庫(kù)送出的消息;term是單詞文本,即關(guān)鍵詞。今天,百度Lee公布了搜索引擎索引系統(tǒng)概述第二

  • 百度站長(zhǎng)平臺(tái)沙龍:百度Lee解密新一代搜索引擎

    “百度之夜”百度站長(zhǎng)平臺(tái)高端沙龍?上海站紀(jì)實(shí)A5站長(zhǎng)網(wǎng)(spokeops.com)消息,10月16日晚,“百度之夜”——百度站長(zhǎng)平臺(tái)高端沙龍?上海站在Caffebene咖啡召開(kāi)。來(lái)自攜程、大眾點(diǎn)評(píng)、1號(hào)店、途牛等60余家上海知名網(wǎng)站的互聯(lián)網(wǎng)精英濟(jì)濟(jì)一堂。百度的搜索專家Lee對(duì)百度最近推出的知心搜

    標(biāo)簽:
    百度lee
  • 百度lee:建立符合搜索抓取習(xí)慣的網(wǎng)站

    之前百度站長(zhǎng)lee給大家介紹了搜索抓取系統(tǒng)工作原理,根據(jù)該工作原理今天簡(jiǎn)要介紹一下如何建立網(wǎng)站是符合搜索引擎抓取系統(tǒng)習(xí)慣的。

    標(biāo)簽:
    搜索抓取
    百度lee

熱門排行

信息推薦