您現在的位置: 网站首頁 / seo優化 / 正文

百度站長平台lee官方版:搜索引擎索引系統概述(一)

作者: admin 发布: 2013-10-21 20:55:53 分类: seo優化 閱讀: 次 查看評論

  衆所周知,搜索引擎的主要工作過程包括:抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關的簡要過程。今天簡要介紹一下索引系統,以億爲單位的網頁庫中查找特定的某些關鍵詞猶如大海裏面撈針,也許一定的時間內可以完成查找,但是用戶等不起,從用戶體驗角度我們必須在毫秒級別給予用戶滿意的結果,否則用戶只能流失。怎樣才能達到這種要求呢?

  如果能知道用戶查找的關鍵詞(query切詞後)都出現在哪些頁面中,那麽用戶檢索的處理過程即可以想象爲包含了query中切詞後不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內以億爲單位的檢索成爲了可能。這就是通常所說的倒排索引及求交檢索的過程。如下爲建立倒排索引的基本過程:

  

  (1)頁面分析的過程實際上是將原始頁面的不同部分進行識別並標記,例如:title、keywords、content、link、anchor、評論、其他非重要區域等等;

  (2)分詞的過程實際上包括了切詞分詞同義詞轉換同義詞替換等等,以對某頁面title分詞爲例,得到的將是這樣的數據:term文本、termid、詞類、詞性等等;

  (3)之前的准備工作完成後,接下來即是建立倒排索引,形成{termàdoc},可以粗略的理解爲如下,爲什麽是【term->doc】,而不是直接應用【doc->term】呢?

  

  上述即是索引系統中的倒排索引過程,是搜索引擎實現毫秒級檢索非常重要的一個環節。

  來源:SEO搜尋引擎優化 - SEO自學網 轉載注明出處!

? 上一篇下一篇 ?   本文關鍵詞: 百度官方資料  搜索引擎原理  

評論列表:

站長SEO學院
第一節:百度搜索引擎工作原理
第二節:建設對搜索引擎友好的站點
第三節:如何進行網站內容建設
第四節:整體優化、結構優化、網頁優化
第五節:移動搜索-明確移動搜索優化標准
百度SEO資料文檔
百度搜索引擎優化指南2.0
百度移動搜索優化指南2.0
網站分析白皮書(站長版)
移動站點該如何優化
建設對百度友好的站點
百度搜索引擎網頁質量白皮書
石榴算法-綠蘿算法-冰桶算法
新搜索時代下的優化策略
更多百度SEO資料文檔
站長推薦
DIV+CSS布局實例教程-Web標准
网站SEO優化常见问题汇总
SEO優化推广方案该如何写
SEO優化方案步骤
影響網站關鍵詞排名因素總結
影響谷歌搜索引擎排名的因素調查
手機移動端站點適配優化
最近發表