A. 什麼是搜索引擎舉例說明!
所謂搜索引擎,就是Internet網上用來查找文件、檔案的一個智能化的機器人。我們現在所說的搜索引擎都是基於WWW的,也就是基於網頁的檢索。現在,根據這種智能化機器人的工作方式,很多人又把它稱作爬行蜘蛛,或機械手。
但是,這些其實並不是互聯網上最早的信息檢索伺服器。在整個Internet有一些稱為文件、檔案伺服器的計算機,這種伺服器是Internet上,用來查找其標題,滿足特定條件的所有文檔的自動搜索服務的工具。
為了從匿名FTP伺服器上下載一個文件,必須知道這個文件的所在地,即必須知道這個匿名FTP伺服器的地址,及文件所在的目錄名。所以,這種信息檢索伺服器,就是幫助用戶在遍及全世界的無數個FTP伺服器中,尋找文件的工具。它另外還被稱作文檔查詢伺服器。用戶只要給出所要查找文件的全名或部分名字,文檔查詢伺服器就會幫用戶查出,在哪些FTP伺服器上存放著這樣的文件。
使用信息檢索伺服器,進行查詢要查找的文件名或部分文件名,必須知道某個或幾個信息檢索伺服器的地址。才能幫助你找到你需要的文件,或目錄的匿名FTP主機的名字。也就是說,當你想要檢索一個你需要了解的文件或目錄時,你要做的事情是告訴信息檢索伺服器。你要檢索什麼,信息檢索伺服器將按照你提供的要求進行檢索,然後顯示每一個包含有那份文件或目錄的匿名FTP主機的名字。信息檢索伺服器最後會把檢索者檢索的文件詳細的告訴你目錄路徑。這樣,你就可以輕易地從相應的FTP主機中,取得你所需要的FTP文件。
信息檢索伺服器經歷了長達20年左右的發展,逐步改進,完善。名稱也逐步被統稱為爬行蜘蛛,機械手,搜索引擎。
搜索引擎的分類
從搜索引擎的工作原理上來區分,搜索引擎有三種基本類型;
第一類是純技術型的全文檢索搜索引擎,如google yahoo等,其原理是通過機器手(即Spider程序)到各個網站收集,存儲信息,並建立索引資料庫供用戶查詢。
第二類稱為分類目錄搜索引擎,這種搜索引擎並不採集網站的任何信息,而是利用各網站向搜索引擎提交網站信息時,填寫的關鍵詞和網站描述等資料,經過人工審核編輯後,如果符合網站登錄的條件,則輸入資料庫以供查詢。
第三類稱為元搜索引擎 ,元搜索引擎(MetaSearch)的特點是在接受用戶查詢請求時,同時在其他多個引擎上進行搜索,把多個獨立搜索引擎的搜索結果整合、控制、優化,再把搜索結果輸出到客戶端。元搜索引擎不需要龐大的網頁資料庫,而能夠搜索到更加豐富、准確的內容。利用其它獨立搜索引擎整合、控制、優化搜索結果的技術稱為「元搜索技術(Meta-Searching Technique)」,是元搜索引擎的核心技術。在搜索結果排列方面,有的直接按來源引擎排列搜索結果,有的則按自定的規則將結果重新排列組合。
參考 網路,谷歌,雅虎,搜搜,搜狗,有道,必應
B. 搜索引擎的分類及其工作原理
搜索引擎的分類:
1、全文索引
搜索引擎分類部分提到過全文搜索引擎從網站提取信息建立網頁資料庫的概念。搜索引擎的自動信息搜集功能分兩種。一種是定期搜索,即每隔一段時間,搜索引擎主動派出「蜘蛛」程序,對一定IP地址范圍內的互聯網網站進行檢索,一旦發現新的網站,它會自動提取網站的信息和網址加入自己的資料庫。
2、目錄索引
目錄索引也稱為:分類檢索,是網際網路上最早提供WWW資源查詢的服務,主要通過搜集和整理網際網路的資源,根據搜索到網頁的內容,將其網址分配到相關分類主題目錄的不同層次的類目之下,形成像圖書館目錄一樣的分類樹形結構索引。
3、元搜索
元搜索引擎接受用戶查詢請求後,同時在多個搜索引擎上搜索,並將結果返回給用戶。著名的元搜索引擎有InfoSpace、Dogpile、Vivisimo等,中文元搜索引擎中具代表性的是搜星搜索引擎。在搜索結果排列方面,有的直接按來源排列搜索結果,如Dogpile;有的則按自定的規則將結果重新排列組合。
搜索引擎的工作原理:
第一步:爬行
搜索引擎是通過一種特定規律的軟體跟蹤網頁的鏈接,從一個鏈接爬到另外一個鏈接,像蜘蛛在蜘蛛網上爬行一樣,所以被稱為「蜘蛛」也被稱為「機器人」。搜索引擎蜘蛛的爬行是被輸入了一定的規則的,它需要遵從一些命令或文件的內容。
第二步:抓取存儲
搜索引擎是通過蜘蛛跟蹤鏈接爬行到網頁,並將爬行的數據存入原始頁面資料庫。其中的頁面數據與用戶瀏覽器得到的HTML是完全一樣的。搜索引擎蜘蛛在抓取頁面時,也做一定的重復內容檢測,一旦遇到權重很低的網站上有大量抄襲、採集或者復制的內容,很可能就不再爬行。
第三步:預處理
搜索引擎將蜘蛛抓取回來的頁面,進行各種步驟的預處理。
第四步:排名
用戶在搜索框輸入關鍵詞後,排名程序調用索引庫數據,計算排名顯示給用戶,排名過程與用戶直接互動的。但是,由於搜索引擎的數據量龐大,雖然能達到每日都有小的更新,但是一般情況搜索引擎的排名規則都是根據日、周、月階段性不同幅度的更新。
(2)引擎採集和存儲信息擴展閱讀:
十大搜索引擎:
1、網路
網路是全球最大的中文搜索引擎、最大的中文網站。2000年1月由李彥宏創立於北京中關村,致力於向人們提供「簡單,可依賴」的信息獲取方式。「網路」二字源於中國宋朝詞人辛棄疾的《青玉案·元夕》詞句「眾里尋他千網路」,象徵著網路對中文信息檢索技術的執著追求。
2、谷歌
Google(中文名:谷歌),是一家美國的跨國科技企業,致力於互聯網搜索、雲計算、廣告技術等領域,開發並提供大量基於互聯網的產品與服務,其主要利潤來自於AdWords等廣告服務。Google由當時在斯坦福大學攻讀理工博士的拉里·佩奇和謝爾蓋·布盧姆共同創建,因此兩人也被稱為「Google Guys」。
3、雅虎
雅虎是美國著名的互聯網門戶網站,也是20世紀末互聯網奇跡的創造者之一。其服務包括搜索引擎、電郵、新聞等,業務遍及24個國家和地區,為全球超過5億的獨立用戶提供多元化的網路服務。同時也是一家全球性的網際網路通訊、商貿及媒體公司。
4、搜狗
搜狗是搜狐公司的旗下子公司,於2004年8月3日推出,目的是增強搜狐網的搜索技能,主要經營搜狐公司的搜索業務。在搜索業務的同時,也推出搜狗輸入法、搜狗高速瀏覽器。
5、愛問
作為首個中文智慧型互動搜索引擎,「愛問」突破了由GOOGLE、網路為代表的演算法致勝的搜索模式。 新浪「愛問」在保留了傳統演算法技術在常規網頁搜索的強大功能外,以一個獨有的互動問答平台彌補了傳統演算法技術在搜索界面上智慧性和互動性的先天不足。
6、搜搜
搜搜是騰訊旗下的搜索網站,是騰訊主要的業務單元之一。網站於2006年3月正式發布並開始運營。搜搜目前已成為中國網民首選的三大搜索引擎之一,主要為網民提供實用便捷的搜索服務,同時承擔騰訊全部搜索業務,是騰訊整體在線生活戰略中重要的組成部分之一。
7、有道
有道是網易旗下利用大數據技術提供移動互聯網應用的子公司。網易有道公司已推出有道詞典、有道雲筆記、惠惠網、有道推廣等一系列產品。
8、中搜
中搜是中國國內領先的第三代搜索引擎服務及技術應用提供商。依託第三代搜索引擎和個性化微件,實現了人類知識和搜索技術的融合,通過兩大WEB站點、移動APP、雲服務平台等載體為網民及企業提供全新的第三代搜索引擎體驗。
9、360搜索
360綜合搜索,屬於元搜索引擎,是搜索引擎的一種,是通過一個統一的用戶界面幫助用戶在多個搜索引擎中選擇和利用合適的(甚至是同時利用若干個)搜索引擎來實現檢索操作,是對分布於網路的多種檢索工具的全局控制機制。
10、天網
天網搜索的前身是北大天網。北大天網由北京大學網路實驗室研究開發,是國家重點科技攻關項目「中文編碼和分布式中英文信息發現」的研究成果。北大天網於1997年10月29日正式在 CERNET上向廣大互聯網用戶提供Web信息搜索及導航服務,是國內第一個基於網頁索引搜索的搜索引擎。
參考資料來源:網路——搜索引擎
C. 目錄類搜索引擎採集和存儲信息一般採用的方式是什麼 電老師給我們的作業
人工方式
D. 數據採集引擎真的能夠採集獲取實時的數據嗎
可以,用101 異構數據採集引擎可以採集實時的數據,也可以採集歷史數據,關鍵在於,它不需要軟體廠商配合做介面,節約了介面的費用,和協調的人工還有時間成本等,非常劃算。
E. 網路搜索引擎的搜集方法
一旦蜘蛛程序完成了網頁信息收集工作(我們應當注意,這是一項永遠不可能真正完成的工作——網頁不斷更新的特性意味著蜘蛛程序需要不斷爬網),搜索引擎就必須以一種有效方式存儲這些信息。要讓收集到的數據可供用戶使用,涉及兩個關鍵環節: 在最簡單的情況下,搜索引擎只需存儲詞語和詞語所在地址。實際上,這樣做會限制搜索引擎的用途,因為這種方式無法區別詞語在網頁中是被重點使用,還是略一提及,也無法區別詞語是使用一次還是多次,或該網頁上是否含有其它包括該關鍵字的網頁的鏈接。換句話說,這樣做將無法建立排名表,無法把最有用的網頁放在查詢結果列表的頂端。
為了獲得更多有用信息,大多數搜索引擎存儲的信息不僅僅是詞語和網址,還可能存儲著該字在網頁中出現的次數。搜索引擎可能會為每個詞條指定一個權重,按照詞語出現在文檔開頭、網頁副標題、鏈接、元標記或標題的順序,權重依次增大。各商業搜索引擎指定索引中詞語權重的公式有所不同。這從一個側面解釋了為什麼使用不同搜索引擎來搜索相同關鍵字,卻會產生不同的搜索結果列表,網頁排列順序也有所不同。 如果忽略搜索引擎存儲的額外信息的准確組合,將這些數據進行編碼可以節省存儲空間。比如,最初的Google論文描述了使用兩個位元組(每個位元組8比特)來存儲權重信息——單詞是不是大寫、字型大小大小、位置以及其他用來為數據確定級別的信息。每個因素大概占據兩位元組中的兩三個比特(8比特=1位元組)。因此,大量信息便能以一種壓縮率極高的方式存儲下來。信息被壓縮之後,就可以建立索引了。
F. 全文搜索引擎一般採用什麼原理來採集信息
全文搜索引擎的工作原理包括如下三個過程:
首先在互聯中發現、搜集網頁信息;即我們通常說的收錄
同時對信息進行提取和組織建立索引庫;再由檢索器根據用戶輸入的查詢關鍵字,在索引庫中快速檢出文檔,進行文檔與查詢的相關度評價,對將要輸出的結果進行排序,
通過搜索查詢結果返回給用戶。
G. 誰能介紹下幾種搜索引擎,寫出它們的特點
搜索引擎有兩種基本類型:一類是純技術型的全文檢索搜索引擎,如google、AltaVista、Inktomi等,其原理是通過機器手(即Spider程序)到各個網站收集、存儲信息,並建立索引資料庫供用戶查詢。需要說明的是,這些信息並不是搜索引擎即時從互聯網上檢索得到的,通常所說的搜索引擎,其實是一個收集了大量網站/網頁資料並按照一定規則建立索引的在線資料庫,如2004年3月底google收錄的網頁數量已經超過42億個,這樣,當用戶檢索時才可以在很短的時間內反饋大量的結果。
另一類稱為分類目錄,這種「搜索引擎」並不採集網站的任何信息,而是利用各網站向「搜索引擎」提交網站信息時填寫的關鍵詞和網站描述等資料,經過人工審核編輯後,如果符合網站登錄的條件,則輸入資料庫以供查詢。yahoo是分類目錄的典型代表,國內的搜狐、新浪等搜索引擎也是從分類目錄發展起來的。分類目錄的好處是,用戶可以根據目錄有針對性地逐級查詢自己需要的信息,而不是像技術性搜索引擎一樣同時反饋大量的信息,而這些信息之間的關聯性並不一定符合用戶的期望。
H. 目前的搜索引擎是主要是通過什麼來開採集網頁數據的
搜索引擎採集數據的程序被稱為「爬蟲」或「蜘蛛」,爬蟲根據別的網頁上面的鏈接搜索到你網站的地址,然後以該地址為入口對你網站上的頁面數據進行採集。一個網頁要想被爬蟲採集必須依賴於兩個條件:1、該網頁要提供一個對外開放的鏈接;2、該網頁在robot規則中沒有被禁止。這樣做的目的是讓網站能夠保護自己的敏感內容不被泄漏。但是可能有搜索引擎不遵守這個規則,比如360搜索,它可以他通過你安裝的360瀏覽器得到一個並沒有對外開放的鏈接地址,然後也會無視該網站的robot規則,這樣會導致網站的敏感信息被外泄。
I. 搜索引擎是如何搜索到信息
隨著互聯網的迅猛發展、WEB信息的增加,用戶要在信息海洋里查找自己所需的信息,就象大海撈針一樣,搜索引擎技術恰好解決了這一難題(它可以為用戶提供信息檢索服務)。搜索引擎是指互聯網上專門提供檢索服務的一類網站,這些站點的伺服器通過網路搜索軟體(例如網路搜索機器人)或網路登錄等方式,將Intemet上大量網站的頁面信息收集到本地,經過加工處理建立信息資料庫和索引資料庫,從而對用戶提出的各種檢索作出響應,提供用戶所需的信息或相關指針。用戶的檢索途徑主要包括自由詞全文檢索、關鍵詞檢索、分類檢索及其他特殊信息的檢索(如企業、人名、電話黃頁等)。下面以網路搜索機器人為例來說明搜索引擎技術。
1.網路機器人技術
網路機器人(Robot)又被稱作Spider、Worm或Random,核心目的是為獲取Intemet上的信息。一般定義為「一個在網路上檢索文件且自動跟蹤該文件的超文本結構並循環檢索被參照的所有文件的軟體」。機器人利用主頁中的超文本鏈接遍歷WWW,通過U趾引用從一個HT2LIL文檔爬行到另一個HTML文檔。網上機器人收集到的信息可有多種用途,如建立索引、HIML文件合法性的驗證、uRL鏈接點驗證與確認、監控與獲取更新信息、站點鏡像等。
機器人安在網上爬行,因此需要建立一個URL列表來記錄訪問的軌跡。它使用超文本,指向其他文檔的URL是隱藏在文檔中,需要從中分析提取URL,機器人一般都用於生成索引資料庫。所有WWW的搜索程序都有如下的工作步驟:
(1)機器人從起始URL列表中取出URL並從網上讀取其指向的內容;
(2)從每一個文檔中提取某些信息(如關鍵字)並放入索引資料庫中;
(3)從文檔中提取指向其他文檔的URL,並加入到URL列表中;
(4)重復上述3個步驟,直到再沒有新的URL出現或超出了某些限制(時間或磁碟空間);
(5)給索引資料庫加上檢索介面,向網上用戶發布或提供給用戶檢索。
搜索演算法一般有深度優先和廣度優先兩種基本的搜索策略。機器人以URL列表存取的方式決定搜索策略:先進先出,則形成廣度優先搜索,當起始列表包含有大量的WWW伺服器地址時,廣度優先搜索將產生一個很好的初始結果,但很難深入到伺服器中去;先進後出,則形成深度優先搜索,這樣能產生較好的文檔分布,更容易發現文檔的結構,即找到最大數目的交叉引用。也可以採用遍歷搜索的方法,就是直接將32位的IP地址變化,逐個搜索整個Intemet。
搜索引擎是一個技術含量很高的網路應用系統。它包括網路技術、資料庫技術動標引技術、檢索技術、自動分類技術,機器學習等人工智慧技術。
2.索引技術
索引技術是搜索引擎的核心技術之一。搜索引擎要對所收集到的信息進行整理、分類、索引以產生索引庫,而中文搜索引擎的核心是分詞技術。分詞技術是利用一定的規則和詞庫,切分出一個句子中的詞,為自動索引做好准備。目前的索引多採用Non—clustered方法,該技術和語言文字的學問有很大的關系,具體有如下幾點:
(1)存儲語法庫,和詞彙庫配合分出句子中的詞彙;
(2)存儲詞彙庫,要同時存儲詞彙的使用頻率和常見搭配方式;
(3)詞彙寬,應可劃分為不同的專業庫,以便於處理專業文獻;
(4)對無法分詞的句子,把每個字當作詞來處理。
索引器生成從關鍵詞到URL的關系索引表。索引表一般使用某種形式的倒排表(1nversionUst),即由索引項查找相應的URL。索引表也要記錄索引項在文檔中出現的位置,以便檢索器計算索引項之間的相鄰關系或接近關系,並以特定的數據結構存儲在硬碟上。
不同的搜索引擎系統可能採用不盡相同的標引方法。例如Webcrawler利用全文檢索技術,對網頁中每一個單詞進行索引;Lycos只對頁名、標題以及最重要的100個注釋詞等選擇性詞語進行索引;Infoseek則提供概念檢索和片語檢索,支持and、or、near、not等布爾運算。檢索引擎的索引方法大致可分為自動索引、手工索引和用戶登錄三類。
3. 檢索器與結果處理技術
檢索器的主要功能是根據用戶輸入的關鍵詞在索引器形成的倒排表中進行檢索,同時完成頁面與檢索之間的相關度評價,對將要輸出的結果進行排序,並實現某種用戶相關性反饋機制。
通過搜索引擎獲得的檢索結果往往成百上千,為了得到有用的信息,常用的方法是按網頁的重要性或相關性給網頁評級,進行相關性排序。這里的相關度是指搜索關鍵字在文檔中出現的額度。當額度越高時,則認為該文檔的相關程度越高。能見度也是常用的衡量標准之一。一個網頁的能見度是指該網頁入口超級鏈接的數目。能見度方法是基於這樣的觀點:一個網頁被其他網頁引用得越多,則該網頁就越有價值。特別地,一個網頁被越重要的網頁所引用,則該網頁的重要程度也就越高。結果處理技術可歸納為:
(1)按頻次排定次序 通常,如果一個頁麵包含了越多的關鍵詞,其搜索目標的相關性應該越好,這是非常合平常理的解決方案。
(2)按頁面被訪問度排序 在這種方法中,搜索引擎會記錄它所搜索到的頁面被訪問的頻率。人們訪問較多的頁面通常應該包含比較多的信息,或者有其他吸引入的長處。這種解決方案適合一般的搜索用戶,而因為大部分的搜索引擎都不是專業性用戶,所以這種方案也比較適合一般搜索引擎使用。
(3)二次檢索 進一步凈化(比flne)結果,按照一定的條件對搜索結果進行優化,可以再選擇類別、相關詞進行二次搜索等。
由於目前的搜索引擎還不具備智能,除非知道要查找的文檔的標題,否則排列第一的結果未必是「最好」的結果。所以有些文檔盡管相關程度高,但並不一定是用戶最需要的文檔。
搜索引擎技術的行業應用:
搜索引擎的行業應用一般指類似於千瓦通信提供的多種搜索引擎行業與產品應用模式,大體上分為如下幾種形式:
1、 政府機關行業應用
n 實時跟蹤、採集與業務工作相關的信息來源。
n 全面滿足內部工作人員對互聯網信息的全局觀測需求。
n 及時解決政務外網、政務內網的信息源問題,實現動態發布。
n 快速解決政府主網站對各地級子網站的信息獲取需求。
n 全面整合信息,實現政府內部跨地區、跨部門的信息資源共享與有效溝通。
n 節約信息採集的人力、物力、時間,提高辦公效率。
2、企業行業應用
n 實時准確地監控、追蹤競爭對手動態,是企業獲取競爭情報的利器。
n 及時獲取競爭對手的公開信息以便研究同行業的發展與市場需求。
n 為企業決策部門和管理層提供便捷、多途徑的企業戰略決策工具。
n 大幅度地提高企業獲取、利用情報的效率,節省情報信息收集、存儲、挖掘的相關費用,是提高企業核心競爭力的關鍵。
n 提高企業整體分析研究能力、市場快速反應能力,建立起以知識管理為核心的競爭情報數據倉庫,是提高企業核心競爭力的神經中樞。
3、新聞媒體行業應用
n 快速准確地自動跟蹤、採集數千家網路媒體信息,擴大新聞線索,提高採集速度。
n 支持每天對數萬條新聞進行有效抓取。監控范圍的深度、廣度可以自行設定。
n 支持對所需內容智能提取、審核。
n 實現互聯網信息內容採集、瀏覽、編輯、管理、發布的一體化。
4、 行業網站應用
n 實時跟蹤、採集與網站相關的信息來源。
n 及時跟蹤行業的信息來源網站,自動,快速更新網站信息。動態更新信息。
n 實現互聯網信息內容採集、瀏覽、編輯、管理、發布的一體化。
n 針對商務網站提出商務管理模式,大大提高行業網站的商務應用需求。
n 針對資訊網站分類目錄生成,提出用戶生成網站分類結構。並可以實時增加與更新分類結構。不受級數限制。從而大大利高行業的應用性。
n 提供搜索引擎SEO優化專業服務,快速提高行業網站的推廣。
n 提供與CCDC呼叫搜索引擎的廣告合作。建立行業網站聯盟,提高行業網站知名度。
5) 網路信息監察與監控
n 網路輿情系統。如「千瓦通信-網路輿情雷達監測系統」
n 網站信息與內容監察與監控系統,如「千瓦通信-網站信息與內容監測與監察系統(站內神探)」
隨著網際網路的迅猛發展、WEB信息的增加,用戶要在信息海洋里查找信息,就象大海撈
針一樣,搜索引擎技術恰好解決了這一難題(它可以為用戶提供信息檢索服務)。目前,
搜索引擎技術正成為計算機工業界和學術界爭相研究、開發的對象。
搜索引擎(Search Engine)是隨著WEB信息的迅速增加,從1995年開始逐漸發展起來
的技術。據發表在《科學》雜志1999年7月的文章《WEB信息的可訪問性》估計,全球目前
的網頁超過8億,有效數據超過9T,並且仍以每4個月翻一番的速度增長。用戶要在如此浩
瀚的信息海洋里尋找信息,必然會"大海撈針"無功而返。搜索引擎正是為了解決這個"迷航
"問題而出現的技術。搜索引擎以一定的策略在互聯網中搜集、發現信息,對信息進行理解
、提取、組織和處理,並為用戶提供檢索服務,從而起到信息導航的目的。搜索引擎提供
的導航服務已經成為互聯網上非常重要的網路服務,搜索引擎站點也被美譽為"網路門戶"
。搜索引擎技術因而成為計算機工業界和學術界爭相研究、開發的對象。本文旨在對搜索
引擎的關鍵技術進行簡單的介紹,以起到拋磚引玉的作用。
分 類
按照信息搜集方法和服務提供方式的不同,搜索引擎系統可以分為三大類:
1.目錄式搜索引擎:以人工方式或半自動方式搜集信息,由編輯員查看信息之後,人
工形成信息摘要,並將信息置於事先確定的分類框架中。信息大多面向網站,提供目錄瀏
覽服務和直接檢索服務。該類搜索引擎因為加入了人的智能,所以信息准確、導航質量高
,缺點是需要人工介入、維護量大、信息量少、信息更新不及時。這類搜索引擎的代表是
:Yahoo、LookSmart、Open Directory、Go Guide等。
2.機器人搜索引擎:由一個稱為蜘蛛(Spider)的機器人程序以某種策略自動地在互
聯網中搜集和發現信息,由索引器為搜集到的信息建立索引,由檢索器根據用戶的查詢輸
入檢索索引庫,並將查詢結果返回給用戶。服務方式是面向網頁的全文檢索服務。該類搜
索引擎的優點是信息量大、更新及時、毋需人工干預,缺點是返回信息過多,有很多無關
信息,用戶必須從結果中進行篩選。這類搜索引擎的代表是:AltaVista、Northern Ligh
t、Excite、Infoseek、Inktomi、FAST、Lycos、Google;國內代表為:"天網"、悠遊、O
penFind等。
3.元搜索引擎:這類搜索引擎沒有自己的數據,而是將用戶的查詢請求同時向多個搜
索引擎遞交,將返回的結果進行重復排除、重新排序等處理後,作為自己的結果返回給用
戶。服務方式為面向網頁的全文檢索。這類搜索引擎的優點是返回結果的信息量更大、更
全,缺點是不能夠充分使用所使用搜索引擎的功能,用戶需要做更多的篩選。這類搜索引
擎的代表是WebCrawler、InfoMarket等。
性 能 指 標
我們可以將WEB信息的搜索看作一個信息檢索問題,即在由WEB網頁組成的文檔庫中檢索
出與用戶查詢相關的文檔。所以我們可以用衡量傳統信息檢索系統的性能參數-召回率(R
ecall)和精度(Pricision)衡量一個搜索引擎的性能。
召回率是檢索出的相關文檔數和文檔庫中所有的相關文檔數的比率,衡量的是檢索系
統(搜索引擎)的查全率;精度是檢索出的相關文檔數與檢索出的文檔總數的比率,衡量
的是檢索系統(搜索引擎)的查准率。對於一個檢索系統來講,召回率和精度不可能兩全
其美:召回率高時,精度低,精度高時,召回率低。所以常常用11種召回率下11種精度的
平均值(即11點平均精度)來衡量一個檢索系統的精度。對於搜索引擎系統來講,因為沒
有一個搜索引擎系統能夠搜集到所有的WEB網頁,所以召回率很難計算。目前的搜索引擎系
統都非常關心精度。
影響一個搜索引擎系統的性能有很多因素,最主要的是信息檢索模型,包括文檔和查詢
的表示方法、評價文檔和用戶查詢相關性的匹配策略、查詢結果的排序方法和用戶進行相
關度反饋的機制。
主 要 技 術
一個搜索引擎由搜索器、索引器、檢索器和用戶介面等四個部分組成。
1.搜索器
搜索器的功能是在互聯網中漫遊,發現和搜集信息。它常常是一個計算機程序,日夜
不停地運行。它要盡可能多、盡可能快地搜集各種類型的新信息,同時因為互聯網上的信
息更新很快,所以還要定期更新已經搜集過的舊信息,以避免死連接和無效連接。目前有
兩種搜集信息的策略:
● 從一個起始URL集合開始,順著這些URL中的超鏈(Hyperlink),以寬度優先、深
度優先或啟發式方式循環地在互聯網中發現信息。這些起始URL可以是任意的URL,但常常
是一些非常流行、包含很多鏈接的站點(如Yahoo!)。
● 將Web空間按照域名、IP地址或國家域名劃分,每個搜索器負責一個子空間的窮盡
搜索。 搜索器搜集的信息類型多種多樣,包括HTML、XML、Newsgroup文章、FTP文件、
字處理文檔、多媒體信息。 搜索器的實現常常用分布式、並行計算技術,以提高信息
發現和更新的速度。商業搜索引擎的信息發現可以達到每天幾百萬網頁。
2.索引器
索引器的功能是理解搜索器所搜索的信息,從中抽取出索引項,用於表示文檔以及生
成文檔庫的索引表。
索引項有客觀索引項和內容索引項兩種:客觀項與文檔的語意內容無關,如作者名、
URL、更新時間、編碼、長度、鏈接流行度(Link Popularity)等等;內容索引項是用來
反映文檔內容的,如關鍵詞及其權重、短語、單字等等。內容索引項可以分為單索引項和
多索引項(或稱短語索引項)兩種。單索引項對於英文來講是英語單詞,比較容易提取,
因為單詞之間有天然的分隔符(空格);對於中文等連續書寫的語言,必須進行詞語的切
分。 在搜索引擎中,一般要給單索引項賦與一個權值,以表示該索引項對文檔的區分
度,同時用來計算查詢結果的相關度。使用的方法一般有統計法、資訊理論法和概率法。短
語索引項的提取方法有統計法、概率法和語言學法。
索引表一般使用某種形式的倒排表(Inversion List),即由索引項查找相應的文檔
。索引表也可能要記錄索引項在文檔中出現的位置,以便檢索器計算索引項之間的相鄰或
接近關系(proximity)。
索引器可以使用集中式索引演算法或分布式索引演算法。當數據量很大時,必須實現即時
索引(Instant Indexing),否則不能夠跟上信息量急劇增加的速度。索引演算法對索引器
的性能(如大規模峰值查詢時的響應速度)有很大的影響。一個搜索引擎的有效性在很大
程度上取決於索引的質量。
3.檢索器 檢索器的功能是根據用戶的查詢在索引庫中快速檢出文檔,進行文檔與
查詢的相關度評價,對將要輸出的結果進行排序,並實現某種用戶相關性反饋機制。
檢索器常用的信息檢索模型有集合理論模型、代數模型、概率模型和混合模型四種。
4.用戶介面
用戶介面的作用是輸入用戶查詢、顯示查詢結果、提供用戶相關性反饋機制。主要的
目的是方便用戶使用搜索引擎,高效率、多方式地從搜索引擎中得到有效、及時的信息。
用戶介面的設計和實現使用人機交互的理論和方法,以充分適應人類的思維習慣。
用戶輸入介面可以分為簡單介面和復雜介面兩種。
簡單介面只提供用戶輸入查詢串的文本框;復雜介面可以讓用戶對查詢進行限制,如
邏輯運算(與、或、非;+、-)、相近關系(相鄰、NEAR)、域名范圍(如.e、.com)
、出現位置(如標題、內容)、信息時間、長度等等。目前一些公司和機構正在考慮制定
查詢選項的標准。
未 來 動 向
搜索引擎已成為一個新的研究、開發領域。因為它要用到信息檢索、人工智慧、計算
機網路、分布式處理、資料庫、數據挖掘、數字圖書館、自然語言處理等多領域的理論和
技術,所以具有綜合性和挑戰性。又由於搜索引擎有大量的用戶,有很好的經濟價值,所
以引起了世界各國計算機科學界和信息產業界的高度關注,目前的研究、開發十分活躍,
並出現了很多值得注意的動向。
1.十分注意提高信息查詢結果的精度,提高檢索的有效性 用戶在搜索引擎上進行
信息查詢時,並不十分關注返回結果的多少,而是看結果是否和自己的需求吻合。對於一
個查詢,傳統的搜索引擎動輒返回幾十萬、幾百萬篇文檔,用戶不得不在結果中篩選。解
決查詢結果過多的現象目前出現了幾種方法:一是通過各種方法獲得用戶沒有在查詢語句
中表達出來的真正用途,包括使用智能代理跟蹤用戶檢索行為,分析用戶模型;使用相關
度反饋機制,使用戶告訴搜索引擎哪些文檔和自己的需求相關(及其相關的程度),哪些
不相關,通過多次交互逐步求精。二是用正文分類(Text Categorization)技術將結果分
類,使用可視化技術顯示分類結構,用戶可以只瀏覽自己感興趣的類別。三是進行站點類
聚或內容類聚,減少信息的總量。
2.基於智能代理的信息過濾和個性化服務
信息智能代理是另外一種利用互聯網信息的機制。它使用自動獲得的領域模型(如We
b知識、信息處理、與用戶興趣相關的信息資源、領域組織結構)、用戶模型(如用戶背景
、興趣、行為、風格)知識進行信息搜集、索引、過濾(包括興趣過濾和不良信息過濾)
,並自動地將用戶感興趣的、對用戶有用的信息提交給用戶。智能代理具有不斷學習、適
應信息和用戶興趣動態變化的能力,從而提供個性化的服務。智能代理可以在用戶端進行
,也可以在伺服器端運行。
3.採用分布式體系結構提高系統規模和性能
搜索引擎的實現可以採用集中式體系結構和分布式體系結構,兩種方法各有千秋。但
當系統規模到達一定程度(如網頁數達到億級)時,必然要採用某種分布式方法,以提高
系統性能。搜索引擎的各個組成部分,除了用戶介面之外,都可以進行分布:搜索器可以
在多台機器上相互合作、相互分工進行信息發現,以提高信息發現和更新速度;索引器可
以將索引分布在不同的機器上,以減小索引對機器的要求;檢索器可以在不同的機器上.
J. 電腦問題
4.D
7.北京時間2005年10月12日 09:00:00 起飛