網(wǎng)絡(luò)蜘蛛




網(wǎng)絡(luò)蜘蛛(Web Spider)又稱為:“網(wǎng)絡(luò)爬蟲”,“機器人”,簡稱“蜘蛛”。是通過網(wǎng)頁的鏈接地址來尋找網(wǎng)頁,從網(wǎng)站某一個頁面(通常是首頁)開始,讀取網(wǎng)頁的內(nèi)容,找到在網(wǎng)頁中的其它鏈接地址,然后通過這些鏈接地址尋找下一個網(wǎng)頁,這樣一直循環(huán)下去,直到把這個網(wǎng)站所有的網(wǎng)頁都抓取完為止。如果把整個互聯(lián)網(wǎng)當(dāng)成一個網(wǎng)站,那么網(wǎng)絡(luò)蜘蛛就可以用這個原理把互聯(lián)網(wǎng)上所有的網(wǎng)頁都抓取下來。
網(wǎng)絡(luò)蜘蛛就是一個爬行程序,一個抓取網(wǎng)頁的程序。網(wǎng)絡(luò)蜘蛛與搜索引擎有著比較密切的關(guān)系,目前全球知名的搜索引擎google、百度、雅虎等都為各自開發(fā)了網(wǎng)絡(luò)蜘蛛程序。