heritrix3 伪装成GOOGLE进行爬取

来源：互联网发布：windows汉语意思编辑：程序博客网时间：2024/05/21 19:22

伪装成搜索引擎蜘蛛google bot访问需网站, 这样能防止爬虫被封
在crawler-beans.cxml 中修改metadata成下面

Java代码

<bean id="metadata" class="org.archive.modules.CrawlMetadata" autowire="byName">
<property name="operatorContactUrl" value="[see override above]"/>
<property name="jobName" value="[see override above]"/>
<property name="descrip蜘蛛的爬取原理tion" value="[see override above]"/>
<property name="userAgentTemplate"
value="Mozilla/5.0 (compatible; Googlebot/2.1; +@OPERATOR_CONTACT_URL@) "/>
</bean>

伪装Googlebot。许多网站访问时需要注册，但用Google、Baidu等搜索引擎搜索时却可以搜索到全文。这是因为网站对访问者的 User Agent进行了判断，如果是bot，则允许其访问；如果是一般用户，则自动跳转到登陆页面。用User Agent Switcher就可以把自己伪装成Googlebot，进而不用注册也可以访问这些网站。

那么我们也可以伪装成搜索引擎来进入这些页面。我们需要的是修改浏览器的User-Agent
值。