分享

得到网页的最新更新时间

 ShangShujie 2010-05-08
zhengyun_ustc博客专家 发表于2007年3月29日 23:09:10  IP:举 报回复
Incremental Web Search-Tracking Changes in the Web.pdf
这篇论文不知你看过没有?也许有启发。
zhengyun_ustc博客专家 发表于2007年3月29日 23:10:53  IP:举 报回复
其实获取http header最简单的就是用perl,几句话就搞定:
use LWP::UserAgent;
my $ua = new LWP::UserAgent;
$ua->timeout(120);
my $url='http://blog.donews.com/banly/';
my $response = $ua->head($url);
if ($response->is_success) {
print $response->as_string."----";
}
zhengyun_ustc博客专家 发表于2007年3月29日 23:14:11  IP:举 报回复
1:
你只给对方web服务器发送head命令,对方就不会给你网页所有数据,而仅仅是http header信息,很短。很多爬虫就是这么做的,不占用太多流量,就可以知道对方网页有否更新。
2:
100%得知对方更新是不可能的。

    本站是提供个人知识管理的网络存储空间,所有内容均由用户发布,不代表本站观点。请注意甄别内容中的联系方式、诱导购买等信息,谨防诈骗。如发现有害或侵权内容,请点击一键举报。
    转藏 分享 献花(0

    0条评论

    发表

    请遵守用户 评论公约

    类似文章 更多