2007年百度之星程序设计大赛试题初赛题目-题1-百度的高级搜索方法
来源:互联网 发布:js array 方法大全 编辑:程序博客网 时间:2024/06/05 14:51
题面描述:
你尝试过在百度上使用 site inurl 语法查询吗 ? 如果还没有的话可以试一下 :)
如输入 site:www.baidu.com inurl:news
则会搜出所有在 www.baidu.com 站点上的包含 "news" 子串的 url 。
现在我们有两份数据,一份是 site_inurl.txt 一份是 url.txt
site_inurl.txt 中每行是一个 site inurl 语法组成的查询串, url.txt 中保存的是 url 列表。
你能否在 url 列表中找出所有能被 site_inurl.txt 中的查询串检索到的 url?
如 site_inurl.txt 内容如下:
site:www.baidu.com inurl:/more
site:zhidao.baidu.com inurl:/browse/
site:www.sina.com.cn inurl:www20041223am
url.txt 内容如下:
http://www.baidu.com/more/
http://www.baidu.com/guding/more.html
http://www.baidu.com/events/20060105/photomore.html
http://hi.baidu.com/browse/
http://hi.baidu.com/baidu/
http://www.sina.com.cn/head/www20021123am.shtml
http://www.sina.com.cn/head/www20041223am.shtml
则你的程序运行完输出的结果应该为:
http://www.baidu.com/more/
http://www.baidu.com/guding/more.html
http://www.sina.com.cn/head/www20041223am.shtml
程序以命令行形式传入这两个文件名,第一个参数为 site_inurl 文件对应的文件名,第二个参数为 url 列表对应的文件名,程序的输出请输出到标准输出。
my answer:
把每个串分去掉不需要的信息,提取出两部分,一个是站点名node.site,一个是字符串node.name
然后用KMP算法进行匹配,KMP算法模版:串中的Find()
没有对特殊情况处理,假设所有输入都正确
#include <iostream>#include <fstream>#include <string>using namespace std;struct node{string str;string site;string name;}url[500];string url_txt;string site_inurl1, site_inurl2;int next[100];void insert(string url_txt, int x);node trans(string a, string b);bool match(node a, node b);void selfcmp(string str);int KMP(string a, string b);int main(){int cnt = 0;ifstream fin1, fin2;fin1.open("url.txt");while(fin1>>url_txt)insert(url_txt, cnt++);fin1.close();fin2.open("site_inurl.txt");while(fin2>>site_inurl1>>site_inurl2){node target = trans(site_inurl1, site_inurl2);selfcmp(target.name);for(int i = 0; i < cnt; i++){if(match(url[i], target))cout<<url[i].str<<endl;}}fin2.close();return 0;}void insert(string url_txt, int x){url[x].str = url_txt;url[x].site = "";url[x].name = "";int j = 7;while(url_txt[j] != '/')url[x].site += url_txt[j++];while(url_txt[j] != '\0')url[x].name += url_txt[j++];}node trans(string a, string b){node ret;ret.site == "";int j = 5;while(a[j] != '\0')ret.site += a[j++];j = 6;while(b[j] != '\0')ret.name += b[j++];return ret;}bool match(node a, node b){if(a.site != b.site)return 0;if(KMP(a.name, b.name)>=0)return 1;return 0;}int KMP(string a, string b){ int la = a.length(); int lb = b.length(); int i,j; for(i=j=0; i<la&&j<lb; i++) { if(a[i] == b[j]) j++; else if(j) { j = next[j-1]+1; i--; } } return j==lb?(i-lb):-1; } void selfcmp(string str){ int len = str.length(); memset(next, 0 , sizeof(next)); int i = 0, j; next[0] = -1; for(j = 1; j < len; j++) { for(i = next[j-1]; i>=0&&(str[i+1]!=str[j]); i = next[i]) ; next[j] = (str[i+1]==str[j]) ? i+1 : -1; } }
- 2007年百度之星程序设计大赛试题初赛题目-题1-百度的高级搜索方法
- 2007年百度之星程序设计大赛初赛题目——百度的高级搜索方法
- 2006年百度之星程序设计大赛试题初赛题目-题1-饭团的烦恼
- 2007年百度之星程序设计大赛试题初赛题目-题4-百度时间
- 2007年百度之星程序设计大赛试题初赛题目-题3-实习生小胖的百度网页过滤器
- 2005年百度之星程序设计大赛试题初赛题目
- 2006年百度之星程序设计大赛试题初赛题目-题2-蝈蝈式的记分
- 2006年百度之星程序设计大赛试题初赛题目-题3-变态的比赛规则
- 2007年百度之星程序设计大赛试题初赛题目-题2-Wii 游戏开始啦!
- 2005年百度之星程序设计大赛试题初赛题目-题1
- 2006年百度之星程序设计大赛试题初赛题目-题6-百度语言翻译机
- 2005年百度之星程序设计大赛初赛题目(1)
- 2005年百度之星程序设计大赛试题初赛题目-题2
- 2005年百度之星程序设计大赛试题初赛题目-题3
- 2005年百度之星程序设计大赛试题初赛题目-题4
- 2006年百度之星程序设计大赛试题初赛题目-题4-剪刀石头布
- 2006年百度之星程序设计大赛试题初赛题目-题5-座位调整
- 2005年百度之星程序设计大赛初赛题目(2)
- web.xml
- ios4及ios5下自定义NavigationBar的返回按钮
- 黑马程序员-004ADO.NET的琐碎知识
- 昨晚上和duwei他们一起吃的饭
- 骨牌铺方格 (递推)
- 2007年百度之星程序设计大赛试题初赛题目-题1-百度的高级搜索方法
- c++文件处理
- OCZ Synapse Cache——打造你的台式机三级存储架构
- 中国联通计划2012年新增5000万3G用户
- java使用Unicode码对中文进行排序
- tomcat7配置问题 jre_home
- 三星“机海”战术追苹果 智能机双寡头格局初现
- 英国当地法院驳回诺基亚上诉请求
- 中国智能手机出货量超过功能机