CMSware常用采集语法
查看全部词条命名空间:Main
导航:返回上一页
注意:这里的“常用”是指可以用于多数页面,但绝对不是“万用”
索引页有效区域定位
这个最简单,建议为空,不是必要的填写反而影响效率,也可以用下面的:/(.*)<\/html>/isU
有效内容页URL过虑
/href=[\"\'@]([^<>\"\']+)[\"\'@][\s>]/isU基本可以通杀了- -不过既然覆盖面广了肯定就不会太准了,也就是说所有的链接都会抓来
再给两个范围比较小的:
/href=[\"\'@]([^<>\s\"\']+.[shtml]+)[\"\'@][\s>]+/isU
/href=[\"\'@]([^<>\s\"\']+.[asphpjx]+/?[a-z]+=[0-9]+)[\"\'@][\s>]+/isU
或者就直接把两个放一起:
/href=[\"\'@]([^<>\s\"\']+.[shtml]+)[\"\'@][\s>]+|href=[\"\'@]([^<>\s\"\']+.[asphpjx]+/?[a-z]+=[0-9]+)[\"\'@][\s>]+/isU
如果要再精确点的话:
/href=[\"\'@]([^<>\s\"\']+[0-9]+.[shtml]+)[\"\'@][\s>]+|href=[\"\'@]([^<>\s\"\']+.[asphpjx]+/?[a-z]+=[0-9]+)[\"\'@][\s>]+/isU
关键是在于链接的名称,就是红色部分
- 如果是全数字就可以[0-9]+
- 如果混有英文就[0-9a-z]+
- 如果有符号比如-就[0-9\-]+
新闻标题
如果是([^<>\s]+)[^\s\-]+<\/title>/isU
/如果页面有h1,最好就是用这个了(.*)<\/h1>/isU
多页采集
比如需要采集http://edu.qq.com/kaoyan/fuxizhidao01.htm ... http://edu.qq.com/kaoyan/fuxizhidao08.htm使用如下的索引页规则
http://edu.qq.com/kaoyan/fuxizhidao{0[1,8,0]}.htm
规则说明: {A[B,C,D]}
“{...}”是索引页分页语法定义
- A:附加字符
- B:开始页数
- C:结束页数
- D:采集的第一页是否从默认初始页(去掉“{...}”的URL)开始,是的话填“1”,否则填“0”
- 举例1-采集索引页URL规则1
http://edu.qq.com/kaoyan/fuxizhidao{0[1,8,1]}.htm
可以采集如下页面:
http://edu.qq.com/kaoyan/fuxizhidao.htm
http://edu.qq.com/kaoyan/fuxizhidao01.htm
http://edu.qq.com/kaoyan/fuxizhidao02.htm
...
http://edu.qq.com/kaoyan/fuxizhidao08.htm
- 举例2-采集索引页URL规则2
http://edu.qq.com/kaoyan/fuxizhidao{0[1,8,0]}.htm
可以采集如下页面:
http://edu.qq.com/kaoyan/fuxizhidao01.htm
http://edu.qq.com/kaoyan/fuxizhidao02.htm
...
http://edu.qq.com/kaoyan/fuxizhidao08.htm
规则1比规则2多采集了一个
- 举例3-采集索引页URL规则3
http://www.blueidea.com/tech/web/index{_[2,8,1]}.asp
可以采集如下页面:
http://www.blueidea.com/tech/web/index.asp
http://www.blueidea.com/tech/web/index_2.asp
http://www.blueidea.com/tech/web/index_3.asp
...
http://www.blueidea.com/tech/web/index_8.asp
- 举例4-采集索引页URL规则4
http://www.blueidea.com/tech/web/index{_[2,8,0]}.asp
可以采集如下页面:
http://www.blueidea.com/tech/web/index_2.asp
http://www.blueidea.com/tech/web/index_3.asp
...
http://www.blueidea.com/tech/web/index_8.asp
多页采集索引页URL规则
http://www.xinhuanet.com/newscenter/xhyw{_[1,20]}.htm
使用以上的规则就可以采集如下共20个页面
http://www.xinhuanet.com/newscenter/xhyw.htm http://www.xinhuanet.com/newscenter/xhyw_1.htm http://www.xinhuanet.com/newscenter/xhyw_2.htm http://www.xinhuanet.com/newscenter/xhyw_3.htm ... .. . http://www.xinhuanet.com/newscenter/xhyw_20.htm
过虑函数管道
通过使用==>[采集函数名称]就可以加入一个过虑管道{DATA} ==>[clearHTML]==>[localizeImg]==>helloworld
内容图片本地化
使用过虑函数实现:localizeImg
{DATA}
| {DATA} |