CMSware采集/正则及函数学习
查看全部词条命名空间:Main
导航:返回上一页
第一课:基础
采集索引页面URL:
待采集的内容链接列表页,一般是网站的2级或3级栏目列表页.(我们在此以下面的为例)
采集索引页URL:
http://www.enet.com.cn/elady/fashion/inforcenter/articlelist.jsp?_current_group=1&_current_page=2&acid=4542
- 采集索引页有效区域定位规则:
用来定位有效的内容链接位置,如下图.(就是我们要采的列表的区块,如下面,可能除了本身的列表外,还有其他栏目的调用列表,所以我们只取中间的,其他的都不要。当然有些栏目本身就一个列表,那这时留空,不用正则)

然后我们右键-查看源文件(这儿要注意下,最好在线用IE右键直接查看,不要另存下来,再用DW或editplus 打开,会有变化),找到一个开始符,一个结束符。
开始符、 结束符必须:从整个源文件最开始,从上到下第一个,不一定非得是惟一的。
如下图:

由上图,我们得到了开始、结束符。
采集索引页有效区域定位规则:
第二课:正则
要采集,就要用到正则,什么是正则?按我最通俗的解释就是:用固定的语句,来对应不固定的内容
CMSware 用的正则的地方有:
- 有效内容页URL过虑规则
- 内容页分页采集自动检测规则
就以上两处,其他的地方都不需要正则。
正则语法:
所有采集正则必须以/开始, /isU结束.格式.即:
- /头标识{DATA}尾标识/isU
- 头/尾标识中的所有/符号必须加个\转义符,也就是