数字化技能提升教程,数字化时代生存宝典

数字化百科 / 词条 / ECMS 6.6/采集正则写法

ECMS 6.6/采集正则写法

查看全部词条命名空间:Main

ECMS 6.6| 安装| 使用| 升级与整合| 新版解密教程|模板标签说明|二次开发| FAQ

帝国CMS的采集正则

作用

通过设置采集正则以便使系统识别你要采集的内容。

帝国CMS的采集正则是什么样的

下面我们用实例讲解:

(1)、假如我们要采集页面的内容页为如下页面:

图1:HTML页面

Cjzz1.gif

图2:查看页面源代码为如下:

Cjzz2.gif

(2)、由上图的源代码内容我们可以得出帝国CMS的采集正则:

新闻标题正则:

    <td>标题:<strong>[!--title--]</strong></td>

新闻内容正则:

    <td>内容:<font color="#FF0000">[!--newstext--]</font></td>

上面中的“[!--title--]”与“[!--newstext--]”分别为“标题”字段与“内容”字段的正则变量。用于指定我们要采集的内容位置。

(3)、由上面我们得出了,帝国CMS采集正则是把正则变量替换要采集内容后的代码内容。

格式:识别代码头部[!--变量名--]识别代码尾部

注意事项:上面的“识别代码头部”一定是要唯一的标记。

表示任意内容的字符:“*”

如果“识别代码头部”中有内容是变化的,那么我们可以用*代替它。如页面源代码为如下,我们要采集下面的链接地址:

<a title="任意可变内容" href="链接地址">标题</a>

通过使用“*”任意内容表示字符,我们可以用下面的正则忽略可变内容,获得链接地址:

<a title="*" href="[!--newsurl--]">

附加说明:[!--newsurl--]为页面链接地址的正则变量。

其他说明

(1)、正则要找出唯一性的开头字符。有时候空格都会成为识别的依据。

(2)、对于特殊字符请在前面加上“\\”,当然直接将特殊字符改为“*”最合适了。

特殊字符如下:

“ )”、“(”、“{”、“}”、“[”、“]”、“\”、“?”等等。


参考来源

ECMS 6.6使用手册导航

安装:

ECMS 6.6 安装

使用:

ECMS建站流程|后台菜单介绍|前台菜单介绍|专业术语介绍|后台栏目管理|后台信息管理|后台专题管理|其他管理操作|采集管理|插件管理|管理员后台操作|管理员后台其他操作管理|后台用户管理|后台会员管理|系统安全设置

升级与整合

打通多个帝国CMS系统的会员整合与同步教程|整合Ucenter接口教程|整合Discuz通行证接口教程|整合PHPwind通行证接口教程|万能会员接口|论坛通行证接口|会员数据从文本文件导入帝国CMS的插件

新版解密教程

教程模型使用相关解密教程|教程模板使用相关解密教程|管理相关解密教程

模板标签说明

网站模板说明|其他模板说明|调用标签使用说明

二次开发

系统目录结构|常用函数介绍|扩展SQL程序编写介绍|插件二次开发格式建议|显示“Hello,world”|显示最新10条新闻|分类信息分页列表

FAQ

ECMS 6.6 FAQ