采集规则概述
织梦CMS内置了内容采集功能,可以通过配置采集规则来自动抓取其他网站的文章数据并导入到指定栏目中。采集规则定义了从目标页面中提取标题、正文、图片等字段的匹配方式。
一、创建采集节点
- 进入
采集 > 采集节点管理 - 点击"增加新节点"
- 填写基本配置:
节点名称: 科技资讯采集 目标站编码: UTF-8(根据目标站实际编码) 列表网址: https://example.com/tech/list_(*).html 文章网址: https://example.com/tech/(*).html 所属栏目: 选择目标栏目(科技资讯) 采集页数: 5 每批采集数: 20
二、配置列表页匹配规则
使用正则表达式或HTML区域匹配来提取文章列表:
<!-- 列表页区域匹配 --> 列表区域开始HTML: <ul class="article-list"> 列表区域结束HTML: </ul> 每条记录开始HTML: <li> 每条记录结束HTML: </li> <!-- 文章链接提取规则 --> 链接匹配规则: <a href="[url]"> 链接过滤规则: 必须包含 /tech/ <!-- 或使用正则表达式 --> 文章链接匹配: <a href="([^"]+)"[^>]*>
三、配置内容页匹配规则
定义如何从文章页面提取各个字段:
<!-- 标题提取 --> 标题开始HTML: <h1> 标题结束HTML: </h1> 标题过滤规则: 去除空格 <!-- 正文提取 --> 正文开始HTML: <div class="content"> 正文结束HTML: <div class="related"> 内容过滤规则: - 去除 <script> 标签及其内容 - 去除 <style> 标签及其内容 - 保留 <img> 标签 - 去除多余空行 <!-- 文章来源提取 --> 来源开始HTML: <span class="source"> 来源结束HTML: </span> <!-- 关键词提取 --> 关键词开始HTML: <meta name="keywords" content=" 关键词结束HTML: "
四、高级采集设置
<!-- 采集选项 --> 是否下载远程图片: 是(将外站图片存到本地) 图片保存目录: /uploads/allimg/ 是否去除外部链接: 是 标题重复处理: 跳过 / 更新 内容替换规则: 旧域名.com → 新域名.com copyright XX → copyright 你的网站 <!-- 采集时间控制 --> 每次采集间隔: 3秒(避免被目标站屏蔽) 每日采集上限: 200篇 采集开始时间: 凌晨2:00-6:00(低峰期采集)
五、运行采集任务
- 手动采集:在采集节点管理中点击"采集"按钮
- 定时自动采集:通过Crontab定时任务执行
# Linux Crontab - 每天凌晨3点自动采集 0 3 * * * /usr/bin/php /www/web/yourdomain/dede/co_get.php >> /www/web/logs/collect.log
六、采集内容的质量控制
<!-- 采集后的内容标记 --> 采集文章标记: 在标题前添加"[转载]" 采集文章状态: 待审核(-1,需人工审核后发布) 采集文章来源: 自动填写原始来源链接 <!-- 内容去重 --> -- 检查已采集的文章 SELECT COUNT(*) FROM dede_archives WHERE title='待采集的文章标题' AND typeid=目标栏目ID; <!-- 如果已存在则跳过 -->
法律提醒:采集他人网站内容前务必确认对方是否允许转载。未经授权的大量采集可能涉及版权纠纷。建议只采集允许转载的公开内容,并注明原始出处和作者信息,遵守robots.txt协议。