新闻采集系统使用新闻采集代码用于解析新闻的各部分内容,一般情况,新闻采集代码由“前缀定位文本”、“数据采集代码”和“后缀定位文本”三部分构成,其中“前缀定位文本”是用来指示被采集数据的起始位置的定位文本(例如:新闻标题前面的一个 HTML 元素);“数据采集代码”用来指示如何从被采集数据中提取有效的数据信息;“后缀定位文本”是用来指示被采集数据的结束位置的定位文本。合理设置采集代码有助于将目标站点的新闻快速准确的采集到 TWMP 系统,设置采集配置时应遵循下面的原则:
- “前缀定位文本”和“后缀定位文本”:在能够准确定位被采集数据的位置的前提下越渐短越好。
- “数据采集代码”:在能够从被采集数据中准确提取有效的数据信息的前提下越渐短越好。
- 跳过无用的可变数据:新闻采集代码中如果涉及到可改变的无用数据时,应采用相应的采集代码跳过此类数据文本。例如:在采集新闻标题时可能出现 HTML 元素标签的属性的参数。
例子:下面是常见的 HTML 源代码中的两种基本样例。
- <li><a href="新闻 URL">新闻标题</a></li>
在这个例子中“<li><a href="”是“前缀定位文本”,“新闻 URL">新闻标题”是数据区,也是“数据采集代码”将要解析的内容,“</a></li>”是“后缀定位文本”。
- <div class="arcTitle">
<h3>新闻标题</h3>
在这个例子中“<li><a href="”是“前缀定位文本”,“新闻 URL">新闻标题”是数据区,也是“数据采集代码”将要解析的内容,“</a></li>”是“后缀定位文本”。
|