1分钟快速生成用于网页内容提取的xslt

脚本专栏 2024/11/17 佚名

3 1 2

1分钟快速生成用于网页内容提取的xslt，具体内容如下

1、项目背景

在《Python即时网络爬虫项目说明》一文我们说过要做一个通用的网络爬虫，而且能节省程序员大半的时间，而焦点问题就是提取器使用的抓取规则需要快速生成。在python使用xslt提取网页数据一文，我们已经看到这个提取规则是xslt程序，在示例程序中，直接把一长段xslt赋值给变量，但是没有讲这一段xslt是怎么来的。

网友必然会质疑：这个xslt这么长，编写不是要花很长时间？

实际情况是，这个xslt是通过GooSeeker的MS谋数台的直观标注功能自动生成的，熟练的话1分钟就搞定了。

2、MS谋数台能做什么

MS谋数台有个图形化界面，把一系列html解析工具集成在一起，包括：

基于直观标注自动生成XSLT
即时测试XSLT的正确性
树状的DOM结构展示
剖析某个DOM节点的属性
为DOM节点生成XPath，可选择定位到class、或者id、或者绝对定位
根据xpath搜索DOM节点

MS谋数台界面分成三部分：DOM数窗口、内嵌浏览器窗口、工作台。在工作台上定义xslt转换规则。

3、用MS谋数台生成XSLT

假设我们要抓取论坛帖子列表，下面一步步讲解操作方法：
第一步，打开GooSeeker的MS谋数台，输入要抓取的网址
第二步，在MS谋数台的浏览器显示窗口里，直接选取要提取的内容，并且起个名字，点击确认

第三步，点击工作台的“测试”按钮，xslt就生成了，在“数据规则”窗口显示出来

通过以上的操作，不用编程，用图形化界面直接在页面上标注，1分钟就可以生成xslt

4、怎样使用XSLT

在python使用xslt提取网页数据一文，我们把生成xslt作为一个字符串交给程序，给人感觉好像一下子回到了史前文明，前面讲的那么好，最后用了很原始的拷贝。其实不然，那个只是一个例子。在《python即时网络爬虫项目: 内容提取器的定义》一文已经初见端倪了，有多种注入xslt的方式，最自动化的方式是api，将在后续文章中详细讲解。

5、文档修改历史

2016-05-28：V3.0，增加第二章
2016-05-26：V2.0，增补文字说明

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

xslt网页内容提取,xslt内容提取,xslt提取网页内容

华山资源网 Design By www.eoogi.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

华山资源网 Design By www.eoogi.com

评论“1分钟快速生成用于网页内容提取的xslt”

暂无评论...

《魔兽世界》大逃杀！60人新游玩模式《强袭风暴》3月21日上线

暴雪近日发布了《魔兽世界》10.2.6 更新内容，新游玩模式《强袭风暴》即将于3月21 日在亚服上线，届时玩家将前往阿拉希高地展开一场 60 人大逃杀对战。

艾泽拉斯的冒险者已经征服了艾泽拉斯的大地及遥远的彼岸。他们在对抗世界上最致命的敌人时展现出过人的手腕，并且成功阻止终结宇宙等级的威胁。当他们在为即将于《魔兽世界》资料片《地心之战》中来袭的萨拉塔斯势力做战斗准备时，他们还需要在熟悉的阿拉希高地面对一个全新的敌人──那就是彼此。在《巨龙崛起》10.2.6 更新的《强袭风暴》中，玩家将会进入一个全新的海盗主题大逃杀式限时活动，其中包含极高的风险和史诗级的奖励。
《强袭风暴》不是普通的战场，作为一个独立于主游戏之外的活动，玩家可以用大逃杀的风格来体验《魔兽世界》，不分职业、不分装备（除了你在赛局中捡到的），光是技巧和战略的强弱之分就能决定出谁才是能坚持到最后的赢家。本次活动将会开放单人和双人模式，玩家在加入海盗主题的预赛大厅区域前，可以从强袭风暴角色画面新增好友。游玩游戏将可以累计名望轨迹，《巨龙崛起》和《魔兽世界：巫妖王之怒经典版》的玩家都可以获得奖励。

更新日志

2024年11月17日

1分钟快速生成用于网页内容提取的xslt

python自动发邮件库yagmail的示例代码

Python KMeans聚类问题分析

评论“1分钟快速生成用于网页内容提取的xslt”

《魔兽世界》大逃杀！60人新游玩模式《强袭风暴》3月21日上线

更新日志

友情链接