描述如何从网页提取结构化数据的语言：Parsley

319 阅读 0 评论 211 点赞

我是靠谱客的博主生动小霸王，这篇文章主要介绍描述如何从网页提取结构化数据的语言：Parsley，现在分享给大家，希望可以做个参考。

郑昀@玩聚SR 20091127

Scrapy里面用到了Parsley。
Parsley是一个挺有意思的小东西，它综合运用了CSS、XPath、正则表达式和JSON，是描述如何从网页里提取结构化数据的简单语言。估计做爬虫(Crawler/Spider)的人都会定义一套类似的模板。只不过Parsley还帮你把具体实现做了，用各种开发语言。

基本事实

Parselets就是用Parsley语言写成的片段(snippets)。

你可以近似认为一个Parselet定义了一套动作，描述如何从html代码中精确抽取数据，比如标题在哪儿，标题的链接怎么拿，评论数在哪儿如何提取。

Parsley有各种语言实现包，Ruby、Python、C/C++等。
pyparsley是对应的Python库。

Code和Result示例

具体例子参见：http://parselets.com/parselets/yc/15 ，

code

左侧的Code就是我们通常说的模板，右边的Result就是提取的结构化数据。

那么它是如何变为现实的呢？

实现

安装Parsley，再安装http://github.com/fizx/pyparsley，然后运行如下Python代码，就可以从给定网页链接，通过Parselet的描述，获得json格式的结构化数据。

python

zhengyun 20091127 beijing

最后

以上就是生动小霸王最近收集整理的关于描述如何从网页提取结构化数据的语言：Parsley的全部内容，更多相关描述如何从网页提取结构化数据内容请搜索靠谱客的其他文章。

本图文内容来源于网友提供，作为学习参考使用，或来自网络收集整理，版权属于原作者所有。

点赞(211)

本文分类：json
浏览次数：319 次浏览
发布日期：2024-01-05 06:45:47

相关文章

hive到hbase

使用 Hadoop,Nutch ,Hbase,Solr 搭建搜索引擎之Hbase-0.94.27.搭建

使用 Hadoop,Nutch ,Hbase,Solr 搭建搜索引擎之Hbase-0.94.27.搭建

MySQL向Hive/HBase的迁移工具

MySQL向Hive/HBase的迁移工具

信息抽取_CodingPark编程公园基本概念新词提取

信息抽取_CodingPark编程公园基本概念新词提取

描述如何从网页提取结构化数据的语言：Parsley

描述如何从网页提取结构化数据的语言：Parsley

python爬虫入门（3）----- scrapyscrapy

python爬虫入门（3）----- scrapyscrapy

HBASE与HIVE转换

初识Scrapy

评论列表共有 0 条评论

发表评论取消回复

立即
投稿返回
顶部