火车头有一个正文提取器,而且不少的采集软件都有这个东西,但是就是一直不知道这些东西到底是怎么实现的?
或是有高人说下实现的原理是多少?
比如步骤?
或是如何用python来实现,可以举个简单的例子
欢迎选择我的课程,让我们一起见证您的进步~~
ソースアドレス: http://www.cnblogs.com/jasondan/p/3497757.html
よりターゲットを絞った場合は、pやarticleなどのタグを使用して簡単に判断できます。より一般的なものが必要な場合は、中国語 (タグなしテキスト) の密度を計算してメイン テキストであるかどうかを判断するアルゴリズムを作成するなど、収集された Web ページ データを分析できます。具体的にはやっていませんが、基本的にはこんな感じです。
HTTP プロトコルのシミュレーション (通常は request、urllib2 モジュールを使用)
情報抽出 (HTML 文書の特殊な性質により、通常は xpath と beautifulsoup が使用されます)
ソースアドレス: http://www.cnblogs.com/jasondan/p/3497757.html
よりターゲットを絞った場合は、pやarticleなどのタグを使用して簡単に判断できます。より一般的なものが必要な場合は、中国語 (タグなしテキスト) の密度を計算してメイン テキストであるかどうかを判断するアルゴリズムを作成するなど、収集された Web ページ データを分析できます。具体的にはやっていませんが、基本的にはこんな感じです。
HTTP プロトコルのシミュレーション (通常は request、urllib2 モジュールを使用)
情報抽出 (HTML 文書の特殊な性質により、通常は xpath と beautifulsoup が使用されます)