ホームページ >バックエンド開発 >PHPチュートリアル >PHPを使用してWeChatパブリックアカウントの記事ページを収集する方法
PHP を使用して WeChat 公開アカウントの記事を収集する方法と PHP コードを作成する方法を分析させてください詳しく説明します。PHP に興味のある友人はそれを学ぶことができます。
Sogou 検索を通じて公開アカウントの履歴メッセージを収集するには、いくつかの問題があります。
1. 確認コードがあります。 2. 履歴メッセージ リストには、最後の 10 件のグループ メッセージしか含まれていません。記事アドレスには有効期限があります
4. バッチ収集には IP を変更する必要があると言われています 収集システムは従来のルールほど単純ではありませんが、這うコレクター。ただし、一度設定した後のバッチ収集の効率はまだ許容範囲内です。さらに、収集された記事アドレスは永続的に有効であり、公開アカウントのすべての履歴メッセージを収集できます。公開アカウント記事のリンク アドレスから始めましょう:
1. WeChat の右上隅にあるメニューからコピーしたリンク アドレス:2. 履歴メッセージ リストから取得したアドレス:
实3、完全な実際のアドレス:
https://
上記3つのアドレスは、同じ記事を異なる場所で取得すると、3 つのまったく異なる結果が得られました。
履歴メッセージページと同様に、WeChatにもパラメータを自動的に補足する仕組みがあります。最初のアドレスはリンクをコピーすることで取得され、偽装されたエンコーディングであるようです。実際のところ、それは無駄なので検討しません。 2 番目のアドレスは、前の記事で紹介した方法で履歴メッセージの json 記事リストから取得したリンク アドレスです。このアドレスをデータベースに保存できます。その後、このアドレスを介してサーバーから記事のコンテンツを取得できます。 3 番目のリンクにパラメーターを追加した後、目的は、記事ページ内の読書 js が読書いいねの json 結果を取得できるようにすることです。前回の記事の方法では、クライアントで記事ページを開いて表示することで、記事ページ内のjsが自動的に閲覧量を取得するため、プロキシサービスを通じてこの記事の閲覧量を取得することができます。 。 この記事の内容は、このコラムの前回の記事で紹介した方法に基づいて、記事のコンテンツやその他の有用な情報を取得する方法を詳細に検討することです。
(データベースに保存されている記事のリスト、一部のフィールド)
1. 記事のソース コードを取得します: PHP 関数 file_get_content() を使用して、記事のソース コードを変数に読み取ることができます。 WeChat記事のソースコードはブラウザから開けるので、ページスペースの無駄を避けるためにここには貼り付けません。<?
//$content_url 变量的值为文章地址
$html = file_get_contents($content_url);
?>
2. ソースコード内の有用な情報:
1) 元のコンテンツ:
<? preg_match_all("/id=\"js_content\">(.*)<script/iUs",$html,$content,PREG_PATTERN_ORDER); $content = "<p id='js_content'>".$content[1][0]; ?>先頭の通常の識別 cfd680454c127ace0ad40a8afa2cb84a、末尾の識別 95d03339b383d1e014ad793435058f5f; 私の通常のマッチングレベルは限られているので、このようにしか書くことができません。専門知識のある人がより良い定期的なマッチング方法を指摘してくれることを願っています。
また注意: この一致ルールは一定期間後に変更される可能性があります。この記事は可能な限り更新され続けます。私の記事に基づいて収集システムを作成し、ある日失敗した場合でも、忘れずに戻ってきて記事が更新されているかどうかを確認してください。
2) コンテンツ処理:
上記の方法で記事コンテンツのhtmlを取得しましたが、記事コンテンツを表示すると写真や動画が正常に表示できないことがわかります。この HTML にはまだ処理が必要なため:
首先是图片,微信文章中的a1f02c36ba31691bcfe87b2722de723b标签中的src属性全部都用了src属性代替。只有在显示的时候才会被替换过来。所以我们也有两个方案,将源代码直接替换过来,或者用js在显示时候再替换。下面我先介绍直接替换html的方法:
<? //$content变量的值是前面获取到的文章内容html $content = str_replace("src","src",$content); ?>
然后是视频,视频的显示不正常,经过长期测试后发现只要替换一个页面地址就能解决,过程就不说了,直接说结果:
<? //$content变量的值是前面获取到的文章内容html $content = str_replace("preview.html","player.html",$content); ?>
通过这两个替换之后,文章内容html中的图片和视频就都正常了。
3) 公众号相关信息:
通过本专栏之前的文章,介绍了我们使用微信客户端,任意打开一个公众号的历史消息页之后。系统从数据库中识别biz的值,发现数据库中没有记录,就会插入一条新的纪录。之后的采集队列就会定期根据这个biz来获取这个公众号的历史消息列表。
但是我们只获得了这个公众号的biz,公众号的名称,头像这两个重要信息还是没有获取到。主要原因是历史消息页面中没有这两个信息。但是我们可以从文章页面中获取到。
在微信文章页面html的底部,有一些js的变量赋值的代码,通过正则匹配之后我们就可以获得这两个公众号的信息:
<? //$html变量的值是前面获取到的文章全部html preg_match_all('/var nickname = \"(.*?)\";/si',$html,$m); $nickname = $m[1][0];//公众号昵称 preg_match_all('/var round_head_img = \"(.*?)\";/si',$html,$m); $head_img = $m[1][0];//公众号头像 ?>
通过这两个正则匹配,我们就能获取到公众号的头像和昵称,然后根据文章地址中的biz,可以保存到对应的微信号数据表中。
3、文章的保存和处理
前面的代码已经将文章内容获取到变量中了。如何保存其实每个人也许都有自己的想法。我这里介绍一下我的保存内容的方法:
将文章内容的html以数据库id为文件名保存成html文件,以biz字段为目录。
<? $dir = "./".$biz."/"; $filename = $dir.$id.".html"; if(!is_dir($dir)) { mkdir($cache_dir); chmod($cache_dir,0777); } $file = fopen($filename, "w"); fwrite($file, $content); fclose($file); ?>
以上代码是一个标准的php建立文件夹保存文件的代码,大家可以根据自己的实际情况安排保存方法。
在这之后我们就可以在自己的服务器上得到一个html文件,内容就是公众号的文章内容。我们可以从浏览器中打开看一下。这时你也许会发现图片防盗链了!无法正常显示!包括数据库中保存的文章封面图,公众号的头像都是防盗链的。
别急,这个问题很好解决,只需要将图片也保存到自己的服务器,无非是将来会占用自己的服务器空间和带宽。
图片防盗链的原理是当图片在网页中显示的时候,图片服务器会检测到引用这张图片的服务器域名,当发现服务器域名不包含http://qq.com或http://qpic.cn的时候就会被替换成防盗链图片。
但是如果检测不到引用页面的域名就会正常显示,所以我们通过php的函数file_get_content()就可以将图片的二进制代码获取过来,然后根据自己的想法起个文件名保存到自己的服务器上。在这里再介绍一个保存图片的方法,我目前使用了腾讯云的“万象优图”,通过它们提供的api将图片保存到云空间,这样的好处是读取图片时直接在图片的链接地址加上希望得到的图片尺寸大小参数,就可以直接得到一张缩略图。比存在自己的服务器方便得多。阿里云也应该有同样的产品,好像名叫对象存储。
另外,我采集公众号内容的目的是制作成一个新闻app,在app中将html代码显示出来之后,因为app同样没有域名,防盗链服务器也同样不会认为图片被盗链了。这样就可以直接显示图片出来。
以上就是我总结的公众号文章内容的采集与存储方法,希望能够帮到你。
相关推荐:
以上がPHPを使用してWeChatパブリックアカウントの記事ページを収集する方法の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。