html - python提取标签中的内容

Question

抓取了一个网页，网页中一部分内容如下： 我使用如下代码： {代码...} 但是只能输出：奥迪阿萨德，第一个之后的内容都不能输出，请问该如何解决？

黄舟 · Answer

lxml 的element.text返回的是这个元素第一个节点的内容，所以会出现这样的问题。可以用getText这个辅助方法来解决：

# require lxml
# version: python2
def getText(elem):
    rc = []
    for node in elem.itertext():
        rc.append(node.strip())
    return ''.join(rc)

这里可以直接修改最后一行即可：

import codecs
#coding=utf-8
from lxml import etree

def getText(elem):
    rc = []
    for node in elem.itertext():
        rc.append(node.strip())
    return ''.join(rc)

f=codecs.open("1.html","r","utf-8")
content=f.read()
f.close()
tree=etree.HTML(content)
# 返回的是lxml.etree._Element,可以直接作为getText参数来调用。
node=tree.xpath("//p[@class='content']")[0]
print getText(node).encoding('gbk')

这里的getText只是简单的实现，比如下面的xml文本会打印abdc,应该可以达到你的要求。


    ab dc

巴扎黑 · Answer

#!/usr/bin/env python3
from bs4 import BeautifulSoup

f = open("1.html", "r")
html = BeautifulSoup( f.read() )
node = html.select(".content")[0]
print( node.prettify() )

html.select(".content")这个可能需要更多的选择器限定一下。另外只是大概写了下BeautifulSoup如何运作的，具体需求可以查看手册：Beautiful Soup 文档

php8，我来也

30分钟学会网站布局

尚观Oracle入门到精通视频教程

你的第一行 UNI-APP 代码

Flutter 从头到应用启动

兄弟连Linux新版视频教程

AXURE 9视频教程（适合产品经理交互产品设计UI）

零基础PS视频教程

16天带你入门UI视频教程

PS技巧和切片技巧视频教程

阿里云环境搭建以及项目上线视频教程

计算机网络概述——程序员必须掌握的基础知识

程序员必备教程——HTTP协议讲解

Websocket视频教程