Python에서 HTML 태그를 제거하는 방법

藏色散人
풀어 주다: 2023-01-05 16:12:17
원래의
6463명이 탐색했습니다.

파이썬에서 html 태그를 제거하는 방법: 1. "pattern.sub('',html)" 방법 2. "BeautifulSoup(html,'html.parser')" 방법 3. "response.xpath('string) ( .)')"방법.

Python에서 HTML 태그를 제거하는 방법

이 기사의 운영 환경: Windows 7 시스템, Python 버전 3.6.4, DELL G3 컴퓨터.

Python에서 html 태그를 제거하는 여러 가지 방법

import re
from bs4 import BeautifulSoup
from lxml import etree
 
html = &#39;<p>你好</p><br/><font>哈哈</font><b>大家好</b>&#39;
 
# 方法一
pattern = re.compile(r&#39;<[^>]+>&#39;,re.S)
result = pattern.sub(&#39;&#39;, html)
print(result)
 <br># 方法二
soup = BeautifulSoup(html,&#39;html.parser&#39;)
print(soup.get_text())
 
# 方法三
response = etree.HTML(text=html)
# print(dir(response))
print(response.xpath(&#39;string(.)&#39;))
 
 
# 你好哈哈大家好
# 你好哈哈大家好
# 你好哈哈大家好
로그인 후 복사

[권장: python 비디오 튜토리얼]

위 내용은 Python에서 HTML 태그를 제거하는 방법의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

관련 라벨:
원천:php.cn
본 웹사이트의 성명
본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.
인기 튜토리얼
더>
최신 다운로드
더>
웹 효과
웹사이트 소스 코드
웹사이트 자료
프론트엔드 템플릿