Mengekstrak Teks Biasa daripada HTML Menggunakan Python
Dalam usaha mendapatkan semula kandungan teks daripada fail HTML, adalah penting untuk mempertimbangkan kukuh kaedah yang mengendalikan entiti HTML dengan betul dan berkesan. Walaupun penyelesaian menggunakan ungkapan biasa mungkin terbukti terhad, perpustakaan seperti Beautiful Soup menawarkan pilihan yang lebih canggih. Walau bagaimanapun, isu dengan menangkap teks yang tidak diingini dan tafsiran entiti kekal.
Beautiful Soup: A Powerful Tool with Caveats
Beautiful Soup ialah pilihan popular untuk penghuraian HTML, namun ia boleh mendapatkan semula elemen tambahan seperti sumber JavaScript dan gagal mentafsir entiti HTML. Contohnya, urutan ' dalam kod sumber tidak ditukar kepada apostrof dalam teks yang diekstrak.
Masukkan html2text: Penyelesaian yang Menjanjikan
Pada masa ini, html2text muncul sebagai pilihan yang menarik. Ia mengendalikan entiti HTML dengan mudah dan mengabaikan kandungan yang tidak perlu seperti JavaScript. Walaupun ia mengeluarkan penurunan nilai dan bukannya teks biasa, ini boleh ditukar dengan mudah.
Pendekatan Teguh dan Boleh Disesuaikan
Coretan kod berikut memanfaatkan Sup Cantik dan menawarkan kawalan yang dipertingkatkan ke atas proses pengekstrakan:
from urllib.request import urlopen from bs4 import BeautifulSoup url = "http://news.bbc.co.uk/2/hi/health/2284783.stm" html = urlopen(url).read() soup = BeautifulSoup(html, features="html.parser") # Remove unwanted elements like scripts and styles for script in soup(["script", "style"]): script.extract() # Extract the text content text = soup.get_text() # Preprocess the text for improved readability lines = (line.strip() for line in text.splitlines()) chunks = (phrase.strip() for line in lines for phrase in line.split(" ")) text = '\n'.join(chunk for chunk in chunks if chunk) print(text)
Dengan menggunakan pendekatan ini, anda boleh mengekstrak teks biasa dengan berkesan, mengendalikan kandungan yang dikehendaki dan tidak diingini mengikut keperluan anda.
Atas ialah kandungan terperinci Bagaimanakah Python Boleh Mengekstrak Teks Biasa dengan Cekap daripada HTML, Mengendalikan Entiti dan Kandungan Tidak Diingini?. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!