首頁 > 後端開發 > C#.Net教程 > asp.net正規表示式刪除指定的HTML標籤的程式碼

asp.net正規表示式刪除指定的HTML標籤的程式碼

高洛峰
發布: 2017-02-03 15:14:11
原創
1451 人瀏覽過

如果全盤刪除裡面的HTML 標籤,可能會造成閱讀上的困難(比如a, img 這些標籤), 最好是刪除一部分,保留一部分. 

正則表達式裡,判斷包含某些字符串是非常容易理解的,但是如何判斷不包含某些字符串(是字符串,不是字符,是某些,不是某個) 確實是個費解的事. 

<(?!((/?\s?li)|(/?\s?ul)|(/?\s?a)|(/?\s?img)|(/?\s?br)|(/?\s?span)|(/?\s?b)))[^>]+>
登入後複製

這個正則是判斷HTML標籤不包含li / ul / a / img / br / span / b 的,就上面的要求來說,是要刪除除這裡列出的HTML標籤,這也是我摸索了很長時間才搞出來的. 
(?!exp) 匹配後面跟的不是exp的位置 
/?s? 我一開始試著把它寫到最前面的< 後面,但是測試失敗了. 

下面是一個簡單的函數,把要保留的TAG串起來,生成一個正則表達式,然後刪除不需要的TAG... 

private static string RemoveSpecifyHtml(string ctx) { 
string[] holdTags = { "a", "img", "br", "strong", "b", "span" };//要保留的 tag 
// <(?!((/?\s?li)|(/?\s?ul)|(/?\s?a)|(/?\s?img)|(/?\s?br)|(/?\s?span)|(/?\s?b)))[^>]+> 
string regStr = string.Format(@"<(?!((/?\s?{0})))[^>]+>", string.Join(@")|(/?\s?", holdTags)); 
Regex reg = new Regex(regStr, RegexOptions.Compiled | RegexOptions.Multiline | RegexOptions.IgnoreCase); 


return reg.Replace(ctx, ""); 
}
登入後複製

修正: 
上面的正則,如果保留了li , 實際運行會發現link 也給保留下來了, 保留a 會把addr 也給保留下來, 解決辦法就是加b 斷言. 

<(?!((/?\s?li\b)|(/?\s?ul)|(/?\s?a\b)|(/?\s?img\b)|(/?\s?br\b)|(/?\s?span\b)|(/?\s?b\b)))[^>]+> 

private static string RemoveSpecifyHtml(string ctx) { 
string[] holdTags = { "a", "img", "br", "strong", "b", "span", "li" };//保留的 tag 
// <(?!((/?\s?li\b)|(/?\s?ul\b)|(/?\s?a\b)|(/?\s?img\b)|(/?\s?br\b)|(/?\s?span\b)|(/?\s?b\b)))[^>]+> 
string regStr = string.Format(@"<(?!((/?\s?{0})))[^>]+>", string.Join(@"\b)|(/?\s?", holdTags)); 
Regex reg = new Regex(regStr, RegexOptions.Compiled | RegexOptions.Multiline | RegexOptions.IgnoreCase); 

return reg.Replace(ctx, ""); 
}
登入後複製

更多asp.net正規表示式刪除指定的HTML標籤的程式碼相關文章請關注PHP中文網!

相關標籤:
來源:php.cn
本網站聲明
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn
最新問題
熱門教學
更多>
最新下載
更多>
網站特效
網站源碼
網站素材
前端模板