asp.net正則表達(dá)式刪除指定的HTML標(biāo)簽的代碼
更新時(shí)間:2010年09月13日 00:14:20 作者:
抓取某網(wǎng)頁(yè)的數(shù)據(jù)后(比如描述),如果照原樣顯示的話,可能會(huì)因?yàn)樗锩姘瑳](méi)有閉合的HTML標(biāo)簽而打亂了格式,也可能它里面用了比較讓人 費(fèi)解 的HTML標(biāo)簽,把預(yù)訂的格式攪亂.
如果全盤刪除里面的 HTML 標(biāo)簽,可能會(huì)造成閱讀上的困難(比如 a, img 這些標(biāo)簽), 最好是刪除一部分,保留一部分.
正則表達(dá)式里,判斷 包含某些字符串 是非常容易理解的,但是如何判斷 不包含某些字符串 (是字符串,不是字符,是某些,不是某個(gè)) 確實(shí)是個(gè)費(fèi)解的事.
<(?!((/?\s?li)|(/?\s?ul)|(/?\s?a)|(/?\s?img)|(/?\s?br)|(/?\s?span)|(/?\s?b)))[^>]+>
這個(gè)正則是判斷HTML標(biāo)簽不包含 li / ul / a / img / br / span / b 的,就上面的要求來(lái)說(shuō),是要 刪除 除這里列出的HTML標(biāo)簽,這也是我摸索了很長(zhǎng)時(shí)間才搞出來(lái)的.
(?!exp) 匹配后面跟的不是exp的位置
/?\s? 我一開(kāi)始試著把它寫到最前面的 < 后面,但是測(cè)試失敗了.
下面是一個(gè)簡(jiǎn)單的函數(shù),把要保留的TAG串起來(lái),生成一個(gè)正則表達(dá)式,然后把不需要的TAG刪除...
private static string RemoveSpecifyHtml(string ctx) {
string[] holdTags = { "a", "img", "br", "strong", "b", "span" };//要保留的 tag
// <(?!((/?\s?li)|(/?\s?ul)|(/?\s?a)|(/?\s?img)|(/?\s?br)|(/?\s?span)|(/?\s?b)))[^>]+>
string regStr = string.Format(@"<(?!((/?\s?{0})))[^>]+>", string.Join(@")|(/?\s?", holdTags));
Regex reg = new Regex(regStr, RegexOptions.Compiled | RegexOptions.Multiline | RegexOptions.IgnoreCase);
return reg.Replace(ctx, "");
}
修正:
上面的正則,如果保留了 li , 實(shí)際運(yùn)行會(huì)發(fā)現(xiàn) link 也給保留下來(lái)了, 保留 a 會(huì)把 addr 也給保留下來(lái), 解決辦法就是加 \b 斷言.
<(?!((/?\s?li\b)|(/?\s?ul)|(/?\s?a\b)|(/?\s?img\b)|(/?\s?br\b)|(/?\s?span\b)|(/?\s?b\b)))[^>]+>
private static string RemoveSpecifyHtml(string ctx) {
string[] holdTags = { "a", "img", "br", "strong", "b", "span", "li" };//保留的 tag
// <(?!((/?\s?li\b)|(/?\s?ul\b)|(/?\s?a\b)|(/?\s?img\b)|(/?\s?br\b)|(/?\s?span\b)|(/?\s?b\b)))[^>]+>
string regStr = string.Format(@"<(?!((/?\s?{0})))[^>]+>", string.Join(@"\b)|(/?\s?", holdTags));
Regex reg = new Regex(regStr, RegexOptions.Compiled | RegexOptions.Multiline | RegexOptions.IgnoreCase);
return reg.Replace(ctx, "");
}
正則表達(dá)式里,判斷 包含某些字符串 是非常容易理解的,但是如何判斷 不包含某些字符串 (是字符串,不是字符,是某些,不是某個(gè)) 確實(shí)是個(gè)費(fèi)解的事.
復(fù)制代碼 代碼如下:
<(?!((/?\s?li)|(/?\s?ul)|(/?\s?a)|(/?\s?img)|(/?\s?br)|(/?\s?span)|(/?\s?b)))[^>]+>
這個(gè)正則是判斷HTML標(biāo)簽不包含 li / ul / a / img / br / span / b 的,就上面的要求來(lái)說(shuō),是要 刪除 除這里列出的HTML標(biāo)簽,這也是我摸索了很長(zhǎng)時(shí)間才搞出來(lái)的.
(?!exp) 匹配后面跟的不是exp的位置
/?\s? 我一開(kāi)始試著把它寫到最前面的 < 后面,但是測(cè)試失敗了.
下面是一個(gè)簡(jiǎn)單的函數(shù),把要保留的TAG串起來(lái),生成一個(gè)正則表達(dá)式,然后把不需要的TAG刪除...
復(fù)制代碼 代碼如下:
private static string RemoveSpecifyHtml(string ctx) {
string[] holdTags = { "a", "img", "br", "strong", "b", "span" };//要保留的 tag
// <(?!((/?\s?li)|(/?\s?ul)|(/?\s?a)|(/?\s?img)|(/?\s?br)|(/?\s?span)|(/?\s?b)))[^>]+>
string regStr = string.Format(@"<(?!((/?\s?{0})))[^>]+>", string.Join(@")|(/?\s?", holdTags));
Regex reg = new Regex(regStr, RegexOptions.Compiled | RegexOptions.Multiline | RegexOptions.IgnoreCase);
return reg.Replace(ctx, "");
}
修正:
上面的正則,如果保留了 li , 實(shí)際運(yùn)行會(huì)發(fā)現(xiàn) link 也給保留下來(lái)了, 保留 a 會(huì)把 addr 也給保留下來(lái), 解決辦法就是加 \b 斷言.
復(fù)制代碼 代碼如下:
<(?!((/?\s?li\b)|(/?\s?ul)|(/?\s?a\b)|(/?\s?img\b)|(/?\s?br\b)|(/?\s?span\b)|(/?\s?b\b)))[^>]+>
private static string RemoveSpecifyHtml(string ctx) {
string[] holdTags = { "a", "img", "br", "strong", "b", "span", "li" };//保留的 tag
// <(?!((/?\s?li\b)|(/?\s?ul\b)|(/?\s?a\b)|(/?\s?img\b)|(/?\s?br\b)|(/?\s?span\b)|(/?\s?b\b)))[^>]+>
string regStr = string.Format(@"<(?!((/?\s?{0})))[^>]+>", string.Join(@"\b)|(/?\s?", holdTags));
Regex reg = new Regex(regStr, RegexOptions.Compiled | RegexOptions.Multiline | RegexOptions.IgnoreCase);
return reg.Replace(ctx, "");
}
相關(guān)文章
ASP.NET的HtmlForm控件學(xué)習(xí)及Post與Get的區(qū)別概述
HtmlForm 控件用于控制form元素,本文主要介紹下HtmlForm控件的Method/Action方法(要提交數(shù)據(jù)的頁(yè)面,即數(shù)據(jù)要傳送至哪個(gè)網(wǎng)址)及Post與Get的區(qū)別感興趣的朋友可以了解下,或許對(duì)你學(xué)習(xí)HtmlForm控件有所幫助2013-02-02asp.net 動(dòng)態(tài)添加多個(gè)用戶控件
動(dòng)態(tài)添加多個(gè)相同用戶控件,并使每個(gè)用戶控件獲取不同的內(nèi)容。2009-12-12.NET?Framework?的項(xiàng)目如何使用?FTP?下載文件
本文專門針對(duì)面向?.NET?Framework?的項(xiàng)目,?對(duì)于面向?.NET?6?及更高版本的項(xiàng)目,不再支持?FTP,此示例演示如何從?FTP?服務(wù)器下載文件,感興趣的朋友跟隨小編一起看看吧2024-01-01服務(wù)器讀取EXCEL不安裝OFFICE如何實(shí)現(xiàn)
用asp.net做了一簡(jiǎn)單的游戲管理后臺(tái),涉及到了上傳Excel導(dǎo)入數(shù)據(jù)的功能,在本地開(kāi)發(fā)實(shí)現(xiàn)都好好的,可已上傳的服務(wù)器上就悲劇了,下面有個(gè)不錯(cuò)的解決方法,大家可以參考下2014-03-03asp.net repeater手寫分頁(yè)實(shí)例代碼
想用repeater實(shí)現(xiàn)手寫分頁(yè)的代碼,想自己控制各種樣式的朋友,可以用用。2009-05-05解決asp.net core在輸出中文時(shí)亂碼的問(wèn)題
最近在學(xué)習(xí)asp.net core的時(shí)候,嘗試在控制臺(tái),或者頁(yè)面上輸出中文,會(huì)出現(xiàn)亂碼的問(wèn)題。那么這該如何解決呢?下面通過(guò)這篇文章來(lái)一起看看吧,文中給出了詳細(xì)的解決方法,相信對(duì)大家有一定的參考價(jià)值。2016-12-12asp.net實(shí)現(xiàn)DropDownList,TreeView,ListBox的無(wú)限極分類目錄樹
這篇文章主要介紹了asp.net實(shí)現(xiàn)DropDownList,TreeView,ListBox的無(wú)限極分類目錄樹,結(jié)合實(shí)例形式較為詳細(xì)的分析了asp.net常見(jiàn)控件實(shí)現(xiàn)無(wú)限極分類目錄樹的具體實(shí)現(xiàn)步驟與相關(guān)操作技巧,需要的朋友可以參考下2016-06-06