C#使用正则表达式过滤html标签

389 阅读 0 评论 257 点赞

我是靠谱客的博主义气小懒猪，这篇文章主要介绍C#使用正则表达式过滤html标签，现在分享给大家，希望可以做个参考。

在项目中遇到这样一个需求，需要将一段html转换为一般文本返回，万能的正则表达式来了。

正则表达式来拯救你，代码如下：

public static string Html2Text(string htmlStr)
{
if (String.IsNullOrEmpty(htmlStr))
{
return "";
}
string regEx_style = "<style[^>]*?>[\s\S]*?<\/style>"; //定义style的正则表达式 
string regEx_script = "<script[^>]*?>[\s\S]*?<\/script>"; //定义script的正则表达式 
string regEx_html = "<[^>]+>"; //定义HTML标签的正则表达式 
htmlStr = Regex.Replace(htmlStr, regEx_style, "");//删除css
htmlStr = Regex.Replace(htmlStr, regEx_script, "");//删除js
htmlStr = Regex.Replace(htmlStr, regEx_html, "");//删除html标记
htmlStr = Regex.Replace(htmlStr, "\s*|t|r|n", "");//去除tab、空格、空行
htmlStr = htmlStr.Replace(" ", "");
htmlStr = htmlStr.Replace(""", "");//去除异常的引号" " "
htmlStr = htmlStr.Replace(""", "");
return htmlStr.Trim();
}