c#处理html字符串

来源:互联网 发布:在英国怎么用淘宝网 编辑:程序博客网 时间:2024/05/21 06:45

最近碰到个问题,html encode后的字符串,需要替换里面的文本内容。需要注意的地方是标签里面的内容不能被替换。

比如<p>pdf</p>,替换p为abc的时候<p>,</p>里面的p不能被替换。

纠结了很久终于解决:

1. 利用System.Web里的HttpUtility.HtmlDecode将字符串解码,比如&lt;&gt;会被解码成<>

2. 利用正则表达式隔离tag和tag外的内容Regex reg = new Regex("(<[a-zA-z/][^>]*>)");

3. 隔开后的string总在一个string 的list中,在通过判断是不是<>开头结尾来过滤,不是标签的话就替换内容

 

代码如下

 

 private static void replaceText(string text,ref List<string> ll)

        {

            string html = HttpUtility.HtmlDecode(text);

            Regex reg = new Regex("(<[a-zA-z/][^>]*>)");

            Match mm = reg.Match(html);

            string temp = string.Empty;

            if (mm.Groups.Count > 1)

            {

                Group gg = mm.Groups[1];

                ll.Add(html.Substring(0,gg.Index));

                ll.Add(html.Substring(gg.Index,gg.Length));

                replaceText(html.Substring(gg.Index + gg.Length), ref ll);

            }

            else

                ll.Add(text);

        }

 

 

static void Main(string[] args)

        {

            List<string> ll = new List<string>();

            replaceText("pvc<p src=/"ds/">dpp</p><p>spdf<br /></p><a href=/"wwwp />fgdfgp",ref ll);

 

            string result = string.Empty;

 

            for(int i =0;i<ll.Count;i++)

            {

                string s = ll[i];

                 if((!string.IsNullOrEmpty(s))&& !(s.StartsWith("<")&&s.EndsWith(">")))

                    s = s.Replace("p","替换");

                Console.WriteLine(s);

                result += s;

            }

            Console.WriteLine("result: " +result);

        }