Java中正则表达式去除html标签
Java中正则表达式去除html的标签,主要目的更精确的显示内容,比如前一段时间在做类似于博客中发布文章功能,当编辑器中输入内容后会将样式标签也传入后台并且保存数据库,但是在显示摘要的时候,比如显示正文的前50字作为摘要,那么这时需要去除所有html标签,然后在截取50字,所以就通过了Java正则表达式实现了如下方法,代码如下:
注:这是Java正则表达式去除html标签方法。
privatestaticfinalStringregEx_script="<script[^>]*?>[\\s\\S]*?<\\/script>";//定义script的正则表达式 privatestaticfinalStringregEx_style="<style[^>]*?>[\\s\\S]*?<\\/style>";//定义style的正则表达式 privatestaticfinalStringregEx_html="<[^>]+>";//定义HTML标签的正则表达式 privatestaticfinalStringregEx_space="\\s*|\t|\r|\n";//定义空格回车换行符 privatestaticfinalStringregEx_w="<w[^>]*?>[\\s\\S]*?<\\/w[^>]*?>";//定义所有w标签 /** *@paramhtmlStr *@return删除Html标签 *@authorLongJin */ publicstaticStringdelHTMLTag(StringhtmlStr){ Patternp_w=Pattern.compile(regEx_w,Pattern.CASE_INSENSITIVE); Matcherm_w=p_w.matcher(htmlStr); htmlStr=m_w.replaceAll("");//过滤script标签 Patternp_script=Pattern.compile(regEx_script,Pattern.CASE_INSENSITIVE); Matcherm_script=p_script.matcher(htmlStr); htmlStr=m_script.replaceAll("");//过滤script标签 Patternp_style=Pattern.compile(regEx_style,Pattern.CASE_INSENSITIVE); Matcherm_style=p_style.matcher(htmlStr); htmlStr=m_style.replaceAll("");//过滤style标签 Patternp_html=Pattern.compile(regEx_html,Pattern.CASE_INSENSITIVE); Matcherm_html=p_html.matcher(htmlStr); htmlStr=m_html.replaceAll("");//过滤html标签 Patternp_space=Pattern.compile(regEx_space,Pattern.CASE_INSENSITIVE); Matcherm_space=p_space.matcher(htmlStr); htmlStr=m_space.replaceAll("");//过滤空格回车标签 htmlStr=htmlStr.replaceAll("","");//过滤 returnhtmlStr.trim();//返回文本字符串 }
ps:方法仅供参考,供大家一起互相学习,若有不足或者疑问欢迎评论。