Python正則表達式基礎

fmwg 9年前發布 | 17K 次閱讀 Python Python開發

正則表達式是搜索、替換和解析復雜字符串的一種強大而標準的方法,Python中的正則相關的東西全在re模塊下。

1 常用的匹配

^匹配字符串的開始

$匹配字符串的結尾

\b匹配一個單詞的邊界

\d匹配任意數字

\D匹配任意非數字字符

x?匹配一個可選的x(匹配1次或0次x字符)

x*匹配0次或多次x

x+匹配1次或多次x

x{n,m}至少n次,至多m次x

(a|b|c)要么匹配a,要么匹配b,要么匹配c

(x)一般情況下表示一個記憶組,你可以利用re.search函數返回對象的groups()函數來獲取它的值

2 一般用途

#-------------------------------------------------------------------------------
# coding:        utf-8
# Purpose:正則表達式
#
# Author:      zdk
#
# Created:     26/02/2013
# Copyright:   (c) zdk 2013
#-------------------------------------------------------------------------------

import re
if __name__ == '__main__':
    addr = "100 BROAD ROAD APT.3"
    print(re.sub("ROAD","RD",addr)) # 100 BRD RD APT.3
    print(re.sub(r"\bROAD\b","RD",addr)) # 100 BROAD RD APT.3
    pattern = ".*B.*(ROAD)?"
    print(re.search(pattern,"ROAD")) #None
    print(re.search(pattern,"B")) #<_sre.SRE_Match object at 0x0230F020><span style="background-color:#FAFAFA;font-family:Monaco, 'DejaVu Sans Mono', 'Bitstream Vera Sans Mono', Consolas, 'Courier New', monospace;font-size:1em;line-height:1.5;">&nbsp;</span>


(1)re.sub("ROAD","RD",addr) 利用re.sub函數對字符串addr進行搜索,滿足表達式"ROAD"的用“RD”替換

(2)re.sub(r"\bROAD\b","RD",addr) ,“\b”含義是“單詞的邊界”,在Python中,由于字符“\”在字符串中必須轉義,這會變得非常麻煩,所以Python用前綴r表示字符串中的所有字符都不轉義。

(3)re.search(pattern,"ROAD") re模塊有一個search函數,該函數有兩個參數,一個是正則表達式,一個是字符串,search函數返回一個擁有多種方法可以描述這個匹配的對象,如果沒有發現匹配,則返回None。  

3 松散正則表達式

上面均是“緊湊”類型的表達式,它比較難以閱讀,即使現在清楚表達式的含義,也不能保證幾個月后還能記得。所以Python允許用戶利用所謂的松散正則表達式來完成內聯文檔的需要,和一般的表達式有以下兩個方面的主要區別

忽略空白符。空格符、制表符、回車符不匹配它們自身(如果你想在松散正則表達式中匹配一個空格符,你不須在它前面添加一個反斜杠符號對它進行轉義)

忽略注釋。和普通的Python代碼一樣,注釋開始于#符號,結束于行尾。

#松散帶有內聯注釋的正則表達式
    pattern = """
    ^   # begin of string
    M{0,3} # 0 to 3 M
    (CM|CD|D?C{0,3}) #CM or CD or D or D 0 to 3 C
    $   #end of string
    """
    print(re.search(pattern,"MCM",re.VERBOSE)) #<_sre.SRE_Match object at 0x021BAF60>
    print(re.search(pattern,"M99",re.VERBOSE)) #None

(1)當使用松散正則表達式時,最重要的一件事就是:必須傳遞一個額外的參數re.VERBOSE,它是re模塊的一個常量,標志著待匹配的正則表達式是一個松散正則表達式。pattern的空格和注釋都是被忽略的,但同時具有更好的可讀性。

4 個例研究:解析電話號碼

必須匹配如下電話號碼:

800-555-1212

800 555 1212

800.555.1212

(800)555-1212

1-800-555-1212

800-555-1212-1234

800-555-1212x1234

800-555-1212 ext.1234

work 1-(800) 555,1212 #1234

格式比較多,我們需要知道的是800為區號,干線號為555,電話號的其他數字為1212,對于有分機號的,我們需要知道分機號為1234

phonePattern = re.compile(r'''
    # don't match beginging of string
(\d{3}) # 3 digits
\D*     #any number of non-digits
(\d{3}) # 3 digits
\D*     #any number of non-digits
(\d{4}) # 4 digits
\D*     #any number of non-digits
(\d*)   #any number of digits
''',re.VERBOSE)
print(phonePattern.search('work 1-(800)555.1212 #1234').groups()) #('800', '555', '1212', '1234')


print(phonePattern.search('work 1-(800)555.1212 #1234').groups()) #('800', '555', '1212', '1234')

(1)一個松散正則表達式如上, 首先匹配3個數字區號(不一定從第一個字符開始,所以沒有用^),接著后面匹配任意多個非數字的字符,接著匹配3個數字干線號,接著匹配任意多個非數字的字符,接著匹配4個數字號碼,接著匹配任意多個非數字的字符,接著匹配任意多個數字的分機號,然后用groups函數分組,得到正確的電話號碼。


 本文由用戶 fmwg 自行上傳分享,僅供網友學習交流。所有權歸原作者,若您的權利被侵害,請聯系管理員。
 轉載本站原創文章,請注明出處,并保留原始鏈接、圖片水印。
 本站是一個以用戶分享為主的開源技術平臺,歡迎各類分享!