原著(zhù):Steve Mansour
sman@scruznet.com
Revised: June 5, 1999
(copied by jm /at/ jmason.org from http://www.scruz.net/%7esman/regexp.htm, after the original disappeared! )
翻譯:Neo Lee
neo.lee@gmail.com
2004年10月16日
譯者按:原文因為年代久遠,文中很多鏈接早已過(guò)期(主要是關(guān)于vi、sed等工具的介紹和手冊),本譯文中已將此類(lèi)鏈接刪除,如需檢查這些鏈接可以查看上面鏈接的原文。除此之外基本照原文直譯,括號中有“譯者按”的部分是譯者補充的說(shuō)明。如有內容方面的問(wèn)題請直接和Steve Mansor聯(lián)系,當然,如果你只寫(xiě)中文,也可以和我聯(lián)系。
什么是正則表達式
范例
簡(jiǎn)單
中級(神奇的咒語(yǔ))
困難(不可思議的象形文字)
不同工具中的正則表達式
我們將在如下的章節中利用一些例子來(lái)解釋正則表達式的用法,絕大部分的例子是基于vi中的文本替換命令和grep文件搜索命令來(lái)書(shū)寫(xiě)的,不過(guò)它們都是比較典型的例子,其中的概念可以在sed、awk、perl和其他支持正則表達式的編程語(yǔ)言中使用。你可以看看不同工具中的正則表達式這一節,其中有一些在別的工具中使用正則表達式的例子。還有一個(gè)關(guān)于vi中文本替換命令(s)的簡(jiǎn)單說(shuō)明附在文后供參考。
在最簡(jiǎn)單的情況下,一個(gè)正則表達式看上去就是一個(gè)普通的查找串。例如,正則表達式"testing"中沒(méi)有包含任何元字符,,它可以匹配"testing"和"123testing"等字符串,但是不能匹配"Testing"。
要想真正的用好正則表達式,正確的理解元字符是最重要的事情。下表列出了所有的元字符和對它們的一個(gè)簡(jiǎn)短的描述。
| 元字符 | 描述 | |
|---|---|---|
| 匹配任何單個(gè)字符。例如正則表達式r.t匹配這些字符串:rat、rut、r t,但是不匹配root。 | ||
| 匹配行結束符。例如正則表達式weasel$ 能夠匹配字符串"He‘s a weasel"的末尾,但是不能匹配字符串"They are a bunch of weasels."。 | ||
| 匹配一行的開(kāi)始。例如正則表達式^When in能夠匹配字符串"When in the course of human events"的開(kāi)始,但是不能匹配"What and When in the"。 | ||
| 匹配0或多個(gè)正好在它之前的那個(gè)字符。例如正則表達式.*意味著(zhù)能夠匹配任意數量的任何字符。 | ||
| 這是引用府,用來(lái)將這里列出的這些元字符當作普通的字符來(lái)進(jìn)行匹配。例如正則表達式\$被用來(lái)匹配美元符號,而不是行尾,類(lèi)似的,正則表達式\.用來(lái)匹配點(diǎn)字符,而不是任何字符的通配符。 | ||
[c1-c2] [^c1-c2] | 匹配括號中的任何一個(gè)字符。例如正則表達式r[aou]t匹配rat、rot和rut,但是不匹配ret??梢栽诶ㄌ栔惺褂眠B字符-來(lái)指定字符的區間,例如正則表達式[0-9]可以匹配任何數字字符;還可以制定多個(gè)區間,例如正則表達式[A-Za-z]可以匹配任何大小寫(xiě)字母。另一個(gè)重要的用法是“排除”,要想匹配除了指定區間之外的字符——也就是所謂的補集——在左邊的括號和第一個(gè)字符之間使用^字符,例如正則表達式[^269A-Z] 將匹配除了2、6、9和所有大寫(xiě)字母之外的任何字符。 | |
| 匹配詞(word)的開(kāi)始(\<)和結束(\>)。例如正則表達式\<the能夠匹配字符串"for the wise"中的"the",但是不能匹配字符串"otherwise"中的"the"。注意:這個(gè)元字符不是所有的軟件都支持的。 | ||
| 將 \( 和 \) 之間的表達式定義為“組”(group),并且將匹配這個(gè)表達式的字符保存到一個(gè)臨時(shí)區域(一個(gè)正則表達式中最多可以保存9個(gè)),它們可以用 \1 到\9 的符號來(lái)引用。 | ||
| 將兩個(gè)匹配條件進(jìn)行邏輯“或”(Or)運算。例如正則表達式(him|her) 匹配"it belongs to him"和"it belongs to her",但是不能匹配"it belongs to them."。注意:這個(gè)元字符不是所有的軟件都支持的。 | ||
| 匹配1或多個(gè)正好在它之前的那個(gè)字符。例如正則表達式9+匹配9、99、999等。注意:這個(gè)元字符不是所有的軟件都支持的。 | ||
| 匹配0或1個(gè)正好在它之前的那個(gè)字符。注意:這個(gè)元字符不是所有的軟件都支持的。 | ||
\{i,j\} | 匹配指定數目的字符,這些字符是在它之前的表達式定義的。例如正則表達式A[0-9]\{3\} 能夠匹配字符"A"后面跟著(zhù)正好3個(gè)數字字符的串,例如A123、A348等,但是不匹配A1234。而正則表達式[0-9]\{4,6\} 匹配連續的任意4個(gè)、5個(gè)或者6個(gè)數字字符。注意:這個(gè)元字符不是所有的軟件都支持的。 |
最簡(jiǎn)單的元字符是點(diǎn),它能夠匹配任何單個(gè)字符(注意不包括新行符)。假定有個(gè)文件test.txt包含以下幾行內容:
要想匹配行首的字符要使用抑揚字符(^)——又是也被叫做插入符。例如,想找到text.txt中行首"he"打頭的行,你可能會(huì )先用簡(jiǎn)單表達式he,但是這會(huì )匹配第三行的the,所以要使用正則表達式^he,它只匹配在行首出現的h。
有時(shí)候指定“除了×××都匹配”會(huì )比較容易達到目的,當抑揚字符(^)出現在方括號中是,它表示“排除”,例如要匹配he ,但是排除前面是t or s的情性(也就是the和she),可以使用:[^st]he。
可以使用方括號來(lái)指定多個(gè)字符區間。例如正則表達式[A-Za-z]匹配任何字母,包括大寫(xiě)和小寫(xiě)的;正則表達式[A-Za-z][A-Za-z]* 匹配一個(gè)字母后面接著(zhù)0或者多個(gè)字母(大寫(xiě)或者小寫(xiě))。當然我們也可以用元字符+做到同樣的事情,也就是:[A-Za-z]+ ,和[A-Za-z][A-Za-z]*完全等價(jià)。但是要注意元字符+ 并不是所有支持正則表達式的程序都支持的。關(guān)于這一點(diǎn)可以參考后面的正則表達式語(yǔ)法支持情況。
要指定特定數量的匹配,要使用大括號(注意必須使用反斜杠來(lái)轉義)。想匹配所有100和1000的實(shí)例而排除10和10000,可以使用:10\{2,3\},這個(gè)正則表達式匹配數字1后面跟著(zhù)2或者3個(gè)0的模式。在這個(gè)元字符的使用中一個(gè)有用的變化是忽略第二個(gè)數字,例如正則表達式0\{3,\} 將匹配至少3個(gè)連續的0。
這里有一些有代表性的、比較簡(jiǎn)單的例子。
| vi 命令 | 作用 |
| :%s/ */ /g | 把一個(gè)或者多個(gè)空格替換為一個(gè)空格。 |
| :%s/ *$// | 去掉行尾的所有空格。 |
| :%s/^/ / | 在每一行頭上加入一個(gè)空格。 |
| :%s/^[0-9][0-9]* // | 去掉行首的所有數字字符。 |
| :%s/b[aeio]g/bug/g | 將所有的bag、beg、big和bog改為bug。 |
| :%s/t\([aou]\)g/h\1t/g | 將所有tag、tog和tug分別改為hat、hot和hug(注意用group的用法和使用\1引用前面被匹配的字符)。 |
將所有方法foo(a,b,c)的實(shí)例改為foo(b,a,c)。這里a、b和c可以是任何提供給方法foo()的參數。也就是說(shuō)我們要實(shí)現這樣的轉換:
| 之前 | 之后 | |
| foo(10,7,2) | foo(7,10,2) | |
| foo(x+13,y-2,10) | foo(y-2,x+13,10) | |
| foo( bar(8), x+y+z, 5) | foo( x+y+z, bar(8), 5) |
下面這條替換命令能夠實(shí)現這一魔法:
現在讓我們把它打散來(lái)加以分析。寫(xiě)出這個(gè)表達式的基本思路是找出foo()和它的括號中的三個(gè)參數的位置。第一個(gè)參數是用這個(gè)表達式來(lái)識別的::\([^,]*\),我們可以從里向外來(lái)分析它:
| [^,] | 除了逗號之外的任何字符 | |
| [^,]* | 0或者多個(gè)非逗號字符 | |
| \([^,]*\) | 將這些非逗號字符標記為\1,這樣可以在之后的替換模式表達式中引用它 | |
| \([^,]*\), | 我們必須找到0或者多個(gè)非逗號字符后面跟著(zhù)一個(gè)逗號,并且非逗號字符那部分要標記出來(lái)以備后用。 |
現在正是指出一個(gè)使用正則表達式常見(jiàn)錯誤的最佳時(shí)機。為什么我們要使用[^,]*這樣的一個(gè)表達式,而不是更加簡(jiǎn)單直接的寫(xiě)法,例如:.*,來(lái)匹配第一個(gè)參數呢?設想我們使用模式.*來(lái)匹配字符串"10,7,2",它應該匹配"10,"還是"10,7,"?為了解決這個(gè)兩義性(ambiguity),正則表達式規定一律按照最長(cháng)的串來(lái),在上面的例子中就是"10,7,",顯然這樣就找出了兩個(gè)參數而不是我們期望的一個(gè)。所以,我們要使用[^,]*來(lái)強制取出第一個(gè)逗號之前的部分。
這個(gè)表達式我們已經(jīng)分析到了:foo(\([^,]*\),這一段可以簡(jiǎn)單的翻譯為“當你找到foo(就把其后直到第一個(gè)逗號之前的部分標記為\1”。然后我們使用同樣的辦法標記第二個(gè)參數為\2。對第三個(gè)參數的標記方法也是一樣,只是我們要搜索所有的字符直到右括號。我們并沒(méi)有必要去搜索第三個(gè)參數,因為我們不需要調整它的位置,但是這樣的模式能夠保證我們只去替換那些有三個(gè)參數的foo()方法調用,在foo()是一個(gè)重載(overoading)方法時(shí)這種明確的模式往往是比較保險的。然后,在替換部分,我們找到foo()的對應實(shí)例,然后利用標記好的部分進(jìn)行替換,是的第一和第二個(gè)參數交換位置。
這里有幾行我們現在的數據:
下面就是第一個(gè)替換命令:
下面這個(gè)替換命令則用來(lái)去除空格:
Billy tried really hard而你想把"really"、"really really",以及任意數量連續出現的"really"字符串換成一個(gè)簡(jiǎn)單的"very"(simple is good!),那么以下命令:
Sally tried really really hard
Timmy tried really really really hard
Johnny tried really really really really hard
:%s/\(really \)\(really \)*/very /就會(huì )把上述的文本變成:
Billy tried very hard表達式\(really \)*匹配0或多個(gè)連續的"really "(注意結尾有個(gè)空格),而\(really \)\(really \)* 匹配1個(gè)或多個(gè)連續的"really "實(shí)例。
Sally tried very hard
Timmy tried very hard
Johnny tried very hard
當然,你也可以在Visual C++編輯器中使用RE。選擇Edit->Replace,然后選擇"Regular expression"選擇框,Find What輸入框對應上面介紹的vi命令:%s/pat1/pat2/g中的pat1部分,而Replace輸入框對應pat2部分。但是,為了得到vi的執行范圍和g選項,你要使用Replace All或者適當的手工Find Next and Replace(譯者按:知道為啥有人罵微軟弱智了吧,雖然VC中可以選中一個(gè)范圍的文本,然后在其中執行替換,但是總之不夠vi那么靈活和典雅)。
Sed是Stream EDitor的縮寫(xiě),是Unix下常用的基于文件和管道的編輯工具,可以在手冊中得到關(guān)于sed的詳細信息。
這里是一些有趣的sed腳本,假定我們正在處理一個(gè)叫做price.txt的文件。注意這些編輯并不會(huì )改變源文件,sed只是處理源文件的每一行并把結果顯示在標準輸出中(當然很容易使用重定向來(lái)定制):
| sed腳本 | 描述 | |
| sed ‘s/^$/d‘ price.txt | 刪除所有空行 | |
| sed ‘s/^[ \t]*$/d‘ price.txt | 刪除所有只包含空格或者制表符的行 | |
| sed ‘s/"http://g‘ price.txt | 刪除所有引號 |
在A(yíng)ho,Weinberger和Kernighan的書(shū)The AWK Programming Language中有很多很好的awk的例子,請不要讓下面這些微不足道的腳本例子限制你對awk強大能力的理解。我們同樣假定我們針對price.txt文件進(jìn)行處理,跟sed一樣,awk也只是把結果顯示在終端上。
| awk腳本 | 描述 | |
| awk ‘$0 !~ /^$/‘ price.txt | 刪除所有空行 | |
| awk ‘NF > 0‘ price.txt | awk中一個(gè)更好的刪除所有行的辦法 | |
| awk ‘$2 ~ /^[JT]/ {print $3}‘ price.txt | 打印所有第二個(gè)字段是‘J‘或者‘T‘打頭的行中的第三個(gè)字段 | |
| awk ‘$2 !~ /[Mm]isc/ {print $3 + $4}‘ price.txt | 針對所有第二個(gè)字段不包含‘Misc‘或者‘misc‘的行,打印第3和第4列的和(假定為數字) | |
| awk ‘$3 !~ /^[0-9]+\.[0-9]*$/ {print $0}‘ price.txt | 打印所有第三個(gè)字段不是數字的行,這里數字是指d.d或者d這樣的形式,其中d是0到9的任何數字 | |
| awk ‘$2 ~ /John|Fred/ {print $0}‘ price.txt | 如果第二個(gè)字段包含‘John‘或者‘Fred‘則打印整行 |
下面的例子中我們假定在文件phone.txt中包含以下的文本,——其格式是姓加一個(gè)逗號,然后是名,然后是一個(gè)制表符,然后是電話(huà)號碼:
Francis, John 5-3871
Wong, Fred 4-4123
Jones, Thomas 1-4122
Salazar, Richard 5-2522
| grep命令 | 描述 | |
| grep ‘\t5-...1‘ phone.txt | 把所有電話(huà)號碼以5開(kāi)頭以1結束的行打印出來(lái),注意制表符是用\t表示的 | |
| grep ‘^S[^ ]* R‘ phone.txt | 打印所有姓以S打頭和名以R打頭的行 | |
| grep ‘^[JW]‘ phone.txt | 打印所有姓開(kāi)頭是J或者W的行 | |
| grep ‘, ....\t‘ phone.txt | 打印所有姓是4個(gè)字符的行,注意制表符是用\t表示的 | |
| grep -v ‘^[JW]‘ phone.txt | 打印所有不以J或者W開(kāi)頭的行 | |
| grep ‘^[M-Z]‘ phone.txt | 打印所有姓的開(kāi)頭是M到Z之間任一字符的行 | |
| grep ‘^[M-Z].*[12]‘ phone.txt | 打印所有姓的開(kāi)頭是M到Z之間任一字符,并且點(diǎn)號號碼結尾是1或者2的行 |
| egrep command | Description | |
| egrep ‘(John|Fred)‘ phone.txt | 打印所有包含名字John或者Fred的行 | |
| egrep ‘John|22$|^W‘ phone.txt | 打印所有包含John 或者以22結束或者以W的行 | |
| egrep ‘net(work)?s‘ report.txt | 從report.txt中找到所有包含networks或者nets的行 |
| 命令或環(huán)境 | . | [ ] | ^ | $ | \( \) | \{ \} | + | | | ( ) | |
| vi | X | X | X | X | X | |||||
| Visual C++ | X | X | X | X | X | |||||
| awk | X | X | X | X | X | X | X | X | ||
| sed | X | X | X | X | X | X | ||||
| Tcl | X | X | X | X | X | X | X | X | X | |
| ex | X | X | X | X | X | X | ||||
| grep | X | X | X | X | X | X | ||||
| egrep | X | X | X | X | X | X | X | X | X | |
| fgrep | X | X | X | X | X | |||||
| perl | X | X | X | X | X | X | X | X | X |
s 表示其后是一個(gè)替換命令。
pat1 這是要查找的一個(gè)正則表達式,這篇文章中有一大堆例子。
g 可選標志,帶這個(gè)標志表示替換將針對行中每個(gè)匹配的串進(jìn)行,否則則只替換行中第一個(gè)匹配串。
聯(lián)系客服