2013年11月22日 星期五

libiconv: 字元集碼編轉換

from:http://www.jollen.org/blog/2006/09/libiconv_1.html

實作 Linux 系統程式時,常需要做「Unicode 與 Big5」間的字元編碼轉換;嵌入式 Linux 的應用也經常會遇到這樣的需求,例如我們原則上會將文件存成 Unicode,當程式執行時,再決定要輸出成 Unicode 或 Big5 (or GBxxxx),這時就要使用到 GNU 的 libiconv 專案。
GNU libiconv 用來做字元間的編碼轉換,已經廣泛被使用在 GNU/Linux 系統中,例如 PHP 的 iconv 系統即是使用 GNU libiconv。libiconv 要移植到 ARM9 平臺上也是非常容易的。GNU libiconv 的官方首頁是:http://www.gnu.org/software/libiconv/
把 libiconv 套件解開並編譯後,可以在 src/ 目錄下找到 iconv 執行檔,這是 libiconv 為我們寫好的一個字元轉碼 (conversion) 工具,這個工具相當的實用,比如以 jollen 的網站來說,jollen.org 的網頁是以 unicode 儲存,但是我們發佈的頁面是以 big5 編碼為主,我們所使用的轉換工具便是 iconv。
iconv 的使用可以參考 http://www.gnu.org/software/libiconv/documentation/libiconv/iconv.1.html,我們舉一個例子來說明,比如我想把 big5.txt 文件 (Big5 encode) 轉換成 Unicode (UTF-8),那麼只要執行:
$ iconv -f BIG5 -t UTF-8 big5.txt
就可以了,參數 -f 指定來源編碼,參數 -t 指定目的編碼,編碼後的字串會輸出到 stdout。字元集 BIG5 也可以寫成 BIG-5,或是 BIG-FIVE,或是 BIGFIVE;要怎麼知道 iconv 可以處理 (接受) 哪些字元集 (character set ),只要執行 'iconv -l' 就可以查詢了,輸出結果會是一大票的字元集列表。
這是使用 iconv 工具的方式,假如要自己寫程式的話也是非常簡單的,因為 libiconv 裡頭只有 3 個函數:
iconv_t iconv_open (const char* tocode, const char* fromcode):開啟 libiconv。
size_t iconv (iconv_t cd, const char* * inbuf, size_t * inbytesleft, char* * outbuf, size_t * outbytesleft):執行轉碼。
int iconv_close (iconv_t cd):做完轉碼後關閉 libiconv。
libiconv-1.xx/src/iconv.c 本身就是一個很棒的範例了,大家可以參考。

關於 gettext

關於 gettext (一、簡介)

關於 gettext (二、一個例子)

關於 gettext (po-mode 使用)

2013年11月7日 星期四

TCP offload engine (TOE)

from:http://www.kernelchina.org/node/611
延伸閱讀:
Competitive Comparison Intel® I/O Acceleration Technology vs. TCP Offload Engine

TCP減壓引擎,第一次聽說這個名詞,但是並不是一個新的概念了,若干年前聽說過設備廠商在研究在FPGA之中實現TCP Stack,但是後來沒有聽到任何的產品出來,應該是路由設備to host的traffic不多,而對於FW設備,中間的TCP Proxy實現過於復雜,工程上不可能實現。
現在的所謂TOE實現我理解主要用於host的interface之中,用於為Gbits以及10Gbits接口場景中為CPU減壓,例如部署在數據中心內部的服務器,CPU雖然越來越快,但是對於洶湧澎湃的Traffic來說,還是有些力不從心。
clip_image002
上面是TOE應用前後協議棧的差別,我覺得畫的有點絕對,TCP Stack不太可能完全實現在interface之中,其實TOE主要實現如下的offload:
1.TCP/IP Checksum offload
CPU可以不用計算checksum而由網卡計算
2.CPU不用考慮數據的分段了,估計是直接將socket送過來的buf交給網卡。
如果是僅僅實現上述功能TOE是很可能工程化實現的。
在另一篇文檔中提到了TOE的一些優勢,但是我的分析,這個可能是要實現TOP替代整個TCP之後的優勢。
1.減少中斷:不用每個報文都產生中斷,如果10G接口這個對於CPU是很大的開銷。
2.減少memory拷貝次數,很多時候網卡的buffer和app的可以直接共享。
3.協議處理的節約,這個是當然的了。

http://en.wikipedia.org/wiki/TCP_offload_engine


2013年10月14日 星期一

Understanding UUID

通用唯一識別碼 (Universally Unique IDentifier, UUID) 或是全域唯一識別碼 (Globally Unique IDentifier, GUID) 是一個 128 bits 的整數,並保證其在時間與空間的分佈都是獨一無二的。UUID 由開放軟體基金會 (OSF) 標準化後用在他們的 DCE 系統上,後來在微軟的 COM 系統上發揚光大。除此之外在許多地方也都可以看到 UUID 的身影,如 Linux 上的分割表/區塊裝置就是以 UUID 來標示,或是 RSS 的  標籤也可以使用 UUID,實際上 UUID 是標準的 URN 表示法之一,你可以在任何需要標示單一物件的地方使用 UUID。
UUID 的文字形式為一個 8-4-4-4-12 的十六進位表示,共有 16 個 bytes,有人說使用 UUID 不方便人類辨識,但了解 UUID 的組成後你還是可以從這個表示法看出一些端倪來。本文參考的是 IETF 版本的 RFC 4122
UUID 共有四個版本,第 13 個字元的位置就是表示版本號。第一種是以時間和網路卡號組成,時間是以一百奈秒為單位,網路卡號理論上是不會重複的,再加上 clock_seq 這個每次開機重設一次的亂數欄位,就算時間回朔了也不會重複,代號是 1。第二種和第四種是以命名空間加上一個 hash 組成的,分別可以使用MD5 或是 SHA1 演算法,算出來後就填到空位中,代號是 3 跟 5。第三種是全亂數組成,代號是 4
因此我們可以在不同的情境選用不同的 UUID,也可以從 UUID 看出版本跟時間等資訊,如4ef17586-f187-11df-8xxx-xxxxxxxxxxxx 看到第三個區塊是 11df 就可以知道是最近產生的以時間卡號為基礎的 UUID,時間 1dff1874ef17586 解出來就是 2010-11-16 13:42:09.173031.0 UTC。而 7c0fdbe4-1b09-4278-9fc9-5f0c6a1f2ae2 就是純亂數的 UUID,沒有任何意義。


from:http://kanru.info/blog/archives/2010/11/16/uuid-el/Ref:http://en.wikipedia.org/wiki/Universally_unique_identifier

2013年9月5日 星期四

LCP, Authentication, and NCP Stage

Within some of the PPP phases described previously, PPP also goes into specific stages such as LCP negotiation, authentication, and NCP negotiation. For more information, refer to RFC 1548 leavingcisco.com and RFC 1661 leavingcisco.com.

LCP (Mandatory Phase)

LCP is a phase in which parameters to establish, configure, and test the data-link connection are negotiated. An LCP state of open means that LCP was successfully completed, while an LCP state of closed indicates an LCP failure.
This diagram shows a conceptual view of an LCP handshake:
debug_ppp_negotiation1.gif
The LCP negotiation also uses a parameter called MagicNumber, which is used to determine if the link is looped back. A random string is sent across the link and, if the same value is returned, then the router determines that the link is looped back.

Authentication (Optional Phase by Default)

In this stage, the authentication is performed with the authentication protocol (CHAP or PAP) agreed upon in LCP negotiation. For PAP related information, refer to Configuring and Troubleshooting PPP Password Authentication Protocol (PAP).
For CHAP related information, refer to Understanding and Configuring PPP CHAP Authentication.
Note: Authentication is optional and PPP only enters this stage if it needs to authenticate.

NCP (Mandatory Phase)

This phase is used to establish and configure different network-layer protocols. The most common L3 protocol negotiated is IP. The routers exchange IP Control Protocol (IPCP) messages to negotiate options specific to the protocol (IP in this example).
RFC 1332 leavingcisco.com says that IPCP negotiates two options: compression and IP address assignments. However, IPCP is also used to pass network related information such as primary and backup Windows Name Service (WINS) and Domain Name System (DNS) servers.
The negotiation occurs with the use of CONF messages, as described in the PPP Negotiation Packets: A Description section of this document.

From: http://www.cisco.com/en/US/tech/tk713/tk507/technologies_tech_note09186a00800ae945.shtml

2013年8月6日 星期二

SED單行腳本快速參考 (USEFUL ONE-LINE SCRIPTS FOR SED)

在以下地址可找到本文檔的最新(英文)版本:
   http://sed.sourceforge.net/sed1line.txt 
   http://www.pement.org/sed/sed1line.txt

文本間隔:
--------

 # 在每一行後面增加一空行
 sed G

 # 將原來的所有空行刪除並在每一行後面增加一空行。
 # 這樣在輸出的文本中每一行後面將有且只有一空行。
 sed '/^$/d;G'

 # 在每一行後面增加兩行空行
 sed 'G;G'

 # 將第一個腳本所產生的所有空行刪除(即刪除所有偶數行)
 sed 'n;d'

 # 在匹配式樣“regex”的行之前插入一空行
 sed '/regex/{x;p;x;}'

 # 在匹配式樣“regex”的行之後插入一空行
 sed '/regex/G'

 # 在匹配式樣“regex”的行之前和之後各插入一空行
 sed '/regex/{x;p;x;G;}'

編號:
--------

 # 為文件中的每一行進行編號(簡單的左對齊方式)。這裡使用了“製表符”
 # (tab,見本文末尾關於'\t'的用法的描述)而不是空格來對齊邊緣。
 sed = filename | sed 'N;s/\n/\t/'

 # 對文件中的所有行編號(行號在左,文字右端對齊)。
 sed = filename | sed 'N; s/^/ /; s/ *\(.\{6,\}\)\n/\1 /'

 # 對文件中的所有行編號,但只顯示非空白行的行號。
 sed '/./=' filename | sed '/./N; s/\n/ /'

 # 計算行數(模擬"wc -l")
 sed -n '$='

文本轉換和替代:
--------

 # Unix環境:轉換DOS的新行符(CR/LF)為Unix格式。
 sed 's/.$//' # 假設所有行以CR/LF結束
 sed 's/^M$//' # 在bash/tcsh中,將按Ctrl-M改為按Ctrl-V
 sed 's/\x0D$//' # ssed、gsed 3.02.80,及更高版本

 # Unix環境:轉換Unix的新行符(LF)為DOS格式。
 sed "s/$/`echo -e \\\r`/" # 在ksh下所使用的命令
 sed 's/$'"/`echo \\\r`/" # 在bash下所使用的命令
 sed "s/$/`echo \\\r`/" # 在zsh下所使用的命令
 sed 's/$/\r/' # gsed 3.02.80 及更高版本

 # DOS環境:轉換Unix新行符(LF)為DOS格式。
 sed "s/$//" # 方法 1
 sed -np # 方法 2

 # DOS環境:轉換DOS新行符(CR/LF)為Unix格式。
 # 下面的腳本只對UnxUtils sed 4.0.7 及更高版本有效。要識別UnxUtils版本的
 # sed可以通過其特有的“--text”選項。你可以使用幫助選項(“--help”)看
 # 其中有無一個“--text”項以此來判斷所使用的是否是UnxUtils版本。其它DOS
 # 版本的的sed則無法進行這一轉換。但可以用“tr”來實現這一轉換。
 sed "s/\r//" infile >outfile # UnxUtils sed v4.0.7 或更高版本
 tr -d \r outfile # GNU tr 1.22 或更高版本

 # 將每一行前導的“空白字符”(空格,製表符)刪除
 # 使之左對齊
 sed 's/^[ \t]*//' # 見本文末尾關於'\t'用法的描述

 # 將每一行拖尾的“空白字符”(空格,製表符)刪除
 sed 's/[ \t]*$//' # 見本文末尾關於'\t'用法的描述

 # 將每一行中的前導和拖尾的空白字符刪除
 sed 's/^[ \t]*//;s/[ \t]*$//'

 # 在每一行開頭處插入5個空格(使全文向右移動5個字符的位置)
 sed 's/^/ /'

 # 以79個字符為寬度,將所有文本右對齊
 sed -e :a -e 's/^.\{1,78\}$/ &/;ta' # 78個字符外加最後的一個空格

 # 以79個字符為寬度,使所有文本居中。在方法1中,為了讓文本居中每一行的前
 # 頭和後頭都填充了空格。在方法2中,在居中文本的過程中只在文本的前面填充
 # 空格,並且最終這些空格將有一半會被刪除。此外每一行的後頭並未填充空格。
 sed -e :a -e 's/^.\{1,77\}$/ & /;ta' # 方法1
 sed -e :a -e 's/^.\{1,77\}$/ &/;ta' -e 's/\( *\)\1/\1/' # 方法2

 # 在每一行中查找字串“foo”,並將找到的“foo”替換為“bar”
 sed 's/foo/bar/' # 只替換每一行中的第一個“foo”字串
 sed 's/foo/bar/4' # 只替換每一行中的第四個“foo”字串
 sed 's/foo/bar/g' # 將每一行中的所有“foo”都換成“bar”
 sed 's/\(.*\)foo\(.*foo\)/\1bar\2/' # 替換倒數第二個“foo”
 sed 's/\(.*\)foo/\1bar/' # 替換最後一個“foo”

 # 只在行中出現字串“baz”的情況下將“foo”替換成“bar”
 sed '/baz/s/foo/bar/g'

 # 將“foo”替換成“bar”,並且只在行中未出現字串“baz”的情況下替換
 sed '/baz/!s/foo/bar/g'

 # 不管是“scarlet”“ruby”還是“puce”,一律換成“red”
 sed 's/scarlet/red/g;s/ruby/red/g;s/puce/red/g' #對多數的sed都有效
 gsed 's/scarlet\|ruby\|puce/red/g' # 只對GNU sed有效

 # 倒置所有行,第一行成為最後一行,依次類推(模擬“tac”)。
 # 由於某些原因,使用下面命令時HHsed v1.5會將文件中的空行刪除
 sed '1!G;h;$!d' # 方法1
 sed -n '1!G;h;$p' # 方法2

 # 將行中的字符逆序排列,第一個字成為最後一字,……(模擬“rev”)
 sed '/\n/!G;s/\(.\)\(.*\n\)/&\2\1/;//D;s/.//'

 # 將每兩行連接成一行(類似“paste”)
 sed '$!N;s/\n/ /'

 # 如果當前行以反斜杠“\”結束,則將下一行並到當前行末尾
 # 並去掉原來行尾的反斜杠
 sed -e :a -e '/\\$/N; s/\\\n//; ta'

 # 如果當前行以等號開頭,將當前行並到上一行末尾
 # 並以單個空格代替原來行頭的​​“=”
 sed -e :a -e '$!N;s/\n=/ /;ta' -e 'P;D'

 # 為數字字串增加逗號分隔符號,將“1234567”改為“1,234,567”
 gsed ':a;s/\B[0-9]\{3\}\>/,&/;ta' # GNU sed
 sed -e :a -e 's/\(.*[0-9]\)\([0-9]\{3\}\)/\1,\2/;ta' # 其他sed

 # 為帶有小數點和負號的數值增加逗號分隔符(GNU sed)
 gsed -r ':a;s/(^|[^0-9.])([0-9]+)([0-9]{3})/\1\2,\3/g;ta '

 # 在每5行後增加一空白行(在第5,10,15,20,等行後增加一空白行)
 gsed '0~5G' # 只對GNU sed有效
 sed 'n;n;n;n;G;' # 其他sed

選擇性地顯示特定行:
--------

 # 顯示文件中的前10行(模擬“head”的行為)
 sed 10q

 # 顯示文件中的第一行(模擬“head -1”命令)
 sed q

 # 顯示文件中的最後10行(模擬“tail”)
 sed -e :a -e '$q;N;11,$D;ba'

 # 顯示文件中的最後2行(模擬“tail -2”命令)
 sed '$!N;$!D'

 # 顯示文件中的最後一行(模擬“tail -1”)
 sed '$!d' # 方法1
 sed -n '$p' # 方法2

 # 顯示文件中的倒數第二行
 sed -e '$!{h;d;}' -ex # 當文件中只有一行時,輸入空行
 sed -e '1{$q;}' -e '$!{h;d;}' -ex # 當文件中只有一行時,顯示該行
 sed -e '1{$d;}' -e '$!{h;d;}' -ex # 當文件中只有一行時,不輸出

 # 只顯示匹配正則表達式的行(模擬“grep”)
 sed -n '/regexp/p' # 方法1
 sed '/regexp/!d' # 方法2

 # 只顯示“不”匹配正則表達式的行(模擬“grep -v”)
 sed -n '/regexp/!p' # 方法1,與前面的命令相對應
 sed '/regexp/d' # 方法2,類似的語法

 # 查找“regexp”並將匹配行的上一行顯示出來,但並不顯示匹配行
 sed -n '/regexp/{g;1!p;};h'

 # 查找“regexp”並將匹配行的下一行顯示出來,但並不顯示匹配行
 sed -n '/regexp/{n;p;}'

 # 顯示包含“regexp”的行及其前後行,並在第一行之前加上“regexp”所
 # 在行的行號(類似“grep -A1 -B1”)
 sed -n -e '/regexp/{=;x;1!p;g;$!N;p;D;}' -eh

 # 顯示包含“AAA”、“BBB”或“CCC”的行(任意次序)
 sed '/AAA/!d; /BBB/!d; /CCC/!d' # 字串的次序不影響結果

 # 顯示包含“AAA”、“BBB”和“CCC”的行(固定次序)
 sed '/AAA.*BBB.*CCC/!d'

 # 顯示包含“AAA”“BBB”或“CCC”的行(模擬“egrep”)
 sed -e '/AAA/b' -e '/BBB/b' -e '/CCC/b' -ed # 多數sed
 gsed '/AAA\|BBB\|CCC/!d' # 對GNU sed有效

 # 顯示包含“AAA”的段落(段落間以空行分隔)
 # HHsed v1.5 必須在“x;”後加入“G;”,接下來的3個腳本都是這樣
 sed -e '/./{H;$!d;}' -e 'x;/AAA/!d;'

 # 顯示包含“AAA”“BBB”和“CCC”三個字串的段落(任意次序)
 sed -e '/./{H;$!d;}' -e 'x;/AAA/!d;/BBB/!d;/CCC/!d'

 # 顯示包含“AAA”、“BBB”、“CCC”三者中任一字串的段落(任意次序)
 sed -e '/./{H;$!d;}' -e 'x;/AAA/b' -e '/BBB/b' -e '/CCC/b' -ed
 gsed '/./{H;$!d;};x;/AAA\|BBB\|CCC/b;d' # 只對GNU sed有效

 # 顯示包含65個或以上字符的行
 sed -n '/^.\{65\}/p'

 # 顯示包含65個以下字符的行
 sed -n '/^.\{65\}/!p' # 方法1,與上面的腳本相對應
 sed '/^.\{65\}/d' # 方法2,更簡便一點的方法

 # 顯示部分文本——從包含正則表達式的行開始到最後一行結束
 sed -n '/regexp/,$p'

 # 顯示部分文本——指定行號範圍(從第8至第12行,含8和12行)
 sed -n '8,12p' # 方法1
 sed '8,12!d' # 方法2

 # 顯示第52行
 sed -n '52p' # 方法1
 sed '52!d' # 方法2
 sed '52q;d' # 方法3, 處理大文件時更有效率

 # 從第3行開始,每7行顯示一次    
 gsed -n '3~7p' # 只對GNU sed有效
 sed -n '3,${p;n;n;n;n;n;n;}' # 其他sed

 # 顯示兩個正則表達式之間的文本(包含)
 sed -n '/Iowa/,/Montana/p' # 區分大小寫方式

選擇性地刪除特定行:
--------

 # 顯示通篇文檔,除了兩個正則表達式之間的內容
 sed '/Iowa/,/Montana/d'

 # 刪除文件中相鄰的重複行(模擬“uniq”)
 # 只保留重複行中的第一行,其他行刪除
 sed '$!N; /^\(.*\)\n\1$/!P; D'

 # 刪除文件中的重複行,不管有無相鄰。注意hold space所能支持的緩存
 # 大小,或者使用GNU sed。
 sed -n 'G; s/\n/&&/; /^\([ -~]*\n\).*\n\1/d; s/\n//; h; P'

 # 刪除除重複行外的所有行(模擬“uniq -d”)
 sed '$!N; s/^\(.*\)\n\1$/\1/; t; D'

 # 刪除文件中開頭的10行
 sed '1,10d'

 # 刪除文件中的最後一行
 sed '$d'

 # 刪除文件中的最後兩行
 sed 'N;$!P;$!D;$d'

 # 刪除文件中的最後10行
 sed -e :a -e '$d;N;2,10ba' -e 'P;D' # 方法1
 sed -n -e :a -e '1,10!{P;N;D;};N;ba' # 方法2

 # 刪除8的倍數行
 gsed '0~8d' # 只對GNU sed有效
 sed 'n;n;n;n;n;n;n;d;' # 其他sed

 # 刪除匹配式樣的行
 sed '/pattern/d' # 刪除含pattern的行。當然pattern
                                       # 可以換成任何有效的正則表達式

 # 刪除文件中的所有空行(與“grep '.' ”效果相同)
 sed '/^$/d' # 方法1
 sed '/./!d' # 方法2

 # 只保留多個相鄰空行的第一行。並且刪除文件頂部和尾部的空行。
 # (模擬“cat -s”)
 sed '/./,/^$/!d' #方法1,刪除文件頂部的空行,允許尾部保留一空行
 sed '/^$/N;/\n$/D' #方法2,允許頂部保留一空行,尾部不留空行

 # 只保留多個相鄰空行的前兩行。
 sed '/^$/N;/\n$/N;//D'

 # 刪除文件頂部的所有空行
 sed '/./,$!d'

 # 刪除文件尾部的所有空行
 sed -e :a -e '/^\n*$/{$d;N;ba' -e '}' # 對所有sed有效
 sed -e :a -e '/^\n*$/N;/\n$/ba' # 同上,但只對gsed 3.02.*有效

 # 刪除每個段落的最後一行
 sed -n '/^$/{p;h;};/./{x;/./p;}'

特殊應用:
--------

 # 移除手冊頁(man page)中的nroff標記。在Unix System V或bash shell下使
 # 用'echo'命令時可能需要加上-e 選項。
 sed "s/.`echo \\\b`//g" # 外層的雙括號是必須的(Unix環境)
 sed 's/.^H//g' # 在bash或tcsh中, 按Ctrl-V 再按Ctrl-H
 sed 's/.\x08//g' # sed 1.5,GNU sed,ssed所使用的十六進制的表示方法

 # 提取新聞組或e-mail 的郵件頭
 sed '/^$/q' # 刪除第一行空行後的所有內容

 # 提取新聞組或e-mail 的正文部分
 sed '1,/^$/d' # 刪除第一行空行之前的所有內容

 # 從郵件頭提取“Subject”(標題欄字段),並移除開頭的“Subject:”字樣
 sed '/^Subject: */!d; s///;q'

 # 從郵件頭獲得回复地址
 sed '/^Reply-To:/q; /^From:/h; /./d;g;q'

 # 獲取郵件地址。在上一個腳本所產生的那一行郵件頭的基礎上進一步的將非電郵
 # 地址的部分剃除。(見上一腳本)
 sed 's/ *(.*)//; s/>.*//; s/.*[:<] *//'

 # 在每一行開頭加上一個尖括號和空格(引用信息)
 sed 's/^/> /'

 # 將每一行開頭處的尖括號和空格刪除(解除引用)
 sed 's/^> //'

 # 移除大部分的HTML標籤(包括跨行標籤)
 sed -e :a -e 's/<[^>]*>//g;/
zipup.bat dir /b *.txt | sed "s/^\(.*\)\.TXT/pkzip -mo \1 \1.TXT/" >>zipup.bat 使用SED:Sed接受一個或多個編輯命令,並且每讀入一行後就依次應用這些命令。 當讀入第一行輸入後,sed對其應用所有的命令,然後將結果輸出。接著再讀入第二 行輸入,對其應用所有的命令……並重複這個過程。上一個例子中sed由標準輸入設 備(即命令解釋器,通常是以管道輸入的形式)獲得輸入。在命令行給出一個或多 個文件名作為參數時,這些文件取代標準輸入設備成為sed的輸入。sed的輸出將被 送到標準輸出(顯示器)。因此: cat filename | sed '10q' # 使用管道輸入 sed '10q' filename # 同樣效果,但不使用管道輸入 sed '10q' filename > newfile # 將輸出轉移(重定向)到磁盤上 要了解sed命令的使用說明,包括如何通過腳本文件(而非從命令行)來使用這些命 令,請參閱《sed & awk》第二版,作者Dale Dougherty和Arnold Robbins (O'Reilly,1997;http://www.ora.com),《UNIX Text Processing》,作者 Dale Dougherty和Tim O'Reilly(Hayden Books,1987)或者是Mike Arst寫的教 程——壓縮包的名稱是“U-SEDIT2.ZIP”(在許多站點上都找得到)。要發掘sed 的潛力,則必須對“正則表達式”有足夠的理解。正則表達式的資料可以看 《Mastering Regular Expressions》作者Jeffrey Friedl(O'reilly 1997)。 Unix系統所提供的手冊頁(“man”)也會有所幫助(試一下這些命令 “man sed”、“man regexp”,或者看“man ed”中關於正則表達式的部分),但 手冊提供的信息比較“抽象”——這也是它一直為人所詬病的。不過,它本來就不 是用來教初學者如何使用sed或正則表達式的教材,而只是為那些熟悉這些工具的人 提供的一些文本參考。 括號語法:前面的例子對sed命令基本上都使用單引號('...')而非雙引號 ("...")這是因為sed通常是在Unix平台上使用。單引號下,Unix的shell(命令 解釋器)不會對美元符($)和後引號(`...`)進行解釋和執行。而在雙引號下 美元符會被展開為變量或參數的值,後引號中的命令被執行並以輸出的結果代替 後引號中的內容。而在“csh”及其衍生的shell中使用感嘆號(!)時需要在其前 面加上轉義用的反斜杠(就像這樣:\!)以保證上面所使用的例子能正常運行 (包括使用單引號的情況下)。DOS版本的Sed則一律使用雙引號("...")而不是 引號來圈起命令。 '\t'的用法:為了使本文保持行文簡潔,我們在腳本中使用'\t'來表示一個製表 符。但是現在大部分版本的sed還不能識別'\t'的簡寫方式,因此當在命令行中為 腳本輸入製表符時,你應該直接按TAB鍵來輸入製表符而不是輸入'\t'。下列的工 具軟件都支持'\t'做為一個正則表達式的字元來表示製表符:awk、perl、HHsed、 sedmod以及GNU sed v3.02.80。 不同版本的SED:不同的版本間的sed會有些不同之處,可以想像它們之間在語法上 會有差異。具體而言,它們中大部分不支持在編輯命令中間使用標籤(:name)或分 支命令(b,t),除非是放在那些的末尾。這篇文檔中我們盡量選用了可移植性較高 的語法,以使大多數版本的sed的用戶都能使用這些腳本。不過GNU版本的sed允許使 用更簡潔的語法。想像一下當讀者看到一個很長的命令時的心情: sed -e '/AAA/b' -e '/BBB/b' -e '/CCC/b' -ed 好消息是GNU sed能讓命令更緊湊: sed '/AAA/b;/BBB/b;/CCC/b;d' # 甚至可以寫成 sed '/AAA\|BBB\|CCC/b;d' 此外,請注意雖然許多版本的sed接受象“/one/ s/RE1/RE2/”這種在's'前帶有空 格的命令,但這些版本中有些卻不接受這樣的命令:“/one/! s/RE1/RE2/”。這時 只需要把中間的空格去掉就行了。 速度優化:當由於某種原因(比如輸入文件較大、處理器或硬盤較慢等)需要提高 命令執行速度時,可以考慮在替換命令(“s/.../.../”)前面加上地址表達式來 提高速度。舉例來說: sed 's/foo/bar/g' filename # 標準替換命令 sed '/foo/ s/foo/bar/g' filename # 速度更快 sed '/foo/ s//bar/g' filename # 簡寫形式 當只需要顯示文件的前面的部分或需要刪除後面的內容時,可以在腳本中使用“q” 命令(退出命令)。在處理大的文件時,這會節省大量時間。因此: sed -n '45,50p' filename # 顯示第45到50行 sed -n '51q;45,50p' filename # 一樣,但快得多 如果你有其他的單行腳本想與大家分享或者你發現了本文檔中錯誤的地方,請發電 子郵件給本文檔的作者(Eric Pement)。郵件中請記得提供你所使用的sed版本、 該sed所運行的操作系統及對問題的適當描述。本文所指的單行腳本指命令行的長 度在65個字符或65個以下的sed腳本〔譯註1〕。本文檔的各種腳本是由以下所列作 者所寫或提供: Al Aab # 建立了“seders”郵件列表 Edgar Allen # 許多方面 Yiorgos Adamopoulos # 許多方面 Dale Dougherty # 《sed & awk》作者 Carlos Duarte # 《do it with sed》作者 Eric Pement # 本文檔的作者 Ken Pizzini # GNU sed v3.02 的作者 SG Ravenhall # 去html標籤腳本 Greg Ubben # 有諸多貢獻並提供了許多幫助 -------------------------------------------------- ----------------------- 譯註1:大部分情況下,sed腳本無論多長都能寫成單行的形式(通過`-e'選項和`;' 號)——只要命令解釋器支持,所以這裡說的單行腳本除了能寫成一行還對長度有 所限制。因為這些單行腳本的意義不在於它們是以單行的形式出現。而是讓用戶能 方便地在命令行中使用這些緊湊的腳本才是其意義所在。

How to repair and clone disk with ddrescue

  ddrescue  is a tool that can be used to repair and clone disks on a  Linux system . This includes hard drives, partitions, DVD discs, flas...