2015年11月13日星期五

Swift Tutorial - To Do List App

2012年10月28日星期日

Release of FEKO Suite 6.2: Feature Overview

http://www.feko.info/about-us/News/release-of-feko-suite-6.2-feature-overview/view

FEKO Suite 6.2 下载地址：

http://www.feko.info/download/releases/Suite_6_2/download_installation/release-archives

Win32:http://www.feko.info/download/releases/Suite_6_2/release-archives/windows/feko_distrib_6.2_win32.exe

Win64:http://www.feko.info/download/releases/Suite_6_2/release-archives/windows/feko_distrib_6.2_win64.exe

2012年10月17日星期三

python 中文乱码问题深入分析

一直以来，python中的中文编码就是一个极为头大的问题，经常抛出编码转换的异常，python中的str和unicode到底是一个什么东西呢？

在本文中，以'哈'来解释作示例解释所有的问题，"哈"的各种编码如下：
1. UNICODE (UTF8-16)，C854；
2． UTF-8，E59388；
3． GBK，B9FE。
一、python中的str和unicode
一直以来，python中的中文编码就是一个极为头大的问题，经常抛出编码转换的异常，python中的str和unicode到底是一个什么东西呢？
在python中提到unicode，一般指的是unicode对象，例如'哈哈'的unicode对象为
u'\u54c8\u54c8′
而str，是一个字节数组，这个字节数组表示的是对unicode对象编码(可以是utf-8、gbk、cp936、GB2312)后的存储的格式。这里它仅仅是一个字节流，没有其它的含义，如果你想使这个字节流显示的内容有意义，就必须用正确的编码格式，解码显示。
例如： python

对于unicode对象哈哈进行编码，编码成一个utf-8编码的str－s_utf8,s_utf8就是是一个字节数组，存放的就是'\xe5\x93\x88\xe5\x93\x88′，但是这仅仅是一个字节数组，如果你想将它通过print语句输出成哈哈，那你就失望了，为什么呢？

因为print语句它的实现是将要输出的内容传送了操作系统，操作系统会根据系统的编码对输入的字节流进行编码，这就解释了为什么utf-8格式的字符串"哈哈"，输出的是"鍝堝搱"，因为 '\xe5\x93\x88\xe5\x93\x88′用GB2312去解释，其显示的出来就是"鍝堝搱"。这里再强调一下，str记录的是字节数组，只是某种编码的存储格式，至于输出到文件或是打印出来是什么格式，完全取决于其解码的编码将它解码成什么样子。

这里再对print进行一点补充说明：当将一个unicode对象传给print时，在内部会将该unicode对象进行一次转换，转换成本地的默认编码（这仅是个人猜测）
二、str和unicode对象的转换

str和unicode对象的转换，通过encode和decode实现，具体使用如下：

decode和encode演示

将GBK'哈哈'转换成unicode，然后再转换成UTF8
三、Setdefaultencoding

python

如上图的演示代码所示：

当把s(gbk字符串)直接编码成utf-8的时候，将抛出异常，但是通过调用如下代码：

import sys

reload(sys)

sys.setdefaultencoding('gbk')

后就可以转换成功，为什么呢？在python中str和unicode在编码和解码过程中，如果将一个str直接编码成另一种编码，会先把str解码成unicode，采用的编码为默认编码，一般默认编码是anscii，所以在上面示例代码中第一次转换的时候会出错，当设定当前默认编码为'gbk'后，就不会出错了。

至于reload(sys)是因为Python2.5 初始化后会删除 sys.setdefaultencoding 这个方法，我们需要重新载入。
四、操作不同文件的编码格式的文件

建立一个文件test.txt，文件格式用ANSI，内容为:

abc中文

用python来读取

# coding=gbk

print open("Test.txt").read()

结果：abc中文

把文件格式改成UTF-8：

结果：abc涓枃

显然，这里需要解码：

# coding=gbk

import codecs

print open("Test.txt").read().decode("utf-8″)

结果：abc中文

上面的test.txt我是用Editplus来编辑的，但当我用Windows自带的记事本编辑并存成UTF-8格式时，

运行时报错：

Traceback (most recent call last):

File "ChineseTest.py", line 3, in

print open("Test.txt").read().decode("utf-8″)

UnicodeEncodeError: 'gbk' codec can't encode character u'\ufeff' in position 0: illegal multibyte sequence

原来，某些软件，如notepad，在保存一个以UTF-8编码的文件时，会在文件开始的地方插入三个不可见的字符（0xEF 0xBB 0xBF，即BOM）。

因此我们在读取时需要自己去掉这些字符，python中的codecs module定义了这个常量：

# coding=gbk

import codecs

data = open("Test.txt").read()

if data[:3] == codecs.BOM_UTF8:

data = data[3:]

print data.decode("utf-8″)

结果：abc中文

五、文件的编码格式和编码声明的作用

源文件的编码格式对字符串的声明有什么作用呢？这个问题困扰一直困扰了我好久，现在终于有点眉目了，文件的编码格式决定了在该源文件中声明的字符串的编码格式，例如：

str = '哈哈'

print repr(str)

a.如果文件格式为utf-8，则str的值为：'\xe5\x93\x88\xe5\x93\x88′（哈哈的utf-8编码）

b.如果文件格式为gbk，则str的值为：'\xb9\xfe\xb9\xfe'（哈哈的gbk编码）

在第一节已经说过，python中的字符串，只是一个字节数组，所以当把a情况的str输出到gbk编码的控制台时，就将显示为乱码：鍝堝搱；而当把b情况下的str输出utf-8编码的控制台时，也将显示乱码的问题，是什么也没有，也许'\xb9\xfe\xb9\xfe'用utf-8解码显示，就是空白吧。>_<

说完文件格式，现在来谈谈编码声明的作用吧，每个文件在最上面的地方，都会用# coding=gbk 类似的语句声明一下编码，但是这个声明到底有什么用呢？到止前为止，我觉得它的作用也就是三个：

声明源文件中将出现非ascii编码，通常也就是中文；
在高级的IDE中，IDE会将你的文件格式保存成你指定编码格式。
决定源码中类似于u'哈'这类声明的将'哈'解码成unicode所用的编码格式，也是一个比较容易让人迷惑的地方，看示例：

#coding:gbk

ss = u'哈哈'

print repr(ss)

print 'ss:%s' % ss

将这个些代码保存成一个utf-8文本，运行，你认为会输出什么呢？大家第一感觉肯定输出的肯定是：

u'\u54c8\u54c8′

ss:哈哈

但是实际上输出是：

u'\u935d\u581d\u6431′

ss:鍝堝搱

为什么会这样，这时候，就是编码声明在作怪了，在运行ss = u'哈哈'的时候，整个过程可以分为以下几步：

1) 获取'哈哈'的编码：由文件编码格式确定，为'\xe5\x93\x88\xe5\x93\x88′（哈哈的utf-8编码形式）

2) 转成 unicode编码的时候，在这个转换的过程中，对于'\xe5\x93\x88\xe5\x93\x88′的解码，不是用utf-8解码，而是用声明编码处指定的编码GBK，将'\xe5\x93\x88\xe5\x93\x88′按GBK解码，得到就是"鍝堝搱"，这三个字的unicode编码就是u'\u935d\u581d\u6431′，至止可以解释为什么print repr(ss)输出的是u'\u935d\u581d\u6431′ 了。

好了，这里有点绕，我们来分析下一个示例：

#-*- coding:utf-8 -*-

ss = u'哈哈'

print repr(ss)

print 'ss:%s' % ss

将这个示例这次保存成GBK编码形式，运行结果，竟然是：

UnicodeDecodeError: 'utf8′ codec can't decode byte 0xb9 in position 0: unexpected code byte

这里为什么会有utf8解码错误呢？想想上个示例也明白了，转换第一步，因为文件编码是GBK，得到的是'哈哈'编码是GBK的编码'\xb9\xfe\xb9\xfe'，当进行第二步，转换成 unicode的时候，会用UTF8对'\xb9\xfe\xb9\xfe'进行解码，而大家查utf-8的编码表会发现，utf8编码表（关于UTF- 8解释可参见字符编码笔记：ASCII、UTF-8、UNICODE）中根本不存在，所以会报上述错误。

Python open读写文件实现脚本

Python中文件操作可以通过open函数，这的确很像C语言中的fopen。通过open函数获取一个file object，然后调用read()，write()等方法对文件进行读写操作。

1.open

使用open打开文件后一定要记得调用文件对象的close()方法。比如可以用try/finally语句来确保最后能关闭文件。
file_object = open('thefile.txt')
try:
all_the_text = file_object.read( )
finally:
file_object.close( )

注：不能把open语句放在try块里，因为当打开文件出现异常时，文件对象file_object无法执行close()方法。
2.读文件
读文本文件
input = open('data', 'r')
#第二个参数默认为r
input = open('data')

读二进制文件
input = open('data', 'rb')

读取所有内容
file_object = open('thefile.txt')
try:
all_the_text = file_object.read( )
finally:
file_object.close( )

读固定字节
file_object = open('abinfile', 'rb')
try:
while True:
chunk = file_object.read(100)
if not chunk:
break
do_something_with(chunk)
finally:
file_object.close( )

读每行
list_of_all_the_lines = file_object.readlines( )

如果文件是文本文件，还可以直接遍历文件对象获取每行：
for line in file_object:
process line

3.写文件
写文本文件
output = open('data', 'w')

写二进制文件
output = open('data', 'wb')

追加写文件
output = open('data', 'w+')

写数据
file_object = open('thefile.txt', 'w')
file_object.write(all_the_text)
file_object.close( )

写入多行
file_object.writelines(list_of_text_strings)

注意，调用writelines写入多行在性能上会比使用write一次性写入要高。

sed圣经

1.练习文件

cat datafile
northwest         NW           Charles Main             3.0      .98    3     34
northern          WE           Sharon  Cray             5.3      .97    5     23
southnorth        SW           Lewis   Dalsass          2.7      .8     2     18
southern          SO           Suan    Chin             5.1      .95    4     15
southeast         SE           Particia Hemenway        4.0      .7     4     17
eastern           EA           TB      Savage           4.4      .7     4     20
northeast         NE           am      Main JR.         5.1      .94    3     13
north             NO           Margot   Weber           4.5      .89    5      9
central           CT           Ann      Stephens        5.7      .94    5     13
wangdongsheng     ST           Neu     Soft             8.8      .77    6      5

2. sed '/north/p' datafile
默认情况下sed会打出全部的，如果在某一行匹配到模式north ,sed会多打一遍此行.

3. sed -n 'north/p' datafile
-n 与p命令配合使用，sed 取消了sed的缺省打印动作，如果不指定n这个选项，
sed就会从复打印north选项,如果指定了n就只打印模式north的那几行.

4. sed '3d' datafile
d命令就是删除第3行内容。

5.sed'3,$d' datafile
删除第3行到最后一行的内容。

6. sed '$d' datafile
删除最后一行.

7. sed '/north/d' datafile
删除包含所有行的north；其他的打印出来

8.sed 's/west/north/g'
把所有的west替换成north

9.sed -n 's/^west/north/p' datafile
搜索行首带west的行，并将替换为north，并打印出来

10.sed 's/[0-9][0-9]$/&.5/' datafile
与符号(&)在替换穿中时，代表查找串中匹配内容。这个例子中以两位数字结尾的行后面都被加上.5如果要在替换串中表示"与"号字面的含义，就要对起进行转义，记为：\&

11. sed -n 's/Hemenway/Jones/gp' datafile
文件中出现所有Hemenway都被替换为Jones,唯一发生变化的行被打印.选项-n与p的组合取消了缺省的输出,标志g含义在行内进行全局替换。

12. sed -n 's/$Mar$got/\lianne/p' datafile
扩在括号里的模式Mar作为标签1被保存与特殊寄存器中，替换串通、1引用它，Margot被替换为Marianne.

13. sed 's#3#88#g' datafile
紧跟在S命令的字符是查找和替换之间的分隔符。分隔符缺省的正斜杠，但可以改变(只在使用s命令时).无论什么字符，只要紧跟着s命令就成新的串分隔符，这个方法在查找包含正斜杠的模式时很管用，例如查找路径名和生日.

14. sed -n '/west/,/east/p' datafile
打印在west和east之间的所有行，如果west出现在east之后的某一行，则打印的范围从west所在行开始，到下一个出现east的行或文件末尾。

15. sed -n '5,/^northeast/p' datafile
打印前5行到第一个以northeast开头的行之间的所有行.

16 '/west/,/east/s/$/***WANGDONGSHENG***/' datafile
修改模式east和west之间的所有行,将各行的行尾($)替换为字符串***WANGDONGSHENG***换行符号被移动到这个新的字符串后面，箭头标出了范围.

17. sed -e '1,3d' -e 's/Hemenway/Jones' datafile
-e的作用是先删除1到3行，然后把Hemenway替换Jones,因为这是逐行编辑的（即两个命令都在模式空间上执行）,所以编辑的顺序会影响结果.例如如果两条命令都是执行替换,则前一行替换会影响后一行.

18.sed -n '/north/w newfile' datafile
w命令是把指定写入文件。文件datafile中所有包含模式north的行都写到文件newfile中

19.sed '/^north  /a\\---->the north sales district has moved<---' datafile
a为追加命令，字符串the north sales district has moved被加在以north开头,north
后跟一空格的各行之后，用于追加文本必须出现在追加命令下一行上.

20.sed '/eastern/i\\NEW REGLAND REGION\\---------------------------' datafile
i命令是插入命令。如果某一行匹配到模式eastern，i命令就在该行上放插入命令中反斜
杠后的文本，除了最后一行，用于插入文本中每一行都必须以反斜杠结尾

21.sed '/eastern/{ n; s/AM/Archie/; }' datafile
如果在某一行匹配到模式eastern,n命令就是指sed用下一个输入行(即包括AM Main Jr 的那行）
替换模式空间中的当前行，用Archie替换（s）其中的AM，然后打印

22. sed'1,3y/abcdefghijklmnopqrstuvwxyz/ABCDEFGHIJKLMNOPQRSTUVWXYZ' datafile
y命令把第一到第3行所有小写字母换成大写字母。正则表达式对y不起作用.

23 sed '5q' datafile
打印第5行之后,q命令让sed程序退出

24 'Lewis/{ s/Lewis/Joseph/;q; }' datafile
在某行匹配模式到Lewis时,先用Joseph替换(s)Lewis然后q命令退出

25 sed -e '/northeast/h' -e '$G' datafile
如果在某一行找到模式WE,h命令就将该行从模式缓冲区拷贝到一个暂存的缓冲区
保存在暂存缓冲区的行可以在以后被重新取出(使用命令G或g），这个例子中，当模式WE
被找到时将模式缓冲区的那份拷贝删除，

26.sed -e '/WE/{h; d; }' -e '/CT/{G; }' datafile
sed处理文件时，会把文件每一行都保存在一个临时的缓冲区中，这个缓冲区会被称为模式空间。sed处理每一行后，都会将其打印在屏幕上，除非该行被删除会被取消。之后模式空间清空，下一输入行等待处理。本例子中，被包含的模式northeast的行被找到之后，就被保存在模式空间里h命令把复制并保存到另一个缓冲区，这个特殊的缓冲区是暂存的缓冲区(holding buffer)在第二条sed命令中,sed读到最后一行($)时，G命令指示它从暂存缓冲区读出一行，将其放回模式缓冲区，追加在模式空间内当前行（本例中是最后一行）的后面

sed 's/^[]*//g' filename

sed 's/^ *//g' filename

sed 's/^[[:space:]]*//g' filename

删除以.结尾行 s/^.$//g

删除以一个以上空格,用一个空格代替 s/[][][]*/[]/g

删除空行 /^$/d

删除第一个字符 s/^.//g

删除所有空格并用Tab键代替 s/[]/[ ]//g

删除行首所有Tab键 s/^[ ]//g

删除所有Tab键 s/[ ]*//g

2012年8月28日星期二

秋天到了

夜阑听窗外风声

2012年8月26日星期日

打扫卫生梳理自己

一个月了，房间里乱的很，是要打扫打扫卫生了。正值今天的大好天气，洗洗衣服晒晒被子，蛮好的。一些零碎的东西趁这个机会也收拾整理一下。
这周没有骑车子到外面去玩，因为感觉背疼。可能是由于Agile培训期间被海伦宾馆的空调吹坏了！！！
同事说背疼是寒气太重，跑跑步出出汗就能好了。于是乎，微博上几个同事相互监督有没有锻炼，真的有点全民运动的感觉～一个习惯的养成需要21天，大家加油吧！
确实，工作后运动的少，身子骨大不如以前了。
入职四个月多了，是应该要给自己做个评估和总结，可是我还是很难克服外界对我计划的影响，很多事情一直在拖着…比如学习Python学习通信基础知识和WCDMA，还有SM一直建议学习英语考雅思出国，还有说了好多次要和同学聚会都耽搁了…
接下来国庆的黄山骑行以及申请公司甘肃志愿者都要提前做好准备。
当然也在和一个女生拍拖，哎，什么时候是个头啊
很高兴的是，组里有好几个同事看到我加入了爱德重返校园计划，都很想和我一起资助小学生，真的，我倍感欣慰～～
好了，去打扫卫生了，上天赐予我们最好的礼物就是时间了，我们要好好珍惜，并把它用在有意义的事情上

订阅：博文 (Atom)

寺院的研究僧

2015年11月13日星期五

Swift Tutorial - To Do List App

2012年10月28日星期日

FEKO Suite 6.2 (32位&64位) 下载

Release of FEKO Suite 6.2: Feature Overview

FEKO Suite 6.2 下载地址：

2012年10月17日星期三

python 中文乱码问题深入分析

Python open读写文件实现脚本

sed圣经

2012年8月28日星期二

秋天到了

2012年8月26日星期日

打扫卫生梳理自己