找到含有某些字符的单词
【问题】
geeks, if I wanted to search a file for words that contained only the letters in a set, what would be my best regex?
【回答】
这个问题没什么好办法但也没什么难的,基本的解决思路是将文本拆成单词,单词再拆成字符集合,用计算交集来匹配字符。正则表达式理论上可以实现字符匹配,但涉及到次序不固定的情况下并不好写,而且执行速度较慢,还不如自己编程序实现上面的思路。下面用SPL来演绎一下:
A |
|
1 |
=file("e:\\sample.txt").read() |
2 |
=A1.words() |
3 |
=A2.select(["c","d","b"]==["c","d","b"]^~.split()) |
A1:读取文本
A2:将字符串拆成单词组成的序列
A3:循环将每个单词拆分成字符集合,查询出含有字符c,d,b的单词
SPL支持字符串的拆分(split),也支持集合运算(^表示交集),还支持过滤(select),实现字符匹配较容易,性能也不错。另外,SPL的函数regex也可以进行正则表达式匹配。