找到含有某些字符的单词

【问题】

geeks, if I wanted to search a file for words that contained only the letters in a set, what would be my best regex? 

【回答】

       这个问题没什么好办法但也没什么难的,基本的解决思路是将文本拆成单词,单词再拆成字符集合,用计算交集来匹配字符。正则表达式理论上可以实现字符匹配,但涉及到次序不固定的情况下并不好写,而且执行速度较慢,还不如自己编程序实现上面的思路。下面用SPL来演绎一下:


A

1

=file("e:\\sample.txt").read()

2

=A1.words()

3

=A2.select(["c","d","b"]==["c","d","b"]^~.split())

A1:读取文本

A2:将字符串拆成单词组成的序列

A3:循环将每个单词拆分成字符集合,查询出含有字符cdb的单词

       SPL支持字符串的拆分(split),也支持集合运算(^表示交集),还支持过滤(select),实现字符匹配较容易,性能也不错。另外,SPL的函数regex也可以进行正则表达式匹配。

       写好的脚本如何在应用程序中调用,可以参考Java 如何调用 SPL 脚本