编程珠玑开篇--磁盘文件排序问题——转自http://blog.csdn.net/fisher_jiang/
输入:
所输入的文件,至多包含n个正整数,每个正整数都小于n,题目中n = 10^7,如果输入时某个正整数重复出现俩次,就会产生致命的错误,这些整数,与其他任何数据都不相关.
输出:
以增序形式输出经过排序的整数列表
约束
至多只有1MB(包括程序本身)可用的主存,但是可以用的磁盘空间是充足的,运行时间至多几分钟,10秒针是最适宜的运行时间.
作者第一个方案使用基于磁盘的合并排序.将每个号码用32位整数表示,可以在1MB的空间里存储250000个号码,使用一个带有40个通道的程序,在第一个通道中将前250000的任意整数读入内存,并对它们进行排序,可以使用高效的快速排序,但是完成整个任务,我们要牺牲读文件40次的代价.最后作者引出了另外一种解决方案位图和位向量:
我们可以用一个20位的字符串可以表示小于20的非负数集合.例如,我们可以将集合{1,2,3,5,8,13}存储在下面字符串中:
集合中代表数字的各个位设置为1 ,而其他的位全部设置为0
在上面问题中,我们使用一千万位的字符串表示该文件,当且仅当整数i在该文件中的时候,第i位才被设置为1,这种表示法使用了这个问题中的三中属性,输入的范围相对小一些,并且还不包括重复的数据,而且没有数据和单个整数以外的每一记录相关联
算法实现分三阶段
1 设置每个位为0
2 读取文件,将相应的位设置为1
3 检查每个位,当为1时,将整数写入
这些函数使用常量来设置,清除并测试位值
- #define BITSPEREORD 32 // the type int contains 32 bits
- #define SHIFT 5 // pow(2,5)
- #define MASK 0X1F //00011111
- #define NUMBER 10000000
- int bitBuffer[ 1 + NUMBER / BITSPEREORD ] ;
- void clr( int i ) //set every bit 0
- {
- bitBuffer [ i >> SHIFT ] &= ~ ( 1 << ( i & MASK )) ;
- }
- //i & MASK 相当于 i mod 32
- void set ( int i ) //set the n bits 1
- {
- bitBuffer [ i >> SHIFT ] |= ( 1 << ( i & MASK )) ;
- }
- int test( int i ) //read the sort number from bitBuffer
- {
- return bitBuffer [ i >> SHIFT ] & ( 1 << ( i & MASK )) ;
- }
- 通过位运算实现的上面的排序算法如下:
- <pre class="csharp" name="code">int main ()
- {
- int i ;
- for ( i = 0 ; i < NUMBER ; i ++ )
- {
- clr(i);
- }
- while(scanf("%d",&i) != EOF )
- {
- set( i );
- }
- for ( i = 0 ; i < NUMBER ;i ++ )
- {
- if (test(i))
- printf("%d/n",i);
- }
- return 0 ;
- }
- 使用一个包含100万个不重复正整数的文件且每个正整数都小于1000万进行测试:下表报告了使用</pre>
- <pre class="csharp" name="code">系统命令行排序,C++和C的排序程序,位运算的排序成本</pre>
- <pre class="csharp" name="code"><table cellspacing="1" cellpadding="1" width="250" summary="" border="1"><tbody><tr><td> </td><td>系统排序</td><td>C++/STL</td><td>C/qsort</td><td>C/位运算</td></tr><tr><td>总时间(秒)</td><td>89</td><td>38</td><td>12.6</td><td>10.7</td></tr><tr><td>计算时间(秒)</td><td>79</td><td>28</td><td>2.4</td><td>0.5</td></tr><tr><td>MB</td><td>0.8</td><td>70</td><td>4</td><td>1.25 </td></