Chinaunix首页 | 论坛 | 博客
  • 博客访问: 826614
  • 博文数量: 330
  • 博客积分: 9641
  • 博客等级: 中将
  • 技术积分: 3181
  • 用 户 组: 普通用户
  • 注册时间: 2007-01-19 14:41
文章分类

全部博文(330)

文章存档

2012年(17)

2011年(135)

2010年(85)

2009年(57)

2008年(36)

我的朋友

分类: LINUX

2009-03-29 21:47:39

用程序生成新的pyPhrase.org,消除了上次生成pyPhrase.org里面的重复数据。
文件:pyPhrase.org.gz
大小:2800KB
下载:下载



看看都有些什么词有重复:
下面这个文件是程序跑出来的重复的词,还不少。
文件:redundance.gz
大小:469KB
下载:下载



新发现即使除去了冗余数据多音字:朝(zhao)(chao)有不少是错误的,得手动改正。
阅读(1192) | 评论(0) | 转发(0) |
给主人留下些什么吧!~~