热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

jieba分词02

github地址:https:github.comfxsjyjieba示例1:对txt文本进行分词,并对获取的分词进行计数,最后将结果写

github地址:https://github.com/fxsjy/jieba

示例1:对txt文本进行分词,并对获取的分词进行计数,最后将结果写入result.txt中。

http://www.cnblogs.com/chenbjin/p/3843800.html


import jieba
import sys
reload(sys)
sys.setdefaultencoding(
'utf8')def fenci(argv) :filename = argv[1]f = open(filename,'r+')file_list = f.read()f.close()seg_list = jieba.cut(file_list,cut_all=True)tf={}for seg in seg_list :#print segseg = ''.join(seg.split())if (seg != '' and seg != "\n" and seg != "\n\n") :if seg in tf :tf[seg] += 1else :tf[seg] = 1f = open("result.txt","w+")for item in tf:#print itemf.write(item+" "+str(tf[item])+"\n")f.close()if __name__ == '__main__' : fenci(sys.argv)


示例2:http://www.cnblogs.com/chenbjin/p/3851165.html

对100份文档进行分词,然后进行TF-IDF的计算,其效果相当好。


import os
import jieba
import jieba.posseg as pseg
import sys
import string
from sklearn import feature_extraction
from sklearn.feature_extraction.text import TfidfTransformer
from sklearn.feature_extraction.text import CountVectorizer
reload(sys)
sys.setdefaultencoding(
'utf8')
#获取文件列表(该目录下放着100份文档)
def getFilelist(argv) :path = argv[1]filelist = []files = os.listdir(path)for f in files :if(f[0] == '.') :passelse :filelist.append(f)return filelist,path
#对文档进行分词处理
def fenci(argv,path) :#保存分词结果的目录sFilePath = './segfile'if not os.path.exists(sFilePath) : os.mkdir(sFilePath)#读取文档filename = argvf = open(path+filename,'r+')file_list = f.read()f.close()#对文档进行分词处理,采用默认模式seg_list = jieba.cut(file_list,cut_all=True)#对空格,换行符进行处理result = []for seg in seg_list :seg = ''.join(seg.split())if (seg != '' and seg != "\n" and seg != "\n\n") :result.append(seg)#将分词后的结果用空格隔开,保存至本地。比如"我来到北京清华大学",分词结果写入为:"我 来到 北京 清华大学"f = open(sFilePath+"/"+filename+"-seg.txt","w+")f.write(' '.join(result))f.close()#读取100份已分词好的文档,进行TF-IDF计算
def Tfidf(filelist) :path = './segfile/'corpus = [] #存取100份文档的分词结果for ff in filelist :fname = path + fff = open(fname,'r+')content = f.read()f.close()corpus.append(content) vectorizer = CountVectorizer() transformer = TfidfTransformer()tfidf = transformer.fit_transform(vectorizer.fit_transform(corpus))word = vectorizer.get_feature_names() #所有文本的关键字weight = tfidf.toarray() #对应的tfidf矩阵
sFilePath = './tfidffile'if not os.path.exists(sFilePath) : os.mkdir(sFilePath)# 这里将每份文档词语的TF-IDF写入tfidffile文件夹中保存for i in range(len(weight)) :print u"--------Writing all the tf-idf in the",i,u" file into ",sFilePath+'/'+string.zfill(i,5)+'.txt',"--------"f = open(sFilePath+'/'+string.zfill(i,5)+'.txt','w+')for j in range(len(word)) :f.write(word[j]+" "+str(weight[i][j])+"\n")f.close()if __name__ == "__main__" : (allfile,path) = getFilelist(sys.argv)for ff in allfile :print "Using jieba on "+fffenci(ff,path)Tfidf(allfile)



推荐阅读
  • 本文讨论了一个关于cuowu类的问题,作者在使用cuowu类时遇到了错误提示和使用AdjustmentListener的问题。文章提供了16个解决方案,并给出了两个可能导致错误的原因。 ... [详细]
  • 本文介绍了在Python3中如何使用选择文件对话框的格式打开和保存图片的方法。通过使用tkinter库中的filedialog模块的asksaveasfilename和askopenfilename函数,可以方便地选择要打开或保存的图片文件,并进行相关操作。具体的代码示例和操作步骤也被提供。 ... [详细]
  • 向QTextEdit拖放文件的方法及实现步骤
    本文介绍了在使用QTextEdit时如何实现拖放文件的功能,包括相关的方法和实现步骤。通过重写dragEnterEvent和dropEvent函数,并结合QMimeData和QUrl等类,可以轻松实现向QTextEdit拖放文件的功能。详细的代码实现和说明可以参考本文提供的示例代码。 ... [详细]
  • Iamtryingtomakeaclassthatwillreadatextfileofnamesintoanarray,thenreturnthatarra ... [详细]
  • 在Android开发中,使用Picasso库可以实现对网络图片的等比例缩放。本文介绍了使用Picasso库进行图片缩放的方法,并提供了具体的代码实现。通过获取图片的宽高,计算目标宽度和高度,并创建新图实现等比例缩放。 ... [详细]
  • Spring源码解密之默认标签的解析方式分析
    本文分析了Spring源码解密中默认标签的解析方式。通过对命名空间的判断,区分默认命名空间和自定义命名空间,并采用不同的解析方式。其中,bean标签的解析最为复杂和重要。 ... [详细]
  • Linux重启网络命令实例及关机和重启示例教程
    本文介绍了Linux系统中重启网络命令的实例,以及使用不同方式关机和重启系统的示例教程。包括使用图形界面和控制台访问系统的方法,以及使用shutdown命令进行系统关机和重启的句法和用法。 ... [详细]
  • CSS3选择器的使用方法详解,提高Web开发效率和精准度
    本文详细介绍了CSS3新增的选择器方法,包括属性选择器的使用。通过CSS3选择器,可以提高Web开发的效率和精准度,使得查找元素更加方便和快捷。同时,本文还对属性选择器的各种用法进行了详细解释,并给出了相应的代码示例。通过学习本文,读者可以更好地掌握CSS3选择器的使用方法,提升自己的Web开发能力。 ... [详细]
  • android listview OnItemClickListener失效原因
    最近在做listview时发现OnItemClickListener失效的问题,经过查找发现是因为button的原因。不仅listitem中存在button会影响OnItemClickListener事件的失效,还会导致单击后listview每个item的背景改变,使得item中的所有有关焦点的事件都失效。本文给出了一个范例来说明这种情况,并提供了解决方法。 ... [详细]
  • Java容器中的compareto方法排序原理解析
    本文从源码解析Java容器中的compareto方法的排序原理,讲解了在使用数组存储数据时的限制以及存储效率的问题。同时提到了Redis的五大数据结构和list、set等知识点,回忆了作者大学时代的Java学习经历。文章以作者做的思维导图作为目录,展示了整个讲解过程。 ... [详细]
  • 本文介绍了C++中省略号类型和参数个数不确定函数参数的使用方法,并提供了一个范例。通过宏定义的方式,可以方便地处理不定参数的情况。文章中给出了具体的代码实现,并对代码进行了解释和说明。这对于需要处理不定参数的情况的程序员来说,是一个很有用的参考资料。 ... [详细]
  • 本文介绍了使用PHP实现断点续传乱序合并文件的方法和源码。由于网络原因,文件需要分割成多个部分发送,因此无法按顺序接收。文章中提供了merge2.php的源码,通过使用shuffle函数打乱文件读取顺序,实现了乱序合并文件的功能。同时,还介绍了filesize、glob、unlink、fopen等相关函数的使用。阅读本文可以了解如何使用PHP实现断点续传乱序合并文件的具体步骤。 ... [详细]
  • 本文主要解析了Open judge C16H问题中涉及到的Magical Balls的快速幂和逆元算法,并给出了问题的解析和解决方法。详细介绍了问题的背景和规则,并给出了相应的算法解析和实现步骤。通过本文的解析,读者可以更好地理解和解决Open judge C16H问题中的Magical Balls部分。 ... [详细]
  • 本文介绍了如何在给定的有序字符序列中插入新字符,并保持序列的有序性。通过示例代码演示了插入过程,以及插入后的字符序列。 ... [详细]
  • baresip android编译、运行教程1语音通话
    本文介绍了如何在安卓平台上编译和运行baresip android,包括下载相关的sdk和ndk,修改ndk路径和输出目录,以及创建一个c++的安卓工程并将目录考到cpp下。详细步骤可参考给出的链接和文档。 ... [详细]
author-avatar
漂泊盼安定
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有