Python中文分词组件jieba - 企业简介 - 南充市顺庆区小房子和树婚礼策划部
当前位置:首页 > 企业简介 >

Python中文分词组件jieba

编辑:南充市顺庆区小房子和树婚礼策划部时间:2017-09-08 18:00:20阅读次数:2
Python中文分词组件jieba


jieba (Powered by Appfog)

Python 2.x 下的安装
  • 目前master分支是只支持Python2.x 的
  • Python3.x 版本的分支也已经基本可用:https://github.com/fxsjy/jieba/tree/jieba3k

    git clone https://github.com/fxsjy/jieba.git git checkout jieba3k python setup.py install
  • Algorithm Output:

    【全模式】: 我/ 来到/ 北京/ 清华/ 清华大学/ 华大/ 大学 【精确模式】: 我/ 来到/ 北京/ 清华大学 【新词识别】:他, 来到, 了, 网易, 杭研, 大厦 (此处,“杭研”并没有在词典中,但是也被Viterbi算法识别出来了) 【搜索引擎模式】: 小明, 硕士, 毕业, 于, 中国, 科学, 学院, 科学院, 中国科学院, 计算, 计算所, 后, 在, 日本, 京都, 大学, 日本京都大学, 深造 功能 2) :添加自定义词典

    功能 7) : ChineseAnalyzer for Whoosh搜索引擎

    引用: from jieba.analyse import ChineseAnalyzer

    用法示例:https://github.com/fxsjy/jieba/blob/master/test/test_whoosh.py

    其他词典

    下载你所需要的词典,然后覆盖jieba/dict.txt 即可或者用jieba.set_dictionary('data/dict.txt.big')

    模块初始化机制的改变:lazy load (从0.28版本开始)

    jieba采用延迟加载,"import jieba"不会立即触发词典的加载,一旦有必要才开始加载词典构建trie。如果你想手工初始jieba,专题系统,也可以手动初始化。

    import jieba

    jieba.initialize() #手动初始化(可选)

    在0.28之前的版本是不能指定主词典的路径的,有了延迟加载机制后,你可以改变主词典的路径:

    jieba.set_dictionary('data/dict.txt.big')

    例子: https://github.com/fxsjy/jieba/blob/master/test/test_change_dictpath.py

    分词速度

    1)模型的数据是如何生成的?https://github.com/fxsjy/jieba/issues/7

    2)这个库的授权是? https://github.com/fxsjy/jieba/issues/2

    更多问题请点击:https://github.com/fxsjy/jieba/issues?sort=updated&state=closed

    Change Log

    http://www.oschina.net/p/jieba/news#list

    http://www.oschina.net/p/jieba

    https://github.com/fxsjy/jieba

    ,采集软件

    企业建站2800元起,携手武汉肥猫科技,做一个有见地的颜值派!更多优惠请戳:咸宁网站建设 http://xianning.45qun.com

    上一篇:python中两个整数相除得到浮点数的值的方法 下一篇:最后一页

    相关阅读