对于中文的自然语言处理任务来说,分词似乎已经是第一步了,因为深度学习想要使用词向量的话,分词基本是第一步,除非我们基于单个中文单词,当然这看具体的模型了。所以我们需要一个好的分词工具,stanford-segmenter就是一个不错的分词工具,当然也有很多优秀的其他分词工具,具体用哪个看个人爱好,本文将介绍stanford-segmenter的使用。
我使用的工具包是“stanford-segmenter-2015-01-30”。
跟postagger一样,它是java写的,具体的使用方式有两种:java;命令行。
java:
具体的代码参看SegDemo.java,同样需要将data文件夹放至项目路径下,在Build Path中加入stanford-segmenter-3.5.1.jar,最终如果需要生成可视化界面,需要在生成的可执行jar路径下将data也拷贝过去才可以。
命令行:
分词的命令行执行方式同样可以参看README-Chinese.txt这个文件,我使用的是segment.sh这个,其中,ctb或者pku随意选择。 我在Linux服务器上使用segment.sh时比较顺利,不像postagger.sh还要改java的classpath,所以,直接使用应该没什么问题,将结果重定向一下就可以得到分完词的结果。
segment
.sh ctb test
.simp.utf8 UTF-
8以上~
转载请注明原文地址: https://ju.6miu.com/read-24898.html