spaCy/spacy/lang/ja/__init__.py

# encoding: utf8
from __future__ import unicode_literals, print_function

from ...language import Language
from ...attrs import LANG
from ...tokens import Doc
from ...tokenizer import Tokenizer


class JapaneseTokenizer(object):
    def __init__(self, cls, nlp=None):
        self.vocab = nlp.vocab if nlp is not None else cls.create_vocab(nlp)
        try:
            from janome.tokenizer import Tokenizer
        except ImportError:
            raise ImportError("The Japanese tokenizer requires the Janome "
                              "library: https://github.com/mocobeta/janome")
        self.tokenizer = Tokenizer()

    def __call__(self, text):
        words = [x.surface for x in self.tokenizer.tokenize(text)]
        return Doc(self.vocab, words=words, spaces=[False]*len(words))


class JapaneseDefaults(Language.Defaults):
    @classmethod
    def create_tokenizer(cls, nlp=None):
        return JapaneseTokenizer(cls, nlp)


class Japanese(Language):
    lang = 'ja'
    Defaults = JapaneseDefaults

    def make_doc(self, text):
        words = self.tokenizer(text)
        return Doc(self.vocab, words=words, spaces=[False]*len(words))


__all__ = ['Japanese']
Add basic japanese support 2017-05-03 04:56:21 +00:00			`# encoding: utf8`
			`from __future__ import unicode_literals, print_function`

Fix relative imports 2017-05-08 20:29:04 +00:00			`from ...language import Language`
			`from ...attrs import LANG`
			`from ...tokens import Doc`
Port over changes from #1157 2017-10-14 11:11:39 +00:00			`from ...tokenizer import Tokenizer`


			`class JapaneseTokenizer(object):`
			`def __init__(self, cls, nlp=None):`
			`self.vocab = nlp.vocab if nlp is not None else cls.create_vocab(nlp)`
			`try:`
			`from janome.tokenizer import Tokenizer`
			`except ImportError:`
			`raise ImportError("The Japanese tokenizer requires the Janome "`
			`"library: https://github.com/mocobeta/janome")`
			`self.tokenizer = Tokenizer()`

			`def __call__(self, text):`
			`words = [x.surface for x in self.tokenizer.tokenize(text)]`
			`return Doc(self.vocab, words=words, spaces=[False]*len(words))`


			`class JapaneseDefaults(Language.Defaults):`
			`@classmethod`
			`def create_tokenizer(cls, nlp=None):`
			`return JapaneseTokenizer(cls, nlp)`
Add basic japanese support 2017-05-03 04:56:21 +00:00

			`class Japanese(Language):`
			`lang = 'ja'`
Port over changes from #1157 2017-10-14 11:11:39 +00:00			`Defaults = JapaneseDefaults`
Add basic japanese support 2017-05-03 04:56:21 +00:00
			`def make_doc(self, text):`
Port over changes from #1157 2017-10-14 11:11:39 +00:00			`words = self.tokenizer(text)`
Add basic japanese support 2017-05-03 04:56:21 +00:00			`return Doc(self.vocab, words=words, spaces=[False]*len(words))`
adding export japanese 2017-05-03 09:07:29 +00:00
Reorganise Japanese language data 2017-05-08 13:50:46 +00:00
			`__all__ = ['Japanese']`