Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension


Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
1 change: 1 addition & 0 deletions README.rst
Original file line number Diff line number Diff line change
Expand Up @@ -223,6 +223,7 @@ Features
sl Slovenian
sr Serbian
et Estonian
ja Japanese
be Belarusian


Expand Down
1 change: 1 addition & 0 deletions docs/index.rst
Original file line number Diff line number Diff line change
Expand Up @@ -224,6 +224,7 @@ Features
sl Slovenian
sr Serbian
et Estonian
ja Japanese
be Belarusian


Expand Down
1 change: 1 addition & 0 deletions docs/user_guide/quickstart.rst
Original file line number Diff line number Diff line change
Expand Up @@ -269,4 +269,5 @@ of popular news source urls.. In case you need help choosing a news source!
sl Slovenian
sr Serbian
et Estonian
ja Japanese
be Belarusian
4 changes: 3 additions & 1 deletion newspaper/configuration.py
Original file line number Diff line number Diff line change
Expand Up @@ -14,7 +14,7 @@

from .parsers import Parser
from .text import (StopWords, StopWordsArabic, StopWordsChinese,
StopWordsKorean, StopWordsHindi)
StopWordsKorean, StopWordsHindi, StopWordsJapanese)
from .version import __version__

log = logging.getLogger(__name__)
Expand Down Expand Up @@ -114,6 +114,8 @@ def get_stopwords_class(language):
# There is a persian parser https://github.com/sobhe/hazm, but nltk is likely sufficient
elif language == 'ar' or language == 'fa':
return StopWordsArabic
elif language == 'ja':
return StopWordsJapanese
return StopWords

@staticmethod
Expand Down
134 changes: 134 additions & 0 deletions newspaper/resources/text/stopwords-ja.txt
Original file line number Diff line number Diff line change
@@ -0,0 +1,134 @@
あそこ
あっ
あの
あのかた
あの人
あり
あります
ある
あれ
いう
います
いる
うち
および
おり
おります
かつて
から
ここ
こちら
こと
この
これ
これら
さらに
しかし
する
せる
そこ
そして
その
その他
その後
それ
それぞれ
それで
ただし
たち
ため
たり
だっ
だれ
でき
できる
です
では
でも
という
といった
とき
ところ
として
とともに
とも
と共に
どこ
どの
ない
なお
なかっ
ながら
なく
なっ
など
なに
なら
なり
なる
なん
において
における
について
にて
によって
により
による
に対して
に対する
に関する
ので
のみ
ほか
ほとんど
ほど
ます
また
または
まで
もの
ものの
よう
より
られ
られる
れる
及び
彼女
我々
特に
私達
貴方
貴方方
13 changes: 13 additions & 0 deletions newspaper/text.py
Original file line number Diff line number Diff line change
Expand Up @@ -182,3 +182,16 @@ def get_stopword_count(self, content):
ws.set_stopword_count(len(overlapping_stopwords))
ws.set_stop_words(overlapping_stopwords)
return ws


class StopWordsJapanese(StopWords):
"""Japanese segmentation
"""
def __init__(self, language='ja'):
super(StopWordsJapanese, self).__init__(language='ja')

def candidate_words(self, stripped_input):
import tinysegmenter

Copy link
Copy Markdown
Owner

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

nit: Python style recommends importing at file header. However, one advantage in doing this is that non-japanese extraction users will not import the un-needed module. But that advantage is lost anyways in this particular implementation since we force tinysegmenter install in reqs.

segmenter = tinysegmenter.TinySegmenter()
tokens = segmenter.tokenize(stripped_input)
return tokens
1 change: 1 addition & 0 deletions newspaper/utils.py
Original file line number Diff line number Diff line change
Expand Up @@ -388,6 +388,7 @@ def print_available_languages():
'sl': 'Slovenian',
'sr': 'Serbian',
'et': 'Estonian',
'ja': 'Japanese',
'be': 'Belarusian'
}

Expand Down
1 change: 1 addition & 0 deletions requirements.txt
Original file line number Diff line number Diff line change
Expand Up @@ -10,3 +10,4 @@ tldextract>=2.0.1
feedfinder2>=0.0.4
jieba3k>=0.35.1
python-dateutil>=2.5.3
tinysegmenter==0.3 # TODO(codelucas): Investigate making this >=0.3
1,940 changes: 1,940 additions & 0 deletions tests/data/html/japanese_article.html

Large diffs are not rendered by default.

Loading