diff --git a/newspaper/extractors.py b/newspaper/extractors.py index 07629052..b258d2ab 100644 --- a/newspaper/extractors.py +++ b/newspaper/extractors.py @@ -14,6 +14,7 @@ from collections import defaultdict import copy from dateutil.parser import parse as date_parser +import dateparser import logging import re import urllib.parse @@ -187,7 +188,7 @@ def parse_date_str(date_str): except: # near all parse failures are due to URL dates without a day # specifier, e.g. /2014/04/ - return None + return dateparser.parse(date_str) date_match = re.search(urls.DATE_REGEX, url) if date_match: diff --git a/requirements.txt b/requirements.txt index 588f5b5b..e29aa959 100644 --- a/requirements.txt +++ b/requirements.txt @@ -10,3 +10,4 @@ tldextract>=1.5.1 feedfinder2>=0.0.4 jieba3k>=0.35.1 python-dateutil>=2.4.0 +dateparser>=0.4.0