Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension


Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
13 changes: 12 additions & 1 deletion newspaper/extractors.py
Original file line number Diff line number Diff line change
Expand Up @@ -17,7 +17,8 @@
import re
from collections import defaultdict

from dateutil.parser import parse as date_parser
from dateutil import parser as date_parser
from qddate import DateParser
from tldextract import tldextract
from urllib.parse import urljoin, urlparse, urlunparse

Expand Down Expand Up @@ -230,6 +231,16 @@ def parse_date_str(date_str):
if datetime_obj:
return datetime_obj

# Uses qddate DateParser to find dates in any strings less than 150 chars long
dp = DateParser(generate=True)
nodes = doc.xpath('//*[string-length(text())<150]')
for node in nodes:
if node.text is None:
continue
datetime_obj = dp.parse(node.text)
if datetime_obj is not None:
return datetime_obj

return None

def get_title(self, doc):
Expand Down
1 change: 1 addition & 0 deletions requirements.txt
Original file line number Diff line number Diff line change
Expand Up @@ -10,3 +10,4 @@ tldextract>=2.0.1
feedfinder2>=0.0.4
jieba3k>=0.35.1
python-dateutil>=2.5.3
qddate>=0.1.0