diff --git a/newspaper/extractors.py b/newspaper/extractors.py index 96255401..9b2e7eb9 100644 --- a/newspaper/extractors.py +++ b/newspaper/extractors.py @@ -193,6 +193,7 @@ def parse_date_str(date_str): date_str = date_match.group(0) datetime_obj = parse_date_str(date_str) if datetime_obj: + print('tarih-url',date_str) return datetime_obj PUBLISH_DATE_TAGS = [ @@ -218,6 +219,8 @@ def parse_date_str(date_str): 'content': 'datetime'}, {'attribute': 'name', 'value': 'publish_date', 'content': 'content'}, + {'attribute': 'name', 'value': 'publish_date', + 'content': 'content'}, ] for known_meta_tag in PUBLISH_DATE_TAGS: meta_tags = self.parser.getElementsByTag( @@ -230,8 +233,16 @@ def parse_date_str(date_str): known_meta_tag['content']) datetime_obj = parse_date_str(date_str) if datetime_obj: + print('tarih-meta',meta_tags[0]) return datetime_obj - + + time_elements = self.parser.getElementsByTag(doc,tag='time') or [] + if time_elements: + date_str = self.parser.getText(time_elements[0]) + datetime_obj = parse_date_str(date_str) + if datetime_obj: + print('tarih-icerik',date_str) + return datetime_obj return None def get_title(self, doc): diff --git a/newspaper/settings.py b/newspaper/settings.py index df19733d..3fa3115d 100644 --- a/newspaper/settings.py +++ b/newspaper/settings.py @@ -47,7 +47,7 @@ CF_CACHE_DIRECTORY = 'feed_category_cache' ANCHOR_DIRECTORY = os.path.join(TOP_DIRECTORY, CF_CACHE_DIRECTORY) -TRENDING_URL = 'http://www.google.com/trends/hottrends/atom/feed?pn=p1' +TRENDING_URL = 'https://trends.google.com/trends/trendingsearches/daily/rss?geo=TR' for path in (TOP_DIRECTORY, MEMO_DIR, ANCHOR_DIRECTORY): try: