From 97bf10c896a94245c8c20fa198af3bfffd47c4fc Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?Alaettin=20U=C3=87AN?= Date: Sat, 18 Dec 2021 01:43:17 +0300 Subject: [PATCH 1/3] Update settings.py --- newspaper/settings.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/newspaper/settings.py b/newspaper/settings.py index df19733d..3fa3115d 100644 --- a/newspaper/settings.py +++ b/newspaper/settings.py @@ -47,7 +47,7 @@ CF_CACHE_DIRECTORY = 'feed_category_cache' ANCHOR_DIRECTORY = os.path.join(TOP_DIRECTORY, CF_CACHE_DIRECTORY) -TRENDING_URL = 'http://www.google.com/trends/hottrends/atom/feed?pn=p1' +TRENDING_URL = 'https://trends.google.com/trends/trendingsearches/daily/rss?geo=TR' for path in (TOP_DIRECTORY, MEMO_DIR, ANCHOR_DIRECTORY): try: From f9102b199a1b9ed49d07d38ef8ec7de469d17108 Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?Alaettin=20U=C3=87AN?= Date: Thu, 20 Jan 2022 20:53:31 +0300 Subject: [PATCH 2/3] Update extractors.py --- newspaper/extractors.py | 1 + 1 file changed, 1 insertion(+) diff --git a/newspaper/extractors.py b/newspaper/extractors.py index 96255401..57c69a38 100644 --- a/newspaper/extractors.py +++ b/newspaper/extractors.py @@ -230,6 +230,7 @@ def parse_date_str(date_str): known_meta_tag['content']) datetime_obj = parse_date_str(date_str) if datetime_obj: + print('aaa',meta_tags[0]) return datetime_obj return None From 37068149a9808aa971c5edd225b5bd89ea003c49 Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?Alaettin=20U=C3=87AN?= Date: Thu, 20 Jan 2022 22:20:37 +0300 Subject: [PATCH 3/3] get_news_date_from_content --- newspaper/extractors.py | 14 ++++++++++++-- 1 file changed, 12 insertions(+), 2 deletions(-) diff --git a/newspaper/extractors.py b/newspaper/extractors.py index 57c69a38..9b2e7eb9 100644 --- a/newspaper/extractors.py +++ b/newspaper/extractors.py @@ -193,6 +193,7 @@ def parse_date_str(date_str): date_str = date_match.group(0) datetime_obj = parse_date_str(date_str) if datetime_obj: + print('tarih-url',date_str) return datetime_obj PUBLISH_DATE_TAGS = [ @@ -218,6 +219,8 @@ def parse_date_str(date_str): 'content': 'datetime'}, {'attribute': 'name', 'value': 'publish_date', 'content': 'content'}, + {'attribute': 'name', 'value': 'publish_date', + 'content': 'content'}, ] for known_meta_tag in PUBLISH_DATE_TAGS: meta_tags = self.parser.getElementsByTag( @@ -230,9 +233,16 @@ def parse_date_str(date_str): known_meta_tag['content']) datetime_obj = parse_date_str(date_str) if datetime_obj: - print('aaa',meta_tags[0]) + print('tarih-meta',meta_tags[0]) return datetime_obj - + + time_elements = self.parser.getElementsByTag(doc,tag='time') or [] + if time_elements: + date_str = self.parser.getText(time_elements[0]) + datetime_obj = parse_date_str(date_str) + if datetime_obj: + print('tarih-icerik',date_str) + return datetime_obj return None def get_title(self, doc):