{"id":19318218,"url":"https://github.com/exizt/blog-category-data-scraping","last_synced_at":"2025-06-26T23:05:35.595Z","repository":{"id":47015178,"uuid":"402947947","full_name":"exizt/blog-category-data-scraping","owner":"exizt","description":"네이버, 티스토리 블로그에서 특정 하나의 카테고리의 게시글을 스크래핑하여 저장합니다.","archived":false,"fork":false,"pushed_at":"2024-01-09T01:19:11.000Z","size":64,"stargazers_count":1,"open_issues_count":0,"forks_count":2,"subscribers_count":1,"default_branch":"main","last_synced_at":"2025-01-06T04:28:03.830Z","etag":null,"topics":["naver-blog","python","scraping-python","tistory","tistory-backup"],"latest_commit_sha":null,"homepage":"","language":"Python","has_issues":false,"has_wiki":null,"has_pages":null,"mirror_url":null,"source_name":null,"license":"gpl-2.0","status":null,"scm":"git","pull_requests_enabled":true,"icon_url":"https://github.com/exizt.png","metadata":{"files":{"readme":"readme.md","changelog":null,"contributing":null,"funding":null,"license":"LICENSE","code_of_conduct":null,"threat_model":null,"audit":null,"citation":null,"codeowners":null,"security":null,"support":null,"governance":null,"roadmap":null,"authors":null,"dei":null,"publiccode":null,"codemeta":null}},"created_at":"2021-09-04T02:47:06.000Z","updated_at":"2025-01-05T14:35:59.000Z","dependencies_parsed_at":"2025-01-06T04:25:56.203Z","dependency_job_id":"036b0b97-a207-4343-acf3-a60d204b03c6","html_url":"https://github.com/exizt/blog-category-data-scraping","commit_stats":null,"previous_names":[],"tags_count":0,"template":false,"template_full_name":null,"repository_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/exizt%2Fblog-category-data-scraping","tags_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/exizt%2Fblog-category-data-scraping/tags","releases_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/exizt%2Fblog-category-data-scraping/releases","manifests_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories/exizt%2Fblog-category-data-scraping/manifests","owner_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners/exizt","download_url":"https://codeload.github.com/exizt/blog-category-data-scraping/tar.gz/refs/heads/main","host":{"name":"GitHub","url":"https://github.com","kind":"github","repositories_count":240420982,"owners_count":19798502,"icon_url":"https://github.com/github.png","version":null,"created_at":"2022-05-30T11:31:42.601Z","updated_at":"2022-07-04T15:15:14.044Z","host_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub","repositories_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repositories","repository_names_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/repository_names","owners_url":"https://repos.ecosyste.ms/api/v1/hosts/GitHub/owners"}},"keywords":["naver-blog","python","scraping-python","tistory","tistory-backup"],"created_at":"2024-11-10T01:17:47.636Z","updated_at":"2025-02-24T05:09:50.069Z","avatar_url":"https://github.com/exizt.png","language":"Python","funding_links":[],"categories":[],"sub_categories":[],"readme":"# 블로그 카테고리 글 수집기\n\n개요\n* 네이버 블로그, 티스토리 블로그에서 한 카테고리의 글을 수집하는 기능입니다. \n* 한 카테고리의 글을 하나의 txt로 백업하는 등의 용도로 사용합니다.\n* Link: https://github.com/exizt/blog-category-data-scraping.git\n\n\u003cbr\u003e\u003cbr\u003e\u003cbr\u003e\n\n# 셋팅\n필요 조건\n- 파이썬이 설치되어져 있어야 함.\n\n\n```shell\n# git clone\ngit clone git@github.com:exizt/blog-category-data-scraping.git blogscrap\n\ncd blogscrap\n\n# venv\npython -m venv venv\n\n# pip\npip install -r requirements.txt\n```\n\n# 사용법\n## 명령어로 실행할 때\n```shell\n# 네이버\npython cli.py --url \"https://blog.naver.com/blog_id\" --category category_id\n\n# 티스토리\npython cli.py --url \"https://blog_id.tistory.com/\" --category category_id\n```\n\n\n## 소스 코드로 이용할 때\n네이버 블로그 스크랩\n```python\nimport BlogCrawler\n\nplatform = 'naver'\n# platform = 'tistory'\nblog_id = '블로그아이디'\ncategory_id = '카테고리번호'\nfilename = '저장할 파일명.txt'\n\ndf = BlogCrawler.read(platform, blog_id, category_id, False)\n\nBlogCrawler.to_text(df, filename, reverse=True)\n```\n\n티스토리 블로그 스크랩\n```python\nimport BlogCrawler\n\nplatform = 'tistory'\nblog_id = '블로그아이디'\ncategory_id = '카테고리번호'\nfilename = '저장할 파일명.txt'\n\ndf = BlogCrawler.read(platform, blog_id, category_id, False)\n\nBlogCrawler.to_text(df, filename, reverse=True)\n```\n\n\u003cbr\u003e\u003cbr\u003e\u003cbr\u003e\n\n# 코드에 대한 간략 설명\n카테고리에 해당하는 글 목록을 우선적으로 수집합니다. 글 목록을 토대로 게시글의 본문을 하나씩 수집합니다.\n차단을 방지하기 위해 몇 초간의 텀을 주기로 하나씩 수집합니다. 글이 많으면 시간이 좀 걸릴 수 있습니다. \n\n전부 수집이 되었다면 pandas 의 DataFrame 으로 반환합니다. 여기까지가 `BlogCrawler.read`의 기능입니다. \n\n수집한 DataFrame의 내용을 보기 좋게 txt파일로 저장하기 위해서\n`BlogCrawler.to_text(df, filename, reverse=True)`을 이용합니다.\n\ntxt로 저장하지 않고, 데이터베이스에 넣거나 다양한 활용을 하시려면, DataFrame 값을 활용하시면 됩니다. \n\n\u003cbr\u003e\u003cbr\u003e\u003cbr\u003e\n\n# 사용된 파이썬 패키지\n- beautifulsoup4 : soupsieve\n  - 응답된 html의 핸들링\n- pandas : numpy, python-dateutil, pytz, six\n  - dataframe으로 손쉽게 데이터 핸들링\n- pytest : atomicwrites, attrs, colorama, iniconfig, packaging, pluggy, py, toml\n  - TDD 디버깅 하려고 추가함.\n- tldextract : url 추출 관련.\n  - : idna, requests, requests-file, filelock\n  - requests : 웹 통신 관련\n    -  certifi, charset-normalizer, idna, urllib3\n\n\u003cbr\u003e\u003cbr\u003e\u003cbr\u003e\n\n# 연관 키워드, 연관 태그\n네이버 블로그 카테고리 글 수집, 티스토리 블로그 카테고리 글 수집, 블로그 크롤링, 블로그 크롤러, 블로그 스크래핑\n","project_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fexizt%2Fblog-category-data-scraping","html_url":"https://awesome.ecosyste.ms/projects/github.com%2Fexizt%2Fblog-category-data-scraping","lists_url":"https://awesome.ecosyste.ms/api/v1/projects/github.com%2Fexizt%2Fblog-category-data-scraping/lists"}