- 3
- 이니스프리
- 조회 수 679
안녕하세요?
밖에 비가 많이 오는데 비 피해는 없으신지요?
다름이 아니라 제가 동문회 홈페이지를 만드는 과정에서
싸이월드 미니홈피에 있는 선배님들의 사진을 동문회 홈페이지로 퍼오면 좋겠다는 아이디어가 떠올랐고
(정확히 말씀드리면 미니홈피를 동아리 홈페이지 및 갤러리로 사용한 경우도 포함합니다)
이에 대해 동의를 구한 선배님들의 미니홈피에 한하여 이미지를 스크레이핑하게 되었네요 ^^
그래서 이미지를 파이썬이나 PHP로 스크레이핑 하려고 했는데 난관에 부딪혔네요 ㅠㅠ
공인인 박주영 선수의 미니홈피를 예를 들어서 설명드릴게요.
https://cy.cyworld.com/home/25270125
하단에 있는 '더보기'를 클릭하면 크롬 개발자도구에서 다음과 같은 XHR 내역을 확인할 수 있더군요.
https://cy.cyworld.com/home/25270125/posts?folderid=&tagname=&lastid=42BED574D40003032EDA6401&lastdate=1119802740166&listsize=20&homeId=25270125&airepageno=0&airecase=D&airelastdate=&searchType=R&search=&_=1564156791808
그런데 이걸 새 탭에서 열어서 내용을 확인하려고 하면 페이지를 찾을 수 없다는 에러메시지 창이 뜨더군요 ㅠㅠ
뭔가 의심이 되는 파라미터를 변경하기 위해 airepageno의 값을 더 큰 수로 입력을 해도 마찬가지로 에러가 뜨네요.
제 생각에 일단 리퍼러의 문제는 아닌 것 같은데요.
이 부분에서 막혀서 진척이 없는데 조금만 힌트를 주시면 감사하겠습니다!
github에는 싸이월드 클럽에 대한 크롤러만 있고, 미니홈피에 대한 크롤러는 없네요 ㅠㅠ
물론 selenium을 사용하면 스크레이핑이 가능하겠지만 퍼올 이미지는 많은데 속도가 어마무시하게 느려질 것 같아서요 ㅜㅜ
그럼 편안한 밤 되시고 즐거운 주말 되세요 ^-^
스포어 회원님들께 항상 감사드립니다!
작성자
댓글 3
참고로 verify 부분의 경우 제 네트워크 설정 때문에 그런지 모르겠지만 SSL 에러가 발생해서 임시로 False로 설정해놓았습니다.
일단 해당 부분을 없이 했을 때 오류가 발생하지 않는다면 그대로 사용하시면 되고, 에러가 발생하면 False로 설정하면 되겠습니다.
바쁘신데 정말 감사합니다!
제가 초보라서 그런지 Accept를 체크하는 경우는 처음 보네요 ㅎㄷㄷ
역시 이건 저 혼자 끙끙거리며 고민한다고 해결할 수 있는 문제가 아니었군요!
스포어에 여쭤보길 잘 했네요 ^^
말씀하신 SSL 에러와 관련해서 verify 옵션을 True로 설정하면 에러가 발생하고
False로 설정하면 Unverified HTTPS requests와 관련된 Insecure request warning이 뜨긴 하지만 다행히 크롤링은 되네요!
humit 님 덕분에 웹과 스크레이핑에 대해 많이 배우네요 ^^
저번에 말씀해주신 Dropbox API와 관련된 팁도 이번주에 이것저것 다뤄보면서 공부했네요.
피상적인 수준에서 배우고 있지만 컴퓨터 공학은 제 전공분야보다 훨씬 심오한 세계인 것 같아요 ㄷㄷ
그럼 humit 님께서도 비 조심하시고 즐거운 주말 되세요!
항상 감사드립니다!!
테스트를 해보니 이 경우는 약간 특이한 케이스로 보이네요 ㅋㅋㅋㅋ
보통은 Referer 쪽만 조작하거나 쿠키 쪽을 업데이트해주면 제대로 동작하는데 이 경우에는 Accept 부분으로 체크하는 것으로 보입니다.
아래는 파이썬 스크립트입니다.
간단하게 필요한 부분만 적었습니다.
URL로 직접 접속했을 때는 Accept 부분이 text/html 로 되기 때문에 이를 통해서 걸러낸다고 보시면 됩니다.