• 목록
  • 아래로
  • 위로

안녕하세요??


미세먼지가 심한데 주말 잘 보내셨는지요?? ^^


페북이나 트위터처럼 태그 속성이 자주 변경되는 사이트의 크롤링에 대해 여쭤봅니다.



BeautifulSoup을 이용하면 태그의 class, id 등을 주로 활용하여 접근하잖아요.


그런데 페북이나 트위터는 의도적으로 이런 속성을 자주 변경하는 것 같더군요.


그렇다고 자체 API에서 이미지나 영상의 다운로드를 지원하는 것 같지는 않던데요 ㄷㄷ



그렇다면 어떻게 이미지나 영상을 포함하는 태그에 접근하는 것이 가장 장기간 안정적일까요??


페북이나 트위터의 이미지를 다운로드하는 프로그램이나 사이트가 있는 것을 보면 뭔가 좋은 방법이 있을 것 같은데요.


BeautifulSoup에서는 지원하지 않지만 XPATH로 접근을 하면 그나마 안정적이려나요??



크롤러를 영리적인 목적으로 이용하려는건 아니고 제 개인적으로 연습해보고 사용하려구요 :)


크롤링 고수님들의 답변을 부탁드립니다!


그럼 굿밤 되세요~! ^-^


작성자
이니스프리 119 Lv. (1%) 2793590/115200000EXP

Make StudyForUs Great Again!

 

CSVpuymXAAAVVpd.jpg

댓글 4

라엘
profile image

큰 범위에서 파싱하고 적절히 필터링 하는 방법이 있겠죠.

태그 속성 바꾸는건는 크롤링, 파싱방지, 광고차단프로그램 방지 용도로 많이 쓰더라구요.

https://m.blog.naver.com/PostView.nhn?blogId=yoyo3299&logNo=220981434571 하지만 유저들이 결국엔 승리한다!

comment menu
2020.03.11. 18:16

신고

"라엘님의 댓글"

이 댓글을 신고 하시겠습니까?

이니스프리 작성자 → 라엘
profile image

오오~ 말씀하신대로 적절히 큰 범위에서 파싱하고 필터링해야겠네요~! ^^

유저들이 결국 승리하기는 하겠지만... 저같은 쪼렙은 힘들듯요~ ㅠㅠ

감사합니다!! 라엘 사마께서도 편안한 저녁 되세요오~

comment menu
2020.03.11. 21:06

신고

"이니스프리님의 댓글"

이 댓글을 신고 하시겠습니까?

title: 황금 서버 (30일)humit
profile image

태그 속성이 바뀌는 이유는 직접 바꾸는 경우도 있겠지만 개발 과정에서 자동으로 css가 업데이트 되기도 합니다.

 

styled-component나 emotion과 같이 javascript 상에서 css를 정의하는 라이브러리를 사용하면 자동으로 클래스 이름을 생성해줍니다.

 

그래서 클래스 이름이 이상한 형태가 아닌 정상적으로 보이는 형태에 대해서만 사용하고 되도록 id와 같이 거의 바뀔 일이 없는 값을 기준으로 차례대로 훑어내려가는 식으로 구현합니다.

comment menu
2020.03.11. 19:14

신고

"humit님의 댓글"

이 댓글을 신고 하시겠습니까?

이니스프리 작성자 → humit
profile image

개발과정에서 자동으로 CSS가 업데이트되는 것이군요 ㅎㄷㄷ

말씀해주신대로 거의 변경되지 않는 값을 기준으로 구현해봐야겠네요!

감사합니다 ^-^ humit 님께서도 좋은 저녁 되세요~

comment menu
2020.03.11. 21:06

신고

"이니스프리님의 댓글"

이 댓글을 신고 하시겠습니까?

권한이 없습니다.
번호 제목 글쓴이 날짜 조회 수
공지 [1차 해결 및 추가] 서버 접속 불가 문제 안내 14 마스터 24.06.20.15:22 891
공지 [작업 완료] 설 명절 맞이 서버 업데이트 안내 3 마스터 24.02.11.17:21 2828
공지 [중요] 호스팅 만료와 관련하여 일부 수칙이 변경됩니다. 4 마스터 23.01.14.02:23 6575
공지 [필독] 질문하는 방법 17 마스터 18.02.23.03:09 4712
566 미디어위키 설치중 오루가 발생했니다 이는 왜 그런거죠? 6 image AA 18.06.10.16:21 196
565 FTPS 프록시 프로그램이 있을까요? 3 네모 18.06.15.15:42 214
564 윈도우서버 2016은 [역방향 프록시] 설정이 안되나요 ? 9 image xnview 18.06.15.16:14 419
563 개인 서버를 내부 인트라넷에서만 사용할 수 있게 하려면 어떻게 해야 하나요? 6 image 제르엘 18.06.17.23:43 303
562 [역방향 프록시] 뭐가 문제인지 검토 부탁 드립니다 11 image xnview 18.06.19.23:03 1237
561 [역방향 프록시] 사이트 URL 이동 500에러 문의드립니다 6 image xnview 18.06.21.14:16 982
560 [e-bay 물품구매질문] 6 image dongs 18.06.21.14:28 233
559 대구시 수돗물 발암물질 좀 도와주세요. 10 참비 18.06.22.10:55 226
558 호스팅 서비스 바꾸기 4 title: 에그joyful 18.06.24.23:09 211
557 안녕하세요 포트포워딩 관련 질문입니다(좀긴글) 7 image Licht 18.06.26.02:23 464
556 [역방향 프록시] 뭐가 문제인지 도움 부탁 드립니다 ㅠㅠ 4 image xnview 18.06.27.22:35 928
555 [가상화 네트워크] 사설IP 여러곳에서 80포트를 사용하고 싶습니다 18 image xnview 18.06.28.13:48 1324
554 호스팅 FTP 계속 타임 아웃이 생깁니다..! 21 image BVC_Liper_Okbul 18.06.29.20:33 573
553 MXexception (?) 오류가 뜹니다. 1 title: 맛스타의 자물쇠에듀 18.07.03.18:39 199
552 XE 많이 안좋은가요?? 6 title: 에그joyful 18.07.04.19:57 194
551 질문합니다. 로그인설정을 바꾸고 싶네요~ 2 youngsik 18.07.05.11:12 159
550 XPEnology VMDK 파일 용량 오버 문제 12 image xnview 18.07.06.14:03 317
549 레이아웃 유료로 파는건 법적 절차가 필요한가요? 5 title: 에그joyful 18.07.07.20:03 212
548 네이버 카페 대문을 HTML로 제작해보려는데 너무 어렵네요. 6 image 도바킨 18.07.09.04:27 2842
547 우분투 부팅이 안되는데요 ㄷㄷ 3 image 국내산라이츄 18.07.11.20:38 183