• 목록
  • 아래로
  • 위로

안녕하세요?


새해의 첫 근무일 잘 보내고 계시는지요? ^^



어제 휴일이어서 예전에 작성한 Selenium을 이용하여 특정 element를 스크린 캡쳐하는 스크립트를 수정해봤는데요.


iframe 내의 element의 경우에 직접 접근할 수 없으므로 iframe_on = 1으로 대입한 경우에 switch_to.frame을 하도록 하도록 하였구요.


iframe_on = 0으로 대입한 경우에는 바로 element에 접근하도록 했는데요.



이렇게 일일이 iframe의 존재 여부 및 XPath값을 대입하지 않고서도 


원하는 element의 XPath만 입력받아서 iframe 내부에 존재하는 element에 접근할 수 있는 방법을 생각해보고 있는데 쉽지 않네요 ㅠㅠ


제가 뭔가 웹에 대한 이해가 전반적으로 부족한 것 같기도 하구요~


Selenium에서는 XPath를 이용하여 바로 접근할 수 있지만, BeautifulSoup에서는 이런 방식이 허용되지 않는 문제와 겹쳐서 더욱 어려운 것 같네요.


특정 XPath에서 parent 노드의 iframe을 알아내서 그 XPath값을 얻어낸다면 해결될 수 있는 문제 같은데요.


1. //*[@id="post_688075132"] // parent :: iframe 이런 방식으로는 접근이 안 되는 것 같네요. 다른 접근 방법은 없을까요??


2. BeautifulSoup에서 Xpath를 지원한다면 조금 수월하게 해결될지도 모르겠는데 그렇다면 lxml이나 htmlement를 사용하면 해결 가능할까요??

(설치해서 시도는 해봤는데 아직까지는 잘 안 되네요 ㅠㅠ)



그럼 주말에 다시 날씨가 쌀쌀해진다는데 감기 조심하시구요.


스포어 회원님들께 항상 감사드립니다!


좋은 오후 되세요~ ^^



from selenium import webdriver
from selenium.webdriver.firefox.options import Options
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from bs4 import BeautifulSoup
from PIL import Image
from io import BytesIO
import time

options = Options()
options.headless = True
driver = webdriver.Firefox(options=options)
driver.implicitly_wait(10)

url = 'https://cafe.naver.com/joonggonara/689072432' # iframe을 사용한 예제 페이지로 중고나라를 선택했습니다.
xpath_e = '//*[@id="post_689072432"]'
driver.get(url)
time.sleep(1)
WebDriverWait(driver, 5).until(EC.visibility_of_all_elements_located((By.TAG_NAME, 'body')))

# 전체 페이지의 사이즈를 구하여 브라우저의 창 크기를 확대하고 스크린캡처를 합니다.
#driver.execute_script("document.body.style.zoom='zoom 100%'")
page_width = driver.execute_script('return document.body.parentNode.scrollWidth')
time.sleep(1)
page_height = driver.execute_script('return document.body.parentNode.scrollHeight')
time.sleep(1)
driver.set_window_size(page_width, page_height)
time.sleep(1)
png = driver.get_screenshot_as_png()
time.sleep(1)

# 특정 element 및 해당 iframe의 위치를 구합니다.

iframe_on = 1 # 만약 iframe이 없으면 0을 대입합니다.
if iframe_on == 1:
    #WebDriverWait(driver, 5).until(EC.visibility_of_all_elements_located((By.XPATH, '//*[@id="cafe_main"]')))
    iframe = driver.find_element_by_xpath('//*[@id="cafe_main"]')
    iframe_location = iframe.location
    iframe_size = iframe.size
    driver.switch_to.frame(iframe)
    time.sleep(1)

element = driver.find_element_by_xpath(xpath_e)
image_location = element.location
image_size = element.size

# 이미지를 element의 위치에 맞춰서 crop 하고 저장합니다.
im = Image.open(BytesIO(png))

if iframe_on == 1:
    left = image_location['x'] + iframe_location['x']
    top = image_location['y'] + iframe_location['y']
    right = image_location['x'] + iframe_location['x'] + image_size['width']
    bottom = image_location['y']  + iframe_location['y'] + image_size['height']    
else:
    left = image_location['x']
    top = image_location['y']
    right = image_location['x'] + image_size['width']
    bottom = image_location['y'] + image_size['height']

im = im.crop((left, top, right, bottom))
rgb_im = im.convert('RGB')
filename = 'screenshot.jpg'
rgb_im.save(filename)
print('The element "' + xpath_e + '" was captured. : ' + filename)
driver.quit()



작성자
이니스프리 119 Lv. (0%) 1876250/115200000EXP

당분간 일신상의 사정으로 쪽지나 댓글로 답변을 드리기 어렵습니다. 죄송합니다.

 

CSVpuymXAAAVVpd.jpg

댓글 2

포인트 폭탄+
이니스프리님 축하합니다.
추가로 200포인트만큼 포인트 폭탄+를 받았습니다.
comment menu
2020.01.02. 16:04

신고

"포인트 폭탄+님의 댓글"

이 댓글을 신고 하시겠습니까?

삭제

"포인트 폭탄+님의 댓글"

이 댓글을 삭제하시겠습니까?

이니스프리 작성자 → 포인트 폭탄+
profile image

포인트 폭탄+도 궁금했나 보네요 ^-^

comment menu
2020.01.02. 16:04

신고

"이니스프리님의 댓글"

이 댓글을 신고 하시겠습니까?

권한이 없습니다.
번호 제목 글쓴이 날짜 조회 수
공지 [작업 완료] 설 명절 맞이 서버 업데이트 안내 3 마스터 24.02.11.17:21 394
공지 [중요] 호스팅 만료와 관련하여 일부 수칙이 변경됩니다. 4 마스터 23.01.14.02:23 4075
공지 [필독] 질문하는 방법 17 마스터 18.02.23.03:09 4465
922 계속 사용중이던 네트워크 공유 폴더가 갑자기 액세스 불가라고 뜹니다. 6 image 장윤서 18.06.07.16:55 34331
921 팀뷰어 대체할 원격 제어 프로그램 추천 부탁드립니다 16 이니스프리 17.11.30.15:38 32325
920 엑셀 그래프의 축 간격 조절 문제입니다. 2 image 국내산라이츄 17.08.10.11:06 12483
919 아이폰/아이패드 충전기 발열 관련 질문 드립니다 9 image 이니스프리 19.05.02.22:52 11105
918 에러 523 해결법 4 입체그림 20.02.21.16:48 6690
917 PyQt 실행시 프리징 현상 관련하여 질문 드립니다! ㅠㅠ 3 이니스프리 19.07.06.03:37 6685
916 프린터가 지 맘대로 프린트를 하네요. 3 곰도리푸 18.04.04.18:20 6018
915 윈도우용 메일 클라이언트가 필요합니다. 9 네모 18.01.11.20:15 5867
914 크롬에서 특정 사이트 접속 문제 관련하여 질문 드립니다 9 이니스프리 17.03.27.18:03 5309
913 오라클 클라우드 프리티어 가입이 안 되네요 ㅠㅠ 20 이니스프리 20.06.26.21:31 4827
912 파이썬 에디터로 어떤 것이 좋나요? 14 NoYeah 20.01.08.21:08 4525
911 라떼판다와 라즈베리 파이 중 어느 쪽을 사는 게 나을까요? 9 제르엘 18.10.14.19:25 3827
910 나무 위키의 수익구조는 무엇일까요? 2 NoYeah 18.03.18.15:56 3808
909 파티션 복구 프로그램 TestDisk 잘 아시는 분 계시나요? 29 이니스프리 17.11.10.14:53 3745
908 IE11에서 이미지가 깨지는 현상을 해결할 수 있을까요? 2 이니스프리 19.08.02.00:01 3702
907 파일질라로 연결하니까 보안되지 않은 서버입니다. TLS를 통한 FTP를 지원하지 않습니다. 이렇게떠요 해결방안좀 1 마카오 16.09.11.00:57 3654
906 자바스크립트 FormData와 관련된 메서드의 IE 호환성과 관련하여 질문 드립니다 ^^ 6 image 이니스프리 19.08.05.14:22 3426
905 선택약정 안 되는 중고폰의 경우에는 어떤 단점이 있는 것인가요?? 6 이니스프리 20.01.21.14:30 3100
904 집에서 시놀로지 NAS로 워드프레스나 미디어위키 돌리면 느릴까요? 10 이니스프리 17.01.16.20:56 2979
903 [Requests] multipart/form-data의 전송에 대해 질문 드립니다 ^^ 4 이니스프리 19.12.18.22:00 2904