Agent가 웹페이지를 열고 클릭하거나 스크린샷을 찍을 수 있나요?
브라우저 도구를 지원하는 환경에서 명확한 페이지 조작을 수행하세요.
브라우저 조작과 텍스트 추출은 다릅니다
웹페이지 텍스트 추출은 공개된 텍스트를 가져오는 데 적합합니다. 브라우저 조작은 지원되는 환경에서 페이지에 접근하고 상태를 확인하며 클릭하고 스크린샷을 찍을 수 있어 레이아웃 관찰이나 동적인 상호작용이 필요한 작업에 적합합니다. Agent가 이러한 동작을 수행할 수 있는지는 현재 환경의 도구 지원과 연결 상태에 달려 있습니다.
모든 온라인 작업이 실제 브라우저를 사용한다고 가정하지 마세요.
구체적인 페이지 목표 제공하기
예를 들어 ‘공개 페이지를 열고 모바일 탐색 메뉴가 내용을 가리는지 확인한 뒤 스크린샷을 저장해 주세요’라고 요청하세요. 확인할 상태, 화면 조건, 출력을 명확히 하면 ‘웹사이트를 확인해 주세요’보다 검증 가능한 결과를 얻기 쉽습니다.
화면 문제라면 문제가 발생하는 페이지 경로와 재현 단계를 제공하고 각 단계의 실제 상태를 기록하도록 요청하세요. 스크린샷은 작업 전인지 후인지 표시하는 것이 좋습니다. 마지막 스크린샷만으로는 중간 상호작용이 요구대로 진행되었는지 증명하기 어려운 경우가 많습니다.
- 대상 웹페이지와 허용할 조작 범위를 확인하세요.
- 관찰할 페이지 상태나 상호작용을 명시하세요.
- 스크린샷이나 실제로 확인 가능한 결과를 요청하세요.
- 제출이나 수정이 있다면 구체적인 작업을 먼저 확인하세요.
로그인과 환경의 경계
Agent가 사용하는 브라우저에 평소 브라우저의 로그인 상태가 있다고 가정해서는 안 됩니다. 클라우드와 로컬 환경에서 서로 다른 페이지가 보일 수 있습니다. 보안 문자, 로그인 안내, 접근 거부가 나타나면 웹사이트가 요구하는 방식으로 처리하세요. 자동 완료는 보장되지 않습니다. 페이지에 성공이 표시된 뒤에도 최종 상태를 확인하세요. 특히 리디렉션, 업로드, 양식 제출에서는 확인이 필요합니다.