Hackcat

Czy Agent może otwierać strony, klikać i robić zrzuty ekranu?

Wykonuj jasno określone operacje stron w środowiskach obsługujących narzędzia przeglądarki.

Działania przeglądarki różnią się od wydobywania tekstu

Ekstrakcja tekstu strony nadaje się do pobierania publicznego tekstu; działania przeglądarki pozwalają w obsługiwanym środowisku otwierać strony, sprawdzać stan, klikać i robić zrzuty, więc służą obserwacji układu lub dynamicznym interakcjom. Możliwość wykonania przez Agent zależy od obsługi narzędzi w bieżącym środowisku i stanu połączenia.

Nie zakładaj, że każde zadanie internetowe używa rzeczywistej przeglądarki.

Podaj konkretne cele na stronie

Na przykład: „Otwórz publiczną stronę, sprawdź, czy mobilna nawigacja zasłania treść, i zapisz zrzut”. Jasne określenie stanu, warunków ekranu i wyniku daje większą szansę na sprawdzalne rezultaty niż „sprawdź mi witrynę”.

Przy problemach interfejsu podaj ścieżkę strony i kroki odtworzenia oraz wymagaj zapisu rzeczywistego stanu przy każdym kroku. Zrzuty najlepiej oznaczyć jako wykonane przed działaniem lub po nim; sam końcowy zrzut często nie dowodzi, że pośrednie interakcje odbyły się zgodnie z wymaganiami.

  1. Potwierdź stronę docelową i dozwolony zakres działań.
  2. Określ stan strony lub interakcje do obserwacji.
  3. Poproś o zrzuty lub rzeczywiście widoczne wyniki.
  4. Przed wysyłaniem formularzy lub zmianami potwierdź konkretne operacje.

Granice logowania i środowiska

Nie zakładaj, że przeglądarka Agent ma stan logowania Twojej zwykłej przeglądarki; chmura i lokalne środowisko mogą widzieć różne strony. Przy CAPTCHA, prośbach o logowanie lub odmowie dostępu postępuj zgodnie z wymaganiami witryny; automatyczne ukończenie nie jest gwarantowane. Nawet po komunikacie powodzenia sprawdź końcowy stan, szczególnie przy przekierowaniach, przesyłaniu plików i formularzach.