Czy Agent może otwierać strony, klikać i robić zrzuty ekranu?
Wykonuj jasno określone operacje stron w środowiskach obsługujących narzędzia przeglądarki.
Działania przeglądarki różnią się od wydobywania tekstu
Ekstrakcja tekstu strony nadaje się do pobierania publicznego tekstu; działania przeglądarki pozwalają w obsługiwanym środowisku otwierać strony, sprawdzać stan, klikać i robić zrzuty, więc służą obserwacji układu lub dynamicznym interakcjom. Możliwość wykonania przez Agent zależy od obsługi narzędzi w bieżącym środowisku i stanu połączenia.
Nie zakładaj, że każde zadanie internetowe używa rzeczywistej przeglądarki.
Podaj konkretne cele na stronie
Na przykład: „Otwórz publiczną stronę, sprawdź, czy mobilna nawigacja zasłania treść, i zapisz zrzut”. Jasne określenie stanu, warunków ekranu i wyniku daje większą szansę na sprawdzalne rezultaty niż „sprawdź mi witrynę”.
Przy problemach interfejsu podaj ścieżkę strony i kroki odtworzenia oraz wymagaj zapisu rzeczywistego stanu przy każdym kroku. Zrzuty najlepiej oznaczyć jako wykonane przed działaniem lub po nim; sam końcowy zrzut często nie dowodzi, że pośrednie interakcje odbyły się zgodnie z wymaganiami.
- Potwierdź stronę docelową i dozwolony zakres działań.
- Określ stan strony lub interakcje do obserwacji.
- Poproś o zrzuty lub rzeczywiście widoczne wyniki.
- Przed wysyłaniem formularzy lub zmianami potwierdź konkretne operacje.
Granice logowania i środowiska
Nie zakładaj, że przeglądarka Agent ma stan logowania Twojej zwykłej przeglądarki; chmura i lokalne środowisko mogą widzieć różne strony. Przy CAPTCHA, prośbach o logowanie lub odmowie dostępu postępuj zgodnie z wymaganiami witryny; automatyczne ukończenie nie jest gwarantowane. Nawet po komunikacie powodzenia sprawdź końcowy stan, szczególnie przy przekierowaniach, przesyłaniu plików i formularzach.