Kan Agent åbne websider, klikke og tage skærmbilleder?
Udfør eksplicitte sideoperationer i miljøer, der understøtter browser-værktøjer.
Browseroperationer adskiller sig fra tekstudtrækning
Tekstudtrækning fra websider er velegnet til at udtrække offentligt tilgængelig tekst; browseroperationer kan få adgang til sider, tjekke status, klikke og tage skærmbilleder i understøttede miljøer, velegnet til opgaver, der kræver observation af layout eller dynamisk interaktion. Om Agent kan udføre disse handlinger afhænger af det aktuelle miljøs værktøjsunderstøttelse og forbindelsesstatus.
Antag ikke, at enhver onlineopgave bruger en rigtig browser.
Angiv specifikke side-mål
For eksempel, "Åbn en offentlig side, tjek om mobilnavigationen dækker indhold, og gem et skærmbillede." Tydelig angivelse af den status, der skal tjekkes, skærmbetingelser og output er mere sandsynligt at give verificerbare resultater end "hjælp mig med at tjekke hjemmesiden."
For interfaceproblemer, angiv sidestien, hvor problemet opstår, og reproduktionsskridt, og anmod om optagelse af den faktiske status ved hvert trin. Skærmbilleder bør ideelt set angive, om de blev taget før eller efter operationen; kun at have det endelige skærmbillede kan ofte ikke bevise, om mellemliggende interaktioner fandt sted som krævet.
- Bekræft den målrettede webside og det tilladte omfang af operationer.
- Angiv sidens tilstand eller interaktioner, der skal observeres.
- Anmod om skærmbilleder eller faktiske synlige resultater.
- For indsendelser eller ændringer, bekræft specifikke operationer først.
Login- og miljøgrænser
Browseren, der bruges af Agent, bør ikke antages at have din almindelige browsers login-status; cloud- og lokale miljøer kan se forskellige sider. Når der vises captchaer, login-prompts eller adgangsafslag, skal du håndtere dem, som hjemmesiden kræver; automatisk fuldførelse er ikke garanteret. Selv efter at siden viser succes, skal du verificere den endelige status, især for omdirigeringer, uploads og formularindsendelser.