Agent può aprire pagine, fare clic e acquisire screenshot?
Esegui operazioni esplicite sulle pagine negli ambienti che supportano strumenti browser.
Le operazioni del browser differiscono dall'estrazione del testo
L'estrazione del testo web è adatta a recuperare contenuti testuali pubblici. Le operazioni browser possono aprire pagine, verificarne lo stato, fare clic e acquisire screenshot negli ambienti supportati, utili quando servono osservazione del layout o interazioni dinamiche. Le azioni disponibili ad Agent dipendono dagli strumenti dell'ambiente corrente e dallo stato della connessione.
Non presumere che ogni attività online utilizzi un browser reale.
Fornisci obiettivi precisi sulla pagina
Per esempio: «Apri una pagina pubblica, controlla se la navigazione mobile copre i contenuti e salva uno screenshot». Specificare stato da controllare, condizioni dello schermo e output produce più facilmente risultati verificabili di un generico «controlla il sito».
Per problemi dell'interfaccia, indica percorso della pagina e passaggi di riproduzione e chiedi di registrare lo stato effettivo a ogni fase. Idealmente gli screenshot devono indicare se sono precedenti o successivi all'azione. La sola immagine finale spesso non dimostra che le interazioni intermedie siano avvenute come richiesto.
- Conferma la pagina di destinazione e l'ambito delle operazioni consentite.
- Specifica lo stato della pagina o le interazioni da osservare.
- Richiedi screenshot o risultati realmente visibili.
- Prima di invii o modifiche, conferma le operazioni specifiche.
Confini di accesso e ambiente
Non presumere che il browser di Agent abbia la sessione del tuo browser abituale. Ambienti cloud e locali possono vedere pagine diverse. In caso di captcha, richieste di accesso o dinieghi, segui quanto richiede il sito: il completamento automatico non è garantito. Anche dopo un messaggio di successo, verifica lo stato finale, soprattutto per reindirizzamenti, caricamenti e invii di moduli.