Agentはウェブページを開いたり、クリックしたり、スクリーンショットを撮ったりできますか?
ブラウザツールをサポートする環境で、明示的なページ操作を実行します。
ブラウザ操作とテキスト抽出の違い
ウェブページテキスト抽出は、公開されているテキストの抽出に適しています。ブラウザ操作は、サポートされている環境でページにアクセスし、ステータスを確認し、クリックし、スクリーンショットを撮ることができ、レイアウトの観察や動的な対話を必要とするタスクに適しています。Agentがこれらのアクションを実行できるかどうかは、現在の環境のツールサポートと接続ステータスによって異なります。
すべてのオンラインタスクが実際のブラウザを使用していると仮定しないでください。
特定のページターゲットを指定してください
例えば、「公開ページを開き、モバイルナビゲーションがコンテンツをカバーしているか確認し、スクリーンショットを保存する」のように指定します。「ウェブサイトのチェックを手伝って」と言うよりも、確認すべきステータス、画面の条件、および出力を明確に指定する方が、検証可能な結果を得られる可能性が高くなります。
インターフェースの問題については、問題が発生するページのパスと再現手順を提供し、各ステップでの実際の状態の記録を要求してください。スクリーンショットは、操作の前後に撮影されたかどうかを示すのが理想的です。最終的なスクリーンショットしかない場合、中間的な操作が必要どおりに行われたかどうかを証明できないことがよくあります。
- ターゲットのウェブページと許可される操作範囲を確認します。
- 観察すべきページの状態または対話を指定します。
- スクリーンショットまたは実際の表示結果を要求します。
- 提出または変更については、まず特定の操作を確認します。
ログインと環境の境界
Agentが使用するブラウザは、通常のブラウザのログイン状態を持っているとは限りません。クラウド環境とローカル環境では異なるページが表示される可能性があります。キャプチャ、ログインプロンプト、またはアクセス拒否が表示された場合は、ウェブサイトが必要とする方法で処理してください。自動完了は保証されません。ページに成功が表示された後でも、特にリダイレクト、アップロード、フォーム送信については、最終ステータスを検証してください。