ツールが実際に正常に実行されたかどうかを判断する方法
終了ステータス、実際の出力、および生成された成果物を同時に確認します。
単一の成功サマリーに頼らないでください
Agentの自然言語サマリーは、ツールの出力と一致する必要があります。コマンド開始の成功、プログラム終了の成功、タスク目標の達成は3つの異なるレベルです。プログラムは正常に終了しても、指定されたファイルを処理していない場合があります。
まずターゲット環境と入力を検証し、次にその出力が最終的な結論を十分に裏付けているかを確認してください。
目に見える証拠で判断してください
例えば、レポート生成タスクでは、ファイルが存在し、内容が完全であることを確認してください。プログラムチェックタスクでは、赤いエラーメッセージがあるかどうかだけでなく、実際の結果と該当する条件を確認してください。
例えば、「チェックに合格しました」というレポートが表示された場合、どのファイルがチェックの対象となったか、どのような入力が使用されたか、および項目がスキップされたかどうかを尋ねてください。正しい終了ステータスは、実行レベルでの判断のみをサポートします。目標が達成されたかどうかは、開始時に合意された受け入れ基準と一致する必要があります。
- コマンドの実行ステータスと主要な出力を確認します。
- 処理されたファイル、バージョン、またはターゲットが期待どおりであることを確認します。
- 生成されたファイルと必要なフィールドを検査します。
- カバーされていないスコープ要件を明確に述べます。
出力が非常に長い場合、または履歴セッションが終了した場合
ツールは限られた出力を保持するか、保存場所を提供する場合があります。会話プレビューが完全なログを示していると仮定しないでください。Agentに関連するセグメントを抽出し、元の結果を保持するように依頼してください。履歴実行記録の「実行中」は、プロセスが現在も実行中であることを必ずしも証明しません。タスクを再開する際は、次のステップを決定する前に、まず現在のステータスと成果物を検証してください。