プロンプトの性能が低い原因を診断する

著者: AILesson7 分でセットアップテスト済み:ChatGPTレビュー日: 2026-08-28

クイック回答

意図、入力、指示、実際の出力を比較し、推測ではなく証拠に基づいて失敗パターンを特定する. 入力するもの: プロンプトと想定タスク, 実際の入力と出力, 評価上の制約. 期待される結果: 観察された失敗にひも付く、優先順位付き診断、最小限の修正、再実行テスト.

1

コンテキストを追加

テキストはこのブラウザ内に留まります。AILesson Prompts は、そのテキストをモデルやサーバーに送信しません。

2

あなたのプロンプト

未入力のフィールドはプレースホルダーとして表示されたままなので、プロンプトをコピーして編集できます。

実際の実行結果を証拠として、提示されたプロンプトの性能が低い原因を診断してください。

正確なプロンプト、周辺の指示、想定用途、モデル/設定、成功基準:
[prompt]

日付付きの代表的な入力と出力:
[runs]

許可される変更、制限、データ/ツール、必須動作、既知の制約:
[constraints]

観察された各失敗を、考えられる最小限の原因までたどってください。原因はプロンプト、入力、コンテキスト、評価、ツール、モデルのいずれかに分類します。タスクの曖昧さ、証拠の不足、指示の競合、過剰に詰め込まれた手順、優先事項の不適切な配置、未定義の用語、不十分な区切り、出力仕様の不足、不明事項の扱いの欠如、誤ったパターンを教える例、観察できない成功基準を確認してください。確認済みの原因と仮説を区別し、比較証拠がないままランダム性やモデルのせいにしてはいけません。診断が完了するまで書き直さないでください。意図と観察結果の比較表、引用した証拠・確信度・代替説明を含む失敗パターンの順位、役立つまたは悪影響を与えるプロンプトの文言、入力と評価の不備、確信度の高い問題ごとの最小限の修正、改訂版プロンプト、一度に一つの変更だけを切り分ける再実行マトリックスを返してください。
Playgroundで試す
デフォルトで非公開プロンプトの組み立てはブラウザ内で行われます。組織が許可しない限り、機密情報を AI サービスに入力しないでください。

入力から結果へ

具体例

具体的なコンテキストを加えると、このレシピが実用的な結果になる様子をご覧ください。

実際の入力

プロンプトと想定タスク
プロンプト:『あなたは熟練したサポート担当者です。チケットを読み、完璧で簡潔な返信を書いてください。共感を示し、問題を解決し、決して間違えてはいけません。』担当者が確認する初回返信の下書きに使用します。モデル:ChatGPT、既定の設定、2026-08-27。成功基準:正確かつ有用で120語以内、権限のない返金や原因の断定を行わないこと。
実際の入力と出力
Run 1の入力:顧客は、エクスポートがE17で2回失敗したため返金を求めています。ポリシーは提示されていません。出力はサーバー障害について謝罪し、全額返金を承認しました。Run 2:顧客は請求書を見つけられません。アカウントの種類は提示されていません。出力はBusinessアカウントだけに該当する操作経路を案内しました。Run 3:顧客はアップデート後に読み込みが遅いと報告しました。出力はOSとアプリのバージョンを尋ね、原因を断定しませんでしたが、154語ありました。レビュー者はRun 1–2を安全でなく、Run 3は有用だが長すぎると評価しました。
評価上の制約
変更できるのはユーザープロンプトだけです。入力はさまざまで、ポリシー、プラン、バージョン、ツールへのアクセスがないこともよくあります。モデルはアカウントを確認できません。不足している事実を推測せず、質問しなければなりません。出力は返信1件、120語以内とし、必ず担当者が確認します。

出力例

意図と観察結果の比較:Run 1とRun 2は、権限のない対応をしないこと、および推測しないことという基準に違反しています。Run 3は事実面の安全性を満たしていますが、長さの条件に違反しています。

診断の順位:(1)確信度:高 — 「問題を解決する」という指示は、ポリシーやアカウント情報がない状況と競合し、モデルに解決まで完了するよう圧力をかけています。異なる二つのケースで裏付けのない補完が起きたことが証拠です。最小修正:裏付けのある次の手順だけを示すことと、不明事項の明示的な扱いを求める。(2)確信度:高 — 「熟練した」と「決して間違えない」は、権限も確認手順も定義せず、観察可能な統制になりません。削除する。(3)確信度:高 — プロンプト内の「簡潔」は数値上限を定めておらず、Run 3は154語でした。出力契約に ≤120語 を入れる。(4)確信度:中 — 構造化された入力フィールドがないため、プランやポリシーの不足を見落としやすくなっています。証拠ブロックまたは不足情報に関する指示を加える。モデルの変動が原因である可能性もありますが、証拠はありません。

改訂版プロンプト:「チケットと、提示されたポリシー/アカウント情報だけを使用し、120語以内の初回サポート返信を1件作成してください。観察された問題には触れますが、未確認の原因を断定してはいけません。提示された明示的なルールで許可されている場合を除き、返金、クレジット、交換、アカウント変更を承認してはいけません。ツールやアカウント状態を確認したと主張してはいけません。必要なプラン、バージョン、ポリシー、結果がない場合は、具体的な質問を最大2件行い、入力によって裏付けられる安全な手順だけを示してください。エラーコードは正確に保持してください。メッセージ本文だけを出力してください。」

再実行:まずRun 1–2に対して、不明事項と権限に関するルールだけを追加します。次にRun 3に対して長さの契約を追加します。最後に、返金が明示的に許可された入力をテストし、安全策が許可済みの対応を妨げないことを確認します。

これがうまくいく理由

  1. 1

    実際の実行証拠を使うことで、プロンプトの欠陥を、入力不足や主観的な不満と区別できます。

  2. 2

    一度に一つだけ変更して再実行すれば、複数の推測をまとめて適用せず、改善の原因を特定できます。

結果を確認

  • 確信度の高い診断はすべて、繰り返された失敗または直接追跡できる失敗を引用していますか?

  • プロンプト、入力、評価者、ツール、モデルに由来する原因を区別していますか?

  • 再実行マトリックスから、どの修正が改善または回帰を引き起こしたか判断できますか?

安心して使うために

よくある質問

このレシピをいつ使うか、何を用意するか、どの場面で人による確認が依然として重要かについての実践的な回答です。

「プロンプトの性能が低い原因を診断する」を使用する前に、何を準備すればよいですか?

「プロンプトの性能が低い原因を診断する」を使用するには、プロンプトと想定タスク、実際の入力と出力、評価上の制約を準備してください。プレースホルダーは、確認可能な情報だけで置き換えます。詳細が不明な場合は、モデルに推測させず、不明であることを明示してください。

「プロンプトの性能が低い原因を診断する」の結果は、どのような場合にまだ使用できませんか?

提示された証拠から、記載された成果である「観察された失敗にひも付く、優先順位付きの診断、最小限の修正、再実行テスト」をまだ作成できていない場合や、未解決の前提、承認の不足、創作した詳細に依存している場合、その結果は使用できません。チェック項目を公開可否の判断基準として使い、裏付けのない出力を磨くのではなく、元の入力を修正するか、権限を持つ担当者を指名してレビューを依頼してください。

「プロンプトの性能が低い原因を診断する」では、どの AI ツールのテスト記録がありますか?

2026-08-28 時点で、「プロンプトの性能が低い原因を診断する」の公開テスト記録には ChatGPT が掲載されています。これは実行記録があることを示すだけで、今後の製品バージョンとの互換性や同一の結果を保証するものではありません。別のツールやバージョンでは、すべての制約を明示したまま、使用前に結果のチェック項目をもう一度確認してください。

作業を前に進める