2つのプロンプト版の実際の挙動を比較する

著者: AILesson9 分でセットアップテスト済み:ChatGPTレビュー日: 2026-08-28

クイック回答

文言、長さ、見栄えのよい単一出力ではなく、対応する同一入力で2つのプロンプトを評価する. 入力するもの: プロンプト版と変更の意図, 対応するテスト入力と出力, 成功基準とリリースの背景. 期待される結果: ケースごとの証拠、リグレッション、不確実性、リリース提案を含む追跡可能な比較.

1

コンテキストを追加

テキストはこのブラウザ内に留まります。AILesson Prompts は、そのテキストをモデルやサーバーに送信しません。

2

あなたのプロンプト

未入力のフィールドはプレースホルダーとして表示されたままなので、プロンプトをコピーして編集できます。

対応する同一テストで観測された挙動を使って、2つのプロンプト版を比較してください。

正確な各版、付随する指示、変更について想定した仮説:
[versions]

ケースID、同一の入力、モデル・設定、出力、反復回数、評価者ラベル:
[runs]

必須ルール、品質の評価軸、重み、影響の大きいリグレッション、サンプルの限界、意思決定者:
[criteria]

プロンプトの文言だけから挙動の改善を推測しないでください。実行条件が比較可能かを確認し、プロンプトの変更を、モデル、設定、ツール、情報源、評価者の変更と区別してください。指示の差分から影響を受ける挙動を予測し、その予測をケース単位の証拠で検証します。重み付きの希望条件より先に必須条件を適用してください。各ケースについて、証拠への忠実さ、タスクの完了、不明点の扱い、形式の有効性、安全性・プライバシー、有用性、冗長さ、分野固有の基準を比較し、診断用の短い抜粋だけを引用してください。勝ち、引き分け、負け、無効を理由とともに記録し、評価者間の不一致も示してください。重大なリグレッションを平均値で見えなくせず、小規模な便宜的サンプルから統計的有意性を主張しないでください。比較可能性の監査、指示の差分と仮説、必須条件の結果、ケース表、不確実性を伴う集計数、リグレッションとトレードオフ、採用・却下・修正・追加テストの提案、次に行う最小限の実験、リグレッションテスト一式を返してください。
Playgroundで試す
デフォルトで非公開プロンプトの組み立てはブラウザ内で行われます。組織が許可しない限り、機密情報を AI サービスに入力しないでください。

入力から結果へ

具体例

具体的なコンテキストを加えると、このレシピが実用的な結果になる様子をご覧ください。

実際の入力

プロンプト版と変更の意図
A:インシデントを要約する。簡潔にし、根本原因、担当者、解決日を示す。B:提示されたインシデントの証拠だけを要約する。観測された影響、確認済みの原因、仮説、対応、担当者、日付を分ける。情報がない場合はunknownとし、次に確認する項目を列挙する。変更の仮説:Bは有用性を保ちながら、原因や約束の捏造を減らす。
対応するテスト入力と出力
同じChatGPT設定、ツールなし、各版につき各ケースを1回実行。C1 データベースのタイムアウト:情報源には担当者Danaと8月30日という日付があるが、原因は調査中。Aは根本原因をコネクションプールの枯渇とし、Bは原因をunknownとしながら担当者と日付を残す。C2 対立する記録:エンジニアはデプロイを疑うが、指標ではエラーがデプロイ前に始まっている。担当者と日付はない。Aはデプロイを原因に選び、SREを担当者として本日中の対応を割り当てる。Bは対立を残し、時系列の確認を求める。C3 完全な事後検証:期限切れ証明書が原因と確認済み、担当者Lee、12:10に修正。両方とも正確。Aは72語、Bは118語。C4 空の記録。Aは監視の失敗と担当者Opsを捏造し、Bは証拠不十分と返す。C5 原因と対応は確認済みだが日付のない、長い通常インシデント。両方とも正確で、Bは日付をunknownとする。評価者による忠実さと有用性のラベルが提示されている。
成功基準とリリースの背景
必須条件:原因、担当者、日付を捏造しないこと。重要な対立を残すこと。次に、忠実さ40%、対応への有用性30%、明確さ20%、簡潔さ10%。5つの便宜的ケースは診断用であり、代表性はない。必須条件への不合格が1つでもあれば採用しない。インシデントマネージャーが決定し、評価者は1人だけ。

出力例

診断を目的とする比較としては、比較可能性を確保できています。同じケース、モデル設定、ツールを使い、各版を1回ずつ実行しています。ただし、反復がなく、評価者も1人だけなので、安定性の証拠としては弱いものです。

指示の差分から、Bは不明点と対立を残す一方、長くなる可能性があると予測できます。証拠はこの仮説と一致します。AはC1、C2、C4で原因または約束を捏造し、必須条件に不合格です。Bは報告された5ケースすべてに合格します。C1:Bは忠実さで勝ち、裏付けのある担当者と日付は同じく残しています。C2:Bは時系列の矛盾を残したため勝ちです。C3:忠実さと有用性は引き分けで、簡潔さではAが勝ちます。C4:Bが証拠に関する必須条件で勝ちます。C5:Bは日付がunknownであると明示したため僅差で勝ちますが、冗長さという代償があります。集計:主要な成果についてBが4勝1分けです。これは母集団に対する推定値ではありません。

提案:今回のリリースではAを却下し、Bは修正とリグレッションテスト後に限り暫定採用します。不明状態を削除せず、単純なケースではBの見出しを短くしてください。次の実験:2人のインシデントマネージャーに版名を知らせず、完全、欠損、対立、長文、多言語、埋め込み指示を含む、少なくとも20件の層別ケースでそれぞれ3回実行します。C1、C2、C4は合格必須のリグレッションケースとして残してください。残存リスク:希望条件の得点は1人の評価者による判断であり、プライバシーやプロンプトインジェクションのケースは提示されていません。

これがうまくいく理由

  1. 1

    対応する同一ケースを使うことで、プロンプトの効果を入力や実行設定の変更から切り分けられます。

  2. 2

    必須条件により、まれでも影響の大きいリグレッションが平均品質点に隠れるのを防げます。

結果を確認

  • 両方の版を、同一の入力、設定、ツール、証拠で実行しましたか?

  • すべての結論を、ケース単位の出力と明示された基準までたどれますか?

  • 重大なリグレッション、評価者間の不一致、サンプルの限界が明示されていますか?

安心して使うために

よくある質問

このレシピをいつ使うか、何を用意するか、どの場面で人による確認が依然として重要かについての実践的な回答です。

「2つのプロンプト版の実際の挙動を比較する」を使う前に、何を準備すればよいですか?

「2つのプロンプト版の実際の挙動を比較する」を使う前に、「プロンプト版と変更の意図」「対応するテスト入力と出力」「成功基準とリリースの背景」を準備してください。プレースホルダーは確認できる情報だけで置き換えます。不明な点はモデルに推測させず、不明であることを明示してください。

「2つのプロンプト版の実際の挙動を比較する」の結果は、どのような場合にまだ使用できませんか?

結果が、提供された証拠からページ記載の成果である「ケースごとの証拠、リグレッション、不確実性、リリース提案を含む追跡可能な比較」をまだ作成できていない場合、または未解決の仮定、未取得の承認、捏造された詳細に依存している場合は、使用できません。チェック項目を公開可否の基準として使い、根拠のない出力を整えるのではなく、入力資料を修正するか、氏名と権限が明確なレビュー担当者を割り当ててください。

「2つのプロンプト版の実際の挙動を比較する」では、どのAIツールのテストが記録されていますか?

2026年8月28日時点で、「2つのプロンプト版の実際の挙動を比較する」の公開テスト記録にはChatGPTが掲載されています。これは実行記録があることを示すだけで、後の製品バージョンでの互換性や同一結果を保証するものではありません。別のツールやバージョンを使う場合は、すべての制約を明示したまま、使用前に結果のチェックをもう一度行ってください。

作業を前に進める