ユーザー入力をそのままLLMに渡していませんか ― プロンプトインジェクションを「前提」にする信頼境界の最小実装
この記事で分かること
プロンプトインジェクション攻撃を防ぐために、信頼境界を設定し最小限の実装で保護する方法が得られる。ユーザー入力とシステム指示を明確に分離する設計パターンと、入力検証の具体的な実装方針を理解できる。
詳細要約
ユーザー入力を直接LLMに渡すとプロンプトインジェクションのリスクが生じるため、入力を「信頼できない外部データ」として扱い、システム指示と明確に分離する設計が必須。実装では、ユーザー入力をLLMに渡す前に専用のプレフィクス(例:「以下はユーザーからの入力です:」)を付与し、システム指示の後に配置する。さらに、出力側で「このメッセージはシステムからの応答です」といったラベルを付けることで、境界を可視化し、インジェクションの影響範囲を限定できる。