Prompt injection guardrail¶
- class opik.guardrails.guards.prompt_injection.PromptInjection(threshold: float = 0.5)¶
Bases:
GuardGuard that detects prompt injection and jailbreak attempts.
Runs a fine-tuned classifier on the guardrails backend, which requires the guardrails server (with a Hugging Face token configured) to be running.
- get_validation_configs() List[Dict[str, Any]]¶
Get the validation configuration for prompt injection detection.
- Returns:
List containing the prompt injection validation configuration