Prompt injection guardrail

class opik.guardrails.guards.prompt_injection.PromptInjection(threshold: float = 0.5)

Bases: Guard

Guard that detects prompt injection and jailbreak attempts.

Runs a fine-tuned classifier on the guardrails backend, which requires the guardrails server (with a Hugging Face token configured) to be running.

get_validation_configs() List[Dict[str, Any]]

Get the validation configuration for prompt injection detection.

Returns:

List containing the prompt injection validation configuration