Prompt injection is an attack that manipulates a language model's textual instructions to bypass its rules: making it ignore its safety guidelines or reveal internal information. Unlike classic attacks, it exploits the model's linguistic logic, which calls for specific defences.
In practice at Gensai
Gensai secures its systems by structuring prompts, filtering inputs and strictly limiting agents' access rights and allowed actions.