Mend.io Vulnerability Database
The largest open source vulnerability database
What is a Vulnerability ID?
New vulnerability? Tell us about it!
MAI-2024-0065
Published:March 01, 2024
Updated:August 02, 2026
The ImgTrojan attack represents a sophisticated data poisoning strategy targeting Vision-Language Models (VLMs). This method enables adversaries to circumvent built-in safety protocols by introducing a minimal number of maliciously designed image-caption pairs into the training dataset. These poisoned pairs deceptively link innocuous images with prompts intended to jailbreak the model, resulting in the generation of unsafe outputs when the VLM processes these images during inference. Remarkably, the attack maintains a high success rate even with an extremely low poison ratio, such as one compromised image among 10,000. Mitigation steps: **For AI Developers:** * Implement advanced data filtering mechanisms capable of identifying and eliminating malicious image-caption pairs using a safety-aligned VLM. * Conduct regular security audits of datasets to identify and address potential vulnerabilities. **For Model Trainers/Fine-tuners:** * Develop VLM architectures with enhanced robustness to minimize susceptibility to data poisoning attacks. * Integrate adversarial training techniques into the VLM training process to improve resilience against malicious inputs.
Related Resources (1)
Do you need more information?
Contact Us
CVSS v4
Base Score:
1.8
Attack Vector
LOCAL
Attack Complexity
HIGH
Attack Requirements
NONE
Privileges Required
HIGH
User Interaction
NONE
Vulnerable System Confidentiality
NONE
Vulnerable System Integrity
LOW
Vulnerable System Availability
NONE
Subsequent System Confidentiality
NONE
Subsequent System Integrity
NONE
Subsequent System Availability
NONE
CVSS v3
Base Score:
1.9
Attack Vector
LOCAL
Attack Complexity
HIGH
Privileges Required
HIGH
User Interaction
NONE
Scope
UNCHANGED
Confidentiality
NONE
Integrity
LOW
Availability
NONE
AIVSS
Base Score:
2.1