A Malicious Policy Detection Approach Enhanced by Threat Knowledge in LLM-Based Embodied Robots
Rattachement africain : cn. Niveau de preuve : code pays fourni par la source.
Le résumé fourni par la source
Integrating Large Language Models (LLMs) into robot systems enables natural language task planning but also raises safety risks, e.g., jailbreak attacks. Existing LLM safety alignment efforts primarily address textual harms, while insufficiently covering physical risks from malicious task planning. Moreover, current defenses against embodied robots lack interpretability and generalization to diverse, real-world attack scenarios. To address these challenges, we propose a novel threat knowledge-enhanced approach for malicious policy detection. Our method builds a structured knowledge base of known malicious behaviors by standardizing multi-format sub-task policies into unified semantic representations. During inference, we retrieve relevant malicious cases and leverage chain-of-thought reasoning for analogy-based semantic analysis. Experiments demonstrate that our approach effectively detects malicious behaviors and generalizes well across tasks. It reduces attack success rates to an average of 2.67% on SafeAgentBench and 2.30% on BadRobot benchmarks, while maintaining high clean task performance of 76.04% on SafeAgentBench.
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.
Le contrôle bibliographique ouvert
DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.
- Titre Crossref
- A Malicious Policy Detection Approach Enhanced by Threat Knowledge in LLM-Based Embodied Robots
- Date Crossref
- 03/05/2026
- Éditeur
- IEEE
- Type
- proceedings-article
Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.
Les institutions déclarées
Une affiliation ne permet pas de déduire la nationalité d’un auteur.