Aller au contenu principal
2026 conference-paper

A Malicious Policy Detection Approach Enhanced by Threat Knowledge in LLM-Based Embodied Robots

0Citations signalées, ce qui n’est pas une note de qualité
3Institutions déclarées
1Pays d’affiliation déclarés

Rattachement africain : cn. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Integrating Large Language Models (LLMs) into robot systems enables natural language task planning but also raises safety risks, e.g., jailbreak attacks. Existing LLM safety alignment efforts primarily address textual harms, while insufficiently covering physical risks from malicious task planning. Moreover, current defenses against embodied robots lack interpretability and generalization to diverse, real-world attack scenarios. To address these challenges, we propose a novel threat knowledge-enhanced approach for malicious policy detection. Our method builds a structured knowledge base of known malicious behaviors by standardizing multi-format sub-task policies into unified semantic representations. During inference, we retrieve relevant malicious cases and leverage chain-of-thought reasoning for analogy-based semantic analysis. Experiments demonstrate that our approach effectively detects malicious behaviors and generalizes well across tasks. It reduces attack success rates to an average of 2.67% on SafeAgentBench and 2.30% on BadRobot benchmarks, while maintaining high clean task performance of 76.04% on SafeAgentBench.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
A Malicious Policy Detection Approach Enhanced by Threat Knowledge in LLM-Based Embodied Robots
Date Crossref
03/05/2026
Éditeur
IEEE
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Les institutions déclarées

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Network Security and Intrusion DetectionAdvanced Malware Detection TechniquesReinforcement Learning in Robotics

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.