Efficient Long-Horizon Mobile Manipulation with RAG-Assisted Vision Language Models
Rattachement africain : cn. Niveau de preuve : code pays fourni par la source.
Le résumé fourni par la source
In dynamic and complex real-world environments, long-horizon mobile manipulation tasks impose higher demands on the autonomous capabilities of robots. Traditional methods suffer from poor generalization and high data requirements. This paper proposes a task planning method called Retrieval-Augmented generation-assisted Vision-Language Model (RAVLM). By combining retrieval-augmented generation with vision language models, RAVLM enables external knowledge retrieval and generative planning. Applied to mobile robots, this method enhances the robot’s understanding of task context and supports long-horizon task planning under complex natural language instructions. Three mobile manipulation tasks were designed on the Habitat 2.0 platform for simulation experiments. The results demonstrate that RAVLM achieves significant advantages in task planning quality, cross-task adaptability, and development cost.
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.
Le contrôle bibliographique ouvert
DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.
- Titre Crossref
- Efficient Long-Horizon Mobile Manipulation with RAG-Assisted Vision Language Models
- Date Crossref
- 12/09/2025
- Éditeur
- IEEE
- Type
- proceedings-article
Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.
Les institutions déclarées
Une affiliation ne permet pas de déduire la nationalité d’un auteur.