Aller au contenu principal
2024 conference-paper

Assisting Visually Impaired Subjects Using Large Language Models: A Comprehensive Evaluation

3Citations signalées, ce qui n’est pas une note de qualité
1Institutions déclarées
1Pays d’affiliation déclarés

Rattachement africain : Égypte. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Visual impairment significantly challenges an individual's ability to navigate and interact with their environment independently. While retinal prostheses have provided partial vision restoration, they offer limited support for complex visual tasks such as object recognition, text reading, and real-time navigation. Recent advancements in technology have introduced Large Language Models (LLMs) as promising tools to enhance these assistive technologies, potentially enhancing the capabilities of existing devices. This study explores the integration of LLMs into assistive devices for visually impaired individuals, evaluating several models, including MiniCPM-Llama3-V-2_5, PaliGemma, Blip2, Microsoft Git Large COCO, and LLaVA-Next. The models are assessed in tasks like image captioning, object detection, and optical character recognition (OCR), focusing on their effectiveness in enhancing user independence and quality of life. Our findings indicate that MiniCPM-Llama3-V-2_5 and PaliGemma excel in providing accurate, detailed, and practical outputs, crucial for real-world applications. These models demonstrate significant potential in transforming retinal prostheses from passive aids into interactive tools that enhance user engagement with their surroundings. The study concludes with discussions on the implications of these findings and suggests future research directions to further improve the integration of LLMs in assistive technologies for visually impaired individuals.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
Assisting Visually Impaired Subjects Using Large Language Models: A Comprehensive Evaluation
Date Crossref
19/10/2024
Éditeur
IEEE
Type
proceedings-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Les institutions déclarées

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Digital Accessibility for DisabilitiesTactile and Sensory InteractionsSubtitles and Audiovisual Media

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.