Aller au contenu principal
2021 article

A 7-nm Four-Core Mixed-Precision AI Chip With 26.2-TFLOPS Hybrid-FP8 Training, 104.9-TOPS INT4 Inference, and Workload-Aware Throttling

34Citations signalées, ce qui n’est pas une note de qualité
5Institutions déclarées
3Pays d’affiliation déclarés

Rattachement africain : us, de, kr. Niveau de preuve : code pays fourni par la source.

Le résumé fourni par la source

Reduced precision computation is a key enabling factor for energy-efficient acceleration of deep learning (DL) applications. This article presents a 7-nm four-core mixed-precision artificial intelligence (AI) chip that supports four compute precisions—FP16, Hybrid-FP8 (HFP8), INT4, and INT2—to support diverse application demands for training and inference. The chip leverages cutting-edge algorithmic advances to demonstrate leading-edge power efficiency for 8-bit floating-point (FP8) training and INT4 inference without model accuracy degradation. A new HFP8 format combined with separation of the floating- and fixed-point pipelines and aggressive circuit/architecture optimization enables performance improvements while maintaining high compute utilization. A high-bandwidth ring protocol enables efficient data communication, while power management using workload-aware clock throttling maximizes performance within a given power budget. The AI chip demonstrates 3.58-TFLOPS/W peak energy efficiency and 26.2-TFLOPS peak performance for HFP8 iso-accuracy training, and 16.9-TOPS/W peak energy efficiency and 104.9-TOPS peak performance for INT4 iso-accuracy inference.

Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.

Le contrôle bibliographique ouvert

DOI retrouvé dans Crossref DOI retrouvé ; titre concordant.

Titre Crossref
A 7-nm Four-Core Mixed-Precision AI Chip With 26.2-TFLOPS Hybrid-FP8 Training, 104.9-TOPS INT4 Inference, and Workload-Aware Throttling
Date Crossref
01/01/2022
Éditeur
Institute of Electrical and Electronics Engineers (IEEE)
Type
journal-article

Ce recoupement confirme des métadonnées liées au DOI. Il ne confirme ni la méthode ni les conclusions de l’étude, et il ne compte pas comme une seconde source scientifique indépendante.

Où se fait cette recherche

  • IBM Research - Thomas J. Watson Research Center pays non établi dans la notice
    Structure de recherche
  • IBM (United States) pays non établi dans la notice
    Entreprise
  • University of California San Diego pays non établi dans la notice
    Université ou école supérieure
  • IBM (Germany) pays non établi dans la notice
    Entreprise
  • Hanyang University Department of Electronic Engineering pays non établi dans la notice
    Université ou école supérieure
  • IBM T. J. Watson Research Center pays non établi dans la notice
    Structure de recherche
  • University of California at San Diego Department of Electrical and Computer Engineering (ECE) pays non établi dans la notice
    Université ou école supérieure
  • IBM Systems Group pays non établi dans la notice
    Institution
  • Rebellions Inc. pays non établi dans la notice
    Entreprise

IBM Research - Thomas J. Watson Research Center, IBM (United States) et University of California San Diego, avec 6 autres affiliations.

Une affiliation ne permet pas de déduire la nationalité d’un auteur.

Les sujets associés

Parallel Computing and Optimization TechniquesAdvanced Neural Network ApplicationsFerroelectric and Negative Capacitance Devices

BNTIC News n’est pas le producteur de ces données. Les publications sont interrogées à la demande dans Crossref, OpenAIRE, DOAJ, Europe PMC, HAL, DataCite, AfricArXiv, ROR et la Banque mondiale, sans clé d’accès. OpenAlex reste optionnel. Aucun service payant n’est nécessaire et aucune donnée externe n’est enregistrée en base. Consulter les sources et leurs limites.