Epistemic Overriding: How Alignment Specifications Flatten Human Ambiguity in Large Language Models
Rattachement africain : us. Niveau de preuve : code pays fourni par la source.
Le résumé fourni par la source
Abstract: Aligned large language models demonstrate epistemic overriding, flattening human ambiguity into assertive, unprompted premises. This behavior is the structural inverse of sycophancy. It occurs because confident disagreement in a language model is an engineered format rather than internal reasoning. Alignment introduces authored selection filters that enforce decisive registers without altering base capabilities. Because evaluators confuse fluency with accuracy through automation bias, this format triggers *cognitive hijacking*, causing users to adopt invented machine premises into independent reasoning. Machine certainty functions as an authored layout that structurally guarantees epistemic overriding, locating accountability within the alignment specification rather than diffuse computation. Keywords: AI Alignment, Large Language Models, Epistemic Overriding, Post-Training Alignment, RLHF, Constitutional AI, Framing Theory, Tonal Uniformity, Perceptual Fluency, Automation Bias, Cognitive Hijacking, Machine Certainty, Sycophancy, Algorithmic Accountability, Sociotechnical Systems, Archaeobytology
Ce résumé expose les affirmations des auteurs. BNTIC ne l’interprète pas comme une validation indépendante des résultats.
Le contrôle bibliographique ouvert
Les institutions déclarées
Une affiliation ne permet pas de déduire la nationalité d’un auteur.