跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分44

研究揭示 LLM 全流程为何默认偏向美式英语:1,813 组 AmE–BrE 变体与 DiAlign 方法

How Does "English (US)" Become the Default? Triangulating Structural Bias Towards American English Across the LLM Pipeline

AI 导读

研究以 1,813 组匹配的美式英语(AmE)与英式英语(BrE)变体为资源,提出免训练的 DiAlign 方法,从数据分布证据估计区域对齐度。AmE 在全部 6 个预训练语料和 21 个后训练数据集中均被偏好,tokenizer 表示更紧凑、预测成本更低,且在中性英语提示下仍是默认生成偏好;改用英式英语提示可向 BrE 偏移,但无法稳定消除 AmE 默认。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org