来源:ArXiv AI 2026-08-18 04:00

立场:人工智能道德推理的评价仍遗漏了一半

道德 规范 评估 应用 推理
arXiv:2608.14566v1 公告类型:新 摘要:最近评估大型语言模型(LLM)道德能力的工作主要集中在我们所说的道德价值问题,即模型输出是否符合人类道德价值观。相比之下,道德规范问题,即模型是否能够识别并正确应用情境敏感的道德规范,仍然没有得到充分探索。我们认为这种不平衡源于该领域对描述性伦理框架的依赖,例如道德基础理论和科尔伯格的道德发展阶段,这些框架强调价值表征而不是规范应用。我们回顾了现有的基准和评估方法,并表明它们主要集中在价值问题上,而有关规范道德的讨论仍然不足。我们发现了三个关键差距:(i)缺乏道德规范及其应用的高质量地面实况数据,(ii)对中间推理过程的评估不足,以及(iii)对识别上下文中的道德相关特征的关注有限。随后,我们提出了一个研究议程,其中包括规范理论的标准化形式表示的开发、捕获规范应用的专家注释数据集的构建以及明确区分价值观水平和规范水平能力的评估协议。我们的目标是鼓励法学硕士对规范推理进行更系统的研究。

相关文章推荐

返回首页