来源:ArXiv AI
2026-08-06 04:00
MatrAIx:用 83 亿角色代理模拟世界
评估
MatrAIx
角色
人类
人工智能
arXiv:2608.04205v1 公告类型:新
摘要:人类对人工智能系统和数字产品的评估成本高昂、速度缓慢且难以扩展。离线评估更具可扩展性,但通常会抽象出人类的多样性和交互行为。因此,我们推出了MatrAIx,一种人口规模的模拟用户评估基础设施,用于使用异构用户测试人工智能系统和数字产品。 MatrAIx 具有三个核心组件:首先,Persona 8B 包含由 1,290 个分类维度表示的 83 亿条角色记录。记录要么从保留相关属性的依赖关系图中采样,要么从人类编写的配置文件中派生。我们发布了约 100 万个角色的质量过滤核心集,其中包括 599,847 条基于人类的记录和 400,000 条综合记录。其次,MatrAIx Playground 提供了四种环境供不同用户评估并与数字产品交互:调查、AI 聊天机器人、Web 和应用程序。第三,MatrAIx 提供了 1,010 个应用程序任务,涵盖超过 25 个领域,包括商业、软件、金融和医疗保健。我们针对八项代表性任务进行了 18,189 次评估试验。 Persona 代理由三个法学硕士提供支持:Claude Opus 4.8、GPT 5.5 和 Claude Haiku 4.5。由此产生的反馈反映了不同角色背景下决策和偏好的差异,包括价格上涨后的犹豫、人工智能助手失败后继续的意愿以及延迟容忍度。我们进行了两项主要验证研究:首先,一项 400 项试验对照研究评估了十种行为属性和所有四种环境中的角色依从性。在 366 项试验中(91.5%)表达或正确抑制了所声明的行为。其次,人类和法学硕士评委评估了以人为本的角色的提取质量。总的来说,MatrAIx 提供了一个端到端的基础设施,用于通过不同的模拟人类用户来评估人工智能系统和数字产品。