来源:ArXiv AI 2026-08-10 04:00

MLLM 能否解码创意飞跃?引入 C4 进行跨概念理解

概念 MLLM 评估 解码 C4
arXiv:2608.06501v1 公告类型:新 摘要:MLLM 的创造力在设计、通信、教育和人类与人工智能的协作中很重要,但仍然难以评估,因为与以准确性为导向的任务相比,明确的目标和奖励信号很少。跨概念理解是接受创造力的核心认知能力。它使感知者能够从不明显但有意义的概念关系中恢复预期的含义。我们将项目构建操作为跨概念编码,将模型推理操作为跨概念解码。我们介绍了 C4,一个基于成语(中国成语)的跨概念创造力的认知启发评估框架。其编码组件将目标槽映射到手动注释和第三方审查的跨概念网络中的桥路径上的可成像替代概念,从而实现具有显式结构的批量生成、按桥数量和深度索引的难度以及准确的答案。使用该框架,我们实例化了 C4 评估集(C4-Eval),其中包括从在线资源收集的 184 个合成项目和 37 个人工创建的跨概念成宇人物。我们手动构建和审查所收集数据的跨概念关系、桥梁路径和推理过程。每个 C4-Eval 项目在五个任务设置中实例化,产生 884 个主要答案恢复案例。在十个经过评估的 MLLM 中,最强的封闭模型达到了 50.7% 和 48.0% 的主要准确率,而开源模型仍然低得多。候选约束极大地提高了准确性,但桥接提示和解释请求仅提供了有限的收益。这些结果揭示了当前 MLLM 如何通过跨概念关系创造性地解码编码含义方面存在巨大差距。代码位于补充材料中。

相关文章推荐

返回首页