AI Insight Hub
图片转PPT
Image2PPT
图片转PPT神器
首页
分类
关于
管理后台
首页
分类
关于
管理后台
来源:ArXiv AI
2026-08-19 04:00
翻译成中文
可解码性标准可预测大型语言模型中隐藏状态选择何时击败多数投票
选择
问题
模型
投票
解码
arXiv:2608.17124v1 公告类型:新 摘要:将一个问题的大型语言模型(LLM)样本的答案组合成一个决策是一个测试时信息融合问题,通常通过多数投票来解决。对于困难的问题,投票是不可靠的,其中抽样的答案存在相关错误,因此错误的答案可能会获胜,而抽取更多的样本会使决策变得更糟。通过读取模型隐藏状态的正确性信号来选择候选者是一种有前途的替代方案,但其准确性因模型和任务而异,并且没有任何衡量标准表明何时可以信任它。在本文中,我们提出了 CASE(正确性轴选择),这是一种动态选择组合器,可在答案令牌隐藏状态上训练线性门并选择得分最高的候选者。它的主要贡献是可解码性,这是一种无泄漏的衡量标准,用于衡量门将问题的正确候选者排在错误候选者之上的程度,从而预测隐藏状态选择是否会优于投票。传统的探测之所以显得准确,只是因为问题身份泄漏,而在问题分组评估下这种泄漏消失了。对于保留数据,可解码性预测选择相对于投票的准确性增益,皮尔逊相关性 r=0.75,决策阈值接近 AUC=0.60。在普通法学硕士和医学法学硕士中,CASE 在中等难度问题上的投票率提高了 19 分,在困难问题上提高了 16.8 分。可解码性取决于模型必须回忆的一致知识,而不是其规模,并且其预测在 3.8 点内转移到看不见的科学领域。因此,它提供了一个实用的标准,可以针对给定的模型和任务提前测量,用于在学习选择和多数投票之间进行选择。
查看原始链接
相关文章推荐
KernelArc:用于 GPU 内核优化的多代理框架
2026-08-19
DiSCO:通过分布引导的对比提示优化来捍卫文本到图像的生成
2026-08-19
记忆就是沟通:记忆与信号之间的边界
2026-08-19
返回首页