来源:ArXiv AI
2026-07-21 04:00
使用小语言模型使人工智能大众化:针对本地部署的结构化基准测试和参数高效的微调
模型
提高
基准
问题
3B
arXiv:2607.16202v1 公告类型:新
摘要:人工智能民主化主要不是一个匹配前沿规模普遍性的问题;而是一个问题。问题在于能否在普通机构实际能够满足的硬件和治理约束下选择、审计和专业化有能力的模型。本文通过在专为结构化本地部署而设计的 1,085 个示例、16 个主题的多项选择基准上对 135M 和 3B 参数之间的 9 个开放权重语言模型进行受控评估来研究该问题。该基准强调严格的单字母输出协议下的符号精度、受限格式、提取和短期语义决策。然后,共享参数高效微调管道使用 4 位 NF4 量化与 DoRA/LoRA 式适配器在 NVIDIA L4 级预算上调整模型子集。在基础评估中,Qwen Coder 3B 以 75.67% 的严格准确率领先,其次是 Qwen2.5 1.5B(67.10%)、Qwen3.5 2B(64.98%)和 Granite 3.3 2B(64.61%)。在共享的 108 个示例保留微调分割上,自适应将 Qwen Coder 3B 提高了 +26.85 点,SmolLM2 1.7B 提高了 +25.92 点,Qwen2.5 1.5B 提高了 +19.44 点,SmolLM2 360M 提高了 +10.18 点,SmolLM2 135M 提高了 +5.55 点。在排名、主题级异质性、难度层、故障构成、效率边界和主题条件转移方面,同样的结论再次出现:基准构建、跨模型评估和低成本专业化的规范工作流程已经使子 3B 模型的子集可以作为结构化利基工作负载的本地专家。