实验室动态

[ACL 2025] QAEval: Mixture of Evaluators for Question-Answering Task Evaluation

岳潭的关于基于混合专家结构的问答任务评估模型的论文《QAEval: Mixture of Evaluators for Question-Answering Task Evaluation》被ACL 2025接收。

问答(QA)任务是评估生成式系统能力的重要基准,但传统基于规则的指标难以有效处理开放式、非结构化回答,常出现评价片面或不稳定的问题;而基于大模型的评估方法虽然更灵活,但容易受到指令表述影响,鲁棒性不足,且计算成本高。为解决这些痛点,我们提出了 QAEval,一个结合规则可信度与大模型灵活性的混合式问答评估框架。QAEval 依托两个高质量数据集构建:用于短答案抽取的 QAExtract,以及用于评分模型训练的 QAScore;并通过引入混合评估器(Mixture of Evaluators)结构与动态负载均衡优化,实现对不同类型问题的稳定、精准、低成本评分。实验结果表明,在仅 0.6B 参数规模下,QAEval 即可达到 92.3% 的高准确率,整体表现优于 GPT-4o 和 Claude-3 等强基线模型,为高效、可靠的问答评估提供了一种通用解决方案。

image.png

QAEval评估方法(C)与基于规则方法(A)和基于大语言模型方法(B)

image.png

QAEval模型整体结构图