Hard Negatives, Hard Lessons:用 LLM 重标检索训练中的假负样本
Hard Negatives, Hard Lessons(Findings of EMNLP 2025)将 BGE 的 15 个检索训练数据集裁剪到 7 个,训练对数从约 160 万降到约 68 万。数据量缩小约 2.35 倍,E5 base 在 14 个 BEIR 数据集上的平均 nDCG@10 却提升了约 1 个点。
裁剪后的数据仍有标签问题。有些段落能回答查询,却被当成难负样本用于训练。论文提出的 RLHN(ReLabeling Hard Negatives)用两级 LLM 找出这些段落,将它们改标为正样本。相对保留原始标签的训练数据,重标让 E5 base 和 Qwen2.5 7B 在 BEIR 上分别提升约 0.7 和 1.4 个点。