当前位置:首页>java>动态RAG新工作:效果爆了,代码已开源

动态RAG新工作:效果爆了,代码已开源

  • 2026-08-24 09:14:01
动态RAG新工作:效果爆了,代码已开源

嗨,我是PaperAGI,主要关注LLM、RAG、Agent等AI前沿技术,每天分享业界最新成果和实战案例。

随着大语言模型(LLM)能力的提升,幻觉问题(hallucination)愈发突出:模型会生成看似合理实则错误的内容,而且往往自信满满。现有动态检索增强生成(Dynamic RAG)方法试图通过模型内部信号(如概率、熵、注意力)判断“何时检索”,但这些信号本身就不靠谱——大模型天生校准不良,常常对错误输出赋予高置信度。

核心痛点

  • 模型内部不确定性信号不可靠,导致“自信幻觉”;
  • 静态RAG策略无法应对多跳问答中动态涌现的信息需求
  • 现有方法对长尾知识实体间关系缺乏有效验证手段。

QuCo-RAG:用“客观证据”替代“主观自信”

QuCo-RAG(Quantifying uncertainty via pre-training Corpus for Dynamic RAG)提出从预训练语料库中挖掘统计证据,用客观频率替代主观置信度,实现毫秒级幻觉检测与动态检索触发。

核心思想:两个“零”触发检索

阶段
检测目标
触发条件
技术实现
生成前
输入问题中的实体是否“冷门”
实体在预训练语料中平均频率低于阈值(默认<1k)
用Infini-gram查实体频率
生成中
模型生成的“实体关系”是否靠谱
实体对在语料中从未共现
(co-occurrence=0)
用Infini-gram查共现窗口

一句话总结:冷门实体提前防,零共现实时拦

系统流程

  1. 预生成知识评估抽取问题实体 → 查频率 → 低频触发检索,提前把相关文档塞进上下文。

  2. 运行时声明验证每生成一句,抽三元组(head, relation, tail) → 查head&tail在语料是否共现 → 零共现=幻觉风险 → 触发检索并重写句子。

  3. 毫秒级查询引擎借助Infini-gram后缀数组索引,在4万亿token规模上实现毫秒级n-gram/共现查询,开销可忽略。

实验结果:碾压SOTA,还能跨模型迁移

主实验:多跳问答全面领先

模型
数据集
最佳基线EM
QuCo-RAG EM
绝对提升
OLMo-2-7B
2WikiMultiHopQA
25.3
32.7+7.4
OLMo-2-13B
2WikiMultiHopQA
29.7
41.7+12.0
OLMo-2-32B
HotpotQA
30.8
41.6+10.8

结论:在所有规模、两个数据集上,QuCo-RAG稳定领先5~12个百分点,而依赖内部信号的方法(DRAGIN/ETC/SeaKR)波动剧烈,常被简单基线反杀。

跨模型迁移:用公开语料“猜”私有模型知识

目标模型
数据集
最佳基线EM
QuCo-RAG EM
提升
Qwen2.5-32B
2Wiki
35.9
50.0+14.1
Llama-3-8B
2Wiki
33.5
38.4+4.9
GPT-4.1
2Wiki
60.0
64.6+4.6
GPT-5-chat
HotpotQA
42.9
48.4+5.5

洞察:Web-scale预训练语料高度重叠,用OLMo-2的4T语料做“代理”,就能给闭源模型提供有效统计信号,无需知晓其真实训练数据

效率权衡:更高精度+更低开销

在HotpotQA(OLMo-2-13B)上:

  • EM最高(35.0);
  • 平均token消耗仅87(远低于FS-RAG的464);
  • 平均检索1.7次(FS-RAG 6.5次,SeaKR 10.3次);

深度分析:为什么QuCo-RAG更靠谱?

维度
发现
消融实验
去掉“运行时验证”掉5.1 EM,去掉“预生成检查”掉2.5 EM,两者互补
领域泛化
PubMedQA生物医学问答上,QuCo-RAG66.4% Acc +11.2 超越最佳基线,而内部信号方法要么过度检索(FLARE 2.8次),要么直接摆烂(DRAGIN≈无检索)。
实体频率分层
低频实体(<50次)问题上,QuCo-RAG领先Wo-RAG 10~17 EM;内部信号方法与Wo-RAG几乎持平——它们根本意识不到自己不知道

案例直击:DRAGIN自信幻觉,QuCo-RAG两步纠错

问题Who is the mother of the director of film Polish-Russian War?标准答案:Małgorzata Braunek

方法
生成过程
结果
原因
DRAGIN
“…directed by Igor Maslennikov. His mother is Natalia Maslennikova.”
❌ 全错
内部信号把假导演标为低不确定性,自信幻觉;检索查询还带错名字,越检越错
QuCo-RAG
①预检发现“Polish-Russian War”冷门→先检索→生成正确导演“Xawery Żuławski
②运行时查出“Xawery Żuławski + mother”零共现→再检索→得到正确母亲“Małgorzata Braunek”。
✅ 全对
客观语料证据
两次纠错,不依赖模型自我感觉

局限与未来

局限
当前缓解
未来方向
同义词/别名
可能造成零共现误触发
保守策略:宁可多检一次,也不错放幻觉
引入实体链接规范名称
静态语料
无法覆盖2025新事实
定期重建Infini-gram索引
带时间戳的动态语料
增量索引

QuCo-RAG用最朴素的统计量——实体频率共现计数——就把动态RAG的不确定性估计做成了可解释、可迁移、可落地的“客观证据链”。它告诉我们:

别再迷信模型内部的“自信”了,去翻翻它小时候读过的书,用真实语料告诉它:什么时候该查资料,什么时候在胡说。

对于工业落地,QuCo-RAG不挑模型不挑领域不挑检索器,只需一次构建4T索引,就能给开源闭源通用专业模型统一装上“幻觉雷达”,真正的即插即用

传送门

QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generationhttps://arxiv.org/pdf/2512.19134 https://github.com/ZhishanQ/QuCo-RAG
每天一篇大模型Paper来锻炼我们的思维~已经读到这了,别忘了点赞、关注噢
推荐阅读
告别 RAG 检索冲突:推理轨迹增强框架让答案更准、更稳
Static-DRA:教你“穷”玩Deep Research
复杂工业文档RAG也行了:本体+图谱来搞定
突破瓶颈,从图谱(KG)到高质量问答RAG

最新文章

随机文章