RAG
中等
面试题库
RAG
简单
检索评估里 recall@k 的 k 该如何选?需要与最终送入 LLM 的 chunk 数一致吗?
RAG
中等
如何用同一条 query 同时评估召回、重排、生成三个环节?分层评估怎么设计?
RAG
中等
评估中“相关性”的判定粒度如何统一?人工标注与 LLM 判定的一致性怎么衡量?
RAG
中等
Ragas 的多语言评估怎么做?英文指标对中文场景是否适用?
RAG
困难
检索结果不相关但答案碰巧正确,评估指标会失真吗?如何发现这种情况?
RAG
简单
端到端评估与分阶段评估(检索、生成分开评)各有什么优缺点?
RAG
中等
冷启动阶段没有标注数据,如何先做一轮粗评估?
RAG
困难
评估忠实度时,基于 LLM 判定与基于 NLI 模型判定有何区别?各有什么局限?
RAG
中等
检索评估中的 nDCG@k 如何计算?与 MRR 相比优势在哪里?
RAG
困难
RAG 离线评估与在线评估(A/B、用户反馈)如何配合?各解决什么问题?
RAG
中等