面试题库

全部 Django Elasticsearch FastAPI Flask Function Call JVM Java IO Java 后端 Java 基础 Java 并发 Java 新特性 Java 集合 JavaWeb Kafka LLM LangChain LangGraph MongoDB MyBatis MySQL Netty Nginx Python RAG RabbitMQ Redis RocketMQ Spring Spring AI SpringBoot SpringCloud SpringMVC ZooKeeper 分布式 后端技术 大厂面经 大数据 微服务 提示词工程 操作系统 数据库 数据结构 智能体 海康威视2026秋季社招专项 消息队列 监控运维 算法 系统设计 缓存 计算机基础 计算机网络 设计模式 面试题 高可用 高并发
RAG 中等

RAG 答非所问的常见原因有哪些?如何系统定位是检索还是生成环节的问题?

RAG 简单

检索评估里 recall@k 的 k 该如何选?需要与最终送入 LLM 的 chunk 数一致吗?

RAG 中等

如何用同一条 query 同时评估召回、重排、生成三个环节?分层评估怎么设计?

RAG 中等

评估中“相关性”的判定粒度如何统一?人工标注与 LLM 判定的一致性怎么衡量?

RAG 中等

Ragas 的多语言评估怎么做?英文指标对中文场景是否适用?

RAG 困难

检索结果不相关但答案碰巧正确,评估指标会失真吗?如何发现这种情况?

RAG 简单

端到端评估与分阶段评估(检索、生成分开评)各有什么优缺点?

RAG 中等

冷启动阶段没有标注数据,如何先做一轮粗评估?

RAG 困难

评估忠实度时,基于 LLM 判定与基于 NLI 模型判定有何区别?各有什么局限?

RAG 中等

检索评估中的 nDCG@k 如何计算?与 MRR 相比优势在哪里?

RAG 困难

RAG 离线评估与在线评估(A/B、用户反馈)如何配合?各解决什么问题?

RAG 中等

Faithfulness 与 Answer Relevancy 有何区别?Ragas 里各自用什么思路判定?