面试题库

全部 Django Elasticsearch FastAPI Flask Function Call JVM Java IO Java 后端 Java 基础 Java 并发 Java 新特性 Java 集合 JavaWeb Kafka LLM LangChain LangGraph MongoDB MyBatis MySQL Netty Nginx Python RAG RabbitMQ Redis RocketMQ Spring Spring AI SpringBoot SpringCloud SpringMVC ZooKeeper 分布式 后端技术 大厂面经 大数据 微服务 提示词工程 操作系统 数据库 数据结构 智能体 海康威视2026秋季社招专项 消息队列 监控运维 算法 系统设计 缓存 计算机基础 计算机网络 设计模式 面试题 高可用 高并发
Function Call 简单

工具调用链路里,延迟主要花在哪几段?如何定位是模型慢还是工具慢?

Function Call 中等

如何设计工具调用的 A/B 测试?改 prompt 或工具描述后如何量化效果差异?

Function Call 中等

评估"工具调用 + RAG"组合任务时,检索质量和工具调用质量如何归因(哪一步错了)?

Function Call 困难

上线后如何对工具调用做线上监控与回归?哪些埋点和指标能发现工具调用质量下降?

Function Call 中等

如何评估工具调用在流式与首字延迟下的体验?性能类指标和正确性指标如何分开?

Function Call 困难

如何给工具调用评测做自动化打分?用 LLM 当裁判(LLM-as-judge)评估工具选择有哪些坑?

Function Call 简单

工具调用的评估为什么不能只看最终答案对不对?需要关注哪些过程信号?

Function Call 简单

评估时如何判断模型"该调工具却没调"和"不该调工具却调了"?分别对应什么指标?

Function Call 困难

如何做工具调用的"沙箱评估"?在真实环境评估写操作工具的风险是什么?

Function Call 中等

多步工具调用任务(需连续调用多个工具)如何评估?如何衡量中间步骤是否合理?

Function Call 中等

工具调用的"端到端成功率"和"单次调用准确率"有何区别?为什么只看单次不够?

Function Call 中等

如何评估工具调用中的"参数幻觉"?如何自动化判断模型生成了不存在的参数值?