Function Call
简单
面试题库
Function Call
中等
如何设计工具调用的 A/B 测试?改 prompt 或工具描述后如何量化效果差异?
Function Call
中等
评估"工具调用 + RAG"组合任务时,检索质量和工具调用质量如何归因(哪一步错了)?
Function Call
困难
上线后如何对工具调用做线上监控与回归?哪些埋点和指标能发现工具调用质量下降?
Function Call
中等
如何评估工具调用在流式与首字延迟下的体验?性能类指标和正确性指标如何分开?
Function Call
困难
如何给工具调用评测做自动化打分?用 LLM 当裁判(LLM-as-judge)评估工具选择有哪些坑?
Function Call
简单
工具调用的评估为什么不能只看最终答案对不对?需要关注哪些过程信号?
Function Call
简单
评估时如何判断模型"该调工具却没调"和"不该调工具却调了"?分别对应什么指标?
Function Call
困难
如何做工具调用的"沙箱评估"?在真实环境评估写操作工具的风险是什么?
Function Call
中等
多步工具调用任务(需连续调用多个工具)如何评估?如何衡量中间步骤是否合理?
Function Call
中等
工具调用的"端到端成功率"和"单次调用准确率"有何区别?为什么只看单次不够?
Function Call
中等