LLM
中等
面试题库
LLM
中等
什么是可验证奖励(RLVR)?它相比基于偏好的RLHF有什么优势?
LLM
简单
用LLM做文本分类相比专用分类模型有什么优劣?哪些场景仍应选专用模型?
LLM
中等
多智能体(multi-agent)协作有哪些常见编排方式?各自的适用场景是什么?
LLM
中等
ReAct范式的“思考-行动-观察”循环是如何让模型调用工具完成任务的?
LLM
中等
CoT的自我一致性(self-consistency)如何通过多次采样投票提升准确率?
LLM
中等
多轮对话中如何避免历史上下文对当前任务造成“污染”?有哪些上下文管理手段?
LLM
中等
few-shot评测时为什么会出现“示例泄漏”?它对评测结果会造成什么偏差?
LLM
简单
学习率调度中的warmup与cosine decay分别解决什么问题?为什么大模型训练需要它们?
LLM
简单
什么是梯度累积(gradient accumulation)?为什么大模型训练需要它?
LLM
中等
temperature设置过高或上下文被截断时,为什么模型回答会前后不一致?
LLM
简单