LLM
困难
面试题库
LLM
困难
DPO(Direct Preference Optimization)如何绕过奖励模型直接优化策略?
LLM
中等
RLHF的三个阶段(SFT、奖励模型、PPO)分别解决什么问题?PPO为何不稳定?
LLM
困难
什么是越狱攻击中的对抗性后缀(adversarial suffix)?GCG这类方法如何自动化构造?
LLM
中等
直接提示注入与间接提示注入有何区别?间接注入如何借助检索文档或网页发动?
LLM
中等
MoE推理时是否必须把所有专家都加载到显存?专家offload到CPU/磁盘如何权衡?
LLM
中等
稀疏MoE的激活参数(active params)与总参数、FLOPs之间是什么关系?如何计算?
LLM
中等
DeepSeek-MoE的细粒度专家与共享专家设计分别解决什么问题?
LLM
中等
专家并行(expert parallelism)与张量并行有何区别?MoE模型通常如何组合这些并行策略?
LLM
中等
什么是MoE训练中的专家坍缩(representation collapse)?如何检测与缓解?
LLM
中等
专家数量与top-k如何影响MoE模型的推理显存与延迟?为什么MoE推理常被说是memory-bound?
LLM
困难