LLM
中等
面试题库
LLM
简单
logits经过softmax后如何被采样成一个token?温度与随机采样的关系是什么?
LLM
简单
temperature、top-p与top-k三个采样参数是如何共同作用的?调参时如何搭配?
LLM
中等
首token延迟(TTFT)与每token延迟(TPOT)分别受哪些因素影响?如何针对性优化?
LLM
中等
数据并行、模型并行与流水线并行有什么区别?各自适合什么规模与场景?
LLM
困难
ZeRO的三个阶段(Stage1/2/3)分别切分了什么?它们如何逐步降低显存?
LLM
困难
混合精度训练中fp16与bf16有何区别?为什么大模型训练倾向bf16?loss scaling解决什么?
LLM
中等
什么是梯度检查点(gradient checkpointing)?它如何用计算换显存?
LLM
中等
大模型预训练的loss是如何计算的?因果语言建模的交叉熵如何逐token累加?
LLM
简单
RAG中chunk大小与embedding维度如何权衡?chunk太大或太小分别丢失什么?
LLM
中等
LoRA的低秩分解为什么能大幅减少可训练参数?其数学原理是什么?
LLM
中等