01 在TP并行结合CUDA Graph的场景下,如何排查稳定性与超时问题?考察候选人对TP并行与CUDA Graph结合时可能出现的稳定性、超时问题的排查思路,包括问题定位、最小复现、根因分析等。 查看学习思路
03 固定Persistent Kernel在小M维度shape下算力浪费的核心原因是什么?如何自适应选择计算路径?考察候选人对Persistent Kernel在动态shape下性能问题的理解,以及自适应计算路径和降级策略的设计能力。 查看学习思路
04 Decode阶段CPU/GPU同步阻塞问题如何优化?如何将轻量化计算托管到GPU以提升吞吐?考察候选人对Decode阶段性能瓶颈的分析和优化能力,特别是CPU/GPU同步阻塞的解决和计算托管策略。 查看学习思路
05 NCCL中Ring AllReduce与Tree AllReduce的工作原理及适用场景?考察候选人对NCCL通信拓扑的理解,包括Ring和Tree AllReduce的原理及在高吞吐、低延迟场景下的选择。 查看学习思路
06 请说明你在多轮对话RL中如何设置双层奖励,以及如何构造用户模拟器来避免模拟器数据过拟合?考察候选人对多轮对话RL中奖励分层设计、用户模拟器构建及过拟合防控的系统性理解,评估其能否将训练目标与真实业务分布对齐。 查看学习思路
10 请说明选择OPD的动机以及数据筛选时的策略,为什么不使用学生错误的轨迹?考察候选人对On-Policy Distillation动机、数据筛选策略以及错误轨迹处理的理解,评估其能否平衡纠错能力与训练噪声。 查看学习思路