01 KV Cache是什么?为什么能加速大模型推理?它的代价是什么?长序列推理时显存怎么估算?考察对KV Cache原理、加速机制、代价以及显存估算的理解,评估候选人能否准确区分Prefill和Decode阶段,并考虑GQA/MQA、PagedAttention等实际因素。 查看学习思路
02 Agent执行多步任务时,对话历史加工具返回结果很容易超限,你有什么处理方案?三种策略分别在什么场景下用?考察对Agent上下文治理的系统性理解,包括预算管理、近期窗口、结构化摘要、外部记忆检索和工具结果压缩,以及不同场景下的策略选择。 查看学习思路
03 一个Agent任务耗时很长,用户等不及了,怎样停止这个任务?这个机制你实际尝试过吗?考察对Agent取消机制的系统设计能力,包括可传播的协作式取消、资源级强制终止、状态一致性恢复和副作用治理。 查看学习思路