生成式人工智能系统应用员二级技师 详细题库
下载APP练习高性能推理框架与引擎知识 题目预览
-
第 1 题 单选题在主流推理框架中,采用分页注意力机制将键值缓存分割为固定大小的块,并允许非连续存储,从而提升长序列推理吞吐量的引擎是( )。
- A. vLLM
- B. llama.cpp
- C. ONNX Runtime
- D. TensorRT-LLM
解析:分页注意力机制是vLLM的核心特性,它将键值缓存划分为页/块进行管理,降低显存碎片并提高缓存利用率。 -
第 2 题 单选题面向英伟达GPU深度优化,将大语言模型转换为TensorRT引擎,并通过引擎复用、动态形状和多卡张量并行实现高效推理的引擎是( )。
- A. DeepSpeed Inference
- B. TensorRT-LLM
- C. llama.cpp
- D. MLC LLM
解析:TensorRT-LLM是英伟达推出的推理引擎,基于TensorRT进行图优化与内核选择,支持引擎缓存和动态形状,并可通过张量并行使用多张GPU。 -
第 3 题 单选题以C++实现、轻量可嵌入,支持GGUF低比特量化,可在CPU、边缘设备和移动端运行大语言模型的推理框架是( )。
- A. vLLM
- B. TensorRT-LLM
- C. llama.cpp
- D. ONNX Runtime
解析:llama.cpp使用C++编写,面向本地与边缘部署,支持GGUF格式的多级量化,并能在CPU、GPU及移动端等环境中运行。 -
第 4 题 单选题在分布式推理中,利用ZeRO策略对模型参数进行分片,并通过自动张量并行和内存优化突破单卡显存限制,从而支持超大规模模型推理的框架是( )。
- A. ONNX Runtime
- B. llama.cpp
- C. MLC LLM
- D. DeepSpeed Inference
解析:DeepSpeed Inference提供ZeRO-Inference、自动张量并行等能力,可将大模型权重分散到多个GPU上,降低单卡显存压力。 -
第 5 题 判断题vLLM的分页注意力机制通过将键值缓存分块管理,有效减少了显存碎片并提高了缓存利用率。
- A. 对
- B. 错
解析:分页注意力机制是vLLM的核心创新,以固定大小的块管理键值缓存,减少碎片化和冗余复制,提高显存利用率。 -
第 6 题 判断题llama.cpp只能使用CPU进行推理,不能利用GPU加速大语言模型计算。
- A. 对
- B. 错
解析:llama.cpp虽然以CPU和移动端部署见长,但已支持CUDA、Metal、Vulkan等GPU后端,可在支持环境中使用GPU加速。 -
第 7 题 多选题下列推理框架或引擎中,能够同时覆盖CPU、GPU和移动端/边缘设备进行生成式模型推理的有( )。
- A. ONNX Runtime
- B. MLC LLM
- C. TensorRT-LLM
- D. llama.cpp
- E. vLLM
解析:ONNX Runtime可通过执行提供程序支持CPU、GPU、移动端等多种硬件;MLC LLM基于编译技术生成适配目标设备的内核;llama.cpp跨平台且支持CPU/GPU/边缘设备。TensorRT-LLM仅限英伟达GPU,vLLM主要用于服务器端GPU部署。 -
第 8 题 多选题关于vLLM与TensorRT-LLM的特点,下列表述正确的有( )。
- A. vLLM通过分页注意力机制管理键值缓存,TensorRT-LLM也包含键值缓存管理机制。
- B. TensorRT-LLM依赖TensorRT编译优化,vLLM更注重调度层与运行时优化。
- C. 两者均支持连续批处理以提升在线推理吞吐量。
- D. TensorRT-LLM可以脱离英伟达GPU在纯CPU环境中运行。
- E. vLLM只能使用HuggingFace模型,无法加载TensorRT引擎。
解析:vLLM的分页注意力机制和TensorRT-LLM的键值缓存管理器都用于优化缓存,两者均支持连续批处理;TensorRT-LLM必须运行在英伟达GPU上,vLLM也能使用本地或自定义的PyTorch模型,并非只能使用HuggingFace模型。
余下详情题库请下载 APP 或扫码小程序查看全部题目与智能刷题。