生成式人工智能系统应用员二级技师 详细题库

职业:生成式人工智能系统应用员 等级:二级/技师 章节:高性能推理框架与引擎知识 题目总数:2276 题 单选题 1124 多选题 562 判断题 590
下载APP练习

高性能推理框架与引擎知识 题目预览

  • 第 1 题 单选题
    在主流推理框架中,采用分页注意力机制将键值缓存分割为固定大小的块,并允许非连续存储,从而提升长序列推理吞吐量的引擎是( )。
    • A. vLLM
    • B. llama.cpp
    • C. ONNX Runtime
    • D. TensorRT-LLM
    解析:分页注意力机制是vLLM的核心特性,它将键值缓存划分为页/块进行管理,降低显存碎片并提高缓存利用率。
  • 第 2 题 单选题
    面向英伟达GPU深度优化,将大语言模型转换为TensorRT引擎,并通过引擎复用、动态形状和多卡张量并行实现高效推理的引擎是( )。
    • A. DeepSpeed Inference
    • B. TensorRT-LLM
    • C. llama.cpp
    • D. MLC LLM
    解析:TensorRT-LLM是英伟达推出的推理引擎,基于TensorRT进行图优化与内核选择,支持引擎缓存和动态形状,并可通过张量并行使用多张GPU。
  • 第 3 题 单选题
    以C++实现、轻量可嵌入,支持GGUF低比特量化,可在CPU、边缘设备和移动端运行大语言模型的推理框架是( )。
    • A. vLLM
    • B. TensorRT-LLM
    • C. llama.cpp
    • D. ONNX Runtime
    解析:llama.cpp使用C++编写,面向本地与边缘部署,支持GGUF格式的多级量化,并能在CPU、GPU及移动端等环境中运行。
  • 第 4 题 单选题
    在分布式推理中,利用ZeRO策略对模型参数进行分片,并通过自动张量并行和内存优化突破单卡显存限制,从而支持超大规模模型推理的框架是( )。
    • A. ONNX Runtime
    • B. llama.cpp
    • C. MLC LLM
    • D. DeepSpeed Inference
    解析:DeepSpeed Inference提供ZeRO-Inference、自动张量并行等能力,可将大模型权重分散到多个GPU上,降低单卡显存压力。
  • 第 5 题 判断题
    vLLM的分页注意力机制通过将键值缓存分块管理,有效减少了显存碎片并提高了缓存利用率。
    • A. 对
    • B. 错
    解析:分页注意力机制是vLLM的核心创新,以固定大小的块管理键值缓存,减少碎片化和冗余复制,提高显存利用率。
  • 第 6 题 判断题
    llama.cpp只能使用CPU进行推理,不能利用GPU加速大语言模型计算。
    • A. 对
    • B. 错
    解析:llama.cpp虽然以CPU和移动端部署见长,但已支持CUDA、Metal、Vulkan等GPU后端,可在支持环境中使用GPU加速。
  • 第 7 题 多选题
    下列推理框架或引擎中,能够同时覆盖CPU、GPU和移动端/边缘设备进行生成式模型推理的有( )。
    • A. ONNX Runtime
    • B. MLC LLM
    • C. TensorRT-LLM
    • D. llama.cpp
    • E. vLLM
    解析:ONNX Runtime可通过执行提供程序支持CPU、GPU、移动端等多种硬件;MLC LLM基于编译技术生成适配目标设备的内核;llama.cpp跨平台且支持CPU/GPU/边缘设备。TensorRT-LLM仅限英伟达GPU,vLLM主要用于服务器端GPU部署。
  • 第 8 题 多选题
    关于vLLM与TensorRT-LLM的特点,下列表述正确的有( )。
    • A. vLLM通过分页注意力机制管理键值缓存,TensorRT-LLM也包含键值缓存管理机制。
    • B. TensorRT-LLM依赖TensorRT编译优化,vLLM更注重调度层与运行时优化。
    • C. 两者均支持连续批处理以提升在线推理吞吐量。
    • D. TensorRT-LLM可以脱离英伟达GPU在纯CPU环境中运行。
    • E. vLLM只能使用HuggingFace模型,无法加载TensorRT引擎。
    解析:vLLM的分页注意力机制和TensorRT-LLM的键值缓存管理器都用于优化缓存,两者均支持连续批处理;TensorRT-LLM必须运行在英伟达GPU上,vLLM也能使用本地或自定义的PyTorch模型,并非只能使用HuggingFace模型。
余下详情题库请下载 APP 或扫码小程序查看全部题目与智能刷题。