生成式人工智能系统应用员二级技师 详细题库

职业:生成式人工智能系统应用员 等级:二级/技师 章节:模型训练性能优化知识 题目总数:2276 题 单选题 1124 多选题 562 判断题 590
下载APP练习

模型训练性能优化知识 题目预览

  • 第 1 题 单选题
    在PyTorch的DataLoader中,为加快数据读取速度而启用多个子进程加载数据的参数是( )。
    • A. num_workers
    • B. prefetch_factor
    • C. persistent_workers
    • D. pin_memory
    解析:num_workers控制DataLoader启动的子进程数,大于0时数据加载可并行进行;prefetch_factor控制每个worker预取批次数,persistent_workers控制worker复用,pin_memory控制锁页内存。
  • 第 2 题 单选题
    在TensorFlow的tf.data管道中,用于让数据预处理操作与模型训练并行执行的方法是( )。
    • A. dataset.cache()
    • B. dataset.prefetch()
    • C. dataset.shuffle()
    • D. dataset.repeat()
    解析:prefetch()使数据准备阶段与下游消费阶段重叠执行,从而减少训练等待数据的时间。
  • 第 3 题 单选题
    在分布式训练中,为避免每个工作节点重复读取相同样本而降低整体吞吐,通常采用的数据预处理优化策略是( )。
    • A. 数据缓存
    • B. 数据混洗
    • C. 数据分片
    • D. 数据填充
    解析:数据分片将数据集按worker切分为不同子集,使各个节点读取不同样本,减少重复加载和存储压力。
  • 第 4 题 单选题
    在自然语言处理模型的训练中,对于长度差异较大的序列数据,为减少填充(padding)带来的无效计算,常用的数据加载与预处理效率优化手段是( )。
    • A. 数据复制
    • B. 数据混洗
    • C. 数据缓存
    • D. 动态分桶(bucketing)
    解析:动态分桶将长度相近的样本放入同一批次,并针对每个桶设置较小填充长度,从而减少无效计算和显存浪费。
  • 第 5 题 判断题
    在PyTorch DataLoader中,当使用GPU训练时,启用pin_memory=True通常可以提升主机到设备的数据拷贝效率,但会额外占用锁页内存。
    • A. 对
    • B. 错
    解析:pin_memory=True会将数据放在锁页内存中,提高数据传输效率;锁页内存比普通可分页内存更受限制但传输更快。
  • 第 6 题 判断题
    在数据加载与预处理效率优化中,增大DataLoader的num_workers数值一定会线性提升数据读取速度。
    • A. 对
    • B. 错
    解析:num_workers过大会增加进程切换和内存开销,并可能因I/O瓶颈导致收益递减甚至性能下降,不能保证线性提升。
  • 第 7 题 多选题
    在PyTorch DataLoader中,能够提升数据加载与预处理效率的措施是( )。
    • A. 将num_workers设置为大于0
    • B. 对数据集启用prefetch_factor
    • C. 在训练循环中每个step手动调用torch.cuda.synchronize()
    • D. 使用persistent_workers=True
    • E. 将shuffle设置为True对每个epoch自动重排
    解析:num_workers>0可实现多进程加载;prefetch_factor可增加每个worker的预取批次数;persistent_workers=True可复用worker进程,减少反复创建与销毁的开销。手动同步会阻塞训练,shuffle主要用于样本随机化而非提高加载效率。
  • 第 8 题 多选题
    在TensorFlow的tf.data数据管道中,有助于提高数据加载与预处理环节效率的做法是( )。
    • A. 使用prefetch(tf.data.AUTOTUNE)提前准备后续批次
    • B. 使用map(num_parallel_calls=tf.data.AUTOTUNE)并行执行预处理函数
    • C. 使用interleave(cycle_length=4)并发读取多个文件
    • D. 将整个数据集先转换成列表再逐样本处理
    • E. 使用cache()缓存重复使用的预处理结果
    解析:prefetch实现训练与数据加载重叠;map并行化预处理;interleave可并发读取多个文件;cache可避免重复计算。D会破坏流水线并行性并增加内存开销,降低效率。
余下详情题库请下载 APP 或扫码小程序查看全部题目与智能刷题。