生成式人工智能系统应用员二级技师 详细题库
下载APP练习模型训练性能优化知识 题目预览
-
第 1 题 单选题在PyTorch的DataLoader中,为加快数据读取速度而启用多个子进程加载数据的参数是( )。
- A. num_workers
- B. prefetch_factor
- C. persistent_workers
- D. pin_memory
解析:num_workers控制DataLoader启动的子进程数,大于0时数据加载可并行进行;prefetch_factor控制每个worker预取批次数,persistent_workers控制worker复用,pin_memory控制锁页内存。 -
第 2 题 单选题在TensorFlow的tf.data管道中,用于让数据预处理操作与模型训练并行执行的方法是( )。
- A. dataset.cache()
- B. dataset.prefetch()
- C. dataset.shuffle()
- D. dataset.repeat()
解析:prefetch()使数据准备阶段与下游消费阶段重叠执行,从而减少训练等待数据的时间。 -
第 3 题 单选题在分布式训练中,为避免每个工作节点重复读取相同样本而降低整体吞吐,通常采用的数据预处理优化策略是( )。
- A. 数据缓存
- B. 数据混洗
- C. 数据分片
- D. 数据填充
解析:数据分片将数据集按worker切分为不同子集,使各个节点读取不同样本,减少重复加载和存储压力。 -
第 4 题 单选题在自然语言处理模型的训练中,对于长度差异较大的序列数据,为减少填充(padding)带来的无效计算,常用的数据加载与预处理效率优化手段是( )。
- A. 数据复制
- B. 数据混洗
- C. 数据缓存
- D. 动态分桶(bucketing)
解析:动态分桶将长度相近的样本放入同一批次,并针对每个桶设置较小填充长度,从而减少无效计算和显存浪费。 -
第 5 题 判断题在PyTorch DataLoader中,当使用GPU训练时,启用pin_memory=True通常可以提升主机到设备的数据拷贝效率,但会额外占用锁页内存。
- A. 对
- B. 错
解析:pin_memory=True会将数据放在锁页内存中,提高数据传输效率;锁页内存比普通可分页内存更受限制但传输更快。 -
第 6 题 判断题在数据加载与预处理效率优化中,增大DataLoader的num_workers数值一定会线性提升数据读取速度。
- A. 对
- B. 错
解析:num_workers过大会增加进程切换和内存开销,并可能因I/O瓶颈导致收益递减甚至性能下降,不能保证线性提升。 -
第 7 题 多选题在PyTorch DataLoader中,能够提升数据加载与预处理效率的措施是( )。
- A. 将num_workers设置为大于0
- B. 对数据集启用prefetch_factor
- C. 在训练循环中每个step手动调用torch.cuda.synchronize()
- D. 使用persistent_workers=True
- E. 将shuffle设置为True对每个epoch自动重排
解析:num_workers>0可实现多进程加载;prefetch_factor可增加每个worker的预取批次数;persistent_workers=True可复用worker进程,减少反复创建与销毁的开销。手动同步会阻塞训练,shuffle主要用于样本随机化而非提高加载效率。 -
第 8 题 多选题在TensorFlow的tf.data数据管道中,有助于提高数据加载与预处理环节效率的做法是( )。
- A. 使用prefetch(tf.data.AUTOTUNE)提前准备后续批次
- B. 使用map(num_parallel_calls=tf.data.AUTOTUNE)并行执行预处理函数
- C. 使用interleave(cycle_length=4)并发读取多个文件
- D. 将整个数据集先转换成列表再逐样本处理
- E. 使用cache()缓存重复使用的预处理结果
解析:prefetch实现训练与数据加载重叠;map并行化预处理;interleave可并发读取多个文件;cache可避免重复计算。D会破坏流水线并行性并增加内存开销,降低效率。
余下详情题库请下载 APP 或扫码小程序查看全部题目与智能刷题。