生成式人工智能系统应用员一级高级技师 详细题库
下载APP练习系统优化 题目预览
-
第 1 题 单选题用于衡量生成文本与参考文本之间语义相似度而非字面匹配的评估指标是( )。
- A. BLEU
- B. ROUGE
- C. BERTScore
- D. 困惑度
解析:BERTScore基于BERT嵌入计算语义相似度,能捕获同义表达。BLEU和ROUGE基于n-gram匹配,困惑度衡量模型概率。 -
第 2 题 单选题在构建生成式AI系统评估指标体系时,若需将多个定量指标综合为单一分数,通常采用的方法是( )。
- A. 熵权法
- B. 线性加权法
- C. 主成分分析法
- D. 因子分析法
解析:线性加权法(加权求和)是最常用的综合方法,通过权重反映各指标重要性。熵权法用于确定权重,主成分分析和因子分析用于降维。 -
第 3 题 单选题在系统评估流程中,若比较两个模型在相同任务上的性能,且数据满足正态分布,应优先选用( )。
- A. 配对t检验
- B. 独立t检验
- C. 曼-惠特尼U检验
- D. 符号检验
解析:配对t检验适用于同一组样本的两次测量,适合比较两个模型在同一任务上的性能差异,且需满足正态分布假设。 -
第 4 题 单选题在评估指标体系设计中,用于衡量生成式AI系统对输入噪声的容忍度的指标是( )。
- A. 精确率
- B. 召回率
- C. F1分数
- D. 输入扰动下的输出差异度
解析:输入扰动下的输出差异度直接量化系统对噪声的敏感程度,反映鲁棒性。精确率、召回率、F1分数衡量分类性能。 -
第 5 题 判断题在生成式人工智能系统评估指标体系中,困惑度越低代表模型生成的文本在语义上越准确。
- A. 对
- B. 错
解析:困惑度衡量模型对测试文本的预测概率,越低表示模型越自信,但语义准确性需人工判断,两者并非完全一致。 -
第 6 题 判断题设计系统评估指标体系时,应优先选择可直接量化的客观指标,避免使用主观人工评估。
- A. 对
- B. 错
解析:生成式AI的很多关键属性(如质量、相关性)需要人工评估,客观指标无法完全替代主观判断,应结合使用。 -
第 7 题 多选题在生成式人工智能系统评估指标体系设计中,属于效率类评估指标的有( )。
- A. 推理时延
- B. 吞吐量
- C. 内存占用
- D. 模型参数量
- E. 训练能耗
解析:推理时延、吞吐量、内存占用、模型参数量、训练能耗均为衡量系统效率的指标,所有选项都正确。 -
第 8 题 多选题在系统评估流程中,为确保评估结果的有效性和可靠性,应遵循的规范设计原则包括( )。
- A. 评估数据集应具有代表性
- B. 评估过程应可重复
- C. 仅使用单一评估指标
- D. 报告评估结果的置信区间
- E. 公开评估脚本和参数
解析:A保证数据多样性,B确保可复现,D提供不确定性度量,E增强透明度和可复现性。C“仅使用单一指标”违背多维度评估原则,故不选。
余下详情题库请下载 APP 或扫码小程序查看全部题目与智能刷题。