智算服务器软件安装部署前测试
本测试用于考核智算服务器软件安装部署相关知识,请独立完成作答,考试时间90分钟,满分100分。
1. 您的姓名:
一、单选题(每题5分,共75分)
2. 在昇腾软件栈中,驱动(Driver)与固件(Firmware)常被合称“驱动固件”。关于二者的运行位置与职责,下列说法正确的是?
驱动运行在昇腾AI处理器内部,固件运行在Host侧操作系统内核中
驱动运行在Host侧操作系统内核中,固件加载到昇腾AI处理器内部执行
驱动与固件都运行在Host侧,二者只是版本命名不同
驱动与固件都加载到昇腾AI处理器内部,由芯片自行管理
3. CANN的五层架构中,负责把上层框架输入的计算图编译成昇腾硬件可执行模型的层次是?
昇腾计算语言层(AscendCL)
昇腾计算服务层(Service Layer)
昇腾计算编译层(Compilation Layer)
昇腾计算执行层(Execution Layer)
4. 关于AscendCL与GE(图引擎)的关系,下列描述准确的是?
AscendCL直接执行硬件指令,GE只负责日志收集
GE把框架的动态图收拢成静态图再做优化与调度,AscendCL是面向开发者的统一编程接口
GE与AscendCL是竞争关系,开发者二选一即可
AscendCL只用于训练,GE只用于推理
5. 在算子体系中,遇到性能不达标时,官方推荐的递进顺序是?
先自定义算子开发,再上AOE调优,最后用现成算子
先用现成算子跑通,再用AOE调优,仍不满足才考虑自定义算子开发
直接重写TBE编译逻辑
先升级固件再调优
6. 关于DVPP与AIPP的分工,下列说法正确的是?
DVPP负责数值归一化与通道转换,AIPP负责图像视频解码
DVPP处理图像视频本身的预处理,AIPP处理喂给模型之前的数值转换,二者可串联
二者功能完全相同,只是所在层次不同
AIPP不依赖模型,可独立在CPU上完成
7. 昇腾体系对版本极其敏感。当一套已装好的环境出现异常时,第一反应应当是?
立即重装CANN以排除未知错误
先核对驱动、固件、CANN等组件的版本配套是否对齐
直接升级驱动固件到最新版
重装操作系统
8. torch_npu在软件栈中的定位是?
一个独立的深度学习框架,可替代PyTorch
夹在PyTorch与CANN之间的一层薄适配,向PyTorch注册NPU后端
昇腾的驱动程序
模型转换工具
9. 关于torch_npu的版本约束,下列说法正确的是?
它是独立的Python包,可以像普通库一样随时装最新版
它向上要匹配PyTorch编译基线,向下要匹配CANN运行时接口,不能随便装最新版
它只依赖PyTorch,与CANN无关
它只依赖CANN,与PyTorch版本无关
10. 将GPU代码迁移到NPU时,关于设备调用的改动,下列说法正确的是?
只需把device字符串从cuda改成npu即可,其余无需改动
判断接口、设备名、搬运方法三组要一起换,只换一半会在运行时报设备类型不匹配
多卡封装无需改动,DataParallel在NPU上同样适用
第三方库里的设备名会自动被框架重定向,无需关注
11. 关于MindIE与torch_npu的关系,下列说法正确的是?
装完torch_npu模型就能对外提供高并发推理服务,无需MindIE
torch_npu让模型能在NPU上算出结果,MindIE负责请求排队、组批、KV Cache管理与服务暴露
MindIE是训练框架,torch_npu是推理框架
二者功能完全重叠,安装其一即可
12. 大模型推理中Prefill与Decode两个阶段性质不同。PD分离部署的核心出发点是?
Prefill与Decode抢同一块资源导致互相干扰,PD分离把两阶段拆开各自成组
拆分后模型精度会更高
拆分能减少模型参数量
PD分离只是为了便于计费
13. MindIE的配置文件config.json在服务进程中的生效方式是?
修改后由监控自动热加载,无需重启
服务进程启动时一次性读进内存,改了配置不重启永远不生效
每处理一个请求读取一次
仅在模型加载时读取一次,之后不变
14. 分布式训练中,RANK_ID与RANK_SIZE的区别是?
二者含义相同,只是不同框架的命名差异
RANK_SIZE是参与训练的进程总数,RANK_ID是当前进程在集群中的全局序号
RANK_ID是进程总数,RANK_SIZE是当前序号
二者都由用户手动强制设置,启动器不会注入
15. 关于npu-smi与ascend-dmi的分工,下列说法正确的是?
npu-smi随驱动就有,看设备实时状态;ascend-dmi来自工具包,面向兼容性检测、算力带宽测试与验收留证
ascend-dmi随驱动就有,npu-smi需额外安装
二者功能完全相同
ascend-dmi只能看实时占用,不能落盘
16. 监控体系中,Grafana这一层的定位是?
负责采集指标并存储时序数据
把时序库里的数据取出来画给人看,不存数据也不生产数据
负责发送告警通知
直接在设备上执行诊断命令
二、多选题(每题2分,共20分)
17. 关于昇腾驱动与固件的版本特征,下列说法正确的有?
二者运行位置不同,但必须版本匹配才能正常工作
升级固件通常需要root权限且必须重启节点才生效
驱动与CANN之间存在明确的版本配套关系
固件不匹配多表现为设备直接不可见或健康状态异常
18. CANN五层架构中,下列说法正确的是?
昇腾计算语言层(AscendCL)提供设备管理、内存管理、模型加载与执行等API
昇腾计算服务层提供算子加速库AOL与调优引擎AOE
昇腾计算执行层包含Runtime、DVPP、AIPP与集合通信库HCCL
昇腾计算基础层提供SVM、VM与HDC
19. 关于torch_npu的安装与验证,下列说法正确的有?
安装前置需确认设备可见、CANN版本明确、Python版本匹配、CPU架构匹配
装PyTorch时应装带CUDA的版本以获得更好性能
安装后验证四步包括:NPU是否可用、能看到几张卡、设备叫什么、是否算得动
环境变量只在当前会话生效,新开终端会失效
20. 关于MindIE的部署形态,下列说法正确的有?
单卡部署时worldSize=1,权重与KV Cache必须同在一张卡上,只适合小模型与试验
多卡张量并行把大矩阵按列或行切分到多卡,每步需汇总中间结果,跨卡通信走HCCL
PD分离把Prefill与Decode拆到不同实例,P实例只做Prefill、D实例只做Decode
规模小、并发低时PD分离反而因多一层调度与KV传输增加时延与运维成本,不值得
21. 关于MindIE配置参数,下列说法正确的有?
ipAddress、port、managementPort、metricsPort分属ServerConfig,业务、管理、监控端口各自独立便于安全控制
modelName必须与请求体里的模型标识逐字相同,否则路由失败
worldSize须与npuDeviceIds内层数组长度一致
truncation开启时超长输入会由服务端静默截断,不报错但可能丢内容
22. 关于MindSpore训练路径,下列说法正确的有?
选择在昇腾上以MindSpore为主线,因其与CANN协同最深、训推一体资产可复用
安装方式含pip、源码编译、容器镜像,分别权衡速度、可控性、环境一致性
mindspore.run_check()可把框架、CANN、设备三条链路一起走一遍做端到端自检
分布式启动一律推荐msrun,rank_table_file自MindSpore 2.4起已不推荐/将废弃
23. 关于分布式训练环境变量,下列说法正确的有?
RANK_SIZE等于参与训练的进程总数,所有进程必须一致
MASTER_ADDR与MASTER_PORT多机场景必设,单机可省略
ASCEND_RT_VISIBLE_DEVICES在驱动层做设备隔离,会重新编排卡号
msrun、mpirun等启动器会自动注入绝大部分身份与组网变量
24. 监控体系通常由哪几段组成,各自职责正确的是?
采集:从设备与主机拿到原始指标
存储与判定:保存时序数据并做阈值判定
可视化:用看板把数据画给人看
通知:把告警送达责任人
25. 关于设备健康状态五态,下列说法正确的有?
OK表示各项自检通过,常规巡检记录即可
Alarm表示异常已影响性能或可靠性,应安排维护窗口排查
Critical表示设备已不可用或即将失效,应立即隔离该卡并报修
健康状态OK就代表业务一定没问题
26. 关于交付验收的判定,下列说法正确的有?
验收应分层验证:先验硬件和链路,再验软件和配置,顺序不能颠倒
算力基准测的是设备本身行不行,不应把它当成业务吞吐的承诺写进合同
判定结果可分为通过、有条件通过、不通过,遗留项必须写清责任方与时限
压力测试结论应写“在并发多少时,吞吐为多少、P99时延为多少”,而非只报吞吐
三、判断题(每题1分,共5分)
27. 固件加载到昇腾AI处理器内部执行,驱动运行在Host侧操作系统内核中,二者必须版本匹配才能正常工作。
对
错
28. torch_npu安装时,应优先选择带CUDA的PyTorch版本,以充分发挥NPU的计算能力。
对
错
29. MindIE的配置文件config.json支持运行时热加载,修改参数后无需重启服务即可生效。
对
错
30. 监控体系中Grafana负责采集并存储指标时序数据,是监控体系的数据底座。
对
错
31. 设备健康状态显示OK,就足以证明模型推理或训练业务一定能正常运行。
对
错
关闭
更多问卷
复制此问卷