LMCC例题A
考试时间:90分钟 满分:100分
您的姓名:
⼀
、单选题(20题 × 3分 = 60分)
1、关于监督学习、无监督学习与自监督学习,下列说法正确的是:
A、监督学习主要依赖无标签数据,自监督学习通常需要人工标注
B、聚类通常属于监督学习,分类通常属于无监督学习
C、自监督学习通常从数据本身构造训练信号,例如语言模型的下一个词元预测
D、模型参数量增大后,训练数据的重要性会明显降低
2、关于模型的训练集、验证集和测试集,以下说法正确的是:
A、训练集用于训练模型,验证集用于调整超参数,测试集用于最终评估
B、三个数据集在小规模实验中可以灵活复用,区分不必过于严格
C、测试集可以在训练过程中多次参考,用于持续优化模型
D、验证集的数据量通常应尽量大于训练集
3、与图像数据相比,自然语言作为大模型输入时最典型的底层特征是:
A、自然语言通常表现为离散符号序列,而图像通常表现为密集像素矩阵
B、自然语言的顺序结构较弱,而图像更天然具有语法结构
C、图像通常可以直接作为原始输入,自然语言更依赖数字化处理
D、自然语言中的歧义相对较少,图像理解中歧义更常见
4、关于注意力机制中查询(Query)、键(Key)、值(Value)的作用,下列说法正确的是:
A、Query用于存储待检索的信息,Key用于生成最终输出
B、注意力分数通过Query与Key的点积计算得到,再经softmax归一化后对Value加权求和
C、softmax函数的作用是将注意力分数映射到(−∞,+∞)的范围
D、Value向量决定了哪些位置应该获得更高的注意力权重
5、关于自回归语言模型的"下一个词元预测"任务,下列说法正确的是:
A、它要求模型根据前文预测下一个token,是Decoder-only大语言模型常见预训练目标
B、它会利用答案右侧的token提供信息,因此因果掩码的重要性较低
C、它主要适用于图像分类模型
D、它与最大似然学习的关系较弱
6、关于大语言模型的"生成"和"理解"两类核心范式,下列说法正确的是:
A、生成任务更侧重让模型产生新的文本,理解任务更侧重分析或判断输入内容的含义
B、生成任务主要用于判断文本类别,理解任务主要用于续写故事或扩写文章
C、生成和理解的差异主要体现在输出文字长短,与任务目标关系较弱
D、大语言模型更适合生成任务,用于理解任务时参考价值较低
7、指令数据(Instruction Data)的典型组成是:
A、主要包含问题描述
B、由指令、输入(可选)、输出三部分组成
C、主要关注模型的最终回答
D、通常需要包含代码实现
8、关于温度(Temperature)参数在文本生成中的作用,以下说法正确的是:
A、温度升高时,生成文本通常更确定和保守
B、温度降低时,生成文本通常更随机和多样
C、温度为0时,模型会选择概率最高的词
D、温度参数对生成结果的影响通常较小
9、关于大语言模型的幻觉(Hallucination)现象,以下说法正确的是:
A、幻觉是指模型生成看似合理但实际错误或不存在的信息
B、幻觉更常见于小模型,大模型中相对较少
C、幻觉是模型的优点,体现了创造力
D、幻觉可以主要通过增加训练数据得到解决
10、关于Prompt(提示词)的设计原则,以下哪项不正确?
A、提示词应该清晰明确,避免歧义
B、提示词越长、包含的信息越多,效果通常越好
C、提示词应该包含必要的上下文信息
D、提示词的设计需要考虑目标模型的特点
11、关于语言模型的发展历程,下列理解最准确的是:
A、统计语言模型、神经网络语言模型、预训练语言模型和大语言模型大致体现了语言模型能力逐步增强的发展路线
B、大语言模型先出现,随后才发展出神经网络语言模型和统计语言模型
C、预训练语言模型主要依赖人工规则库,对从语料中学习语言规律的依赖较低
D、统计语言模型和大语言模型的主要区别在于是否用于中文任务
12、关于编码器-解码器架构、因果解码器架构和前缀解码器架构,下列说法正确的是:
A、编码器-解码器架构常用于输入序列到输出序列的转换任务,因果解码器架构常用于从左到右生成文本
B、因果解码器在生成当前位置时通常会利用右侧尚未生成的token作为主要依据
C、前缀解码器架构与传统卷积神经网络在文本生成任务中的作用基本相同
D、架构选择与任务类型关系较弱,生成任务和理解任务通常使用同一种结构即可
13、关于自监督学习与预训练任务,下列说法最准确的是:
A、自回归语言建模通常根据前文预测下一个词元,掩码预测通常根据上下文恢复被遮盖的词元
B、对比学习主要要求模型记住每个样本的人工类别标签,与表示学习关系较弱
C、掩码预测和自回归预测的训练目标差异较小,主要只是名称不同
D、预训练任务通常只用于图像模型,在语言模型中参考价值较小
14、关于指令数据集的构建,下列做法最合理的是:
A、可以从少量种子指令出发合成更多指令-回答样本,并通过规则检查或人工抽查过滤低质量样本
B、指令数据主要保存任务问题,期望输出或参考回答的重要性相对较低
C、合成指令数据时,样本数量越多通常越能代替质量控制
D、为了便于训练,指令样本通常更适合来自较少的任务类型和较统一的表达方式
15、关于贪心搜索和束搜索解码,下列说法正确的是:
A、贪心搜索每一步通常只保留当前概率最高的选择,束搜索会保留多个候选序列并综合比较
B、束搜索通常比贪心搜索计算量更小,因为候选序列管理更简单
C、贪心搜索在每一步选择局部高概率词元,因此通常能保证整句达到全局最优
D、增大束宽主要是为了让生成结果更随机,与候选序列数量关系较弱
16、某训练集共有9600条样本,Batch Size设置为64,完整训练3个epoch。若每个batch更新一次模型参数,且样本数能被batch size整除,则总参数更新步数为:
A、150
B、300
C、450
D、600
17、某二分类模型在测试集上的结果为:真正例TP=80,假正例FP=20,假负例FN=40。该模型的精确率 (Precision)和召回率(Recall)最接近:
A、0.67 和 0.80
B、0.80 和 0.67
C、0.80 和 0.80
D、0.67 和 0.67
18、某14B模型在BF16下权重占用约28GB。若改为INT4后,权重本体理论占用缩至1/4;另外需要1.6GB量化标尺开销与0.9GB元数据开销;并预计运行时碎片化额外增加15%(按"量化后权重本体+固定开销"计)。则总占用最接近:
A、9.5 GB
B、10.2 GB
C、10.9 GB
D、12.4 GB
19、某排序前5项相关性分数为[3,2,0,1,0]。按 DCG=Σ((2^rel−1)/log2(i+1)),NDCG@5最接近:
A、0.81
B、0.90
C、0.99
D、1.10
20、某推理服务每步设置batch=48、平均序列长度3072 token,单步耗时3.0s。系统每执行5步还会触发一次额外checkpoint同步,耗时1.5s。按长期平均计算,系统吞吐量最接近:
A、38.4k token/s
B、44.7k token/s
C、49.2k token/s
D、56.3k token/s
⼆、材料题(10题 × 4分 = 40分)
材料题1:智能体⼯具调⽤JSON校验器
在⼯具调⽤型智能体中,模型输出通常需要被解析为结构化JSON,再根据⼯具schema校验⼯具名和参数是否
合法。下⾯的代码实现了⼀个简化版⼯具调⽤校验器:它读取模型输出字符串,检查⼯具名、参数字段和参数
类型,并返回标准化后的⼯具调⽤对象。
请阅读代码,并根据描述完成空缺部分。
21、【材料题1·智能体工具调用JSON校验器】代码片段:obj = ____[1]____。 需要将模型输出字符串解析为Python对象。请选择正确实现:
A、json.dumps(raw)
B、json.loads(raw)
C、dict(raw)
D、raw.split(",")
22、【材料题1·智能体工具调用JSON校验器】代码片段:required = spec["required"];optional = spec["optional"];allowed_keys = ____[2]____。 需要得到该工具允许出现的全部参数名。请选择正确实现:
A、set(required) | set(optional)
B、set(required) & set(optional)
C、list(required.values()) + list(optional.values())
D、required == optional
23、【材料题1·智能体工具调用JSON校验器】代码片段:missing_keys = ____[3]____。 需要找出缺失的必需参数。请选择正确实现:
A、set(arguments) - set(required)
B、set(required) - set(arguments)
C、set(optional) - set(required)
D、set(arguments) | set(optional)
24、【材料题1·智能体工具调用JSON校验器】代码片段:if name in arguments and ____[4]____: return False。 需要检查参数值是否符合schema中声明的类型。请选择正确实现:
A、arguments[name] is expected_type
B、expected_type in arguments[name]
C、not isinstance(arguments[name], expected_type)
D、type_rules[name] == arguments[name]
材料题2:API⽂档检索助⼿
API⽂档检索助⼿是⼀类典型的检索增强系统。它先把API⽂档⽚段编码成向量并建⽴索引;当⽤户提出问题
时,再把问题编码成向量,与⽂档向量计算相似度,选出最相关的⽂档⽚段,⽤于后续回答⽣成。
补充材料:
1.
tokenizer(texts, return_tensors="pt", padding=True, truncation=True)
会返回⼀个字典,
常⻅字段包括
input_ids
和
attention_mask
。
2. 嵌⼊模型输出的
last_hidden_state
形状通常为
[batch_size, seq_len, hidden_dim]
。
3.
attention_mask
的形状通常为
[batch_size, seq_len]
,其中1表示真实token,0表示padding
token。
4. 对带padding的序列做平均池化时,应排除padding位置,否则短⽂本向量会被填充值稀释。
5. 若查询向量和⽂档向量都已做L2归⼀化,则⼆者点积等价于余弦相似度。
6. 如果查询向量形状为
[1, hidden_dim]
,⽂档矩阵形状为
[num_docs, hidden_dim]
,则⼀次性计算
所有⽂档相似度可使⽤矩阵乘法,结果形状为
[1, num_docs]
。
请阅读代码,并根据描述完成空缺部分。
25、【材料题2·API文档检索助手】代码片段:tokens = ____[1]____。 在encode_texts方法中,需要将输入文本列表转换为模型所需的token格式。请选择正确实现:
A、self.tokenizer.encode(texts, return_tensors="pt", padding=True, truncation=True, max_length=512)
B、self.embedding_model(texts, return_tensors="pt", padding=True, truncation=True, max_length=512)
C、self.tokenizer(texts, return_tensors="pt", padding=True, truncation=True, max_length=512)
D、self.tokenizer.tokenize(texts, return_tensors="pt", padding=True, truncation=True)
26、【材料题2·API文档检索助手】代码片段:sentence_embeddings = ____[2]____。 需要对序列隐藏状态做masked mean pooling,得到句子级向量。请选择正确实现:
A、hidden_states.mean(dim=1)
B、hidden_states[:, 0,:]
C、(hidden_states * mask.unsqueeze(-1)).sum(1) / mask.sum(1, keepdim=True)
D、torch.max(hidden_states, dim=1)[0]
27、【材料题2·API文档检索助手】代码片段:similarity_scores = ____[3]____。 需要一次性计算查询向量与全部文档向量的相似度。请选择正确实现:
A、torch.matmul(query_normalized, self.doc_embeddings)
B、torch.matmul(self.doc_embeddings, query_normalized)
C、torch.matmul(query_normalized, self.doc_embeddings.T)
D、(query_normalized * self.doc_embeddings).sum(dim=0)
材料题3:论⽂阅读——思维链忠实性与早退策略
请阅读下⾯根据论⽂
Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought
(arXiv:2603.05488v4,2026-05-28)整理的中⽂阅读材料,然后回答3个问题。
1. 研究背景:思维链为什么看起来重要
近年来,思维链提示被⼴泛⽤于提升⼤语⾔模型在数学、科学和复杂推理任务上的表现。特别是经过强化学习
训练的推理模型,常常会在给出答案前⽣成较⻓的中间推理⽂本,形式上像是在逐步分析问题、排除错误选
项、检查条件并修正判断。直观上,如果模型把推理过程写出来,⼈们似乎就可以通过阅读这些⽂字判断模型
是否真的在推理、哪⾥出现了逻辑错误、是否有潜在⻛险。因此,⼀些安全和可解释性⽅案把"监控思维链⽂
本"视为理解模型内部过程的重要窗⼝。
这篇论⽂⾸先提醒读者:思维链很有⽤,但它不⼀定等于模型真实内部过程的逐字转录。⼀个推理模型可能写
出结构清楚、逻辑连贯、看似诚实的推理⽂本,但这些⽂本仍可能没有及时反映模型内部已经形成的判断。换
句话说,外显思维链更像模型在任务过程中"说出来的内容",⽽不是模型内部状态的完整记录。
2. 核⼼概念:什么是"表演式思维链"
论⽂把⼀种关键现象称为"表演式思维链"。它并不是说模型完全随机输出,也不是说所有⻓思维链都没有价
值,⽽是指:模型在内部激活中已经较早形成了对最终答案的⾼置信判断,但外部输出仍继续⽣成看似犹豫、
探索、推导或⾃我检查的⽂字。也就是说,模型可能在内部"已经知道答案",却在⽂本上继续表现为"还在⼀
步步想"。
这⾥的关键⽭盾不是模型最终是否答对,⽽是"内部答案形成时间"和"外部⽂本承认答案的时间"之间是否存在
明显错位。如果内部状态很早就指向某个答案,⽽⽂本要到很后⾯才透露这个答案,那么只阅读⽂本的监控者
就会滞后。
3. 研究设计:三种⽅法⽐较"模型何时知道答案"
为了研究这种错位,论⽂⽐较了三类"早期解码"⽅法:
-
激活探针
:在模型⽣成思维链的不同位置截取内部激活,训练⼀个轻量探针预测模型最终会选择的答案。使
⽤注意⼒池化探针,对⼀段前缀中的隐藏状态做可学习的加权汇聚。
-
强制提前作答
:在模型⽣成到某个中间步骤时截断思维链,然后提示同⼀个模型⽴刻给出最终选项,观察模
型在该时刻是否已经具备回答能⼒。
-
思维链监测器
:另⼀个语⾔模型,只能阅读被测模型已经⽣成的部分思维链,判断这些⽂本是否⾜以推出最
终选项;信息不⾜时可以回答"不⾜以判断"。
三种⽅法的信息权限不同:激活探针能读内部表示,强制提前作答能把潜在信息压出来,思维链监测器只能看
外部⽂字。三者之间的时间差就能反映内部信念和外显⽂本之间的错位。
4. 实验设置
论⽂主要分析DeepSeek-R1 671B和GPT-OSS 120B两个开放权重推理模型。实验任务包括MMLU-Redux
2.0(5280道题,偏知识回忆)和GPQA-Diamond(198道更困难的科学问题,需要多步推理)。论⽂关注的
是:在思维链⽣成到0%、20%、50%、80%等不同位置时,三种⽅法分别能多早看出模型最终会选什么。
5. 主要发现:容易题更容易出现"表演式推理"
论⽂的核⼼发现是,表演式思维链具有明显的任务差异。在MMLU-Redux这类相对容易、偏知识回忆的题⽬
上,激活探针和强制提前作答常常在思维链很早的位置就能较⾼准确率地预测模型最终答案;但思维链监测器
要晚得多才从⽂本中看到答案线索。这说明模型内部答案信息已经出现,后续较⻓的思维链更多是在铺陈、解
释或延迟显露答案。
论⽂⽤"探针/强制提前作答与⽂本监测器之间的信息增益差距"来刻画"表演性"。在DeepSeek-R1上,MMLU
的"探针相对监测器"差距为0.417,"强制作答相对监测器"差距为0.505;⽽GPQA-Diamond上对应数值只有
0.012和0.010,接近0。这意味着:对偏记忆的题,模型可能读完题后很快就知道答案,只是仍继续写出⼀段
像推理过程的⽂字;⽽在困难多跳题上,三种⽅法的准确率通常从接近随机⽔平开始,随着推理过程逐步提
⾼,三者增⻓趋势更⼀致。
6. 模型规模的影响
更⼤的模型往往更早就能从内部激活中解码出最终答案,说明它们可能更多依赖参数中已有的知识和先验。较
⼩的蒸馏模型在前半段推理中探针准确率更低,后⾯才逐渐提升,表现得更像"需要现场推理"。但"是否表演
式"不是模型的固定属性,⽽是模型能⼒、任务难度和答案是否容易被已有知识快速确定之间的交互结果。
7. 转折点:⻓思维链并不总是表演
论⽂特别研究了思维链中的"转折点",例如回溯、重新考虑、突然意识到某个条件的重要性。结果显示,⾼置
信回答(从开始探针置信度就达到90%以上且之后从未低于90%)中的转折点更少:所有转折点按步骤归⼀
化后的总⽐例为0.020,⽽⾮⾼置信回答为0.045,约为前者两倍多。这说明许多回溯和重新考虑并⾮纯粹表
演,⽽可能对应真实的不确定性消解。
8. 讨论:思维链监控的价值与边界
论⽂的重点不是简单否定思维链,⽽是要求更谨慎地解释思维链。对于容易题,模型可能已经在内部形成答
案,但继续⽣成⻓篇推导;只读⽂本的监测器直到答案接近显露时才知道模型要选什么。在这种情形下,思维
链⽂本可能⽆法可靠⽤于发现"模型是否已经承诺了某个答案"。
对于困难题,情况不同。如果答案信息确实在⽣成过程中逐步出现,那么⽂本推理可能更好地追踪模型内部信
念变化。换句话说,思维链监控并不是完全⽆效,⽽是有适⽤条件。
9. ⼯程启发:探针置信度早退
论⽂提出的⼯程启发是"基于探针置信度的早退"。如果注意⼒探针经过校准,能够在中间位置以较⾼置信度预
测最终答案,并且答案在连续步骤中保持稳定,那么系统可以提前停⽌⽣成,不再让模型继续写完整思维链。
这种策略把探针从解释⼯具变成⾃适应计算⼯具:简单题少⽣成,复杂题多⽣成。
论⽂报告,在MMLU上,DeepSeek-R1以95%置信度阈值早退时,可以保留原始性能的97%,同时节省68%
的⽣成token;在GPQA-Diamond上,80%置信度阈值早退可以保留约97%的性能,并节省50%的token。这
个差异也呼应了前⾯的讨论:容易题更容易提前确定答案,因此早退空间更⼤。
早退并不等于越早停⽌越好。若探针没有校准,或者任务确实需要多步推理,过早停⽌可能让模型错过后续关
键计算,损害准确率。更合理的策略是设置较⾼置信度阈值,同时要求答案在相邻步骤中保持稳定。
10. 总结
这篇论⽂提醒⼈们区分两种情况:⼀种是模型已经内部确定答案,后续思维链主要起解释、包装或延迟显露作
⽤;另⼀种是模型确实在⽣成过程中逐步形成答案,思维链更忠实地反映了推理过程。
28、【材料题3·论文阅读:思维链忠实性与早退策略】 某道MMLU 类题目中,模型生成到思维链20%位置时,激活探针已经以较高置信度预测最终选项为B;此时强制模型提前作答,模型也输出B;但只阅读已生成文本的思维链监测器回答"不足以判断"。直到思维链接近结尾时,文本才明确支持B。根据阅读材料,对这一现象最合理的解释是:
A、文本监测器难以判断时,通常说明模型内部也尚未形成明确答案倾向
B、激活探针和强制提前作答都可能受到随机噪声影响,因此内部信号的参考价值较有限
C、模型内部答案信息可能早于外显文本出现,说明思维链文本相对内部信念存在滞后
D、该现象主要说明模型最终选项为B,与思维链忠实性的关系较弱
29、【材料题3·论文阅读:思维链忠实性与早退策略】 阅读材料给出DeepSeek-R1上的"探针相对监测器"差距:MMLU 为0.417,GPQA-Diamond为0.012;"强制作答相对监测器"差距:MMLU 为0.505,GPQA-Diamond为0.010。对这些数字的解读,最准确的是:
A、MMLU 上内部信号显著领先文本信号,更支持"容易知识题上更容易出现表演式思维链"的结论
B、GPQA-Diamond上差距更小,说明GPQA-Diamond中真实推理需求较低
C、差距较大通常说明模型最终答案更可能不可靠
D、两组数据更倾向说明文本监测器比激活探针更稳定
30、【材料题3·论文阅读:思维链忠实性与早退策略】 某系统希望使用探针置信度做早退。连续4个检查点的探针输出如下,其中阈值设为0.90,要求"同一答案连续两个检查点置信度均不低于阈值"才允许早退: 检查点预测答案置信度 20% B 0.86 40% C 0.91 60% B 0.93 80% B 0.94 根据阅读材料中"高置信度+答案稳定性"的原则,以下策略最合理的是:
A、在40%处早退,因为此时置信度已经超过阈值,可以优先节省后续token
B、在60%处早退,因为B的置信度超过阈值,并且相较40%检查点已经发生修正
C、在80%处早退,因为B在相邻两个检查点均超过阈值且答案稳定
D、从20%处早退,因为0.86已接近阈值且可以最大化节省token
关闭
更多问卷
复制此问卷